动察 Beating AI hızlı haberi: Terminal-Bench 4.0 yayınlandı. Ajanların görevleri yerine getirirken kullandığı süre, CPU ve bellek yeniden kalibre edildi; 19 görev düzeltildi ve doygunluk, yanıt reddi, açık çözüm veya kalite sorunu içeren 8 görev kaldırıldı. Tüm görevler için maksimum çalışma süresi 8 saate eşitlendi; bu, esas olarak zaman aşımı ve ortam sorunlarının puanlara müdahalesini azaltmayı amaçlıyor.
En son sıralamada, Opus 5 + Claude Code %51,8 ile birinci, Fable 5 ise %44,5 ile ikinci sırada. GLM-5.3 + Claude Code %41,8 alarak üçüncülüğe yükseldi ve GPT-5.6 Sol + Codex'in %37,3'ünü geride bıraktı. İlk üçte, GLM-5.3, Anthropic'e ait olmayan tek model.
Terminal-Bench 3.0'da GLM-5.3, %32,4 ile dördüncü sırada yer alıyor ve GPT-5.6 Sol'un %34,6'sının gerisinde kalıyordu; 4.0'da ise GLM-5.3 üçüncülüğe yükselerek Sol'u 4,5 puan farkla geride bıraktı.
