动察 Beating tarafından yapılan izlemeye göre, Tencent Hunyuan ekibi birden fazla üniversiteyle iş birliği yaparak LHTB'yi yayınladı. Bu kıyaslama, AI Agent'ların terminalde karmaşık görevleri sürekli olarak tamamlayıp tamamlayamadığını test etmek için özel olarak tasarlandı.
Kıyaslama, yazılım mühendisliği, deney tekrarı, bilimsel hesaplama ve çok modlu analiz gibi alanları kapsayan 46 görev içeriyor. Her bir görev en fazla 90 dakika sürüyor ve genellikle yüzlerce adımlık sürekli işlem gerektiriyor.
LHTB yalnızca nihai başarıya veya başarısızlığa bakmıyor. Görevin bir kısmı tamamlanırsa, gerçek ilerlemeye göre puan veriliyor. Gizli doğrulayıcılar dosyaları, test sonuçlarını ve program çıktılarını kontrol ediyor; Agent'ın kendi kendine "tamamlandı" demesi geçerli sayılmıyor.
Makalenin ilk sürümü 15 modeli test etti. GPT-5.5, 7 görevi tamamlayarak birinci oldu. Her bir model bir görevi yerine getirirken ortalama olarak yaklaşık 9,9 milyon Token tüketti ve yaklaşık 85 dakika sürdü.
Mevcut açık sonuçlar 20 modele genişletildi. Grok 4.5, ortalama 0,505 puanla zirveye yerleşti ve 13 görevi tamamladı. 46 görevden 29'u hâlâ hiçbir model tarafından tamamlanma standardına ulaşamadı.
Çoğu Agent bazı adımları tamamlayabiliyor, ancak sık sık 90 dakikayı tüketiyor veya görev henüz bitmeden erken sonlanıyor, böylece karmaşık görevleri gerçekten sonuna kadar götüremiyor.
