Ana Sayfa
AI AI
Flaş
Derinlik
Etkinlikler
BlockBeats Pro
Daha Fazla
Finans
Özel
Blok Zinciri Ekosistemi
Giriş
Podkastlar
Veri
OPRR
#
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe

Grok 4.5, Tencent Hunyuan Agent dayanıklılık listesinde zirveye yerleşti ve görevlerin %60'ından fazlası model olmadan tamamlandı.

动察 Beating tarafından yapılan izlemeye göre, Tencent Hunyuan ekibi birden fazla üniversiteyle iş birliği yaparak LHTB'yi yayınladı. Bu kıyaslama, AI Agent'ların terminalde karmaşık görevleri sürekli olarak tamamlayıp tamamlayamadığını test etmek için özel olarak tasarlandı.

Kıyaslama, yazılım mühendisliği, deney tekrarı, bilimsel hesaplama ve çok modlu analiz gibi alanları kapsayan 46 görev içeriyor. Her bir görev en fazla 90 dakika sürüyor ve genellikle yüzlerce adımlık sürekli işlem gerektiriyor.

LHTB yalnızca nihai başarıya veya başarısızlığa bakmıyor. Görevin bir kısmı tamamlanırsa, gerçek ilerlemeye göre puan veriliyor. Gizli doğrulayıcılar dosyaları, test sonuçlarını ve program çıktılarını kontrol ediyor; Agent'ın kendi kendine "tamamlandı" demesi geçerli sayılmıyor.

Makalenin ilk sürümü 15 modeli test etti. GPT-5.5, 7 görevi tamamlayarak birinci oldu. Her bir model bir görevi yerine getirirken ortalama olarak yaklaşık 9,9 milyon Token tüketti ve yaklaşık 85 dakika sürdü.

Mevcut açık sonuçlar 20 modele genişletildi. Grok 4.5, ortalama 0,505 puanla zirveye yerleşti ve 13 görevi tamamladı. 46 görevden 29'u hâlâ hiçbir model tarafından tamamlanma standardına ulaşamadı.

Çoğu Agent bazı adımları tamamlayabiliyor, ancak sık sık 90 dakikayı tüketiyor veya görev henüz bitmeden erken sonlanıyor, böylece karmaşık görevleri gerçekten sonuna kadar götüremiyor.

举报 Düzeltme/Rapor
Düzeltme/Rapor
Gönder
Kütüphane Ekle
Sadece kendime görünür
Herkese Açık
Kaydet
Kütüphane Seç
Kütüphane Ekle
İptal
Tamamla