动察 Beating AI hızlı haber: Tencent Hunyuan ve diğer ekipler, büyük modellerin sürekli değişen bilgilere ayak uydurup uyduramadığını özel olarak test eden EvolveScaler'ı yayınladı. Uzun metinlere sürekli olarak değiştirilmiş, geri çekilmiş, eklenmiş ve geçersiz kılınmış bilgiler ekliyor, ardından modelden en güncel duruma göre soruyu yanıtlamasını istiyor.
Örneğin, önce modele 40 günlük oyun kaydı gösteriliyor, sonra şu soruluyor: "Eğer 7. günde o küçük Boss'u yenmeseydin, sonunda yine de kazanabilir miydin?" Bu, sonraki ekipmanları, can puanını ve savaş sonuçlarını zincirleme olarak değiştiriyor. Modelin 7. günden başlayarak sonraki onlarca günü yeniden hesaplaması gerekiyor; metinde hazır bir cevap yok.
Ekip 117 görev türü ve 159 soru tipi tasarladı; en uzunu yaklaşık 1200 olay içeriyor. GPT-5.5, Gemini 3.1 Pro, DeepSeek V4 Preview Pro, GLM-5.2 ve Qwen3.5 Plus dahil 14 model yapılandırması test edildi. En zor seviyede medyan puan yalnızca %11,3; en iyi performans gösteren GPT-5.5-xhigh bile yalnızca %59,3 aldı.
Bu veri seti modelleri eğitmek için de kullanılabilir. Dahili bir A3B modeline bu tür 6000 veri eklenince, 8 harici testin tamamında iyileşme görüldü ve ortalama 5,25 puan arttı.
