Ana Sayfa
AI AI
Flaş
Derinlik
Etkinlikler
BlockBeats Pro
Daha Fazla
Finans
Özel
Blok Zinciri Ekosistemi
Giriş
Podkastlar
Veri
OPRR
#
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe

Bilgiler tekrar tekrar değiştirildiğinde, büyük modeller altüst oluyor: en iyi performans gösteren GPT-5.5 bile yalnızca %59,3 doğru cevap verebiliyor

动察 Beating AI hızlı haber: Tencent Hunyuan ve diğer ekipler, büyük modellerin sürekli değişen bilgilere ayak uydurup uyduramadığını özel olarak test eden EvolveScaler'ı yayınladı. Uzun metinlere sürekli olarak değiştirilmiş, geri çekilmiş, eklenmiş ve geçersiz kılınmış bilgiler ekliyor, ardından modelden en güncel duruma göre soruyu yanıtlamasını istiyor.


Örneğin, önce modele 40 günlük oyun kaydı gösteriliyor, sonra şu soruluyor: "Eğer 7. günde o küçük Boss'u yenmeseydin, sonunda yine de kazanabilir miydin?" Bu, sonraki ekipmanları, can puanını ve savaş sonuçlarını zincirleme olarak değiştiriyor. Modelin 7. günden başlayarak sonraki onlarca günü yeniden hesaplaması gerekiyor; metinde hazır bir cevap yok.


Ekip 117 görev türü ve 159 soru tipi tasarladı; en uzunu yaklaşık 1200 olay içeriyor. GPT-5.5, Gemini 3.1 Pro, DeepSeek V4 Preview Pro, GLM-5.2 ve Qwen3.5 Plus dahil 14 model yapılandırması test edildi. En zor seviyede medyan puan yalnızca %11,3; en iyi performans gösteren GPT-5.5-xhigh bile yalnızca %59,3 aldı.


Bu veri seti modelleri eğitmek için de kullanılabilir. Dahili bir A3B modeline bu tür 6000 veri eklenince, 8 harici testin tamamında iyileşme görüldü ve ortalama 5,25 puan arttı.

举报 Düzeltme/Rapor
Düzeltme/Rapor
Gönder
Kütüphane Ekle
Sadece kendime görünür
Herkese Açık
Kaydet
Kütüphane Seç
Kütüphane Ekle
İptal
Tamamla