動察 Beating tarafından yapılan izlemeye göre, Artificial Analysis yeni bir AI analiz yeteneği testi olan AA-AnalystAgent'ı piyasaya sürdü. Bu test, modellerin gerçek tablolar ve belgeler üzerinde çalışarak veri istatistikleri, trend analizi, finansal modelleme gibi görevleri tamamlamasını sağlıyor. Test toplam 80 sorudan oluşuyor ve her soruda model bağımsız olarak 5 kez çözüyor; yalnızca 5 kez tamamen doğru cevap verenler geçer sayılıyor.
Sonuçlara göre birinci sırada Claude Opus 5 yer alıyor, ancak yalnızca %54'lük bir soru oranında 5 kez üst üste tam doğru cevap verebiliyor. GPT-5.5 ikinci sırada, geçme oranı %50; Claude Fable 5 ise %49. Açık ağırlıklı modeller arasında en iyi performansı %39 ile Kimi K3 gösteriyor.
Yalnızca her cevabın ortalama doğruluk oranına bakıldığında, GPT-5.5 aslında en yüksek seviyede, %66'ya ulaşıyor. Ancak aynı sorunun 5 kez üst üste doğru cevaplanması gerektiğinde, geçme oranı yalnızca %50'ye düşüyor. Claude Opus 5'in tek seferlik doğruluk oranı biraz daha düşük, ancak daha istikrarlı olduğu için sonuçta birinci sırada yer alıyor.
AI'ın en yaygın sorunu hesaplama yapamaması değil, başlangıçta soruyu yanlış anlamasıdır. Artificial Analysis, 1567 başarısızlık kaydını inceledi ve bunların %57'sinde bu durumun görüldüğünü tespit etti: model erken bir aşamada yanlış bir yorumu kesin olarak kabul ediyor ve ardından bu yönde ilerlemeye devam ediyor.
