Ana Sayfa
AI AI
Flaş
Derinlik
Etkinlikler
BlockBeats Pro
Daha Fazla
Finans
Özel
Blok Zinciri Ekosistemi
Giriş
Podkastlar
Veri
OPRR
#
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe

Yapay zeka analist olarak henüz yeterince güvenilir değil: Her soruyu 5 kez çözdüğünde, Claude Opus 5 soruların yalnızca %54'ünde tamamen doğru cevap verebiliyor.

動察 Beating tarafından yapılan izlemeye göre, Artificial Analysis yeni bir AI analiz yeteneği testi olan AA-AnalystAgent'ı piyasaya sürdü. Bu test, modellerin gerçek tablolar ve belgeler üzerinde çalışarak veri istatistikleri, trend analizi, finansal modelleme gibi görevleri tamamlamasını sağlıyor. Test toplam 80 sorudan oluşuyor ve her soruda model bağımsız olarak 5 kez çözüyor; yalnızca 5 kez tamamen doğru cevap verenler geçer sayılıyor.

Sonuçlara göre birinci sırada Claude Opus 5 yer alıyor, ancak yalnızca %54'lük bir soru oranında 5 kez üst üste tam doğru cevap verebiliyor. GPT-5.5 ikinci sırada, geçme oranı %50; Claude Fable 5 ise %49. Açık ağırlıklı modeller arasında en iyi performansı %39 ile Kimi K3 gösteriyor.

Yalnızca her cevabın ortalama doğruluk oranına bakıldığında, GPT-5.5 aslında en yüksek seviyede, %66'ya ulaşıyor. Ancak aynı sorunun 5 kez üst üste doğru cevaplanması gerektiğinde, geçme oranı yalnızca %50'ye düşüyor. Claude Opus 5'in tek seferlik doğruluk oranı biraz daha düşük, ancak daha istikrarlı olduğu için sonuçta birinci sırada yer alıyor.

AI'ın en yaygın sorunu hesaplama yapamaması değil, başlangıçta soruyu yanlış anlamasıdır. Artificial Analysis, 1567 başarısızlık kaydını inceledi ve bunların %57'sinde bu durumun görüldüğünü tespit etti: model erken bir aşamada yanlış bir yorumu kesin olarak kabul ediyor ve ardından bu yönde ilerlemeye devam ediyor.

举报 Düzeltme/Rapor
Düzeltme/Rapor
Gönder
Kütüphane Ekle
Sadece kendime görünür
Herkese Açık
Kaydet
Kütüphane Seç
Kütüphane Ekle
İptal
Tamamla