动察 Beating AI hızlı haber: Artificial Analysis, dün gece çıkan birkaç yeni model için üçüncü taraf testlerini tamamladı. Claude Opus 5.5 max, Intelligence Index v4.3'te 58 puan alarak şu anda birinci sırada. GPT-6 Astra ve Fable 5.1 her ikisi de 53 puan, Opus 5 ise 51 puan. Opus 5.5, 10 değerlendirmeden 6'sında en yüksek puanı aldı.
Ancak bu en yüksek puan daha fazla token kullandı. Opus 5.5 max, görev başına ortalama yaklaşık 119 bin token çıktı üretiyor; bu, Opus 5'in 73 bininin yaklaşık %60 üzerinde. API'de %20 indirim ve önbellek okumada %60 indirim sayesinde görev başına maliyet sonuçta 5,98 dolar oldu ve Opus 5'in 5,86 dolarıyla neredeyse aynı seviyede kaldı. Daha kullanışlı medium sürümü 51 puan alarak Opus 5 max ile eşitlendi ve görev başına maliyeti yalnızca 1,34 dolar.
OpenAI ise farklı bir yol izledi. GPT-6 Sol ve Luna'nın Intelligence Index performansı GPT-5.6 önceki nesline yakın, ancak fiyat belirgin şekilde düştü. Sol max'ta görev başına maliyet 1,99 dolardan 1,06 dolara, Luna'da 0,18 dolardan 0,07 dolara indi. Kodlama Agent değerlendirmesinde Sol 55 puandan 57 puana yükseldi ve maliyeti de yaklaşık yarı yarıya düştü; Luna 43 puandan 41 puana geriledi, ancak görev başına maliyeti yaklaşık %60 daha düşük.
İki şirketin rotaları şimdiden ayrışmaya başladı: Opus 5.5 daha fazla akıl yürütmeyle yetenek üst sınırını yeni bir zirveye taşırken, GPT-6 Sol ve Luna esas olarak mevcut yetenekleri daha ucuz hale getirdi. Artificial Analysis'in performans/maliyet grafiğinde, her iki şirketin yeni modelleri de yeni Pareto sınırını işgal ediyor.
