动察 Beating AI hızlı haberi: OpenAI, 3 Eylül'den bu yana GPT-6 Astra'yı piyasaya sürdükten sonra birçok model değerlendirme kıyaslama verisi sürekli olarak ayarlandı. Bazı değişiklikler Astra'nın performansını daha iyi gösterirken, bazı rakip modellerin puanlarında düşüş yaşandı ve bu durum dışarıda AI'ın "skor şişirme" ve değerlendirme şeffaflığı konusunda soru işaretleri yarattı.
Bunlar arasında, Astra'nın halüsinasyon oranı %4,2'den %2'ye düşürüldü, GPT-5.6 Sol ise %12,2'den %9,4'e indirildi, ardından ikisi de sırasıyla %4,2 ve %12,2'ye geri döndü. Matematik değerlendirmelerinde, Anthropic'in Fable 5.1 puanı da %87,8'den %78'e düşürüldü ve şu anda %83'e geri yükseldi; GPT-5.6 Sol ise %83'ten %80,5'e düştü ve ardından %83'e geri döndü.
Ayrıca, Astra'nın ARC-AGI-3 değerlendirmesindeki puanı, yayın öncesi taslaktaki %98,6'dan nihai sayfadaki %99,99'a yükseltildi ve programlama değerlendirme puanı da %57,7'den hafif bir artışla %57,9'a çıkarıldı. OpenAI, değerlendirme sonuçlarının model sürümü, araç yapılandırması, akıl yürütme seviyesi ve test çalıştırmaları gibi faktörlerden etkilenebileceğini ve bu ayarlamaların verilerin modelin en iyi performansını daha doğru yansıtmasını sağlamak için yapıldığını belirtti.
Ancak, Stanford Üniversitesi araştırmacıları, sık sık yeniden değerlendirme yapmanın "Benchmaxxing" olarak adlandırılan bir uygulamayı içerebileceğini, yani test koşullarını ayarlayarak kıyaslama puanlarını maksimize etmeyi düşünüyor. Sektör içindekiler, AI model rekabeti yoğunlaştıkça değerlendirme verilerinin model yeteneklerini ölçmek ve pazar payı için mücadele etmek adına önemli bir araç haline geldiğini ve kıyaslama testlerinin şeffaflığını ve tekrarlanabilirliğini artırmanın giderek daha fazla ilgi gördüğünü belirtiyor.
