Ana Sayfa
AI AI
Flaş
Derinlik
Etkinlikler
BlockBeats Pro
Daha Fazla
Finans
Özel
Blok Zinciri Ekosistemi
Giriş
Podkastlar
Veri
OPRR
#
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe

OpenAI'nin GPT-6 Astra değerlendirme verilerini sessizce ayarladığı iddia ediliyor; bazı metrikler rakiplerin performansını "kötüleştiriyor".

动察 Beating AI hızlı haberi: OpenAI, 3 Eylül'den bu yana GPT-6 Astra'yı piyasaya sürdükten sonra birçok model değerlendirme kıyaslama verisi sürekli olarak ayarlandı. Bazı değişiklikler Astra'nın performansını daha iyi gösterirken, bazı rakip modellerin puanlarında düşüş yaşandı ve bu durum dışarıda AI'ın "skor şişirme" ve değerlendirme şeffaflığı konusunda soru işaretleri yarattı.


Bunlar arasında, Astra'nın halüsinasyon oranı %4,2'den %2'ye düşürüldü, GPT-5.6 Sol ise %12,2'den %9,4'e indirildi, ardından ikisi de sırasıyla %4,2 ve %12,2'ye geri döndü. Matematik değerlendirmelerinde, Anthropic'in Fable 5.1 puanı da %87,8'den %78'e düşürüldü ve şu anda %83'e geri yükseldi; GPT-5.6 Sol ise %83'ten %80,5'e düştü ve ardından %83'e geri döndü.


Ayrıca, Astra'nın ARC-AGI-3 değerlendirmesindeki puanı, yayın öncesi taslaktaki %98,6'dan nihai sayfadaki %99,99'a yükseltildi ve programlama değerlendirme puanı da %57,7'den hafif bir artışla %57,9'a çıkarıldı. OpenAI, değerlendirme sonuçlarının model sürümü, araç yapılandırması, akıl yürütme seviyesi ve test çalıştırmaları gibi faktörlerden etkilenebileceğini ve bu ayarlamaların verilerin modelin en iyi performansını daha doğru yansıtmasını sağlamak için yapıldığını belirtti.


Ancak, Stanford Üniversitesi araştırmacıları, sık sık yeniden değerlendirme yapmanın "Benchmaxxing" olarak adlandırılan bir uygulamayı içerebileceğini, yani test koşullarını ayarlayarak kıyaslama puanlarını maksimize etmeyi düşünüyor. Sektör içindekiler, AI model rekabeti yoğunlaştıkça değerlendirme verilerinin model yeteneklerini ölçmek ve pazar payı için mücadele etmek adına önemli bir araç haline geldiğini ve kıyaslama testlerinin şeffaflığını ve tekrarlanabilirliğini artırmanın giderek daha fazla ilgi gördüğünü belirtiyor.

举报 Düzeltme/Rapor
Düzeltme/Rapor
Gönder
Kütüphane Ekle
Sadece kendime görünür
Herkese Açık
Kaydet
Kütüphane Seç
Kütüphane Ekle
İptal
Tamamla