Ana Sayfa
AI AI
Flaş
Derinlik
Etkinlikler
BlockBeats Pro
Daha Fazla
Finans
Özel
Blok Zinciri Ekosistemi
Giriş
Podkastlar
Veri
OPRR
#
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe

OpenAI araştırmacısı Noam Brown, tek bir puanın öncü büyük modelleri ölçmekte yetersiz kaldığını belirterek, akıl yürütme hesaplama gücü eğrisinin benimsenmesini savunuyor.

动察 Beating tarafından yapılan izlemeye göre, OpenAI araştırmacısı Noam Brown, AI modellerinin performansı arttıkça, modelleri değerlendiren kıyaslama puanlarının giderek çıkarım hesaplama gücü (yani modelin soruları yanıtlarken tükettiği hesaplama kaynakları) tarafından domine edildiğini belirtti. Tek bir statik puan, güçlü bir modelin gerçek seviyesini yansıtamaz; gelecekteki değerlendirme standartları, yatay eksende çıkarım hesaplama gücü veya üretilen token sayısı olan bir performans genişleme eğrisine yönelmelidir.

Noam Brown, yeni model GPT-5.5'in test sürecini örnek olarak verdi. İlk standart testlerde GPT-5.5, GPT-5.4'e kıyasla belirgin bir avantaj göstermedi. Ancak, daha fazla çıkarım hesaplama gücü tahsis edildiğinde, GPT-5.5'in performansı patlama yaptı. Çalışma bütçesi sınırlandırılırsa, standart testler öncü modellerin gerçek üst sınırını yansıtamaz. Benzer performans genişleme gösterimleri, birden fazla harici değerlendirme tarafından doğrulandı. Andrej Karpathy'nin otonom ajan araştırma deneylerinde ve İngiltere AI Güvenlik Enstitüsü'nün kötü niyetli ağ testlerinde, çıkarım bütçesi arttıkça GPT-5.5 ve Mythos modellerinin performansı sürekli yükseldi; 100 milyondan fazla token üretildikten sonra bile bir tavana ulaşılmadı ve daha güçlü modeller, daha fazla hesaplama gücü yatırıldığında daha belirgin performans artışı gösterdi.

Çıkarım hesaplama gücündeki artış, güvenlik değerlendirmelerini de daha karmaşık hale getirdi. Noam Brown, mevcut biyolojik veya ağ güvenliği testlerinin genellikle sabit bir çıkarım bütçesine sahip olmadığı konusunda uyardı. Ulusal düzeydeki bir rakip, belirli bir görev için 10 milyon doların üzerinde bir çıkarım bütçesi yatırdığında, başlangıçta güvenli görünen bir model tehlikeli kırmızı çizgiyi aşabilir. Büyük model üreticileri, yeni bir model yayınlarken, yatay eksende token sayısı, hesaplama maliyeti veya çalışma süresi olan bir performans eğrisini proaktif olarak açıklamalıdır. Değerlendirme kurumlarının da çıkarım bütçesini değerlendirmenin temel bir değişkeni olarak ele alması ve güvenlik değerlendirmelerinde düşük hesaplama gücü testleri aracılığıyla güvenlik sınırlarını dışa doğru tahmin etmesi gerekir.

举报 Düzeltme/Rapor
Düzeltme/Rapor
Gönder
Kütüphane Ekle
Sadece kendime görünür
Herkese Açık
Kaydet
Kütüphane Seç
Kütüphane Ekle
İptal
Tamamla