动察 Beating AI hızlı haberi: Scale AI, RSI Bench'i tanıttı; bu, yapay zekanın bir araştırmacı gibi kendi AI araştırmasını yapıp yapamayacağını özel olarak test ediyor.
AI doğrudan makaleler, kod ve hesaplama gücü alacak; ardından kendi deneylerini tasarlayacak, eğitim çalıştıracak, yöntemleri değiştirecek ve mevcut AI'ı daha iyi hale getirip getiremeyeceğine bakacak.
İlk testlerde Claude Opus 5 ve GPT-5.6 Sol kullanıldı. Her iki model de kendi başına deney çalıştırabiliyor, parametreleri ayarlayabiliyor ve çözümleri yineleyebiliyor; bazı görevlerde gerçekten verilen taban çizgisini aşmayı başardılar.
Ancak mevcut AI hâlâ "icat etme" konusunda pek iyi değil. En yeni araştırmalarla karşılaştıklarında, çoğu deneme hâlâ makaledeki mevcut yöntemler ve parametre ayarlamalarıyla sınırlı kalıyor; gerçekten yeni fikirler ortaya koymak nadir görülüyor.
