动察 Beating AI hızlı haberi: OpenAI baş bilim insanı Jakub Pachocki, CoT izlemenin neden giderek daha güvenilmez hale geldiğini açıklayan bir yazı yayınladı. CoT izleme, modelin yazdığı akıl yürütme sürecini gözlemleyerek gizli hedefler veya hizalanmamış düşünceler içerip içermediğini kontrol etmektir.
Birkaç gün önce dış dünya, Astra'nın tekrarlayan derinlik mimarisini CoT izleme arızasıyla ilişkilendirdi. Pachocki o sırada sorunun yeni mimariden kaynaklanmadığını savundu ve nedenlerini ayrı bir yazıda açıklayacağını belirtti. Beş gün sonra yazısında üç neden sıraladı:
Birincisi, ajanların akıl yürütmesi giderek daha fazla araç çağrıları, insanlarla veya diğer yapay zekalarla etkileşimler sırasında gerçekleşiyor ve bu süreçler denetime tabi tutulmak zorunda. Yalnızca CoT'ye bakarak tam akıl yürütme sürecini görmek giderek zorlaşıyor.
İkincisi, modeller kendi akıl yürütme süreçlerini kontrol etmede giderek daha yetenekli hale geliyor.
Üçüncüsü, ön eğitim güçlendikçe modeller akıl yürütmeyi yazmasalar bile daha akıllı hale gelmeye devam edebiliyor.
OpenAI, CoT izlemeyi her zaman önemli bir güvenlik önlemi olarak görmüştür. o1-preview başlangıçta tam düşünce zincirini açıklamadı; önemli bir neden, CoT'yi doğrudan denetlemekten kaçınarak modelin gerçek niyetlerini gizlemeyi öğrenmesini engellemekti. Şimdi OpenAI'nin değerlendirmeleri, bu yöntemin güvenilirliğinin düştüğünü gösteriyor.
Pachocki ayrıca açıkça, şu anda hiçbir laboratuvarın hizalamayı ve izlemeyi uzun vadeli tam hızda model ölçeklendirmeyi sürdürebilecek düzeyde çözmediğini belirtti. Ortak bir güvenlik eşiği oluşturulmadan önce laboratuvarların hızlarını bilinçli olarak azaltmasını umduğunu ve gerektiğinde OpenAI'nin de model ölçeklendirmeyi durduracağını söyledi.
