动察 Beating AI hızlı haberi, AI sızıntı hesabı Leo, OpenAI'nin dün dahili olarak çalışanlarına Astra'yı önümüzdeki haftalarda yayınlamayı planladığını söylediğini bildirdi. Yayın sırasında, Astra'nın görevleri doğrudan nasıl yerine getirdiğini gösteren gerçek çalışma demoları da sunulacak. Güncellenmiş bir kontrol noktası (eğitimdeki model sürümü) da çalışanların denemesi için verildi ve çalışanlar Codex gibi araçlar aracılığıyla doğrudan kullanabilir.
Leo, bu sürümün esas olarak model davranışını düzeltmeye odaklandığını, sadece yetenekleri artırmaya devam etmediğini belirtti. Önemli noktalar arasında hizalama ve modelin ödül mekanizmasındaki boşlukları kullanmasını azaltmak yer alıyor; örneğin kodlanmış cevaplar, test örneklerine özel hile yapma veya görevi kötü yaparken puanlayıcıyı kandırıp yüksek puan alma girişimleri.
Ancak OpenAI, Astra'ya güvenlik konusunda fren yaptı: bazı pekiştirmeli öğrenme eğitimleri iki hafta duraklatıldı, şimdi eğitim ve değerlendirmenin bir kısmı yeniden başlatıldı, ancak birçok Astra görevi hâlâ durdurulmuş durumda ve en büyük ölçekli öncü model pekiştirmeli öğrenme eğitimi henüz yeniden başlatılmadı. Bunun nedeni, OpenAI'nin Astra'nın siber güvenlik yeteneklerinin en yüksek risk seviyelerinden birine ulaşabileceğini düşünmesi ve bu nedenle sanal alan, ağ izinleri ve model davranış izleme gereksinimlerini artırmasıdır.
Bu iki olay mutlaka çelişkili değil. OpenAI, eğitilmiş Astra sürümünü test etmeye ve iyileştirmeye devam edebilirken, daha büyük ölçekli yeni eğitim turunu beklemeye alabilir.
