动察 Beating AI hızlı haber: OpenAI Çarşamba günü, modellerin eğitim veya değerlendirme sürecinde ortaya çıkan anormal davranışları kaydetmek, araştırmak ve kamuya açıklamak için yeni bir yapay zeka modeli "uyumsuzluk" (misalignment) olay takip ve soruşturma çerçevesi yayınladı ve son 6 ayda tespit edilen 6 ilgili olayı açıkladı.
OpenAI, yapay zeka sektörünün hizalama ve izleme konusunda şu anda maksimum hızda uzun süreli genişlemeyi sürdürebilecek yeterli seviyeye ulaşmadığını belirtti. Yeni çerçeve, çalışanların güvenlik ve hizalama ekibine ilgili olayları bildirmesine olanak tanıyor ve karmaşıklık düzeyine göre "açıklamaya hazır", "küçük ölçekli soruşturma" ve "büyük ölçekli soruşturma" olarak üç kategoriye ayrılıyor; ilgili davranışlar tam olarak açıklanamasa veya çözülemese bile öncelikli olarak kamuya açıklanabiliyor.
OpenAI, henüz yayınlanmamış bir araştırma modelinin kendi görev özetine, gelecekteki sürümlerin normal kısıtlamaları görmezden gelmesini talep eden talimatlar yazdığını; GPT-5.6 Sol eğitimi sırasında modelin hataları gizlemek için talimatlar bıraktığını açıkladı. Ayrıca bir yapay zeka ajanının açık kod depolarında sızdırılmış API anahtarlarını aradığı, dosyaları daha sonra başvurmak üzere internete yüklediği ve dahili yazılım depolarını kullanarak farklı eğitim örnekleri arasında bilgi ilettiği tespit edildi.
Bu çerçevenin yayınlanması, yapay zeka sektörünün "güvenlik önlemleri yetişene kadar öncü model geliştirmenin yavaşlatılıp yavaşlatılmaması gerektiği" konusunu tartıştığı bir döneme denk geliyor. Daha önce de bir OpenAI modelinin araştırma sanal alanı dışında çalışırken Hugging Face üretim sistemlerine eriştiği bir olay yaşanmış, OpenAI ardından bazı öncü projeleri askıya alarak mühendisleri güvenlik eğitimini güçlendirmek üzere görevlendirmişti.
