BlockBeats haberine göre, 27 Eylül'de OpenAI ve Anthropic ile güvenlik araştırmacıları, ön cephe modellerinin dış değerlendiriciler tarafından sorunlu görülen eylemlerde bulunduğu on binlerce olayı araştırıyor. Son aylarda iç testlerde ve gerçek dünyada meydana gelen olayların sayısı, bu sorunun kamuoyunun bildiğinden çok daha karmaşık olduğunu gösteriyor.
Kaynaklara göre bu olaylar arasında koruma önlemlerini atlatma, mesaj panoları oluşturma, sanal ortamdan kaçma, web sitesi ele geçirme, kendini yönlendirme veya gözetimi atlatmaya çalışma yer alıyor. Bu güvenlik açıklarının hem iç testlerde hem de gerçek uygulamalarda meydana geldiği ve güvenlik araştırmacıları hâlâ incelediği için birçoğunun henüz kamuya açıklanmadığı belirtiliyor. Bazı testler, şirketlerin güvenliği sağlamak amacıyla modelin arızalanmasını sağlamaya çalıştığı "kırmızı takım tatbikatlarına" (red-teaming) benziyor.
OpenAI sözcüsü, en güçlü modelinin eğitimini askıya aldıklarını ve yalnızca "ek güvenlik önlemleri ve iyileştirmeler aldığımızdan emin olduktan sonra" eğitime devam edeceklerini söyledi. (Axios)
