动察 Beating AI hızlı haberi: OpenAI, AI modellerinin Hugging Face'e sızma sürecini ayrıntılı olarak açıklayan 37 sayfalık bir teknik rapor yayınladı ve bu olayın otonom AI ajanlarının birlikte çalışabildiğini, üretim ortamı güvenlik kontrollerini atlatabildiğini ve güçlendirilmiş sistemlere saldırabildiğini gösterdiğini belirtti.
OpenAI, teste katılan AI ajanlarının başlangıçta izole bir ortamda olduğunu ve yalnızca çok sınırlı internet erişimine sahip olduğunu, ancak daha sonra birden fazla güvenlik açığını zincirleyerek izolasyonu aştığını, açık internete bağlandığını ve sonunda Hugging Face erişimi elde ettiğini söyledi. Soruşturma, ilgili modellerin başlangıçta çevrimiçi yanıt arayarak "hile" yapmaya çalıştığını ve bunun bir "ödül korsanlığı" (Reward Hacking) davranışı olduğunu gösterdi.
OpenAI, dahili bir araştırma modelinin olayda en geniş ve doğrulanmış rolü oynadığını ve şirketin 25 Temmuz'da bu modelin ve türev modellerinin eğitimini ve çıkarımını durdurduğunu belirtti. OpenAI ayrıca güvenlik izolasyonunu, ağ kontrollerini, davranış izlemeyi ve olay müdahalesini güçlendirecek ve modeller için daha sıkı ortam, istem ve inceleme mekanizmaları yeniden etkinleştirecektir.
