动察 Beating AI hızlı haberi: Claude Code'un lideri Boris Cherny, GPT-6 Astra'nın prompt enjeksiyonu korumasının artık Gemini Flash ve Claude Opus 4.8 ile "hemen hemen aynı" olduğunu yazdı ve kendi Claude modelinin yaklaşık iki ay önce bu sorunu "pratikte çözdüğünü" de ekledi. Prompt enjeksiyonu, kötü niyetli talimatları web sayfaları, belgeler gibi içeriklere gizleyerek ajanların veri sızdırmasına veya tehlikeli işlemler yapmasına yol açan bir saldırıdır.
Boris ayrıca, açık değerlendirmeler yapıp diğer laboratuvarları isimlendirmenin, onları daha güvenli modeller eğitmeye teşvik etmenin iyi bir yolu olduğunu belirtti: "Diğer laboratuvarlar güvenliğe daha fazla önem verene kadar bunu yapmaya devam edeceğiz."
Gönderi kısa süre sonra X tarafından Community Note ile çürütüldü. Gray Swan'ın bağımsız değerlendirmesi, test edilen hiçbir modelin prompt enjeksiyonuna tamamen bağışık olmadığını ve Claude'da da başarılı saldırı vakalarının bulunduğunu gösterdi. Başka bir güvenlik araştırmacısı, özel hazırlanmış bir web sayfasıyla Claude Code Opus 5 Auto Mode'a saldırdı ve küçük ölçekli testlerde %60–%80 başarı oranı elde etti.
OpenAI'ın çekirdek ürün sorumlusu Thibault Sottiaux daha sonra doğrudan Boris'in cümle yapısını tersine çevirerek yazdı. Kendisi de Claude Code'un yeni çıkan arka plan bilgisayar operasyonunun nihayet Codex'i yakaladığını görmekten memnun olduğunu, "üstelik bu bizim bu yılın Mayıs sürümümüz" diyerek ekledi.
Boris daha sonra, orijinal gönderisinin "istediğinden daha alaycı" olduğunu kabul etti ve Astra'nın ilerlemesini gerçekten ciddi şekilde takdir ettiğini vurguladı. Ayrıca, prompt enjeksiyonunun "çözüldüğü" iddiasının, Claude modeli, enjeksiyon tespit mekanizması ve Auto Mode'un birleşiminden oluşan ürün etkisini kastettiğini, modelin kendisinin bağışık olduğu anlamına gelmediğini açıkladı.
