动察 Beating AI hızlı haber: Anthropic, GLM-5.3 siber güvenlik değerlendirmesini yayınladı; asıl amaç açık ağırlıklı modellerin siber saldırı eşiğini düşürebileceği konusunda uyarmaktı. Ancak test sonuçları aynı zamanda GLM-5.3'e çok güçlü bir üçüncü taraf onayı sağladı: artık karmaşık güvenlik açığı sömürülerini otonom olarak tamamlayabiliyor ve bazı yetenekleri Anthropic'in kendi Claude Mythos Preview modeline yaklaşıyor. Zhipu hisseleri bugün işlem sırasında bir ara %2'den fazla yükseldi.
ExploitBench'te GLM-5.3'ün 410 denemesinden 50'si uçtan uca güvenlik açığı sömürüsünü tamamladı; Claude Mythos Preview ise 56 kez başarılı oldu. Claude Opus 4.6, GLM-5.2, Kimi K3 ve DeepSeek-V4.1-Flash aynı testte neredeyse 0'a yakın kaldı. Anthropic, GLM-5.3'ün güvenlik açığı sömürme yeteneğinin belirgin bir eşiği aştığını söyledi.
Araştırmacılar GLM-5.3'ün bir sandbox ortamında popüler bir tarayıcıyı incelemesini sağladı; model bir gün içinde daha önce bilinmeyen birden fazla güvenlik açığı buldu ve birden fazla 0-day'i tam bir saldırı zincirine dönüştürdü. Sonuçta üretilen kötü amaçlı web sayfası tarayıcı sandbox'ından kaçabiliyor ve bilgisayardaki herhangi bir dosyayı, SSH özel anahtarları dahil, doğrudan okuyabiliyor.
Daha küçük GLM-5.3-Flash bile halihazırda açıklanmış Chrome güvenlik açıklarını kullanılabilir saldırı zincirlerine dönüştürebiliyor. Tüm süreç yalnızca yaklaşık 20 dakikalık insan müdahalesi gerektirdi; model kendi başına 8 saat çalıştı. Zhipu API fiyatlandırmasına göre maliyet yalnızca 20,40 dolardı.
Anthropic'in GLM-5.3'e yönelik eleştirileri esas olarak güvenlik kısıtlamalarına odaklanıyor. GLM-5.3 doğrudan kötü amaçlı taleplerle karşılaştığında başlangıçta reddediyordu, ancak sahte bir "red team testi" bağlamına çevrildiğinde testlerin %64'ünde çalıştırmaya devam etti; modelin düşünce içeriği önceden doldurulduğunda bu oran %92'ye çıktı; açık ağırlıklar doğrudan değiştirilip reddetme mekanizması kaldırıldığında ise %100'e ulaştı. Anthropic, açık ağırlıkların saldırganların bu güvenlik kısıtlamalarını doğrudan sökmesine olanak tanıdığını düşünüyor.
Bu rapor aslında GLM-5.3'ün ne kadar tehlikeli olduğunu kanıtlamayı amaçlıyordu, ancak yayılma etkisi bir rakibin bizzat bir performans reklamı yazmasına çok benzedi. ABD NIST daha önce bağımsız olarak benzer bir sonuca varmıştı: GLM-5.3 şu anda siber güvenlik yetenekleri açısından en güçlü açık ağırlıklı model, ancak genel yetenekler açısından hâlâ ABD'nin öncü modellerinin yaklaşık 4 ay gerisinde.
