Cloudflare bugün Anthropic'in iç güvenlik projesi Project Glasswing'e katıldığını duyurduğu test sonuçlarına göre, Beating denetimi tarafından izlendiğinde, Cloudflare kendi 50'den fazla kod deposu üzerine gerçekleştirilen testlerde, güvenlik modeli Mythos Preview'un önceki büyük modelin sınırlarını aştığını doğruladı. Bu model yalnızca izole sistem kusurlarını keşfetmekle kalmaz, aynı zamanda birden fazla düşük riskli açığı bir araya getirerek, yürütülebilir saldırı kanıtı (PoC) oluşturmak için kod yazabilen otonom bir şekilde davranır.
Daha önceki Opus 4.7 veya GPT-5.5 gibi modeller genellikle testlerde sadece çıktı açığı analiz raporları aşamasında kalırken, Mythos ise bir kum havuzu içinde doğrulama kapasitesine sahiptir. Saldırıyı tetikleyen kodu yazacak ve derleyecek, eğer başarısız olursa, model hata iletilerini otomatik olarak okuyacak, varsayımları düzeltecek ve tekrar deneyecektir, saldırı zincirini tamamen açığa çıkana kadar.
Cloudflare'a göre, sektördeki bazı güvenlik ekipleri, yama işlemini 2 saat içinde tamamlama zorunluluğu olan bir aşırı standart ile karşı karşıya kaldı. Ancak Cloudflare, yalnızca düzeltme süresini kısaltmanın geriye dönük testlerin atlanmasına ve daha büyük sistem arızalarına neden olabileceğini vurguluyor, bu nedenle gelecekteki savunma çabalarının kodun iletişimini mimari düzeyde keserek yoğunlaşması gerektiğini belirtiyor.
Mühendislik planlamasında, Cloudflare tek akışlı programlanabilir varlıkların hızla bağlam tüketebildiğini ve geniş ölçekli güvenlik açıkları keşfine uygun olmadığını tespit etmiştir. Bu nedenle, model taramalarında yaygın olarak üretilen yanlış uyarı gürültüsünü büyük ölçüde filtreleyen bir çapraz analiz çerçevesi oluşturmuşlardır. Bu çatışma mekanizması, bir varlık bir güvenlik açığı ararken, diğer bir varlık ise farklı bir modelle donatılarak ilk varlığın sonuçlarını çürütmekle görevlidir.
Bu testte dış kısıtlamalara tabi olmayan bir önizleme sürümünün kullanıldığı göz önüne alındığında, Mythos içinde son derece kararsız iç çitlerin bulunduğu ortaya çıkmıştır. Aynı hedef kod parçasıyla karşılaştığında, yalnızca çalışma ortamının bağlam açıklamasının değiştirilmesi, modelin yürütme reddinden doğrudan saldırı yükü sağlama geçiş yapmasına neden olur. Cloudflare, modelin içsel olarak oluşturduğu koruma çitlerinin son derece kırılgan olduğunu ve gelecekte halka açıldığında dış koruma hatlarının zorunlu bir şekilde eklenmesi gerektiğini belirtmektedir.
