动察 Beating AI 快讯,Anthropic,Claude'un gizli düşüncelerine "bağlam kilidi" eklemeye başladı. Fable 5.1 API aracılığıyla üretilen şifreli düşünceler, artık oluşturuldukları sistem istemi, araçlar ve geçmiş mesajlarla birlikte aynen geri gönderilmek zorunda. Önceki içerik değiştirilirse, API hata verir veya bu düşünceyi doğrudan atar.
Bu değişiklik, model damıtmayı önlemek için yapıldı. Araştırmacılar daha önce, Claude'un şifreli düşüncelerinin kullanıcılar tarafından anlaşılamasa da, Anthropic'in uyumlu modellerine yeniden okutulabileceğini keşfetti. Saldırganlar önce Opus'a yüksek kaliteli akıl yürütme yaptırabilir, ardından şifreli bloğu daha zayıf korumalı Haiku'ya vererek onu Opus'un tam düşüncesini okumaya teşvik edebilir. Bu, yalnızca büyük modelin cevabını kopyalamak değil, aynı zamanda taslak kağıdındaki çözüm sürecini de almak anlamına gelir.
Anthropic, Haziran ayında Fable 5'i yayınladığında bu konuyu bir kez ele almış ve şifreli düşünceleri modele bağlamaya başlamıştı; artık Haiku gibi küçük modellere şifre çözdürmek mümkün değildi. Fable 5.1 bu kez "diyalog bağlaması" ekledi: model değişmese bile, önceki istem, araç veya sohbet geçmişi değiştirilirse, eski düşünceler de geçersiz olur.
Bu kilit henüz tamamen açılmadı. 31 Ağustos'tan sonra açılan yeni API hesapları Fable 5.1'i çağırdığında zorunlu olacak; eski hesaplar şimdilik etkilenmeyecek. Claude.ai, Claude Code, Cowork ve diğer Claude modelleri de kapsam dışında. Anthropic, gelecekte yayınlanacak yeni modellerde bu kuralların tüm kullanıcılar için varsayılan olarak etkinleştirileceğini belirtti.
