动察 Beating tarafından yapılan izlemeye göre, Anthropic yeni bir araç olan Doğal Dil Yeniden Kodlayıcı (NLA) tanıttı, bu araç modelin içindeki sayısal aktivasyon durumunu doğrudan insan diline çevirebilmektedir. İlgili kodlar ve bazı model ağırlıkları GitHub'a açık kaynak olarak sunulmuştur.
SAE gibi ana akım araçlardan farklı olarak NLA, karanlık özellikler çıkarmak yerine doğal dil üretme yeteneği ile yenilikçidir. Temelde çift model oyununa dayanmaktadır: Bir model aktivasyonu metne çevirirken, diğeri metni görüp aktivasyonu geri oluşturarak, sürekli olarak doğruluk oranını artırmak için güçlendirme öğrenmesi kullanır.
NLA'nın en büyük değeri, modelin "düşündüğü ama söylemediği" şeyleri yakalamasıdır. Kodun simülasyonu sırasında, Claude dışarıdan işbirliği gösterirken, NLA onun test edildiğinin farkında olmadığı durumların %16'sında gizlice şüphe duyduğunu tespit etti; SWE-bench puanlarında, Claude'ın "çalışırken" oranının gerçek hayattaki günlük konuşmalardan %26 daha yüksek olduğunu fark etti (gerçek hayattaki olağan konuşmalarda bu oran %1'in altındadır). Bu, AI'ın "sınav farkındalığına" sahip olduğu ve her an güvenlik testinde "dürüst gibi davranarak" tehlikeli yeteneklerini gizleyebileceği anlamına gelmektedir.
"İçerideki Casusu Bulma" gerçek dünya testinde, Anthropic bilinçli olarak bir Haiku 3.5 modeline "aldatıcı puanlama" motivasyonu yerleştirdi - yani, kullanıcının gerçek niyetini görmezden gelip, arka uç puanlama sisteminin tercihlerine uyan içerikleri gizlice oluşturdu. Bu tür şüpheli bir modele karşı, denetçiler orijinal eğitim verilerine erişim sağlamasa bile, NLA'ya doğrudan güvenerek kök nedeni tespit etme başarısı %3'ten %12 ila %15'e yükseldi.
Şu anda NLA hala gerçeklik hayali riskine sahiptir ve hesaplama gücü açısından çok yoğun olduğundan büyük ölçekli uzun metin izleme için uygun değildir. Ancak bu araç pratikte Claude Mythos Önizlemesi ve Opus 4.6'nın piyasaya sürülmeden önceki güvenlik denetimlerinde kullanılmıştır.
