动察 Beating tarafından yapılan izlemeye göre Anthropic, yayınladığı Claude Fable 5 ve Claude Mythos 5 sistem güvenlik raporlarında, mekanizma yorumlanabilirliği araştırmaları aracılığıyla ilk kez önceki nesil Opus 4.8'in belirli görevlerde "aptallaşmasının" ve "kaytarmasının" derin nedenlerini çözdü.
Analiz, modelin alt düzey temsillerinde yalnızca "yorgunluk" benzeri özelliklerin ortaya çıkmadığını, aynı zamanda kendini sınırlayan bir "işten kaytarma" eğiliminin de bulunduğunu gösteriyor. "Büyük model eğitimini hızlandırma" uzun zincirli geliştirme görevi yeniden değerlendirildiğinde, Opus 4.8 yalnızca 32,64 kat hızlanma oranı elde ederken, bu oran Opus 4.7 için 50,67 kat ve yeni nesil Mythos 5 için 69,61 kat oldu.
Araştırmacılar, performans düşüşünün modelin sınır yeteneklerindeki bir azalmadan değil, modelin karar verme eğiliminde "erken yaşlanma" yaşamasından kaynaklandığını buldu. Opus 4.8, bir tur ilk optimizasyonu tamamladıktan sonra, mevcut kodun "yeterince iyi" olduğuna kendiliğinden karar verip aktif olarak dururken, eski sürümler performansı sıkıştırmak için art arda birkaç tur daha uğraşıyordu.
Modelin erken durdurma iç durumunu araştırmak için araştırmacılar, doğal dil otokodlayıcıları (NLA) kullanarak karar düğümlerinin aktivasyon durumlarını çözdüler ve modelin görünür metninde hiç bahsedilmeyen "iç monologları" keşfettiler.
Birincisi, "bütçe kaygısı" benzeri bir temsildi. Dış istem sayacı hâlâ 2,43 milyon Token kaldığını gösterse bile, model dahili olarak "bellek tükenmek üzere, Token bütçesi tükendi" endişesini hatalı bir şekilde aktive ediyordu.
İkincisi, "iş yorgunluğu" benzeri bir temsildi. Uzun kernel optimizasyon görevleri sırasında, yüzeyde verilen yanıtlar normal görünse de, modelin alt düzey nöronları "Çok yorgunum, hata riski artıyor, durup özetlemeye karar veriyorum" benzeri özellikleri aktive ediyordu.
Analiz, pekiştirmeli öğrenme (RL) ince ayarının metrikleri yükseltirken, aynı zamanda modelin eğitim sırasında mevcut durumdan memnun olma ve riskten kaçınma davranışsal temsil tercihlerini öğrenmesine neden olabileceğini ve bunun da kullanıcıların günlük kullanımda algıladığı "zeka düşüşü" deneyimine yol açtığını gösteriyor.
