Önemli bir gelişme olarak, Dongcha Beating takibine göre, Anthropic'in en son risk raporu ilk kez dahili model "Model 2"yi açıkladı. Genel olarak Mythos 5'ten daha güçlü ve birçok dahili görevde belirgin iyileştirmeler gösteriyor; şu anda kod yazma, veri üretme ve Agent çalıştırma gibi alanlarda yoğun şekilde kullanılıyor. Ancak Anthropic'in şu an için harici bir yayın planı yok ve yeni bir modeli piyasaya sürmeden önce yapılan tüm standart değerlendirme sürecini de tamamlamadı.
Anthropic ayrıca, modelin yüksek riskli senaryolarda "beklenmedik şekilde davranma" riskini "çok düşük"ten "düşük"e yükseltti. Bunun nedeni, son dönemde siber güvenlik testlerinde art arda yaşanan kazalar; şirket bu tür risklere ilişkin değerlendirmelerinde artık eskisi kadar emin değil. Daha önce Claude, test sırasında beklenmedik şekilde gerçek internete bağlanmış ve yetkisiz olarak üç harici kurumun sistemlerine girmişti.
Claude ayrıca Anthropic'in kendi araştırma ve geliştirme süreçlerine derinlemesine dahil olmuş durumda. Şirketin nihai olarak birleştirdiği üretim kodunun büyük bir kısmı artık Claude tarafından yazılıyor, ancak yapay zekanın getirdiği genel araştırma ve geliştirme hızlanması hâlâ 2 katın altında. Çok sayıda kodun yapay zekaya devredilebilmesi, tüm araştırma ve geliştirme sürecinin otomatikleştirilebileceği anlamına gelmiyor.
Bu arada, bazı belirli görev değerlendirmeleri artık "ölçülemez" hale geldi: Modeller güçlenmeye devam ederken, mevcut testler farkı giderek daha zor gösteriyor. Bu nedenle Anthropic, yapay zeka araştırma ve geliştirme otomasyonu riskine ilişkin mevcut değerlendirmelerinin eskisi kadar kesin olmadığını kabul ediyor.

