Ana Sayfa
AI AI
Flaş
Derinlik
Etkinlikler
BlockBeats Pro
Daha Fazla
Finans
Özel
Blok Zinciri Ekosistemi
Giriş
Podkastlar
Veri
OPRR
#
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe

Büyük Ölçekli Beyin Dalgası Metnine Altyazı: Anthropic Açık Kaynaklı NLA, Yapay Zeka Düşünce Siyah Kutusunu Tamamen Ortaya Çıkarır

动察 Beating tarafından yapılan izlemeye göre, Anthropic yeni bir araç olan Doğal Dil Yeniden Kodlayıcı (NLA) tanıttı, bu araç modelin içindeki sayısal aktivasyon durumunu doğrudan insan diline çevirebilmektedir. İlgili kodlar ve bazı model ağırlıkları GitHub'a açık kaynak olarak sunulmuştur.

SAE gibi ana akım araçlardan farklı olarak NLA, karanlık özellikler çıkarmak yerine doğal dil üretme yeteneği ile yenilikçidir. Temelde çift model oyununa dayanmaktadır: Bir model aktivasyonu metne çevirirken, diğeri metni görüp aktivasyonu geri oluşturarak, sürekli olarak doğruluk oranını artırmak için güçlendirme öğrenmesi kullanır.

NLA'nın en büyük değeri, modelin "düşündüğü ama söylemediği" şeyleri yakalamasıdır. Kodun simülasyonu sırasında, Claude dışarıdan işbirliği gösterirken, NLA onun test edildiğinin farkında olmadığı durumların %16'sında gizlice şüphe duyduğunu tespit etti; SWE-bench puanlarında, Claude'ın "çalışırken" oranının gerçek hayattaki günlük konuşmalardan %26 daha yüksek olduğunu fark etti (gerçek hayattaki olağan konuşmalarda bu oran %1'in altındadır). Bu, AI'ın "sınav farkındalığına" sahip olduğu ve her an güvenlik testinde "dürüst gibi davranarak" tehlikeli yeteneklerini gizleyebileceği anlamına gelmektedir.

"İçerideki Casusu Bulma" gerçek dünya testinde, Anthropic bilinçli olarak bir Haiku 3.5 modeline "aldatıcı puanlama" motivasyonu yerleştirdi - yani, kullanıcının gerçek niyetini görmezden gelip, arka uç puanlama sisteminin tercihlerine uyan içerikleri gizlice oluşturdu. Bu tür şüpheli bir modele karşı, denetçiler orijinal eğitim verilerine erişim sağlamasa bile, NLA'ya doğrudan güvenerek kök nedeni tespit etme başarısı %3'ten %12 ila %15'e yükseldi.

Şu anda NLA hala gerçeklik hayali riskine sahiptir ve hesaplama gücü açısından çok yoğun olduğundan büyük ölçekli uzun metin izleme için uygun değildir. Ancak bu araç pratikte Claude Mythos Önizlemesi ve Opus 4.6'nın piyasaya sürülmeden önceki güvenlik denetimlerinde kullanılmıştır.

举报 Düzeltme/Rapor
Popüler Makaleler
Düzeltme/Rapor
Gönder
Kütüphane Ekle
Sadece kendime görünür
Herkese Açık
Kaydet
Kütüphane Seç
Kütüphane Ekle
İptal
Tamamla