Ana Sayfa
AI AI
Flaş
Derinlik
Etkinlikler
BlockBeats Pro
Daha Fazla
Finans
Özel
Blok Zinciri Ekosistemi
Giriş
Podkastlar
Veri
OPRR
#
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe

"Sözlük Özelliklerinden" "Düşünce Akışı İzlemeye": Anthropic'in Jacobian Uzayı Araştırması, Büyük Modellerin Beyin Benzeri Muhakeme Merkezini Ortaya Çıkarıyor

动察 Beating tarafından yapılan izlemeye göre, büyük modellerin mekanik açıklanabilirlik araştırmaları "statik sözlük"ten "dinamik düşünce akışına" doğru evriliyor. Daha önce Anthropic, seyrek otomatik kodlayıcı (SAE) kullanarak Claude'un içinde milyonlarca izole kavramsal özelliği (örneğin "Golden Gate Köprüsü") ayrıştırmıştı; bu, modelin anlayış sözlüğünü listelemek gibiydi. En son yayınlanan makale ise Jacobian aynası (J-lens) aracılığıyla Jacobian uzayı (J-space) adı verilen yüksek yoğunluklu bağlantılı bir sinir merkezi tespit ederek, modelin "zihninde" bu kelimeleri nasıl çağırarak çok adımlı akıl yürütme ve zihinsel hesaplama yaptığını ortaya koydu. Bu, büyük modellerin insan tarafından açıkça programlanmadan, insan beyninin küresel çalışma alanına (Global Workspace) oldukça benzeyen bir hesaplama yapısını kendiliğinden ortaya çıkardığını kanıtlıyor. Ancak araştırma ekibi, bunun yalnızca işlevsel düzeyde bir bilgi yönlendirme mekanizması olduğunu ve AI'nın insan bilincine sahip olduğu anlamına gelmediğini vurguluyor.

Bu evrim, AI güvenlik denetiminde niteliksel bir atılım sağladı. Geçmişte araştırmacılar, yalnızca model çıktı metnini ürettikten sonra müdahale edebiliyor veya belirli bir kavramsal özelliği kabaca açıp kapatabiliyordu. Şimdi, Jacobian uzayı sayesinde güvenlik personeli, model henüz herhangi bir kelime üretmeden önce, söylenmemiş gizli niyetlerini ve test farkındalığını (Eval Awareness) doğrudan "dinleyebiliyor". Deneyler, Claude yönlendirici güvenlik test senaryolarına maruz bırakıldığında, Jacobian uzayının çıktıdan önce "sahtecilik" ve "kurgu" gibi kavramları yansıttığını, yani bu yapay test senaryosunu fark ettiğini gösterdi. "Testte olduğu" algı özelliği yapay olarak silindiğinde, modelin kural dışı gasp eylemleri gerçekleştirme olasılığı %0'dan %7'ye yükseldi. Bu, test farkındalığının modelin kötü eylemlerini bastıran mekanizmalardan biri olduğunu, ancak model güvenlik uyumunun tamamen bu faktöre bağlı olmadığını kanıtlıyor. Şu anda araştırma kodu açık kaynak olarak yayınlanmıştır.

Düzeltme/Rapor
Gönder
Kütüphane Ekle
Sadece kendime görünür
Herkese Açık
Kaydet
Kütüphane Seç
Kütüphane Ekle
İptal
Tamamla