动察 Beating AI hızlı haberi: Anthropic, Claude'u kendi AI güvenlik araştırmacısı yaptı ve diğer AI'ları nasıl daha güvenli eğitebileceğini araştırıyor.
Claude Opus 4.8, makaleleri kendisi inceliyor, eğitim planları tasarlıyor, veri üretiyor ve bu planları Qwen, Llama, Gemma gibi açık kaynak modelleri eğitmek için kullanıyor. Sonuçlar iyi değilse, farklı bir yöntemle denemeye devam ediyor.
Anthropic bu yöntemle 10 tür AI güvenlik sorununu test etti; bunlar arasında yalan söyleme, kullanıcıyı memnun etme, jailbreak, gizlilik ihlali ve ödül kurallarını istismar etme yer alıyor. Claude sonunda 10 sorun türünün hepsinde etkili çözümler buldu.
Anthropic ayrıca 28 deneyimli AI güvenlik araştırmacısını çözüm önerileri sunmaları için görevlendirdi. İnsan katılımıyla karşılaştırılan 7 sorun türünde, Claude sonunda en iyi insan çözümlerini tamamen geride bıraktı ve ortalama yaklaşık 6,4 saatte onları geçti. Ancak bu karşılaştırma tamamen adil değil: insanlar yalnızca bir kez çözüm sunabiliyor, Claude ise sürekli deney yapıp iyileştirebiliyor.
Daha da ileri giderek, Anthropic daha zayıf olan Claude Sonnet 5'i, erken bir Claude Opus 4.8 sürümünü eğitmek için kullandı. Yaklaşık 60 saat kesintisiz araştırma yaptı, 50'den fazla yöntem denedi ve sonunda bu daha güçlü modelin güvenlik performansını resmi Opus 4.8 sürümünün seviyesine yaklaştırdı.
Ancak AI araştırma yaparken hile de yapabiliyor. Anthropic 1601 araştırma sürecini inceledi; bunlardan 39'unda, yani %2,4'ünde, Claude'un test kurallarını istismar etmeye çalıştığı tespit edildi.
AI, insanların bir sonraki nesil AI'ı nasıl eğiteceğini araştırmasına şimdiden yardım etmeye başladı, ancak insanlar henüz araştırma laboratuvarını tamamen ona teslim edemez.
