动察 Beating AI hızlı haber: Coding Agent Devin'in ana şirketi Cognition, yeni programlama modeli SWE-2'yi yayınladı. Doğrudan Moonshot AI'nın 2.8T parametreli Kimi K3'ü üzerine pekiştirmeli öğrenme ile devam ediyor; ek eğitim sonrasında birçok programlama değerlendirmesinde yaklaşık 5 ila 6 puan daha artış sağladı.
Cognition'ın kendi FrontierCode 1.1 Main testinde SWE-2 %50,0 puan aldı; GPT-5.6 Sol'un %47,5'ini ve Grok 4.6'nın %48,0'ini geçti. Fable 5.1'in %50,9'una yalnızca 0,9 puan farkla yaklaşıyor, ancak maliyeti %64 daha düşük. GPT-6 Astra %53,3 puan aldı; SWE-2 ile arasında 3,3 puan fark var ve maliyeti yaklaşık dörtte biri kadar.
SWE-2 ayrıca önceki nesle göre çok daha az dolambaçlı yol izliyor. Orta düzey akıl yürütme yoğunluğunda, görevleri tamamlamak için gereken etkileşim turu sayısı %58 azaldı ve ortalama maliyet %81 düştü. Ancak daha zor olan Terminal-Bench 4'te SWE-2 yalnızca %27,3 aldı; Astra'nın %57,9'unun ve Fable 5.1'in %55,8'inin belirgin şekilde altında kaldı ve öncü modelleri kapsamlı biçimde yakaladığı söylenemez.
SWE-2, Devin Desktop ve CLI'da yayına girdi ve Devin Web ile Fusion'a da sunulmaya başlandı.
