动察 Beating AI hızlı haber: YC tarafından kuluçkaya alınan AI veri şirketi Specific Labs, Coding Agent'ları gerçek şirketlerin özel kodlarıyla test eden Real-SWE adlı programlama değerlendirme platformunu tanıttı. Görevler doğrudan kurumsal üretim ortamlarından geliyor; vergi hesaplama, fatura taşıma, API faturalandırma ve müşteri verisi taşıma gibi işleri kapsıyor. Kod ve cevaplar internette açıklanmadığı için Agent'ın şirketin iş kurallarını ve kod yapısını kendi başına çözmesi gerekiyor.
Sonuçlara göre Fable 5.1 birinci sırada yer aldı, ancak geçme oranı yalnızca %38,8 oldu; GPT-6 Astra %33,8, Gemini 3.8 Flash ise %31,2 aldı. GLM 5.3 %28,8 ile dördüncü sırada yer alarak Grok 4.6, Kimi K3 ve GPT-5.6 Sol'un önüne geçti. Şu anda açık olan 10 görevden 6'sında genel geçme oranı %15'in altında kaldı ve bir görevde tüm modeller başarısız oldu.
En çok şaşırtan sonuç GLM 5.3 oldu. Real-SWE, Agent'ın yabancı bir projede sürekli kod okuyup kuralları bulma ve çok adımlı değişiklikleri tamamlama becerisini daha fazla test ediyor. Zhipu araştırmacısı Xiaopu Peng, GLM-5.1'den itibaren uzun vadeli görevler üzerinde eğitim yaptıklarını, Real-SWE'nin bu tür yetenekler açısından halka açık SWE sıralamalarından daha yakın olduğunu belirtti; bu da GLM 5.3'ün bu sıralamada neden öne çıktığını kısmen açıklıyor.
