Ana Sayfa
AI AI
Flaş
Derinlik
Etkinlikler
BlockBeats Pro
Daha Fazla
Finans
Özel
Blok Zinciri Ekosistemi
Giriş
Podkastlar
Veri
OPRR
#
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe

Programcıların yerini gerçekten almasına daha çok var: Agent'ların kurumsal özel kodlara girmesiyle en yüksek geçme oranı bile sadece yüzde kırk.

动察 Beating AI hızlı haber: YC tarafından kuluçkaya alınan AI veri şirketi Specific Labs, Coding Agent'ları gerçek şirketlerin özel kodlarıyla test eden Real-SWE adlı programlama değerlendirme platformunu tanıttı. Görevler doğrudan kurumsal üretim ortamlarından geliyor; vergi hesaplama, fatura taşıma, API faturalandırma ve müşteri verisi taşıma gibi işleri kapsıyor. Kod ve cevaplar internette açıklanmadığı için Agent'ın şirketin iş kurallarını ve kod yapısını kendi başına çözmesi gerekiyor.


Sonuçlara göre Fable 5.1 birinci sırada yer aldı, ancak geçme oranı yalnızca %38,8 oldu; GPT-6 Astra %33,8, Gemini 3.8 Flash ise %31,2 aldı. GLM 5.3 %28,8 ile dördüncü sırada yer alarak Grok 4.6, Kimi K3 ve GPT-5.6 Sol'un önüne geçti. Şu anda açık olan 10 görevden 6'sında genel geçme oranı %15'in altında kaldı ve bir görevde tüm modeller başarısız oldu.


En çok şaşırtan sonuç GLM 5.3 oldu. Real-SWE, Agent'ın yabancı bir projede sürekli kod okuyup kuralları bulma ve çok adımlı değişiklikleri tamamlama becerisini daha fazla test ediyor. Zhipu araştırmacısı Xiaopu Peng, GLM-5.1'den itibaren uzun vadeli görevler üzerinde eğitim yaptıklarını, Real-SWE'nin bu tür yetenekler açısından halka açık SWE sıralamalarından daha yakın olduğunu belirtti; bu da GLM 5.3'ün bu sıralamada neden öne çıktığını kısmen açıklıyor.

举报 Düzeltme/Rapor
Düzeltme/Rapor
Gönder
Kütüphane Ekle
Sadece kendime görünür
Herkese Açık
Kaydet
Kütüphane Seç
Kütüphane Ekle
İptal
Tamamla