Ana Sayfa
AI AI
Flaş
Derinlik
Etkinlikler
BlockBeats Pro
Daha Fazla
Finans
Özel
Blok Zinciri Ekosistemi
Giriş
Podkastlar
Veri
OPRR
#
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe

智谱GLM-5.2, DeepSWE açık kaynak sıralamasında zirveye yerleşti: Karmaşık geliştirme görevlerinin %44'ünü çözerek ana akım kapalı kaynak modelleri geride bıraktı.

动察 Beating tarafından yapılan izlemeye göre, Zhipu AI'nın açık kaynak modeli GLM-5.2, uzun vadeli yazılım mühendisliği kriteri DeepSWE'ye resmi olarak dahil oldu. Maksimum düşünme gücü modunda, karmaşık geliştirme görevlerinde tek seferde başarı oranı %44'e ulaşarak açık kaynak modeller arasında birinci sıraya yerleşti. Daha önce listeye giren Kimi K2.7 Code ile karşılaştırıldığında, başarı oranı 13 puan daha yüksek.

GLM-5.2'nin her bir görevi çözme ortalama maliyeti 3,92 dolar olup, Kimi K2.7 Code'un 2,82 dolarından biraz daha yüksek. Ancak başarı oranı, belirli düşünme yapılandırmaları altındaki birçok popüler kapalı kaynak modelin performansını geride bıraktı; bunlar arasında Claude Sonnet 4.6 [high] (%30), Gemini 3.5 Flash [medium] (%37) ve Claude Opus 4.8 [low] (%41) yer alıyor.

Değerlendirmeyi başlatan Datacurve tarafından tasarlanan DeepSWE kriteri, AI ajanlarının uzun görevleri çözme yeteneğini test etmek için özel olarak geliştirildi. Test, 5 dili kapsayan 113 gerçek programlama sorusunu içeriyor. Yalnızca tek bir kod parçasını değiştiren geleneksel testlerin aksine, DeepSWE, AI'nın birden fazla dosyayı eş zamanlı olarak değiştirmesini gerektiriyor ve ortalama olarak 600 satırdan fazla kodu düzeltiyor. Değerlendirme, izole edilmiş konteynerlerde çalıştırılıyor ve CPU ile bellek kaynakları sıkı bir şekilde sınırlandırılıyor.

举报 Düzeltme/Rapor
Düzeltme/Rapor
Gönder
Kütüphane Ekle
Sadece kendime görünür
Herkese Açık
Kaydet
Kütüphane Seç
Kütüphane Ekle
İptal
Tamamla