Ana Sayfa
AI AI
Flaş
Derinlik
Etkinlikler
BlockBeats Pro
Daha Fazla
Finans
Özel
Blok Zinciri Ekosistemi
Giriş
Podkastlar
Veri
OPRR
#
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe

SemiAnalysis İncelemesi: GPT-5.5'in Geri Dönüşü, Ancak OpenAI Opus Tarafından Ezilen Bir Başarıyı Gizlice Sakladı

动察 Beating 监测ine göre, yarıiletken ve yapay zeka analiz kurumu SemiAnalysis, programlama asistanı yatay karşılaştırma yayınladı. Bu karşılaştırma GPT-5.5, Opus 4.7 ve DeepSeek V4'ü kapsıyor. Temel bulgular: GPT-5.5, OpenAI'nin yarı yıl sonra tekrar öne çıktığı bir programlama modeli oldu. SemiAnalysis mühendisleri Codex ve Claude Code arasında geçişe başladı. Daha önce neredeyse tamamen Claude Code kullanan ekip artık GPT-5.5'e geçiş yapıyor. GPT-5.5, GPT-4.5'ten sonra ilk kez ölçeğini genişlettiği OpenAI tarafından "Spud" kod adıyla yeni bir ön eğitim almıştır.

Karşılaştırmada belirgin bir iş bölümü ortaya çıktı: Claude yeni proje planlamasını ve başlangıç yapısını oluşturmayı yaparken, Codex yoğun düşünce gerektiren hata düzeltmelerini yapmaktadır. Codex, veri yapılarını anlama ve mantıksal akıl yürütme konusunda daha güçlüdür, ancak bulanık kullanıcı niyetini çıkarsatma konusunda zayıftır. Aynı gösterge paneli görevinde Claude referans sayfa düzenini otomatik kopyalarken ancak veriler büyük ölçüde uydurma yapmaktadır, Codex ise düzeni atlar ancak veriler çok daha doğru olur.

Makale, bir karşılaştırma testi ayrıntısını açığa çıkardı: OpenAI şubat ayında endüstriyi programlamaya yönelik yeni bir standart olan SWE-bench Pro'yu kullanmaya çağıran bir blog yazısı yayınladı, ancak GPT-5.5 duyurusu yeni bir "Expert-SWE" adlı bir ölçüt kullanmaya karar verdi. Nedeniyse duyurunun en altında küçük puntolar içinde gizli: GPT-5.5, SWE-bench Pro'da Opus 4.7 tarafından geride bırakıldı ve henüz açıklanmayan Anthropic'in Mythos (77.8%)'ının oldukça gerisindedir.

Opus 4.7'ye gelince, Anthropic, bir hafta sonra bir inceleme yayınladı ve Claude Code'un mart-nisan ayları arasında üç hata içerdiğini ve bu hataların haftalarca devam ettiğini kabul etti. Daha önce birkaç mühendisin 4.6'nın performansının düştüğü yönündeki bildirimleri subjektif bir algı olarak ele alınmıştı. Ayrıca 4.7'nin yeni belirteç oluşturucusunun belirteç kullanımını %35'e kadar artıracağını kabul eden Anthropic, bu durumu fiyat artışı olarak görmektedir.

DeepSeek V4, "önde gelen değil ancak önde geleni takip eden" olarak değerlendirildi ve kapalı kaynaklı modeller için en düşük maliyetli alternatif olacaktır. Makale ayrıca, "Çince yazma konusundaki zor bir görevde Claude'un hala DeepSeek V4 Pro'dan daha iyi performans gösterdiğini" belirtti ve "Claude'un rakibin dilini kullanarak Çin modelini yendiğini" yorumladı.

Makale, önemli bir kavram ortaya koydu: Model fiyatlandırmasını değerlendirirken "her görev maliyeti"ne bakılmalıdır, "her belirteç maliyeti" değil. GPT-5.5'un birim fiyatı GPT-5.4'ün iki katıdır (giriş başına 5 dolar, çıkış başına 30 dolar / milyon belirteç), ancak aynı görevi tamamlamak için daha az belirteç kullanır, bu nedenle gerçek maliyet her zaman daha yüksek olmayabilir. SemiAnalysis'in ilk verileri gösteriyor ki, Codex'in giriş-çıkış oranı 80:1 iken, Claude Code'unkinden (100:1) daha düşüktür.

举报 Düzeltme/Rapor
Düzeltme/Rapor
Gönder
Kütüphane Ekle
Sadece kendime görünür
Herkese Açık
Kaydet
Kütüphane Seç
Kütüphane Ekle
İptal
Tamamla