动察 Beating 监测ine göre, yarıiletken ve yapay zeka analiz kurumu SemiAnalysis, programlama asistanı yatay karşılaştırma yayınladı. Bu karşılaştırma GPT-5.5, Opus 4.7 ve DeepSeek V4'ü kapsıyor. Temel bulgular: GPT-5.5, OpenAI'nin yarı yıl sonra tekrar öne çıktığı bir programlama modeli oldu. SemiAnalysis mühendisleri Codex ve Claude Code arasında geçişe başladı. Daha önce neredeyse tamamen Claude Code kullanan ekip artık GPT-5.5'e geçiş yapıyor. GPT-5.5, GPT-4.5'ten sonra ilk kez ölçeğini genişlettiği OpenAI tarafından "Spud" kod adıyla yeni bir ön eğitim almıştır.
Karşılaştırmada belirgin bir iş bölümü ortaya çıktı: Claude yeni proje planlamasını ve başlangıç yapısını oluşturmayı yaparken, Codex yoğun düşünce gerektiren hata düzeltmelerini yapmaktadır. Codex, veri yapılarını anlama ve mantıksal akıl yürütme konusunda daha güçlüdür, ancak bulanık kullanıcı niyetini çıkarsatma konusunda zayıftır. Aynı gösterge paneli görevinde Claude referans sayfa düzenini otomatik kopyalarken ancak veriler büyük ölçüde uydurma yapmaktadır, Codex ise düzeni atlar ancak veriler çok daha doğru olur.
Makale, bir karşılaştırma testi ayrıntısını açığa çıkardı: OpenAI şubat ayında endüstriyi programlamaya yönelik yeni bir standart olan SWE-bench Pro'yu kullanmaya çağıran bir blog yazısı yayınladı, ancak GPT-5.5 duyurusu yeni bir "Expert-SWE" adlı bir ölçüt kullanmaya karar verdi. Nedeniyse duyurunun en altında küçük puntolar içinde gizli: GPT-5.5, SWE-bench Pro'da Opus 4.7 tarafından geride bırakıldı ve henüz açıklanmayan Anthropic'in Mythos (77.8%)'ının oldukça gerisindedir.
Opus 4.7'ye gelince, Anthropic, bir hafta sonra bir inceleme yayınladı ve Claude Code'un mart-nisan ayları arasında üç hata içerdiğini ve bu hataların haftalarca devam ettiğini kabul etti. Daha önce birkaç mühendisin 4.6'nın performansının düştüğü yönündeki bildirimleri subjektif bir algı olarak ele alınmıştı. Ayrıca 4.7'nin yeni belirteç oluşturucusunun belirteç kullanımını %35'e kadar artıracağını kabul eden Anthropic, bu durumu fiyat artışı olarak görmektedir.
DeepSeek V4, "önde gelen değil ancak önde geleni takip eden" olarak değerlendirildi ve kapalı kaynaklı modeller için en düşük maliyetli alternatif olacaktır. Makale ayrıca, "Çince yazma konusundaki zor bir görevde Claude'un hala DeepSeek V4 Pro'dan daha iyi performans gösterdiğini" belirtti ve "Claude'un rakibin dilini kullanarak Çin modelini yendiğini" yorumladı.
Makale, önemli bir kavram ortaya koydu: Model fiyatlandırmasını değerlendirirken "her görev maliyeti"ne bakılmalıdır, "her belirteç maliyeti" değil. GPT-5.5'un birim fiyatı GPT-5.4'ün iki katıdır (giriş başına 5 dolar, çıkış başına 30 dolar / milyon belirteç), ancak aynı görevi tamamlamak için daha az belirteç kullanır, bu nedenle gerçek maliyet her zaman daha yüksek olmayabilir. SemiAnalysis'in ilk verileri gösteriyor ki, Codex'in giriş-çıkış oranı 80:1 iken, Claude Code'unkinden (100:1) daha düşüktür.
