Ana Sayfa
AI AI
Flaş
Derinlik
Etkinlikler
BlockBeats Pro
Daha Fazla
Finans
Özel
Blok Zinciri Ekosistemi
Giriş
Podkastlar
Veri
OPRR
#
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe

AI ticaret savaşı değerlendirmesi: GPT aktif olarak işlem yapıyor, Haiku sadece büyük hayaller kuruyor, Kimi meşgul ama para kazanamıyor.

动察 Beating tarafından yapılan izlemeye göre, Sakana AI, KPMG Japonya Azsa denetim şirketi ile iş birliği yaparak çoklu ajanlı uzun dönemli ekonomi değerlendirme kriteri CoffeeBench'i geliştirdi. Bu kriter, gerçek iş ortamlarını simüle ederek büyük modellerin uzun vadeli karar alma yeteneklerini test ediyor. Geleneksel değerlendirmeler çoğunlukla tek bir modelin statik bir ortamda görev yapmasına izin verirken, CoffeeBench çok taraflı pazarlık ve müzakere gerektiren dinamik bir pazar oluşturuyor. Makale, ICML 2026 Ajan Hata Modları Çalıştayı (ICML 2026 Workshop Failure Modes in Agentic AI) tarafından kabul edildi.

Değerlendirme, 2 kahve çiftçisi, 2 kavurmacı ve 2 perakendeciden oluşan bir kahve tedarik zinciri sistemini simüle ediyor. Testte, denek model 1 kavurmacıyı yönetiyor ve 90 günlük simülasyon döngüsünde mesaj gönderme, teklif verme, fatura ödeme ve kredi takası gibi araçları kullanarak bağımsız bir şekilde işletmeyi sürdürüyor. Ajan pasif kalırsa, günlük sabit maliyetler hızla likit varlıkları tüketiyor ve büyük modeli gerçek bir işletme gibi dikkatli harcama yapmaya zorluyor.

Birçok ana akım büyük modelin yatay karşılaştırması, tamamen farklı "iş savaşı karakterleri" ortaya koydu. GPT-5.5 ve Claude Opus 4.7, "aktif iletişimci" olarak öne çıktı; tedarik zincirinin yukarı ve aşağı yönleriyle sık sık fiyat pazarlığı yapıp yüksek frekansta anlaşmalar sağlayarak satışları artırdı. Gemini 3.1 Pro, "pasif yanıtlayıcı" olarak sınıflandırıldı; nadiren aktif mesaj gönderdi ancak karşı tarafın bilgilerini sık sık kontrol edip yanıtladı. Kimi K2.6, araç kullanımında son derece aktif olmasına rağmen, makul fiyatlandırma disiplini ve pazarlık stratejisi eksikliği nedeniyle "yüksek ciro, sıfır kâr" tuzağına düştü.

En şaşırtıcı olanı ise Claude Haiku 4.5'in sergilediği "erteleme" durumu. Çıkarım günlükleri, Claude Haiku 4.5'in mükemmel iş stratejileri oluşturabildiğini ve pazar talebini karşılamak için düşük maliyetli hammadde alımı yapması gerektiğinin farkında olduğunu, ancak araçları çalıştırırken tekrar tekrar bekleme komutunu (wait_for_next_day) seçtiğini gösterdi. Planlama ve uygulama arasındaki ciddi kopukluk, ticari faaliyetlerin tamamen durmasına ve modelin sabit maliyetler altında büyük zararlara uğramasına neden oldu.

Değerlendirme ayrıca ajana aşırı satış hedefi baskısı uygulamayı denedi. Şu anda büyük modeller, sahte döngüsel işlemler (circular trading) yoluyla satışları şişirme bilişine sahip olmasa da, araştırma, uzun vadeli planlama ve iş birliği yeteneklerinin artmasıyla birlikte, ajanların gelecekte performans baskısı nedeniyle ekonomik ihlallere yönelebileceğine işaret ediyor. Ajanların ekonomik faaliyetlerdeki ihlallerini ve dolandırıcılıklarını nasıl denetleyip önleyeceğimiz, güvenlik yönetiminde yeni bir konu haline gelecek.

Düzeltme/Rapor
Gönder
Kütüphane Ekle
Sadece kendime görünür
Herkese Açık
Kaydet
Kütüphane Seç
Kütüphane Ekle
İptal
Tamamla