Ana Sayfa
AI AI
Flaş
Derinlik
Etkinlikler
BlockBeats Pro
Daha Fazla
Finans
Özel
Blok Zinciri Ekosistemi
Giriş
Podkastlar
Veri
OPRR
#
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe

Yapay zeka stajyeri 7 ay sonra gerçek insanları geçti: Fable 5.1 muhasebe pozisyonunda başarı oranı %72

动察 Beating AI hızlı haber: AI Agent girişimi NeoCognition, ApprenticeBench'i yayınladı; bu benchmark, bir AI'ın yeni bir çalışan gibi işe girdikten sonra bir işi kendi başına öğrenip öğrenemeyeceğini özel olarak ölçüyor. İlk sürümde Agent, simüle edilmiş bir Kaliforniya inşaat şirketinde borç hesapları işini yapıyor. Önce altı aylık geçmiş faturaları, şirket el kitabını ve Odoo eğitimini okuyor, ardından 7 ay boyunca 100 faturayı kesintisiz işliyor; bu süreçte kural değişiklikleri ve yönetici geri bildirimleriyle de karşılaşıyor.


Fable 5.1 nihai başarı oranı %72'ye ulaşırken, GPT-6 Astra %68'de kaldı; en iyi insan test katılımcısı ise yalnızca %51 aldı. Görevler fatura girmenin yanı sıra hataları bulmayı, maliyet kodları atamayı, tedarikçilerle iletişime geçmeyi, onay süreçlerini yürütmeyi ve geçmiş kayıtlarla geri bildirimlerden şirketin iç kurallarını öğrenmeyi içeriyor. İki modelin doğrudan GUI üzerinden çalışması, API çağırmaktan bir miktar daha yüksek performans gösterdi; geçmişte Computer Use'da sık görülen performans kaybı neredeyse ortadan kalktı.


Ancak "insanı geçme" yalnızca bu tek simüle edilmiş pozisyon için geçerli ve gerçek insan örneklemi sadece 2 kişiydi. Maliyet de daha yüksek: Fable 5.1 ortalama görev başına 18,23 dolar harcarken, insanlar yaklaşık 7,21 dolar. İnsanlar yaptıkça hızlanıyor, Agent ise giderek daha fazla şey hatırladığı için yavaşlıyor.

举报 Düzeltme/Rapor
Düzeltme/Rapor
Gönder
Kütüphane Ekle
Sadece kendime görünür
Herkese Açık
Kaydet
Kütüphane Seç
Kütüphane Ekle
İptal
Tamamla