动察 Beating AI hızlı haber: AI Agent girişimi NeoCognition, ApprenticeBench'i yayınladı; bu benchmark, bir AI'ın yeni bir çalışan gibi işe girdikten sonra bir işi kendi başına öğrenip öğrenemeyeceğini özel olarak ölçüyor. İlk sürümde Agent, simüle edilmiş bir Kaliforniya inşaat şirketinde borç hesapları işini yapıyor. Önce altı aylık geçmiş faturaları, şirket el kitabını ve Odoo eğitimini okuyor, ardından 7 ay boyunca 100 faturayı kesintisiz işliyor; bu süreçte kural değişiklikleri ve yönetici geri bildirimleriyle de karşılaşıyor.
Fable 5.1 nihai başarı oranı %72'ye ulaşırken, GPT-6 Astra %68'de kaldı; en iyi insan test katılımcısı ise yalnızca %51 aldı. Görevler fatura girmenin yanı sıra hataları bulmayı, maliyet kodları atamayı, tedarikçilerle iletişime geçmeyi, onay süreçlerini yürütmeyi ve geçmiş kayıtlarla geri bildirimlerden şirketin iç kurallarını öğrenmeyi içeriyor. İki modelin doğrudan GUI üzerinden çalışması, API çağırmaktan bir miktar daha yüksek performans gösterdi; geçmişte Computer Use'da sık görülen performans kaybı neredeyse ortadan kalktı.
Ancak "insanı geçme" yalnızca bu tek simüle edilmiş pozisyon için geçerli ve gerçek insan örneklemi sadece 2 kişiydi. Maliyet de daha yüksek: Fable 5.1 ortalama görev başına 18,23 dolar harcarken, insanlar yaklaşık 7,21 dolar. İnsanlar yaptıkça hızlanıyor, Agent ise giderek daha fazla şey hatırladığı için yavaşlıyor.
