动察 Beating AI haber bülteni, bağımsız değerlendirme projesi Assistant Benchmark, kişisel AI asistanlarını gerçek görevlerle karşılaştırmaya başladı. Agent'lara doğrudan otel rezervasyonu yaptırıyor, restoran seçtiriyor, alışveriş yaptırıyor, e-posta yanıtlatıyor ve üçüncü taraf hizmetlere bağlanmalarını sağlıyor, ardından gerçek tamamlama durumuna göre puan veriyor. Her değerlendirme boyutu için herkese açık sabit bir görev bulunuyor ve puan verilebilmesi için gerçek çalıştırma kaydı gerekiyor.
Şu anda Muse, tamamlanan 7 değerlendirme boyutunda ortalama 9,1 puanla geçici olarak birinci sırada; Instinct 11 boyutu tamamladı, ortalaması 8,4; Grok Bot 7 boyutu tamamladı, ortalaması 7,3. Muse alışveriş, e-posta ve üçüncü taraf uygulama bağlantısı boyutlarında 10 puan aldı.
Ancak bunu sürekli güncellenen bir gerçek deneyim sıralaması olarak görmek daha doğru. Muse'un 9,1'i şu an yalnızca test edilen 7 boyutun ortalaması, tam bir sonuç değil. Her boyut şu an yalnızca tek bir sabit görevle test ediliyor; sonraki ek testlerin ardından puanlar ve sıralamalar değişebilir.
