Beating tarafından yapılan izlemeye göre, Arena Agent sıralaması gerçek kullanıcı görevleri ve araç çağrı kayıtlarına dayanmaktadır. Kimi K3'ün kapsamlı net iyileştirme oranı %9,62 olup 4. sırada yer almaktadır. Claude Fable 5, Claude Opus 4.8 Thinking ve GPT-5.6 Sol'un ardından gelmektedir.
Arena, değerlendirilen tüm modelleri eşit şekilde harmanlayarak sanal bir ortalama referans oluşturur ve ardından K3'e geçildiğinde çeşitli sonuçlarda ne kadar iyileşme sağlanacağını tahmin eder. Beş net iyileştirme göstergesinin ortalaması alınarak kapsamlı puan elde edilir.
K3, şu ana kadar 8.344 test oturumu biriktirmiştir. Kullanıcı onay başarı göstergesinde net iyileştirme %14,42 olup birinci sıradadır. Övgülerin şikayetlerden fazla olması göstergesinde %20,62 iyileşme ile üçüncü sırada yer almaktadır. Hata düzeltme uygulamasında 14., Bash hata kurtarmada ise 17. sıradadır. K3, kullanıcıların onaylayacağı sonuçlar üretme konusunda daha başarılıdır, ancak yol boyunca hataları düzeltme ve komut hatalarından kurtarma konularında hala zayıf yönleri bulunmaktadır.
