动察 Beating AI hızlı haber: Tencent, Qwen3.5-122B-A10B'yi özellikle terminal Agent'ı eğitmek için kullandı ve T1'i geliştirdi. Esas olarak Linux terminalindeki karmaşık görevleri ele alıyor ve tek bir görevde en fazla 300'den fazla tur boyunca art arda araç çağırabiliyor. Terminal-Bench 2.1 puanı temel modelin %43,8'inden %64,0'a yükseldi, 20,2 puan arttı.
Bu 20,2 puanın büyük kısmı pekiştirmeli öğrenmeden geldi. SFT puanı yalnızca %49,4'e çıkardı, sonraki pekiştirmeli öğrenme ise 14,6 puan daha ekledi. Ekip yaklaşık 15 bin terminal görevi hazırladı ve her görev otomatik testlerle donatıldı. Agent tüm görevi tamamlamasa bile, gereksinimlerin bir kısmını yerine getirdiği sürece ilgili ödülü alabiliyor.
Uzun görevlerin bir başka sorunu daha var. Agent gerçekten çalışırken ve ardından bu deneyimle eğitilirken, aynı içerik farklı token'lara yeniden bölünebilir ve MoE de farklı bir uzman grubunu devreye alabilir. T1, o sırada üretilen token'ları ve seçilen uzmanları kaydediyor, eğitim sırasında doğrudan bunları yeniden oynatıyor ve bu eğitim-çıkarım sapmasını yaklaşık üçte bir oranında azaltıyor.
