Ana Sayfa
AI AI
Flaş
Derinlik
Etkinlikler
BlockBeats Pro
Daha Fazla
Finans
Özel
Blok Zinciri Ekosistemi
Giriş
Podkastlar
Veri
OPRR
#
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe

Tencent T1, uzun görevli Agent'lara odaklanıyor: 300'den fazla tur kesintisiz işlem, puan 20 puan arttı

动察 Beating AI hızlı haber: Tencent, Qwen3.5-122B-A10B'yi özellikle terminal Agent'ı eğitmek için kullandı ve T1'i geliştirdi. Esas olarak Linux terminalindeki karmaşık görevleri ele alıyor ve tek bir görevde en fazla 300'den fazla tur boyunca art arda araç çağırabiliyor. Terminal-Bench 2.1 puanı temel modelin %43,8'inden %64,0'a yükseldi, 20,2 puan arttı.


Bu 20,2 puanın büyük kısmı pekiştirmeli öğrenmeden geldi. SFT puanı yalnızca %49,4'e çıkardı, sonraki pekiştirmeli öğrenme ise 14,6 puan daha ekledi. Ekip yaklaşık 15 bin terminal görevi hazırladı ve her görev otomatik testlerle donatıldı. Agent tüm görevi tamamlamasa bile, gereksinimlerin bir kısmını yerine getirdiği sürece ilgili ödülü alabiliyor.


Uzun görevlerin bir başka sorunu daha var. Agent gerçekten çalışırken ve ardından bu deneyimle eğitilirken, aynı içerik farklı token'lara yeniden bölünebilir ve MoE de farklı bir uzman grubunu devreye alabilir. T1, o sırada üretilen token'ları ve seçilen uzmanları kaydediyor, eğitim sırasında doğrudan bunları yeniden oynatıyor ve bu eğitim-çıkarım sapmasını yaklaşık üçte bir oranında azaltıyor.

举报 Düzeltme/Rapor
Düzeltme/Rapor
Gönder
Kütüphane Ekle
Sadece kendime görünür
Herkese Açık
Kaydet
Kütüphane Seç
Kütüphane Ekle
İptal
Tamamla