动察 Beating AI hızlı haber: Alibaba Qianwen, metin, görsel, ses, video ve 1M bağlam desteği sunan yerel tam modal model Qwen3.8-Omni-Flash'i yayına aldı.
Bu nesil, ses-video Agent yeteneklerini belirgin şekilde güçlendirdi. Model videodan kendi başına bilgi bulabiliyor, görevleri planlayabiliyor ve ardından kurgu, seslendirme ve render işlemlerini tamamlamak için harici araçları çağırabiliyor. Resmi tanıtımda uzun toplantı işleme, kısa dizi çevirisi, film yorumu, MV yapımı ve videoyu görsel-metin nota dönüştürme gibi senaryolar gösterildi.
Saatler süren uzun videolar karşısında, baştan sona tümünü işlemesi gerekmiyor. Model önce yanıtın nerede olabileceğini değerlendiriyor, ardından kilit bölümleri adım adım konumlandırıyor. OmniVideoBench'te doğruluk %63,4'ten %67,8'e yükseldi, Token tüketimi 145.736'dan 79.117'ye düştü, yani %45,7 azaldı.
Qianwen, Qwen3.8-Omni-Flash'in 30 değerlendirmedeki ortalama performansının Qwen3.5-Omni-Plus'a göre %26'dan fazla arttığını, ses-video yeteneğinin Gemini 3.8 Flash'a yaklaştığını ve ses yeteneğinin genel olarak onu geçtiğini belirtiyor. Ses giriş maliyeti %98'den fazla, ses-video girişi ise %93'ten fazla düştü.
Şu anda Qwen3.8-Omni-Flash model ağırlıkları henüz açıklanmadı, yalnızca API açıldı. Qianwen aynı zamanda Qwen-MM-Plugins'i açık kaynak olarak yayımladı; bu eklenti Claude Code, Codex, Gemini CLI, Qwen Code gibi Agent'lara kurularak onlara görsel, ses, uzun video işleme ve video kurgu yetenekleri kazandırılabiliyor.
Diğer bir set olan Qwen-Live Harness ise daha çok gerçek zamanlı zamanlama katmanı gibi. Kullanıcılar gerçek zamanlı tam modal modelle doğrudan konuşabiliyor, ardından karmaşık görevleri Gemini CLI, Claude Code, Codex gibi arka plan Agent'larına sürekli yürütülmek üzere devredebiliyor. Görev ilerlemesini takip ediyor ve tamamlandıktan sonra proaktif olarak geri dönüp size sonucu bildiriyor.
