BlockBeats haberine göre, 9 Eylül'de Ant Group açık kaynak duyurusunda,百灵 serisinin ilk yerel çok modlu büyük modeli Ling-3.0-flash-VL'yi resmi olarak yayınladığını ve açık kaynak olarak sunduğunu bildirdi. Model, Ling-3.0-flash'in MoE mimarisi temel alınarak genişletilmiş olup, toplam parametre sayısı 124B, tek çıkarımda 5.5B parametre aktive edilir, görüntü, metin ve video girişlerini yerel olarak destekler ve bağlam penceresi 256KToken'a ulaşır.
"Gerçek görevleri daha güvenilir ve verimli bir şekilde nasıl tamamlarız" etrafında, Ling-3.0-flash-VL şu yönlere odaklanmaktadır:
Büyük modele görsel yetenek eklemek, yaygın bir endişe olarak metin zekasını düşürebileceği yönündedir. Ancak eğitim pratiği tam tersi bir sonuç göstermektedir: yerel çok modlu birleşik eğitim yalnızca uygulama sınırlarını genişletmekle kalmaz, aynı zamanda metin zekasını da artırır. Ling-3.0-flash-VL, görsel geri bildirim mekanizması sunar—yürütme sonuçlarını gözlemleme, hedeflerle karşılaştırma, sapmaları tespit etme, sürekli düzeltme—görevi tek seferlik "üretim"den "gözlem → eylem → doğrulama → düzeltme" kapalı döngüsüne dönüştürerek yürütme sonuçlarını daha güvenilir hale getirir.
Ling-3.0-flash-VL, Ling-3.0-flash'in Agent iş akışında verimli bir yürütme düğümü olarak sahip olduğu temel avantajı miras alır, görsel geri bildirim kapalı döngüsünde çıktı kalitesi ile yürütme verimliliğini dengeler ve daha düşük maliyet ve daha kısa sürede tam görevleri ilerletir.
