Beating监测ine göre, Ant Group'ün BaiLing modeli Ling-3.0-tiny ağırlıklarını resmi olarak açtı ve BF16, FP8 ve INT4 olmak üzere üç sürüm sunuyor. Hugging Face sayfasında MIT lisansı olarak işaretlenmiş. Model toplam 7,9 milyar parametreye sahip ve her Token yalnızca 1,3 milyarını etkinleştiriyor; öncelikli olarak yerel dağıtım ve Ajan senaryolarına yönelik.
Ling-3.0-tiny, 128 yönlendirici uzmana sahip ve her Token yalnızca bunlardan 8'ini seçiyor, ayrıca tüm Token'ların kullandığı 1 paylaşımlı uzman ekleniyor. Dikkat mekanizması kısmında 3:1 oranında KDA ve MLA hibrit mimarisi kullanılıyor; yani her 3 Kimi Delta Attention katmanından sonra 1 MLA katmanı geliyor.
Resmi açıklamaya göre, FP8 sürümü M4 Pro MacBook üzerinde yaklaşık 86–90 Token/s hıza ulaşabilir; DGX Spark üzerinde ise yaklaşık 100–105 Token/s hıza ulaşabilir.
