动察 Beating AI hızlı haberi: NVIDIA, Alibaba'nın en son önizleme modeli Qwen3.8-Flash-Next'in NVIDIA GB300 NVL72 platformu tarafından desteklendiğini duyuran bir makale yayınladı. Bu modelin toplam parametre ölçeği 176 milyar olup, her Token'da yaklaşık 6 milyar parametre aktive edilir, doğal olarak 262.000 Token bağlamını destekler ve YaRN ile 1 milyon Token'a genişletilebilir; öncelikle akıllı programlama, belge işleme ve araç çağırma gibi uzun bağlamlı Ajan uygulamalarına yöneliktir.
NVIDIA, Qwen3.8-Flash-Next'in Gated DeltaNet (GDN) ve Qwen Sparse Attention (QSA) hibrit mimarisini kullandığını, böylece uzun bağlam senaryolarında hesaplama ve KV önbellek yükünü azalttığını belirtti. Testler, GB300 NVL72 üzerinde bu modelin tek GPU işleme hızının saniyede 16.000 Token'ı aştığını ve tek kullanıcı işleme hızının saniyede 200 Token'ı aştığını gösteriyor; ayrıca SGLang, vLLM ve TensorRT-LLM gibi çıkarım çerçevelerini destekler.
