Ana Sayfa
AI AI
Flaş
Derinlik
Etkinlikler
BlockBeats Pro
Daha Fazla
Finans
Özel
Blok Zinciri Ekosistemi
Giriş
Podkastlar
Veri
OPRR
#
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe

Nvidia: Qwen3.8-Flash-Next, GB300NVL72 üzerinde saniyede 16.000 Token'ın üzerinde tek kart verimliliği elde edebiliyor.

动察 Beating AI hızlı haberi: NVIDIA, Alibaba'nın en son önizleme modeli Qwen3.8-Flash-Next'in NVIDIA GB300 NVL72 platformu tarafından desteklendiğini duyuran bir makale yayınladı. Bu modelin toplam parametre ölçeği 176 milyar olup, her Token'da yaklaşık 6 milyar parametre aktive edilir, doğal olarak 262.000 Token bağlamını destekler ve YaRN ile 1 milyon Token'a genişletilebilir; öncelikle akıllı programlama, belge işleme ve araç çağırma gibi uzun bağlamlı Ajan uygulamalarına yöneliktir.


NVIDIA, Qwen3.8-Flash-Next'in Gated DeltaNet (GDN) ve Qwen Sparse Attention (QSA) hibrit mimarisini kullandığını, böylece uzun bağlam senaryolarında hesaplama ve KV önbellek yükünü azalttığını belirtti. Testler, GB300 NVL72 üzerinde bu modelin tek GPU işleme hızının saniyede 16.000 Token'ı aştığını ve tek kullanıcı işleme hızının saniyede 200 Token'ı aştığını gösteriyor; ayrıca SGLang, vLLM ve TensorRT-LLM gibi çıkarım çerçevelerini destekler.

举报 Düzeltme/Rapor
Düzeltme/Rapor
Gönder
Kütüphane Ekle
Sadece kendime görünür
Herkese Açık
Kaydet
Kütüphane Seç
Kütüphane Ekle
İptal
Tamamla