动察 Beating tarafından yapılan izlemeye göre, DeepSeek, Pekin Üniversitesi ile birlikte spekülatif örnekleme hızlandırma çerçevesi DSpark'ın teknik raporunu yayınladı ve tam yığın kod kütüphanesi DeepSpec'i açık kaynak olarak sundu. Şu anda DSpark, DeepSeek-V4'ün çevrimiçi iş süreçlerine entegre edilmiş durumda. Çıktı kalitesinden ödün vermeden, DSpark, Flash sürümünde tek kullanıcılı üretim hızını %60 ila %85, Pro sürümünde ise %57 ila %78 oranında artırdı. DSpark, mevcut tek Token çoklu dal tahmini (MTP-1) taban çizgisini geride bırakarak, sıkı gecikme kısıtlamaları altında sistemin genel işlem hacmini önemli ölçüde artırdı.
Daha önce, çok Token'lı spekülatif örneklemenin çevrimiçi üretim ortamlarında uygulanması zordu. Otoregresif taslak modeller çok yavaş üretim yaparken, paralel taslak modeller her konumda bağımsız tahmin yaptığı için uzun dizilerin ikinci yarısında kabul oranı son derece düşüktü. Yüksek eşzamanlılık altında çok Token'lı taslakları körü körüne doğrulamak, büyük modellerin reddedileceği kesin olan hatalı token'ları doğrulamak için büyük miktarda hesaplama gücü harcamasına neden olur ve bu da sistemin genel işlem hacminin ciddi şekilde düşmesine yol açar. Bu nedenle sektör, çevrimiçi ortamlarda genellikle tek Token tahmini (MTP-1) ile sınırlı kalmıştır.
DSpark, yüksek eşzamanlılık altında işlem hacmi darboğazının üstesinden geldi. DSpark, öncelikle DFlash paralel omurga ağını kullanarak gizli durumlar üretir ve ardından son derece hafif bir Markov başlığı ekler. Markov başlığı, bir tablo araması ve tek bir matris çarpımı ile çok düşük bir maliyetle bitişik kelimeler arasındaki ilişkiyi seri olarak enjekte eder. Aynı zamanda sistem, güven tahmin başlığı ve posterior kalibrasyon algoritmasını entegre eder. Üretim ortamında sıfır ek yük ile zamanlamayı mükemmel şekilde uyumlu hale getirmek ve gelecekteki bilgi sızıntısını önlemek için zamanlayıcı, asenkron bir mekanizma kullanır. Bu mekanizma, iki adım önceki geçmiş tahminleri kullanarak aday token kesme uzunluğunu dinamik olarak belirler ve büyük modelin ağır yük altında yüksek riskli kuyruk hatalarını doğrulamasını tamamen engeller.
DSpark'ın yanı sıra, DeepSeek'in bu kez açık kaynak olarak sunduğu DeepSpec kod kütüphanesi, Qwen3 ve Gemma gibi açık kaynak büyük modelleri yerel olarak destekler. DeepSpec, istem indirme, büyük model önbelleğini yeniden oluşturma, taslak model eğitimi ve kıyaslama değerlendirmesi dahil olmak üzere eksiksiz bir Python araç zinciri sunar. Geliştiriciler, açık kaynak betiklerini kullanarak farklı açık kaynak büyük modeller için yerel olarak özel hızlandırma modülleri özelleştirebilir ve dağıtabilir.

