BlockBeats Haberi, 19 Temmuz. Yarı iletken ve yapay zeka bağımsız araştırma kuruluşu SemiAnalysis, Kimi K3'ün ağ katmanlarının yaklaşık dörtte üçünde KDA kullanmasına rağmen, tam küresel dikkat modeline kıyasla KV önbellek aktarım bant genişliğini 10 kata kadar azaltabildiğini, ancak bunun AI ağ anahtarı pazar büyüklüğünün önemli ölçüde daralacağı anlamına gelmediğini belirtti.
Kimi K3, 2,8 trilyon parametreye sahiptir ve MXFP4 kullanılsa bile her ileri hesaplama için yaklaşık 1,5 TB HBM bant genişliği gerektirir. Makul bir etkileşim hızını korurken karlı bir dağıtım yapmak için, yine de GB300 NVL72 gibi yüksek bant genişliğine sahip ağlar aracılığıyla çok sayıda çipin bağlanması ve WideEP genişletme hizmetine güvenilmesi gerekir.
WideEP, 896 uzman modelini birden fazla GPU'ya dağıtır ve her katmanda, her ileri hesaplamada iki kez Token dağıtımı ve sonuç birleştirme işlemi gerçekleştirir; tek bir ileri hesaplama 120'den fazla kez yürütülür. Buna karşılık, ön doldurma ve kod çözme arasındaki KV önbellek aktarımı her diyalog turunda yalnızca bir kez gerçekleşir, bu nedenle KDA'nın sağladığı bant genişliği tasarrufu, büyük ölçekli uzman modellerinin getirdiği genişletilmiş ağ ihtiyacından çok daha az olabilir.
SemiAnalysis, daha verimli dikkat mekanizmalarının bağlam uzunluğunu 1 milyon Token'dan 5 milyon Token'ın üzerine çıkarabileceğini düşünüyor. Jevons paradoksuna göre, verimlilik artışı AI kullanım ölçeğini genişletebilir ve bu da ağ ihtiyacını daha da artırabilir.
