BlockBeats haberine göre, 8 Ağustos'ta bir geliştirici yakın zamanda kimi-k3-in-c adlı açık kaynak projesini başlattı ve 2,78 trilyon parametreye sahip Kimi K3 modelini yalnızca 8GB belleğe sahip bir cihazda çalıştırmayı denedi. Proje yalnızca 176KB boyutunda olup saf C99 ile yazılmıştır; GPU, CUDA, PyTorch veya BLAS'a bağımlı değildir ve model çıkarımını yalnızca CPU ile tamamlayabilir.
Bu çözüm, Kimi K3'ün MoE (Karışık Uzmanlar) mimari özelliğinden yararlanır. Modelin toplam parametre ölçeği 2,78T'ye ulaşsa da, her katmandaki 896 uzmandan yalnızca 16'sı etkinleştirilir. Bu nedenle geliştirici, yaklaşık 1,56TB'lık tam model ağırlıklarını belleğe yüklemek yerine, çoğu uzman ağırlığını NVMe diskinde saklar ve çıkarım ihtiyacına göre gerçek zamanlı okur; aynı zamanda bazı yoğun katmanlar (dense trunk) da katman katman akış yükleme yöntemiyle işlenir.
Ancak bu çözüm şu anda belirgin performans sınırlamalarına sahiptir. 8GB bellek modunda, modelin bir token üretmesi yaklaşık 32,7 saniye sürer ve ayrıca yaklaşık 1,7TB yüksek hızlı depolama alanı desteği gerektirir.
Geliştirici, bu çözümün şu anda büyük model çıkarım altyapısı optimizasyon yönüne yönelik deneysel bir keşif olduğunu ve gerçek üretim kullanım değeri taşımadığını, ancak "disk akış yükleme + MoE seyrek aktivasyon" yöntemiyle gelecekte düşük maliyetle devasa ölçekli modeller çalıştırmak için yeni bir düşünce yolu sunduğunu belirtti.
