动察 Beating AI hızlı haber: Inco AI, açık kaynaklı yerel çıkarım motoru Splash'i yayınladı ve Qwen3.8-27B'yi M5 Max MacBook Pro'da en yüksek 144 Token/s hızına ulaştırdı. LM Studio hemen entegre etti, 0.4.25 sürümü artık doğrudan kullanılabilir.
Inco'nun daha önce geliştirdiği DFlash, SGLang, vLLM, TensorRT-LLM ve llama.cpp'ye girmiş durumda. Meta, NVIDIA, Xiaomi, Poolside gibi şirketler de kendi modelleri için DFlash hızlandırma küçük modelleri ekledi. DFlash önce küçük modelin paralel olarak birden fazla Token tahmin etmesini sağlar, ardından büyük modele toplu doğrulama için gönderir ve Token bazında üretim hesaplamasını azaltır.
Splash bu optimizasyonu tüm yerel çıkarım motoruna genişletti. Şu anda yalnızca Qwen3.8-27B ve Qwen3.6-35B-A3B'yi destekliyor, her model için ayrı GPU kernel, bellek çözümü ve DFlash 2 küçük modeli yapılandırılmış. Kapsanan model sayısı az, ancak karşılığında daha agresif performans optimizasyonu elde ediliyor.
144 Token/s, M5 Max'teki en yüksek gösterim değeri. Inco'nun karşılaştırma testleri için kullandığı 48GB M5 Pro'ya geçildiğinde, Qwen3.8-27B tek kanal kısa bağlamda 74 Token/s'ye ulaşıyor; 4 kanal eşzamanlı olduğunda toplam verim 170 Token/s'ye çıkıyor ve bu ikinci sıradakinin 3.9 katı. Bu da Splash'in Agent senaryoları için daha uygun olduğu nokta. Bir Agent aynı anda birden fazla alt görevi başlattığında, eşzamanlı toplam verim genellikle tek bir konuşma hızından daha önemlidir.
Splash'in kendisi açık kaynak ve LM Studio'ya bağlı değil. Şu anda M3 veya daha yeni Mac, macOS 26.4 ve üzeri, en az 36GB birleşik bellek gerekiyor.
