动察 Beating AI hızlı haber: Xiaomi MiMo ekibi, yeni nesil MiMo-V3'te kullanılacak HySparse2 mimarisini kamuoyuna açıkladı. Bu mimari esas olarak Agent'ların giderek daha pahalı çalışması sorununu çözüyor. Agent her seferinde yalnızca çok kısa bir talimat gönderiyor, ancak web sayfalarından, terminalden ve araçlardan büyük miktarda içerik geri alabiliyor. Modelin önce bu yeni içeriği tamamen okuması gerekiyor; bağlam uzadıkça bu adım daha fazla hesaplama gücü tüketiyor ve KV Cache de daha fazla VRAM kaplıyor.
HySparse2 önce modeli iki parçaya ayırıyor. İlk yarı girdiyi işlemekle, ikinci yarı ise çıkarım ve üretime devam etmekle görevli. İkinci yarının ihtiyaç duyduğu bağlam bilgisi doğrudan ilk yarının zaten hesapladığı sonuçlardan üretilebiliyor; böylece prefill aşamasında ikinci yarının tamamının yeniden çalıştırılmasına gerek kalmıyor. Bu fikir, Microsoft Research'ün 2024'te önerdiği YOCO'dan geliyor; adı da "You Only Cache Once" yani "Yalnızca Bir Kez Önbellekle" anlamına geliyor. Özü, ikinci yarının önceden hesaplanmış bilgileri paylaşmasını sağlayarak daha az önbellek depolamak ve daha az tekrarlı hesaplama yapmak.
Aynı zamanda sparse attention da yeniden tasarlandı. Normal tam attention her seferinde tüm bağlamı görmek zorundayken, HySparse2 bunu yalnızca az sayıda katmanın yapmasına izin veriyor. Bu katmanlar önce uzun bağlamdan en alakalı 1024 token'ı seçiyor, sonraki katmanlar doğrudan bu sonuç kümesini kullanıyor ve aynı zamanda en son 128 token sabit olarak korunuyor. Önceki nesil HySparse her 64 token'ı bir grup yapıp sonra seçim yapıyordu; bir grupta önemli bilgi varsa tüm grubun kalması gerekiyordu. Şimdi ise token token seçim yapılıyor; aynı hesaplama miktarıyla daha fazla gerçekten alakalı içeriğe yer ayrılabiliyor. Yalnızca bu değişiklik test edildiğinde, iki uzun metin erişim sonucu sırasıyla 6,57 puan ve 8,14 puan arttı.
Makale, toplam 80 milyar parametreli ve her seferinde yaklaşık 3 milyar parametresi aktif olan bir modeli karşılaştırma için kullanıyor. 49 katmanlı model, prefill aşamasında yalnızca ilk 25 katmanı çalıştırmak zorunda. Girdi 1 milyon token'a ulaştığında, MiMo-V2 serisinde kullanılan hibrit kayan pencere attention'a kıyasla prefill hesaplama miktarı yaklaşık 1/5'e düşüyor ve KV Cache 12,09GB'den 2,69GB'ye iniyor.
