动察 Beating AI hızlı haber: Apple, uzun belgeleri işlemek için özel olarak geliştirilmiş görsel dil modeli LensVLM-9B'yi açık kaynak olarak yayınladı. Model, Qwen3.5-9B-Base üzerine eğitildi. Uzun belgeleri işlerken önce tüm belgeyi düşük çözünürlüklü sayfalara sıkıştırıp hızlıca tarıyor, ilgili sayfaları bulduktan sonra o sayfalardaki orijinal metni veya yüksek çözünürlüklü görüntüleri okuyor.
Böylece tüm metni model bağlamına sıkıştırmaya gerek kalmıyor. Makalede 100 sayfalık bir belge test edildiğinde, doğrudan tüm metni okumak 51.273 token gerektirirken LensVLM yalnızca 8.090 token kullandı. Buna karşılık gelen KV önbelleği yaklaşık 1,6 GB'dan 253 MB'a düştü, yani %84,2 azalma sağlandı.
Sıkıştırma sonrası doğrulukta da belirgin bir düşüş yaşanmadı. 7 belge soru-cevap testinde doğrudan tüm metni okumanın ortalama doğruluğu %72,4 iken LensVLM yaklaşık 4,3 kat sıkıştırmada hâlâ %68,9 doğruluğa ulaştı. Metni doğrudan görüntüye küçültüp modelin tanımasını sağlamaya kıyasla, aynı yaklaşık 5 kat sıkıştırmada doğruluk %31,3'ten %68,9'a yükseldi.
Ancak şu an daha yavaş çalışıyor. LensVLM ilgili sayfaları bulduktan sonra orijinal metni okumak için bir kez daha araç çağırması gerekiyor, bu nedenle art arda iki tur çıkarım yapması gerekiyor. Makaledeki testte bir yanıt yaklaşık 17 saniye sürüyor; bu sıkıştırma yöntemi kullanılmadan tüm belge doğrudan Qwen3.5-9B'ye metin olarak verilirse bir yanıt üretmek yaklaşık 8 saniye sürüyor.
