Ana Sayfa
AI AI
Flaş
Derinlik
Etkinlikler
BlockBeats Pro
Daha Fazla
Finans
Özel
Blok Zinciri Ekosistemi
Giriş
Podkastlar
Veri
OPRR
#
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe

Apple, LensVLM-9B'yi açık kaynak olarak yayınladı: 100 sayfalık belgeler önce görsele sıkıştırılıyor, KV önbelleği %84 tasarruf sağlıyor

动察 Beating AI hızlı haber: Apple, uzun belgeleri işlemek için özel olarak geliştirilmiş görsel dil modeli LensVLM-9B'yi açık kaynak olarak yayınladı. Model, Qwen3.5-9B-Base üzerine eğitildi. Uzun belgeleri işlerken önce tüm belgeyi düşük çözünürlüklü sayfalara sıkıştırıp hızlıca tarıyor, ilgili sayfaları bulduktan sonra o sayfalardaki orijinal metni veya yüksek çözünürlüklü görüntüleri okuyor.


Böylece tüm metni model bağlamına sıkıştırmaya gerek kalmıyor. Makalede 100 sayfalık bir belge test edildiğinde, doğrudan tüm metni okumak 51.273 token gerektirirken LensVLM yalnızca 8.090 token kullandı. Buna karşılık gelen KV önbelleği yaklaşık 1,6 GB'dan 253 MB'a düştü, yani %84,2 azalma sağlandı.


Sıkıştırma sonrası doğrulukta da belirgin bir düşüş yaşanmadı. 7 belge soru-cevap testinde doğrudan tüm metni okumanın ortalama doğruluğu %72,4 iken LensVLM yaklaşık 4,3 kat sıkıştırmada hâlâ %68,9 doğruluğa ulaştı. Metni doğrudan görüntüye küçültüp modelin tanımasını sağlamaya kıyasla, aynı yaklaşık 5 kat sıkıştırmada doğruluk %31,3'ten %68,9'a yükseldi.


Ancak şu an daha yavaş çalışıyor. LensVLM ilgili sayfaları bulduktan sonra orijinal metni okumak için bir kez daha araç çağırması gerekiyor, bu nedenle art arda iki tur çıkarım yapması gerekiyor. Makaledeki testte bir yanıt yaklaşık 17 saniye sürüyor; bu sıkıştırma yöntemi kullanılmadan tüm belge doğrudan Qwen3.5-9B'ye metin olarak verilirse bir yanıt üretmek yaklaşık 8 saniye sürüyor.

举报 Düzeltme/Rapor
Düzeltme/Rapor
Gönder
Kütüphane Ekle
Sadece kendime görünür
Herkese Açık
Kaydet
Kütüphane Seç
Kütüphane Ekle
İptal
Tamamla