动察 Beating AI hızlı haber: açık kaynaklı Computer Use aracı Cua, Cua Driver'a isteğe bağlı Perception görsel uzantısı ekledi. Driver normalde öncelikle web sayfası yapısı ve sistem erişilebilirlik ağacı üzerinden düğmeleri bulur. Canvas, oyunlar, uzak masaüstü veya özel çizim uygulamalarında bu yapılar boş olabilir. Perception doğrudan ekran görüntüsünü okur, görüntüyü metin, tür ve konum içeren bölgelere ayırır ve Agent'ın işleme devam etmesini sağlar.
İlk sürümde simgeleri ve kontrolleri tanımlamak için OmniParser, metni okumak için PP-OCR kullanılır. Tüm ayrıştırma süreci yerel CPU'da tamamlanır, GPU gerekmez ve ekran görüntüsü ağa gönderilmez. Resmi testlerde tek bir ekran görüntüsü macOS'ta yaklaşık 2 ila 2,5 saniye, Linux'ta 3,5 ila 4 saniye, Windows'ta 8 ila 9 saniye sürer. Esas olarak sayfa yapısı ve erişilebilirlik ağacı başarısız olduğunda yedek olarak çalışır, varsayılan olarak her adımda görsel ayrıştırma çalıştırmaz.
Cua ayrıca görsel işlemlerin eski ekran görüntülerini yeniden kullanmasını sınırlar. Her görsel tanıma, geçerli ekran görüntüsünün `capture_id` değerine bağlanır ve ardından gelen tıklama aynı ekran görüntüsünden gelmelidir. Ekran görüntüsü 60 saniyeyi aşarsa veya zaten bir işlem gerçekleştirilmişse, Driver kullanmaya devam etmeyi reddeder; böylece arayüz değiştikten sonra eski koordinatlarla yanlış tıklama önlenir.
Cua aslında geçmişte `cua-som` ve OmniParser aracılığıyla görsel konumlandırma yapabiliyordu. Şimdi bu yetenek doğrudan Cua Driver'a entegre edildi ve üst katman Agent'lar birleşik arayüz üzerinden tanıma sonuçlarını alabilir. Modelin kendisi görüntüleri okuyamasa bile, bu metin ve bölge bilgilerine göre bir sonraki işleme karar verebilir.
Perception varsayılan bir bileşen değildir; içindeki OmniParser dedektörü AGPL-3.0 kullanır; Cua Driver ise MIT lisansını korumaya devam eder.
