Ana Sayfa
AI AI
Flaş
Derinlik
Etkinlikler
BlockBeats Pro
Daha Fazla
Finans
Özel
Blok Zinciri Ekosistemi
Giriş
Podkastlar
Veri
OPRR
#
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe

DeepSeek görsel anlama modelini yayınladı, büyük mavi balina geç gelen gözlere kavuştu

Bu makaleyi okumak için 21 Dakika
Önündeki yol, artık gözlerini kapatarak yürümesine izin vermiyor.
Orijinal Başlık: "DeepSeek Görsel Anlama Modelini Yayınladı, Büyük Mavi Balina Geç Kalan Gözlere Kavuştu"
Orijinal Yazar: 动察Beating


21 Ağustos 2026'da DeepSeek, yeni görsel anlama modeli deepseek-v4-flash-vision-exp'i piyasaya sürdü ve çok modlu API resmi olarak açıldı. Geliştiriciler ilk kez görselleri doğrudan DeepSeek'in resmi arayüzüne gönderebilecek.


Model, V4 Flash'ın 1 milyon token bağlam penceresini ve 384.000 token maksimum çıktısını koruyor; JSON Output, Tool Calls, Responses API'yi destekliyor ve Anthropic API ile de uyumlu.


Fiyatlandırma da tamamen V4 Flash ile aynı. Milyon token başına giriş, önbellek isabetsizliğinde, yoğun saatlerde 3 yuan, boş saatlerde 1,5 yuan; önbellek isabetinde sırasıyla 0,1 yuan ve 0,05 yuan. Çıkış yoğun saatlerde 9 yuan, boş saatlerde 4,5 yuan. Pekin'de her gün 9:00-12:00 ve 14:00-18:00 arası yoğun saatlerdir, kalan 17 saat yarı fiyatına uygulanır.


Görseller de token bazında faturalandırılır. Modele girmeden önce her görsel boyutuna göre otomatik olarak ölçeklenir; yaklaşık 384×384 pikselden küçük olanlar büyütülür, büyük görseller ise toplam piksel miktarı yaklaşık 800×800 piksele sıkıştırılır. Tek bir görsel en fazla 384 token kaplar. 2000×2000'lik bir görsel ile 5000×5000'lik bir görsel sonunda tamamen aynı token miktarını tüketebilir.


384 token üst sınırına göre, bir görselin yoğun saatlerde ve önbellek isabetsizliğinde giriş maliyeti yaklaşık 0,001152 yuan'dır. Bu tür bin görsel işlendiğinde, görsel girişinin kendisi yalnızca yaklaşık 1,152 yuan tutar; metin ve model çıktısı ayrıca hesaplanır.


Birlikte yayınlanan bir diğer özellik de Files API'dir. Geliştiriciler görselleri önceden yükleyebilir ve ardından file_id'yi isteğe ekleyebilir. Aynı görsel yalnızca bir kez yüklenmesi gerekir ve sonrasında farklı isteklerde tekrar tekrar referans gösterilebilir.


Bu API'nin kendisi ücretsizdir. Tek bir dosya en fazla 64 MiB boyutunda olabilir; her kullanıcı en fazla 25 GiB ve 10.000 dosya saklayabilir. Dosyalar 1 saat ile 30 gün arasında bir süre sonra sona erecek şekilde ayarlanabilir; geçerlilik süresi belirtilmezse süresiz olarak saklanabilir. Şu anda resmi olarak dosya içeriğini indirmek için bir arayüz de sağlanmamıştır. Geliştiriciler yükleyebilir, sorgulayabilir ve silebilir; model okuyabilir. Bu, sıradan bir bulut diskinden ziyade daha çok çıkarım için özel olarak hazırlanmış ücretsiz bir görsel deposudur.


Ancak aslında garip olan, DeepSeek'in görüntü tanımayı ancak bugün öğrenmesi değil.


İki Zaman Çizgisi


Sadece araştırmaya bakılırsa, DeepSeek'in görsel yetenekleri geç değil.


Sadece ürün ve API'ye bakılırsa, gerçekten de uzun süre gecikmiş.


11 Mart 2024'te DeepSeek-VL açık kaynak olarak yayınlandı.


1.3B ve 7B olmak üzere iki sürümü vardı; doğal görüntüleri, web sayfalarını, formülleri, grafikleri ve belgeleri anlayabiliyordu. Ekim ayında Janus ortaya çıktı ve görüntü anlama ile üretimi aynı otoregresif çerçeveye yerleştirdi. 13 Kasım'da JanusFlow takip etti. Aralık'ta DeepSeek-VL2 yayınlandı; karışık uzman mimarisine geçildi ve toplam parametre sayısı 3B, 16B ve 27B olmak üzere üç kademeye ayrıldı.



28 Ocak 2025 sabahı erken saatlerde, yılbaşı gecesi, Janus-Pro açık kaynak olarak yayınlandı. Resmi depo UTC'ye göre 27 Ocak olarak kaydedildi.


7B sürümü, metinden görüntü üretme talimat takibi değerlendirmesi olan GenEval'de 0.80 puan aldı ve makalede listelenen DALL-E 3'ün 0.67'sini geçti. Açık kaynak ağırlıkları vardı, yerel olarak dağıtılabilir ve halka açık bir demosu da mevcuttu.


DeepSeek bunu kendi barındırdığı API'ye bağlamadı.


Hemen önceki hafta, R1 DeepSeek'i spot ışıklarının altına itmişti. Janus, GitHub ve Hugging Face'te kaldı. Çoğu sıradan kullanıcı için kısa sürede gözden kayboldu.


20 Ekim 2025'te DeepSeek-OCR açık kaynak olarak yayınlandı; görsel token'larla uzun belgeleri sıkıştırıyordu. 27 Ocak 2026'da OCR 2 yayınlandı.


DeepSeek-VL'den başlayarak, iki yıl içinde en az DeepSeek-VL, Janus, JanusFlow, VL2, Janus-Pro, OCR ve OCR 2 olmak üzere yedi kamu kaydı bulunabiliyor.


Görsel araştırmalar sürekli yapıldı ve sürekli dışarıya sunuldu.


Sadece sıradan geliştiriciler için o giriş noktası hiç olmadı.


Öte yandan, Mart 2024'e gelindiğinde, birkaç ana rakip geliştirici arayüzleri zaten görüntü kabul edebiliyordu. OpenAI, Kasım 2023'te GPT-4 Turbo with Vision'ı açtı; görüntüler doğrudan Chat Completions API'ye girebiliyordu; bir ay sonra Google, Gemini Pro Vision API'yi yayınladı; Mart 2024'te Claude 3'ün tüm serisi görsel yetenekler ekledi.


25 Nisan 2025'te Robin Li, Baidu Create konferansında "DeepSeek de her şeye kadir değil" dedi. Ardından sıraladığı birkaç sorun arasında tek modlu olması da vardı.


Onun değerlendirmesi, çok modluluğun temel modeller için standart hale geleceği ve saf metin modellerinin pazarının giderek küçüleceği yönündeydi.


O zamanlar DeepSeek, bir yıldır görsel araştırma yapıyordu.


Şafak Vakti


7 ve 8 Nisan 2026'da bazı kullanıcılar DeepSeek'i açtıklarında arayüzde aniden üç yeni giriş belirdi.


"Hızlı", "Uzman", "Görsel".



29 Nisan'da DeepSeek çok modlu ekip lideri Chen Xiaokang, görüntü tanıma özelliğinin bazı kullanıcılara kademeli olarak sunulmaya başlandığını doğruladı. Ardından DeepSeek'te kıdemli bir araştırmacı, "Küçük balina artık görebiliyor" yazdı. South China Morning Post bu cümleyi doğrudan başlığına koydu.


DeepSeek'in gözleri ilk kez gerçekten ürün arayüzünden dışarı çıktı.


Ertesi gün DeepSeek, "Thinking with Visual Primitives" başlıklı makaleyi GitHub'a yükledi. Birkaç saat sonra depo ve makale tekrar kaldırıldı. 1 Mayıs'a gelindiğinde orijinal adres 404 döndürüyordu. DeepSeek hiçbir açıklama yapmadı; internette yalnızca makalenin yansımaları ve medya aktarımları kaldı.


Makale çok spesifik bir sorunu inceliyordu.


Model, çok kalabalık bir görüntü gördüğünde genellikle ne söylediğini bilir, ancak tam olarak hangi kişiden veya hangi çizgiden bahsettiğini netleştiremez. Ekip, nokta koordinatlarını ve sınır kutularını doğrudan akıl yürütme sürecine ekleyerek modelin bir yandan konumu işaret etmesini, diğer yandan düşünmeye devam etmesini sağladı.


756×756 boyutundaki bir görüntü önce görsel kodlayıcıdan geçerek 2916 görüntü parçası token'ına dönüştürülür, ardından 3×3 uzamsal sıkıştırma ile 324 token'a indirgenir. V4 Flash'ın seyrek dikkat mekanizması önbelleği sıkıştırmaya devam ederek yalnızca 81 görsel KV girişi bırakır.


Ekip ayrıca bu yöntem için 40 milyondan fazla eğitim örneği üretti; buna özel olarak labirent navigasyonu ve yol izleme üzerine eğitim verileri de dahildi.


Bu makalenin büyük çaba harcayarak çözmeye çalıştığı şey aslında "neresini işaret ettiğini bilmek"ti.


Model önce görmeli, sonra nereye baktığını bilmeli. Ancak bu şekilde akıl yürütmeye devam edebilir.


DeepSeek bu sefer Vision Exp'in bu Visual Primitives yaklaşımını tamamen benimseyip benimsemediğini açıklamadı. Daha da önemlisi, bu araştırma DeepSeek'in "görsel akıl yürütme" anlayışını ilk kez dışarıya ifşa etti.


18 Haziran'da web ve uygulama görsel tanıma modu resmi olarak yayınlandı. Ertesi gün, bir medya kuruluşu Liang Wenfeng'in fotoğrafını test ederek yükledi ve DeepSeek onu iki kez üst üste Zhang Yiming olarak tanıdı. Farklı bir sohbette ise Zhang Yiming'i Cambricon'un kurucusu Chen Tianshi olarak tanıdı.


Artık İngilizce ekran görüntülerini okuyabiliyor ve web sayfalarını koda dönüştürebiliyor.


Ancak yüzlerle karşılaştığında, kendi patronunu bile tanıyamıyor.


19 Ağustos'ta DeepSeek Harness, tarihi net olarak belirtilmiş bir teknik doküman bıraktı. Resmi adaptör, görselleri image_url olarak serileştirebiliyor; doküman ayrıca varsayılan model dizininde deepseek-v4-flash-vision-exp'in şimdilik gösterilmeyeceğini, ilgili API uç noktasının kullanılabilir olmasının beklendiğini belirtiyor.


20 Ağustos'ta, geliştiriciler tarafından yapılan gerçek testler, henüz açılmamış bu model adına görsel gönderildiğinde yalnızca 400 hatası alındığını ortaya koydu.


21 Ağustos'ta bu kısıtlama kaldırıldı. Harness, deepseek-v4-flash-vision-exp'i varsayılan model dizinine ekledi ve ilgili birleştirme commit'i doğrudan "publish the vision model" yazıyordu. Ardından, DeepSeek resmi API dokümantasyonu ve resmi hesap aynı anda Vision Exp'in yayınlandığını duyurdu.


İki hat nihayet birleşti.


Agent


Bu yıl Mayıs ayında bir yatırımcı toplantısının ses kaydı dökümünde Liang Wenfeng, kendi anlayışındaki AGI yolunu birkaç basamağa ayırdı: dil modeli, düşünce zinciri, Agent, sürekli öğrenme, kendi kendini yineleme ve ardından somutlaşmış zeka.


Çok modluluğu bir bileşen konumuna koydu, arama ile hemen hemen aynı seviyede.


Video üretiminden bahsederken, dökümde şu cümle yer alıyor:


Ticari olarak, bu iyi bir iş. Ancak bunun zeka ile hiçbir ilgisi yok.


Onun değerlendirmesi, video üretimi ve dünya modelinin mevcut aşamada zeka sınırıyla çok büyük bir ilişkisi olmadığı; şu an daha acil olanın AI eğitimi ve eğitim sonrası sürekli öğrenme olduğu yönünde.


Multimodal yapının farklı olduğu nokta, her ne kadar "bileşen" konumunda yer alsa da, DeepSeek'in açıkça yapacağını belirttiği bir bileşen olmasıdır. Liang Wenfeng o dönemde ayrıca V4 ve sonraki sürümlerin doğal multimodal desteği sunacağını da belirtmişti.


Görsel yetenekler DeepSeek'in yol haritasında her zaman bir yere sahipti, ancak öncelik sıralamasında o kadar önde değildi.


Yol haritası üçüncü adım olan Agent'a ulaştığında durum biraz değişmeye başladı.


DeepSeek, bu görsel API'nin "Agent için yayınlandığını" açıkça söylemedi. Ancak Liang Wenfeng'in yol haritasına dair değerlendirmeleri ile bugünkü duyuruyu bir araya getirdiğinizde, bu iki çizgiyi artık tamamen ayrı değerlendirmek zor.


Agent'ın ekranı okuması, grafiklere bakması ve araçların geri gönderdiği ekran görüntülerini işlemesi gerekiyor. Sonsuza dek yalnızca düz metin içinde yaşayamaz. İki yıldır geliştirilen görsel yetenekler nihayet makalelerden, depolardan ve test sayfalarından çıkıp API'ye ulaştı.


DeepSeek'in bugün Vision Exp için gösterdiği üç örnek de geleneksel "resme bakıp konuşma" türünde değil: bir Agent'ın üst düzey müşterilere Tibet otomobil turu PPT'si hazırlaması, DeepSeek Harness web sitesini yeniden tasarlaması ve görsel gereksinimlere göre dinamik efektli bir ön yüz demosu oluşturması.


Bunların hepsi modelin uzun süreçli görevlerde görsel bilgiyi tekrar tekrar işlemesini gerektiriyor.


API tasarımı da bu yöne doğru ilerliyor. Responses API ayrıca input_image kabul ediyor; tarayıcı Agent'ı web sayfası ekran görüntüsünü aldıktan sonra bir sonraki akıl yürütme turuna yeniden gönderebiliyor; kod Agent'ı işlenmiş sonuçları kontrol edebiliyor, grafikler, taranmış belgeler ve yazılım arayüzleri doğrudan bağlam haline gelebiliyor.


Files API ise başka bir sorunu çözüyor: aynı görselin her istek turunda tekrar yüklenmesine gerek yok. Bir dosya uzun süre orada tutulabiliyor ve Agent'ın yalnızca file_id'yi tekrar göndermesi yeterli. Tek bir istekte en fazla 600 görsel yer alabiliyor. Harici bağlantı veya Base64 kullanıldığında tek görsel sınırı 32 MiB iken, Files API üzerinden referans verildiğinde 64 MiB'a çıkabiliyor.


Bu artık sohbet kutusuna bir "görsel yükle" düğmesi eklemek gibi görünmüyor.


Daha çok Agent'ın görsel kullanırken ihtiyaç duyduğu altyapıyı tamamlamak gibi.


DeepSeek'in açıkladığı dört multimodal Agent karşılaştırması da geleneksel anlamda "resme bakıp konuşmayı" pek test etmiyor.


ApexBench, yatırım bankacılığı, danışmanlık ve hukuk gibi uzun süreçli görevlere odaklanır. Agents' Last Exam, 55 uzmanlık alanındaki gerçek işlerden gelir. Chartography, Kaplan-Meier eğrileri, mum grafikleri, kontur çizgileri, Sankey diyagramları ve Bode grafiklerini özel olarak test eder. ZeroBench ise 100 elle tasarlanmış zor soruyla çok adımlı görsel akıl yürütmeyi ölçer.



Vision Exp, Claude Opus 4.8'e karşı iki galibiyet ve iki mağlubiyet aldı.


Agents' Last Exam'de 27,3'e karşı 25,7, ZeroBench'te 35,0'a karşı 34,0. ApexBench'te 36,5'e karşı 39,4, Chartography'de 64,3'e karşı 65,0. Dört farkın hiçbiri 3 puanı aşmadı.


Daha ilginç olanı, görsel özellikler eklendikten sonra orijinal metin tabanlı ajan yeteneklerinin belirgin şekilde düşmemesi.


31 Temmuz'da yayınlanan metin tabanlı V4 Flash ile madde madde karşılaştırıldığında, resmi site hem önceki hem sonraki sonuçları veren beş metin tabanlı ajan değerlendirmesinin tamamında artış gösteriyor.


Terminal Bench 2.1, 82,7'den 83,9'a, NL2Repo 54,2'den 57,7'ye, DeepSWE 54,4'ten 59,3'e, DSBench-Hard 59,6'dan 63,6'ya ve AutomationBench 25,1'den 25,7'ye yükseldi. DeepSWE'nin 59,3'ü, grafikteki Opus 4.8'in 58,0'ını da aştı.


Ancak bu rakamlar DeepSeek'in kendi testlerinden geliyor. Resmi açıklamada, açık Code Agent metin görevlerindeki DeepSeek serisi modellerin DeepSeek Harness minimalist modunu kullandığı ve akıl yürütme seviyesinin max olarak ayarlandığı belirtiliyor. Bunlar, Vision Exp'in kendi V4 Flash'ına kıyasla değişimini gözlemlemek için daha uygun; doğrudan üçüncü taraf bağımsız bir sıralama olarak ele alınmamalı.


Model adının arkasındaki "exp" etiketi de henüz kaldırılmadı.


DeepSeek bunu açıkça deneysel bir model olarak işaretliyor ve sürüm hâlâ değişmeye devam edebilir. Mevcut API yalnızca görüntü anlama yapıyor, çıktı hâlâ metin. Görüntü üretimi ve video açık değil; Files API yalnızca JPEG, PNG, GIF ve WebP kabul ediyor, PDF doğrudan yüklenemiyor.


2024 yılında, geliştiriciler DeepSeek'e bir görsel göndermek istediklerinde, resmi API henüz bunu desteklemiyordu.


26 Ağustos 2026'ya gelindiğinde, bu görsel nihayet içeri girdi.


DeepSeek'in gözleri gerçekten de geç açıldı.


Gerçekten açıldığında, önündeki yol artık gözlerini kapalı tutmaya izin vermiyordu.


Orijinal Bağlantı


BlockBeats Resmi Topluluğuna Katılın:

Telegram Abonelik Grubu: https://t.me/theblockbeats

Telegram Sohbet Grubu: https://t.me/BlockBeats_App

Twitter Resmi Hesabı: https://twitter.com/BlockBeatsAsia

举报 Düzeltme/Rapor
Kütüphane Seç
Kütüphane Ekle
İptal
Tamamla
Kütüphane Ekle
Sadece kendime görünür
Herkese Açık
Kaydet
Düzeltme/Rapor
Gönder