· kaynak dev.to (home feed)
Bağımsız analiz, DeepSeek'in görme çizgisini DeepSeek-VL'den Vision-Exp'e kadar izliyor
dev.to üzerinde yayımlanan bağımsız bir analiz, DeepSeek'in görme-dil araştırmasını DeepSeek-VL ve VL2'den Janus'a kadar yeniden yapılandırıyor ve yeni deepseek-v4-flash-vision-exp API'sinin belgelerinde yer alanları doğrulanmamış olanlardan ayırıyor.

dev.to üzerinde yayımlanan bağımsız bir teknik analiz, DeepSeek'in en yeni deneysel görme modelinin ani bir görüntü dönüşü olmaktan çok yıllara yayılan bir araştırma programının en son adımı olarak okunması gerektiğini savunuyor. zipflow.xyz tarafından yazılan yazı, şirketin kamuya açık görme-dil çizgisini orijinal DeepSeek-VL'den VL2 ve Janus görüntü üretim modellerine kadar yeniden yapılandırıyor, ardından bu geçmişi mevcut deepseek-v4-flash-vision-exp API'sinin belgelenmiş davranışıyla karşılaştırıyor. Yazar, analiznin gayriresmî olduğunu ve modelin kendi upstream kanalları üzerinden sunulmadığını açıkça belirtiyor; dolayısıyla API ayrıntıları üretimde test edilmiş değil, belgelere dayanıyor.
DeepSeek-VL belgeleri birinci sınıf görme girdisi olarak ele aldı
Analize göre DeepSeek'in 2024 tarihli “Towards Real-World Vision-Language Understanding” makalesi, görme yeteneğini genel görüntü açıklaması yerine pratik girdiler — web ekran görüntüleri, PDF'ler, OCR, grafikler ve bilgi odaklı içerikler — çevresinde çerçeveledi. Proje, gerçek kullanıcı senaryolarından bir görev taksonomisi türetti ve bunu tanıma, transkripsiyon, dönüştürme, analiz, sağduyu ve mantıksal akıl yürütme, çoklu görüntü karşılaştırma ile güvenlik prompt'larını kapsayan instruction-tuning verisi oluşturmak için kullandı.
Mimari; hibrit bir görme kodlayıcı, bir görme-dil adaptörü ve bir DeepSeek dil modeli bir araya getiriyordu. Kodlayıcı, SigLIP-L tabanlı düşük çözünürlüklü semantik bir dal ile SAM-B tarzı bir kodlayıcıdan türetilmiş daha yüksek çözünürlüklü bir dalı eşleştiriyordu; gerekçe, küçük metinler, yoğun sayfalar ve görsel grounding için yalnızca global semantik özelliklerin yetersiz olmasıydı.
Eğitim üç aşamada yürütüldü: görme ve dil bileşenleri dondurulmuşken adaptör ısındırma, karışık metin ve multimodal veriyle ortak ön eğitim ve denetimli ince ayar. Ön eğitim karışımı kabaca %70 metin ve %30 multimodal olarak kaldı; görüntülere ani bir geçiş yerine kademeli bir modality ısındırması yapıldı. Analiz bu dengeden daha geniş bir ders çıkarıyor: bir kodlayıcı eklemek yeterli değil, çünkü eğitim aynı zamanda temel modelin mevcut akıl yürütme ve talimatları izleme davranışını da korumak zorunda. DeepSeek-VL, kabaca 1.3B ve 7B varyantlarıyla birlikte kod ve ağırlıkları yayımladı; bu, her eğitim örneği kamuya açık şekilde izlenebilir olmasa da erken çizgiyi kapalı bir API modelinden daha incelenebilir kıldı.
VL2 dinamik tiling ve mixture-of-experts ekledi
Analize göre DeepSeek-VL2 çizgiyi iki yönde genişletti. Dinamik tiling, çeşitli en-boy oranlarını ve daha yüksek çözünürlükleri, sabit bir yeniden boyutlandırmanın belge ve ekran görüntüsü görevlerinde yol açtığı ayrıntı kaybı olmadan işledi. DeepSeek'in verimli attention tasarımına sahip Mixture-of-Experts dil bileşeni, her token için tüm parametreleri etkinleştirmeden multimodal yeteneğin büyümesine izin verdi. Makalenin değerlendirmeleri görsel soru cevaplama, OCR, belge anlama, tablo ve grafik anlama ile görsel grounding'i kapsıyordu ve yayın Tiny, Small ve daha büyük varyantlarla geldi.
Janus anlamayı üretimden ayırdı
Janus çizgisi başka bir soruyu ele aldı: tek bir otoregresif çerçeve hem görüntüleri anlayabilir hem de üretebilir mi? Çalışma, görsel kodlamayı, anlama için semantik bir yol ile üretim için ayrık görsel token yolu olarak ayırdı; her ikisi de tek bir transformer'a besleniyordu. Gerekçe, bir grafiği okumak için en iyi temsilin piksel çizmek için en iyi temsil olmamasıydı. Janus-Pro daha sonra modeli ölçeklendirdi ve eğitim ile veri stratejisini rafine etti. Analiz, bu çalışmayı mevcut API teklifiyle eş tutmamak konusunda uyarıyor: Janus birleşik anlama-ve-üretim araştırmasıyken, Vision-Exp metnin yanında görüntü kabul eden bir API modeli. Paylaştıkları şey, görsel temsile yapılan temel yatırımdır.
Vision-Exp API'si neyi belgeliyor
Analizde özetlendiği üzere DeepSeek'in belgeleri, deepseek-v4-flash-vision-exp'i JPEG, PNG, GIF ve WebP görüntülerini base64 veri URL'leri, herkese açık görüntü URL'leri veya Files API referansları üzerinden kabul eden deneysel bir model olarak listeliyor. Model, OpenAI uyumlu Chat Completions ve Responses API'lerinin yanı sıra Anthropic uyumlu bir Messages endpoint'i üzerinden erişilebilir. Sınırlar arasında yeniden boyutlandırmadan sonra görüntü başına en fazla 384 token, istek başına 600'e kadar görüntü ve dış veya base64 girdiler ile Files API referansları için farklı üst sınırlar yer alıyor.
Köken boşluğu
Makaleler araştırma düzeyinde köken sunuyor — hedeflenen görev kategorileri, geniş veri karışımları, seçilmiş kamuya açık veri kümeleri, iç senaryo taksonomileri ve kademeli hizalama prosedürleri — ancak analizın vurguladığı gibi, kaynak düzeyinde bir kayıt defteri sunmuyor. Mevcut model için kullanılan görüntülerin kamuya açık eksiksiz bir listesi, tam bir lisans zinciri, tekilleştirme veya bulaşma raporu yok ve mevcut model davranışından belirli eğitim örneklerine bir eşleme yok. Mimari ve API belgeleri modelin nasıl çağrılacağını yanıtlıyor, her eğitim örneğinin nereden geldiğini değil.
Neden önemli
Bu çizgi, mevcut API'nin biçimini açıklıyor. Erken araştırma açıkça ekran görüntüleri, PDF'ler, OCR ve grafikleri hedeflediği için, yeni modeldeki görüntü girdisi yalnızca fotoğraf açıklaması yerine belge ağırlıklı ve agent tarzı iş akışlarına hitap ediyor. Aynı zamanda analiz, teknik, hukuki ve tedarik due diligence açısından önemli bir ayrım yapıyor: görünür bir araştırma çizgisi, doğrulanabilir eğitim verisi kökeniyle aynı şey değil ve en yeni modelin veri hikâyesi hâlâ belgelenmemiş durumda.
- #deepseek
- #vision-language-models
- #multimodal-ai
- #api
- #machine-learning