· kaynak dev.to (home feed)
Transformer'lardan sonra: state space modelleri, difüzyon metni ve dünya modelleri üretime yaklaşıyor
Bir dev.to anketi, transformer'ların maliyet, veri ve bağlam uzunluğunda yapısal sınırlara ulaştığını savunuyor ve Mamba tarzı state space modellerinin, difüzyon dil modellerinin ve JEPA dünya modellerinin üretime doğru nasıl ilerlediğini izliyor.

Transformer sonrası alanın haritası
Eylül 2026'da yayımlanan bir dev.to yazısı, transformer'ın yerini alacak başlıca adayları inceliyor ve bir sonraki mimari kaymanın çoktan şekillendiğini — basın bültenlerinden çok araştırma laboratuvarlarında — savunuyor. Yazar, yapay zekâ ilerlemesini kabaca üç yıllık bir döngü olarak çerçeveliyor: transformer'lar 2017 civarında RNN ve CNN'lerin yerini aldı, difüzyon modelleri 2020 ile 2022 arasında görüntü üretimine hâkim oldu ve LLM'ler 2022'de ana akım hâle geldi. Bu ritme göre, hibrit transformer sonrası sistemler 2026–2028 penceresine denk geliyor ve yazı, geçişin başladığına dair kanıtlar sunuyor.
Ölçeklemenin çözemediği dört sınır
Yazıya göre, ekstra işlem gücüyle çözülemeyecek dört sorun transformer'ların üzerinde giderek daralan bir halka oluşturuyor:
- Self-attention her token'ı diğer her token'la karşılaştırdığı için maliyet, bağlam uzunluğunun karesiyle büyüyor. Bağlamı iki katına çıkarmak işlem gücünü dört katına çıkarıyor ve yazar, aritmetiğin yaklaşık on milyon token civarında tümüyle çöktüğünü ileri sürüyor.
- Eğitim verisi tükeniyor. İnternet metinleri büyük ölçüde tüketildi ve yazı, sentetik verinin model nesilleri boyunca bozulduğuna dikkat çekiyor; öğreniciler üretim sürecinin artefaktlarını özümsedikçe, 2020–2024'ün ölçekleme yasaları azalan getiriyle karşılaşıyor.
- Enerji ve maliyet sert bir tavan oluşturuyor. Frontier eğitim çalışmaları onlarca ile yüzlerce milyon dolar arasında paraya mal oluyor, büyük ölçekte sunum gigawatt'larca güç talep ediyor ve yazı, Sam Altman'ın 2024'te işlem gücü maliyetlerinin her şeyi kısıtladığını kabul ettiğine atıf yapıyor.
- Token tahmini örüntü eşleştirmedir, nedensel anlayış değil. Planlama yapması, simülasyon çalıştırması ya da yeni ortamlara uyum sağlaması gereken sistemler, yazarın savunusuna göre bir sonraki kelimeyi tahmin ederek oraya ulaşamaz.
State space modelleri: doğrusal ölçekleme, sıkıştırılmış bellek
Mamba ve Gated DeltaNet gibi state space modelleri, tüm geçmiş üzerindeki attention'ı, onu özetleyen sabit boyutlu bir iç durumla değiştiriyor; böylece karesel yerine doğrusal ölçekleme ve çıkarım sırasında token başına sabit bellek sağlıyor. Yazı soyağacını izliyor: erken S4 ailesi modeller sabit geçiş kuralları kullanıyordu; bu hızlıdır ama bir token'ı diğerine göre ağırlıklandıramaz. Mamba bu parametreleri girdiye bağımlı yaptı, böylece model neyi saklayacağını seçiyor ve yinelemeyi GPU belleği içinde donanımdan haberdar paralel bir tarama olarak çalıştırıyor — yazarın FlashAttention'a benzettiği kernel çalışması bu. Ardından Mamba-2, state space duality kavramını getirdi: seçici bir SSM ile kısıtlı bir doğrusal attention biçiminin aynı temel işlemi hesapladığını gösterdi; böylece SSM kernel'leri matris çarpımı donanımını yeniden kullanabiliyor.
Yazıya göre üretim dönüm noktası, uzun bağlam işlemeyi daha iyi olan Mamba-2'nin delta kuralıyla rafine edilmiş hâli Gated DeltaNet. Makale, Qwen3.5'ın Şubat 2026'da onu çekirdek mimari olarak benimsediğini ve hibrit bir mixture-of-experts yapılandırmasında yalnızca üç milyar aktif parametreyle güçlü ajan ve kodlama benchmark sonuçları açıkladığını, ayrıca NVIDIA'nın içine Mamba-2 katmanları yerleştirilmiş Nemotron 3'ü piyasaya sürdüğini bildiriyor. Takas yapısal: geçmişi sabit bir duruma sıkıştırmak, attention'ın koruduğu ince ayrıntıları kaybedebilir; bu yüzden yazı, birebir kopyalama veya atıf işlerinde transformer'ların hâlâ kazandığını kabul ederken, state space modellerinin özetleme, araç kullanımı ve genel özün birebir hatırlamadan daha önemli olduğu uzun belge işleri için uygun olduğunu söylüyor.
Difüzyon metne geliyor
Difüzyon dil modelleri, görüntü üreticilerinin ardındaki tekniği ödünç alıyor: bir seferde bir token üretmek yerine, metnin bütün bir bloğunu paralel olarak rafine ediyorlar ve ileri geçiş başına çok sayıda token üretiyorlar. Makaleye göre, Mayıs 2026'da yayımlanan NVIDIA'nın Nemotron-Labs-Diffusion'ı, HumanEval, GSM8K ve Math500 dahil benchmark'larda rekabetçi doğrulukla, Qwen3-8B'nin ileri geçiş başına token sayısının yaklaşık altı katına ulaştı ve otoregresif, difüzyon ve self-speculation kod çözmeyi tek bir üç kipli modelde birleştiriyor. Google'ın Gemini Diffusion'ı, metin üretimi için vaat edilen on kat hızlanmayla anılıyor. Yazarın belirttiği pürüz şu: difüzyon, bir çıktı boyunca küresel eniyileme yapar; bu genel yapıya yardımcı olabilir ama bazen ince ayrıntıları feda eder — yaratıcı işler için potansiyel olarak daha iyi, hassas teknik çıktı için daha zayıf.
Üçüncü hat olarak dünya modelleri
Son aday dünya modeli. Makale, Yann LeCun'un 2025'i otoregresif LLM'lerin temelden sınırlı olduğu ve yapay zekânın kelimelerden çok dünyayı tahmin eden modellere ihtiyaç duyduğu savunusuyla geçirdiğini anlatıyor; ekibi Eylül 2025'te görüntü için, ardından video ve dil için Joint Embedding Predictive Architecture makaleleri yayımladı. Yazıya göre Aralık 2025'te VL-JEPA geldi — rakiplerinin yaklaşık yarısı kadar parametreye sahip olmasına rağmen yine de daha iyi performans gösteren bir görü-dil modeli.
Neden önemli
Bu iddiaların çoğu — benchmark rakamları, piyasaya sürülme tarihleri ve satıcı hızlanma vaatleri — tek bir anket yazısından geliyor; laboratuvar ve satıcı duyurularını aktarıyor, dolayısıyla bağımsız doğrulamayı hak ediyor. Ama yön, 2027 ve sonrası için yapay zekâ sistemleri tasarlayan herkes için önemli. Enerji bağlayıcı kısıtsa, doğrusal ölçeklenen ve sabit çıkarım bellekli mimariler neyin dağıtımda ekonomik olduğunu değiştiriyor ve attention, state space katmanları ile difüzyon kod çözme karışımı hibritler teoride kalmak yerine çoktan gönderiliyor. Mühendislerin yarın transformer'ları terk etmesi gerekmiyor, ama yalnızca attention kullanan modellerin varsayılan olarak kalacağı varsayımı, bu kanıtlara bakılırsa giderek eskimiş görünüyor.
- #ai-architecture
- #state-space-models
- #diffusion-models
- #transformers
- #machine-learning