· kaynak Hacker News – Front Page (native)
World Labs, 3D dünyaları üreten ve yeniden yapılandıran bir dünya modeli olan Atlas'ı tanıttı
World Labs'ın Atlas'ı, kamerayla kontrol edilen video üretebilen, birkaç fotoğraftan sahneleri yeniden yapılandırabilen ve yaratıcı çalışmalar ile robotik için açık 3D geometri çıktısı sunabilen çok modlu bir dünya modeli.

World Labs ne duyurdu
World Labs, şirketin uzamsal zekâ yolculuğunda bir sonraki adım olarak konumlandırdığı genel amaçlı dünya modeli Atlas'ı duyurdu. Hacker News'in ana sayfasında öne çıkan bir şirket blog yazısına göre dünya modelleri, ortamları üreten, yeniden yapılandıran ve simüle eden sistemlerdir; bu ortamların nasıl göründüğünü, nasıl davrandığını ve zamanla nasıl değiştiğini yakalarlar; yaratıcı render, gerçek dünyanın yüksek sadakatli simülasyonu ve robot planlaması gibi alanlarda kullanılırlar.
Atlas, sıfırdan metin, görsel, video ve 3D veriyle doğal olarak çalışacak şekilde ön eğitimden geçmiş bir omni model olarak tanımlanıyor. Mimari açıdan World Labs bunu çok modlu otoregresif bir diffusion transformer olarak nitelendiriyor: tüm girdiler tek bir uzamsal bağlamda birleştiriliyor ve model, o bağlamda zaten bulunan her şeyle geometrik olarak tutarlı kalarak sıradakini üretiyor. Şirket, modelin ölçeklendiğini, eğitim hesaplama gücü arttıkça performansın iyileştiğini ve bu eğilimin sürmesini beklediklerini söylüyor.
Dört yetenek alanı
World Labs, Atlas'ın yeteneklerini dört gruba ayırıyor.
Kamera kontrollü üretim, bir veya daha fazla referans görsel alır ve kullanıcının belirttiği kamera konumu ile açısından, girdilerde hiç görünmemiş sahne bölümlerini de türeterek yeni görünümler üretir. Videolar, elle tasarlanmış kamera yolları boyunca bir ila altı girdi görselden üretiliyor ve çıktı 1440p çözünürlükte bir dakikaya kadar çıkabiliyor. Kamera geometrisi doğal bir girdi türü olduğundan çekimler metinle tarif edilmeden doğrudan çerçeveleniyor.
Uzamsal yeniden yapılandırma, gerçek dünya sahnelerini bir ila düzinelerce fotoğraftan yeniden inşa ediyor ve yüzden fazla fotoğrafı da işleyebiliyor; hem yeni görünümler hem de açık 3D çıktılar üretiyor. World Labs, doğru bir yeniden yapılandırma için genellikle iki veya üç görselin yeterli olduğunu ve Atlas'ın yalnızca 3D yeniden yapılandırma için eğitilmiş uzmanlaşmış sistemleri geride bıraktığını söylüyor. Bu karşılaştırmalar bağımsız bir değerlendirmeden değil, şirketin kendi duyurusundan geliyor.
Uzay-zaman simülasyonu, girdi videolarındaki uzay ve zamanla çalışıyor; görüntülerin görsel efektler için yeniden çerçevelenmesini ve robotik için Real-to-Sim iş akışlarını mümkün kılıyor.
Görsel üretimi, metinden görsele ve 360 derece panoramaları kapsıyor; karmaşık prompt'lar, render edilen metinler ve çeşitli görsel stiller destekleniyor.
Yalnızca bir prompt değil, uzamsal bir bağlam
World Labs'ın en çok vurguladığı mekanizma uzamsal bağlam. Atlas, bir dil modeli gibi girdilerini kodlar ve bunlara koşullu olarak üretim yapar; ancak her görsel uzayda bir 3D konuma sabitlenir. Bu sabitleme, metin prompt'larının ifade edemediği kontroller sağlar: birbiriyle ilgisiz iki referans görsel farklı konumlara yerleştirilebilir ve Atlas, kapıları, koridorları ve diğer geçişleri de içeren, ikisini bağlantılandıran tutarlı bir dünya uydurur.
Uzun video üretimi de aynı şekilde çalışır. Kullanıcı sahneyi kurar ve her kamera hareketini tasarlar; kullanılabilir bir sonuç çıkması umuduna kapılmak yerine model, yol boyunca tutarlı bir dünyayı doldurur.
Yeniden yapılandırma tarafında modelin ne kadar hayal edeceği, ne kadar gördüğüne bağlı. Bir örnekte Atlas, tek bir yer seviyesindeki fotoğraftan havadan bir görünüm üretti; görünür bahçeyi doğru şekilde yeniden yaratırken çevredeki sahneyi uydurdu. Bir kulübe ve bir ana evün fotoğraflarının eklenmesi çıktıyı gerçeğe yaklaştırdı. Bir diğerinde model, Stanford'un Main Quad alanını iki ila yirmi beş yer seviyesi fotoğraftan yeniden yapılandırdı ve kampüsün üzerinde uçan havadan yollar üretti.
Açık 3D çıktı
Atlas hem 2D görüntü kareleri hem de 3D derinlik haritaları üzerinde çalışır; bu yüzden dünyaları nokta bulutları veya 3D Gaussian splat olarak çıktı verebilir. Tek bir görselden model, yeni görünümleri üretirken geometrilerini de tahmin eder; bir videodan ise her kare için derinliği öngörür ve bunları, kameranın hiç yakalamadığı alanları doldurarak tek bir yeniden yapılandırmada birleştirir. World Labs, ortaya çıkan splat sahnelerinin şirketin mevcut ürünü Marble ile aynı temsili kullanılarak cihaz üzerinde yerel olarak yüksek çözünürlük ve kare hızlarında render edilebildiğini söylüyor. Atlas, Marble'ın ve diğer World Labs ürünlerinin gelecek sürümlerini besleyecek.
Neden önemli
Seyrek görsellerden yeni görünüm sentezi, 3D bilgisayarlı görme alanının on yıllardır üzerinde çalıştığı bir sorun ve bunu uzmanlaşmış sistemleri geride bıraktığını iddia eden genel amaçlı bir model, robotik, haritalama ve içerik üretimi alanlarında etkiler yaratır. Real-to-Sim yeteneği özellikle robotik için önemli, çünkü gerçek videoyu simüle ortamlara dönüştürmek eğitim ve test için bir darboğaz. Splat gibi açık 3D çıktılar, üretici sonuçlarını yalnızca video oynatmayla sınırlamak yerine oyun motorlarında, tasarım araçlarında ve VFX iş akışlarında kullanılabilir hale getiriyor. Açık soru ise doğrulama: şimdiye kadarki her performans iddiası World Labs'ın kendisinden geliyor ve üçüncü taraf karşılaştırmaları henüz ortaya çıkmış değil.
- #world-models
- #generative-ai
- #3d-reconstruction
- #robotics
- #spatial-intelligence