deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Tiangong Omni'nin yüzünü kapatarak koşusu, NVIDIA'ın Isaac yığınındaki pekiştirmeli öğrenmeden ortaya çıktı

Pekin merkezli X-Humanoid mühendisleri, Tiangong Omni robotunun tuhaf yüz kapatarak koşusunun önceden programlanmadığını — yürüyüşün NVIDIA'ın Isaac simülasyon yığınındaki pekiştirmeli öğrenme sırasında kendiliğinden ortaya çıktığını söylüyor.

Tiangong Omni'nin yüzünü kapatarak koşusu, NVIDIA'ın Isaac yığınındaki pekiştirmeli öğrenmeden ortaya çıktı

Utangaç görünümlü bir robot birinciliği alıyor

Tiangong Omni humanoid robotunun her iki eliyle yüzünü kapatarak koştuğu ve birinci bitirdiği bir video, araştırmacı David Ha'nın yaklaşık bir hafta önce X'te paylaşmasının ardından geniş çapta yayıldı; dev.to'daki bir yazıya göre durum böyle. Koşu, Pekin'deki bir robot oyunları etkinliğinde gerçekleşti ve bu tuhaf utangaç duruş anında konuşulan konu oldu. Ancak teknik olarak ilginç olan kısım, bu yürüyüşün nereden geldiği.

Tasarlanmadı, keşfedildi

dev.to'daki yazı, Tiangong robot serisinin arkasındaki ekip olarak bilinen ve Pekin Humanoid Robot İnovasyon Merkezi adındaki X-Humanoid mühendislerinin, bu duruşun önceden tasarlanmış bir animasyon olmadığını söylediğini aktarıyor. Bunun yerine, robotun eğitim aldığı simülasyon ortamında — şirketin eğitim alanı olarak kullandığı "metaverse" içinde — kendiliğinden ortaya çıktı.

Yazının anlattığına göre, işlem hattı NVIDIA'ın robotik yığınından geçiyor:

  • Omniverse, temel 3D ve dijital ikiz platformu olarak hizmet veriyor.
  • Isaac Sim, üzerinde fizik simülatörü olarak çalışıyor ve milyonlarca paralel pekiştirmeli öğrenme deneme-yanılma bölümü burada gerçekleşiyor.
  • NVIDIA'ın açık kaynak pekiştirmeli öğrenme çerçevesi Isaac Lab, büyük ölçekli paralel eğitimi yürütüyor.
  • X-Humanoid'in Isaac Lab üzerine inşa ettiği açık kaynak çerçeve Tien-Kung-Lab, Tiangong serisi için hareket kontrol algoritmalarını sağlıyor.

Bir policy eğitildikten sonra dışa aktarılıyor ve fiziksel Tiangong Omni'ye dağıtılmadan önce MuJoCo'da çapraz doğrulamadan geçiyor — bir Sim2Sim doğrulama adımı — ve gerçek makinede küçük bir ince ayar yapılıyor.

Tanıdık bir olgu, artık gerçek bacaklarda

Yazıda alıntılanan David Ha, durumu "MuJoCo ortamlarında keşfedilen yeni hareket policy'lerine benziyor, tek farkla: bunlar gerçek dünyada çalışıyor" diye karşılaştırdı. Pekiştirmeli öğrenme araştırmacıları, uzun süredir ajanların simülatörler içinde tuhaf ama etkili hareket etme yolları icat ettiğini görüyor. Buradaki olağandışı kısım, böyle bir policy'nin fiziksel donanıma aktarımı atlattığı ve kamusal bir yarışı kazandığı.

İki simülatör, tek işlem hattı

Yazı, sonucu daha geniş araç ekosistemine de yerleştiriyor. Tiangong ekibinin ana eğitimi NVIDIA ekosisteminde, GPU üzerinde binlerce paralel ortamla yürüyor. Aynı robot modeli ve ödül fonksiyonları daha sonra yürüyüşü yeniden üretmek için MuJoCo'ya taşınıyor — bu, PhysX tabanlı simülasyonun artefakt üretip üretmediğine dair bilinçli bir çapraz kontrol ve gerçek robota dokunmadan önce sim-to-real açığını araştırmanın bir yolu.

Yazıya göre iki ekosistem eskisinden daha iyi birlikte çalışıyor: Isaac Sim, MuJoCo'nun MJCF model formatını doğrudan içe aktarabiliyor ve Isaac Lab 3.0, Omniverse render'ını başlatmadan fizik arka ucu olarak MuJoCo-Warp çalıştırabiliyor. Yüz kapatan yürüyüş ilke olarak iki ortamda da eğitilebilirdi; büyük ölçekli paralelliği ve sensör simülasyonu nedeniyle ağır iş için Isaac yığını seçildi.

Açıkça söylemek gereken bir uyarı: bu eğitim ayrıntıları, şirketin mühendislik iddialarını Ha'nın gönderisiyle birlikte aktaran tek bir yazıdan geliyor, bu yüzden bağımsız olarak doğrulanmış değil, aktarıldığı şekliyle okunmalı.

Neden önemli

Buradaki ana mesaj, sim-to-real aktarımını atlatmış ortaya çıkan davranış. Pekiştirmeli öğrenme simülasyonda rutin olarak tuhaf ama işlevsel yürüyüşler üretir ve bunların çoğu yerçekimi, sürtünme ve donanım toleransları devreye girdiğinde çöker. Yalnızca fiziksel bir humanoid'e aktarılmakla kalmayıp bir yarışı da kazanan bir policy, kimsenin elle tasarlaması gerekmeyen bir hareket kabiliyetine giden güvenilir bir yol olarak, masif paralel eğitim artı çapraz simülatör doğrulaması kombinasyonunun yerleştiğine dair bir kanıt.

Bu aynı zamanda standart uygulamaya dönüşen bir sektör modelini de gösteriyor: paralellik ve sensör simülasyonunun ucuz olduğu yerde eğit, temas dinamiğine güvenilen yerde doğrula. Daha fazla humanoid bu şekilde geliştirildikçe, sağlam gerçek dünya yeteneğini simülatör kokan kazalardan ayırmak giderek daha önemli hale gelecek — ki bu tam olarak X-Humanoid'in iş akışındaki MuJoCo çapraz kontrolünün işi.

  • #humanoid-robots
  • #reinforcement-learning
  • #nvidia-isaac
  • #sim-to-real
  • #robotics

İlgili yazılar