· kaynak Hacker News – Front Page (hnrss.org)
Yeniden üretilebilir ZLUDA ve ROCm yığını, CUDA Windows uygulamalarını AMD GPU'larda çalıştırıyor
Hacker News'te öne çıkan bir GitHub projesi, CUDA hedefli Windows uygulamalarını Radeon donanım üzerinde çalıştıran, bir RX 9060 XT üzerinde gerçek bir LibTorch eğitim iş yüküyle doğrulanmış, yeniden üretilebilir bir ZLUDA ve AMD HIP/ROCm kurulumunu belgeliyor.
Yığın ne yapıyor
Hacker News ana sayfasına ulaşan CUDA-for-AMD-Windows adlı bir depo, NVIDIA'nın CUDA araç setine karşı derlenmiş Windows uygulamalarını AMD GPU'larda çalıştırmak için işlevsel, yeniden üretilebilir bir reçete sunuyor. Proje, CUDA çağrılarını yakalayan bir uyumluluk katmanı olan ZLUDA'yı, AMD'nin HIP SDK'sı ve ROCm kütüphane ekosistemiyle birleştiriyor. Depoya göre tam yol yalnızca herkese açık upstream bileşenleriyle doğrulandı: resmi sürümden ZLUDA v6-preview.69, AMD HIP SDK 6.4 ve CUDA 11.8 için derlenmiş LibTorch 2.3.0. Doğrulanan referans makine tek bir kart, AMD'nin Radeon RX 9060 XT'si (gfx1200) ve proje diğer AMD GPU'ları desteklenen cihazlar değil, doğrulanmamış adaylar olarak açıkça konumlandırıyor. Test edenlerden bir kartın çalışıp çalışmadığına bakılmaksızın uyumluluk raporları açmalarını istiyor ve bir GPU'nun mimarisini tespit etmenin, bir iş yükünün çalışacağının kanıtı olmadığını vurguluyor.
Nasıl çalışıyor
Belgelenen boru hattı katmanlar halinde çalışıyor. CUDA hedefli bir uygulama, NVIDIA'nın kütüphaneleri olduğuna inandığı şeylere bağlanır; ZLUDA altta yer alır ve bu çağrıları yeniden yönlendirir; cuBLAS, cuBLASLt, cuSPARSE ve cuFFT uyumluluk katmanları, Radeon donanım üzerinde çalışan AMD'nin rocBLAS, hipBLASLt, rocSPARSE ve HIP runtime'larına eşlenir. Bir launcher script'i gerekli uyumluluk DLL'lerini hedef çalıştırılabilir dosyanın yanına yerleştirir ve o çalıştırma için HIP/ROCm runtime yollarını ayarlar; böylece uygulamaların yeniden derlenmesi veya değiştirilmesi gerekmez.
Doğrulama ve performans
Doğrulanan kurulumda ZLUDA'nın cuda_check aracı CUDA sürücüsü (nvcuda), cuBLAS, cuBLASLt, cuSPARSE ve cuFFT için geçiyor. Entegrasyon testi sentetik bir kontrolden daha ileri gidiyor: depo, 2.216.347 parametreli gerçek bir PPO ağının CUDA'ya bakan cihazda ileri geçişleri, çıkarımı, öğrenme ve optimizer adımlarını tamamladığını ve bir temiz doğrulama iterasyonunun, projenin ürettiği runtime'ı kullanarak 65.536 zaman adımı çalıştırdığını raporluyor.
cuDNN belirgin boşluk. Stabil Windows HIP SDK, MIOpen gibi daha kapsamlı ROCm yapay zekâ kütüphane yığınını içermiyor; bu nedenle proje, cuDNN'e bağımlı evrişim ağır yazılımların daha yeni veya nightly bir HIP yığını ya da ek çalışma gerektirebileceği konusunda uyarıyor. Yoğun, GEMM ağırlıklı LibTorch eğitimi mutlaka cuDNN gerektirmiyor ve doğrulanan PPO iş yükü onsuz tamamlandı.
2026-09-13 tarihli kontrollü bir A/B karşılaştırması, aynı RX 9060 XT iş yükünde her runtime için on iterasyon çalıştırdı ve her denemenin ilk iterasyonunu ısınma olarak attı. Yalnızca upstream kullanan yol saniyede medyan 13.278 toplam adıma ulaşırken, özgün geliştirme ortamından gelen özel DLL katmanı 12.876'da kaldı; bu da katmanı yaklaşık %3,03 daha yavaş yapıyor, dolayısıyla herkese açık upstream yolu varsayılan olarak kalıyor. Geçmişteki ayarlanmış çalıştırmalar farklı bir eğitim yapılandırması kullandı ve saniyede kabaca 70.000 ile 109.000 toplam adıma ulaştı. Bu özel katman, kaynak kökeni eksik olduğu ve kurtarılan HIP runtime'ı üçüncü taraf AMD ikili dosyaları içerdiği için ikili dosyalar olarak dağıtılmıyor; ancak SHA-256 parmak izleri deponun manifestolarında kayıtlı.
Araçlar ve sınırlamalar
Kurulum PowerShell'de script'lenmiş. Yükleyici AMD GPU'yu ve yerel gfx hedefini tespit eder, sürücüyü ve gerekli matematik kütüphaneleriyle birlikte HIP SDK'yı doğrular, sabitlenmiş ZLUDA derlemesini ve isteğe bağlı olarak LibTorch'u (yaklaşık 2,66 GB) indirir, SHA-256 hash'lerini kontrol eder, runtime yapılandırma ve GPU rapor dosyalarını üretir ve kurulu yığınagainst cuda_check'i çalıştırır. Ayrı bir launcher seçilen CUDA'ya bakan çalıştırılabilir dosyayı çalıştırır ve ek script'ler çalıştırmadan DLL'leri hazırlayabilir, bir makineyi teşhis edebilir, GPU'yu tarayabilir veya runtime'ı test edebilir. Projeye göre tarayıcı model, mimari, sürücü ve HIP bilgilerini kaydediyor ve kullanıcı adlarını, token'ları veya kullanıcı dosyalarını kasıtlı olarak toplamıyor.
Sınırlamalar listesi açık sözlü: yalnızca RX 9060 XT doğrulanmış, ZLUDA eksiksiz bir CUDA uygulaması değil, Windows tam ROCm ekosisteminin yalnızca bir alt kümesini sunuyor ve NCCL, TensorRT, bazı PTX davranışları ile özel CUDA uzantıları başarısız olabilir. ZLUDA_CC=8.6 ayarı, AMD mimarisinin bir tanımı değil, CUDA'ya bakan bir uyumluluk değeridir. Projeye ait script'ler ve dokümantasyon MIT lisanslıdır; ZLUDA, ROCm/HIP, CUDA bileşenleri ve PyTorch/LibTorch kendi upstream lisanslarını korur.
Neden önemli
CUDA, GPU yazılımı için hâlâ varsayılan hedef ve bu, büyük miktarda Windows aracını ve yapay zekâ iş yükünü NVIDIA donanımına kilitliyor. Tüketici sınıfı bir Radeon kartta gerçek LibTorch eğitimi çalıştıran, belgelenmiş, yeniden üretilebilir bir yığın, bu kilidin geçirgen olduğunun pratik bir kanıtı. API ve kütüphane kapsamı iş yüküne bağlı ve doğrulama tek kart derinliğinde; ancak projenin sabitlenmiş sürümleri, hash doğrulaması, karşılaştırma metodolojisi ve uyumluluk raporlaması, topluluğa her ikisini de genişletmek için somut bir temel veriyor.
- #cuda
- #amd
- #rocm
- #windows
- #open-source
İlgili yazılar
- RevenueOS açık kaynak gelir ajanı olarak ücretsiz çalışıyor, yalnızca onaylanmış ölçülmüş sonuçlar için ücret alıyor
- Kairos 1.0, 'ay sonundan 3 iş günü önce' ifadesini tek bir ifadeye indiren bir schedule DSL'i ile geliyor
- Iris'in geliştiricisi bir ayda API eşdeğeri 24.000 dolarlık Claude kullanımı kaydetti