· kaynak dev.to (home feed)
ROCmFix ve InferBench, AMD GPU Kurulumunu ve Yerel LLM Backend Karşılaştırmalarını Otomatikleştiriyor
Bir dev.to yazısı iki araç tanıtıyor: AMD GPU'larda HSA_OVERRIDE_GFX_VERSION override işlemlerini otomatikleştiren ROCmFix ve Vulkan ile ROCm/HIP'i medyan tok/s ve TTFT ölçümleriyle karşılaştıran InferBench.

AMD'nin yerel LLM'deki sürtünme noktaları
dev.to'daki bir yazı, AMD GPU'larda Ollama veya LM Studio gibi araçlarla büyük dil modelleri çalıştıranları düzenli olarak zorlayan iki engel odaklanıyor. İlki eksik sürücüler veya tanınmayan grafik mimarileri; bu durumda kullanıcılar, ROCm tabanlı runtime'ların kartı desteklenmiş olarak görmesi için HSA_OVERRIDE_GFX_VERSION ortam değişkenini elle ayarlamak zorunda kalıyor. İkincisi ise saf belirsizlik: Hem Vulkan hem ROCm/HIP backend'leri mevcutken, belirli bir makinede hangisinin saniyede daha fazla token ürettiğini anlamanın bariz bir yolu yok.
Yazar, sorunu tek seferlik bir karşılaştırmayla kapatmak yerine, GitHub'da barındırılan ve sorunun her yarısına hitap eden iki araca işaret ediyor: ROCmFix ve InferBench.
ROCmFix: Override işlemini otomatikleştirmek
ROCmFix, HSA_OVERRIDE_GFX_VERSION geçici çözümündeki tahmin işini ortadan kaldıran tek dosyalık bir Python aracıdır. dev.to yazısına göre, GPU'nun PCI ID'sini doğrudan sorguluyor; Windows'ta Registry'yi okuyup Linux'ta lspci çağırarak doğru override değerini bir forum başlığından kopyalanmış bilgiden değil, gerçek donanımdan türetiyor.
Araç daha sonra değişkeni kalıcı olarak veya yalnızca mevcut oturum için yazabiliyor ve her iki platformun yaygın shell'lerini kapsıyor: Windows'ta CMD ve PowerShell, Linux'ta ise Bash, Zsh ve Fish. Yardımcı komut rocmfix doctor, bozuk bir kurulumu teşhis etmeye yardımcı olmak için yüklü HIP SDK ve Vulkan bileşenlerini inceliyor. Çalıştırmak için python rocmfix.py yazmak yeterli.
InferBench: Backend karşılaştırmalarını dürüst yapmak
İkinci araç olan InferBench, yerel LLM çıkarımının backend motorları arasındaki hız testlerini otomatikleştiriyor. İş akışı, Vulkan ve ROCm/HIP arasında gerçekten karşılaştırılabilir sayılar üretecek şekilde tasarlanmış. Önce ısınma sorgularını çalıştırıyor, ardından testler arasında VRAM boşaltmalarını zorunlu tutuyor; böylece önbellekleme ve bellek parçalanması sonraki ölçümleri, tesadüfen önce çalışan motor lehine etkileyemiyor.
Her yapılandırma için medyan tokens-per-second ve Time-to-First-Token (TTFT) değerlerini raporluyor; pratikte en çok önem taşıyan iki metriği kapsıyor: uzun üretimler için verimlilik ve etkileşimli kullanım için gecikme. Dikkat çekici bir şekilde, yazı Vulkan ve HIP arasında evrensel bir kazanan ilan etmiyor. İma edilen argüman, cevabın belirli GPU'ya, sürücü yığınına ve modele bağlı olduğu ve bunu kendi donanımınızda öğrenmenin yolunun InferBench olduğu.
Neden önemli
Radeon donanımında yerel modeller çalıştırmak hâlâ, daha olgun yığınların kullanıcılarının nadiren dokunduğu tesisat işleri gerektiriyor: mimari sürüm numaraları, ortam override'ları ve backend'e özgü tuhaflıklar issue başlıklarında halk bilgisi olarak dolaşıyor. Bu durum kırılgan çünkü bir sürücü güncellemesi veya desteklenmeyen bir kart, çalışan bir kurulumu sessizce bozabilir.
Bu iki araç soruna iki uçtan saldırıyor. ROCmFix en yaygın geçici çözümü deterministik ve incelenebilir bir sürece dönüştürürken, InferBench ısınma, zorunlu boşaltmalar, medyan ve TTFT dahil olmak üzere özenli bir benchmark metodolojisini paketliyor; böylece sıradan bir kullanıcı bunu yeniden üretebiliyor. Vulkan ile ROCm/HIP arasında seçim yapan uygulayıcılar için bu, genellikle anekdotlarla çözülen bir tartışmayı, her sürücü veya model güncellemesinden sonra tekrarlanabilecek bir ölçüme dönüştürüyor.
- #amd
- #rocm
- #vulkan
- #local-llm
- #benchmarking
- #open-source
İlgili yazılar
- Açık kaynak ENZO, kendi anahtarını getir ajanlarıyla 300'den fazla AI modelini self-host olarak çalıştırıyor
- 150 GB'lık açık veri seti, Orta Asya dillerini LLM eğitimi için kaynak kodla eşleştiriyor
- Cua, computer-use agent yığınını açık kaynak yaptı: bulut masaüstleri, driver, System 1 modelleri ve benchmark'lar