· kaynak Hacker News – Front Page (native)
Araştırmacılar AMD GPU matrix çekirdeklerinin bit düzeyinde doğru modellerini yayımladı
arXiv'de yayımlanan bir bildiri, AMD'nin CDNA 1-3 matrix çekirdeklerinin IEEE-754 dışı davranışlarını MATLAB'de modelleyerek donanımla 10 milyon rastgele test girdisinde birebir aynı sonucu üretiyor.

Araştırmacılar, üç AMD GPU neslindeki matrix çarpım birimlerinin çıktısını bit düzeyinde birebir yeniden üreten yazılım modelleri geliştirdi. arXiv'deki bildirinin özetine göre (2609.14845) modeller CDNA 1, CDNA 2 ve CDNA 3 mimarilerini kapsıyor — bunlar MI100, MI210/MI250 ve MI300A/MI300X hızlandırıcılarına karşılık geliyor — ve 10 milyon rastgeleleştirilmiş girdi setinden oluşan bir test paketiyle gerçek donanıma karşı doğrulandı. Çalışma, 16 Eylül 2026'da Hacker News'in ana sayfasında yer aldı.
Standart kayan nokta biçimi geçerli değil
Modern GPU hızlandırmasının kalbindeki matrix çarpıcılar, çoğu yazılımın varsaydığı kayan nokta standardı IEEE 754'e uymuyor. Bildirinin açıkladığına göre davranışları yalnızca üreticiler arasında değil, aynı üreticinin farklı çip nesilleri arasında da değişiyor: biriktiricinin genişliği, yuvarlamanın ne zaman uygulandığı, normalizasyonun nerede gerçekleştiği, ara adımlardaki underflow ve overflow'un nasıl ele alındığı ve subnormal ile özel değerlerin nasıl davranıldığı hepsi farklılık gösteriyor.
Bunun sonucu olarak özdeş küçük matrix çarpımları farklı cihazlarda farklı sonuçlar üretiyor ve temeldeki uygulama ayrıntıları belgelenmediği için yalnızca yazılımla bunları uzlaştırmak mümkün değil. Bu durumda geliştiriciler, bir uyuşmazlığın gerçek bir sayısal özelliği mi yoksa duyurulmamış bir donanım tuhaflığı mı yansıttığını söyleyemiyor.
Sayısal davranışın tersine mühendisliği
Birimleri karakterize etmek için yazarlar, donanımın desteklediği tüm girdi biçimlerinde belirli sayısal özelliklere yönelik test vektörleri tasarladı. Bildiri, her vektörün belirli bir davranışı yalnızca bir cihazın ürettiği çıktılardan nasıl belirlediğinin türetmesini ve gerekçesini veriyor — bu, iç tasarım belgelerine erişim gerektirmeyen bir tür black-box yoklama yöntemi.
Bu gözlemler daha sonra mimari başına bir tane olmak üzere MATLAB tabanlı modellere kodlandı. Bit düzeyinde tam uyuma ulaşmak, ekibin daha önce geliştirdiği yinelemeli bir teknik gerektirdi: rastgele test, ardından testlerin rafine edilmesi, model her durumda donanımla eşleşene dek tekrarlandı. Son kontrol 10 milyon rastgele girdi setiyle yapıldı ve modeller her seferinde silisyumun çıktılarını tam olarak yeniden üretti.
NVIDIA'ya karşı bir karşılaştırma
Kavram kanıtı olarak yazarlar modelleri iki gösterimsel sayısal uygulamada çalıştırıp AMD matrix çekirdekleri ile NVIDIA tensor çekirdekleri arasındaki uygulama düzeyindeki doğruluk farklarını nicelleştirmek için kullandı. Özette hangi uygulamaların kullanıldığı belirtilmiyor, ancak bu alıştırma, kesin donanım davranışı simüle edilebildiğinde modellerin olanaklı kıldığı karşılaştırmalı araştırma türünü gözler önüne seriyor.
Bildirinin 1. sürümü 13 Eylül 2026'da Faizan Ahmad Khattak tarafından arXiv'e gönderildi, ardından 15 Eylül'de gözden geçirilmiş bir sürüm yayımlandı.
Neden önemli
Bit düzeyinde yeniden üretilebilirlik, GPU hesaplamada süregelen bir sorun. Eğitim ve çıkarım sonuçları iş yükleri hızlandırıcılar arasında taşındığında kayabiliyor, regression testleri güvenilirsizleşiyor ve altındaki aritmetik bir kara kutu olduğunda karışık hassasiyetli yapay zeka hatlarının denetlenmesi zorlaşıyor. Belgelenmemiş matrix çekirdeği davranışını açık ve doğrulanmış modellere dönüştüren bu çalışma, araştırmacılara ve mühendislere karşılaştırma yapabilecekleri bir referans, cihazlar arası uyuşmazlıkları ayıklama aracı ve kıt donanımı meşgul etmeden sayısal doğruluğu inceleme yolu sunuyor. Ayrıca üreticiler arasındaki alanı dengeliyor: sayısal kaliteyle ilgili iddialar tahmin edilmeden ölçülebiliyor — bildirideki AMD-NVIDIA karşılaştırmasının yapmaya başladığı şey de tam olarak bu.
- #amd
- #gpu
- #floating-point
- #numerical-computing
- #reproducibility