deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (native)

Açık kaynaklı agent, CUDA kernel'lerini otonom bir döngüde üretiyor, doğruluyor ve karşılaştırıyor

Show HN'de paylaşılan bir proje, bir LangGraph agent'ını C++ CUDA harness ile eşleştirerek GPU kernel'lerini otomatik olarak üretiyor, doğruluyor ve benchmark'lardan geçiriyor; en hızlı doğrulanmış uygulamayı saklıyor.

Açık kaynaklı agent, CUDA kernel'lerini otonom bir döngüde üretiyor, doğruluyor ve karşılaştırıyor

Araç ne yapıyor

Geliştirici bertaye tarafından GitHub'da yayımlanan ve 25 Eylül 2026'da Hacker News'in ana sayfasında öne çıkan agentic CUDA kernel optimizer adlı proje, bir yapay zeka agent'ını sistem programlamanın daha özel köşelerinden birine uyguluyor: hızlı GPU kernel'leri yazmak.

Deponun README'sine göre araç, bir iş yükünün düz bir açıklamasını alıyor — verilen örnek, dikdörtgen matrislerle tek duyarlıklı GEMM — ve kod üretimi, doğruluk kontrolü, benchmark ve iyileştirme döngüsünü tekrarlayarak GPU uygulamaları üretiyor.

Sistemin iki ana parçası var. Python'da LangGraph tabanlı bir agent iş akışı aday değişiklikler önerirken, bağımsız bir C++ harness kernel'leri çalışma zamanında NVRTC ile derliyor, CUDA Driver API üzerinden başlatıyor ve çıktılarını kaydediyor. Python daha sonra sonuçları NumPy ile karşılaştırıyor ve hangi adayın bir sonraki tura kalacağını seçiyor.

Agent hem kernel kaynak kodunu hem de bireysel test durumları için başlatma yapılandırmasını değiştirebiliyor. Ayrıca GPU özelliklerini sorgulayabiliyor ve yapılandırmaya bağlı olarak optimizasyon rehberliği için NVIDIA dokümantasyonunu çekebiliyor, bir sonraki deneyini bilgilendirmek için Nsight Compute profilleyici sayaçlarını okuyabiliyor. Her deneme kaydediliyor ve doğrulamadan geçen en hızlı uygulama saklanan uygulama oluyor.

Optimizasyon döngüsü

README iş akışını beş adıma bölüyor. Agent önce iş yükü imzasını, girdi durumlarını, bir referans kernel ve bir başlangıç kernel'ini yüklüyor ya da üretiyor. Referansı çalıştırıyor ve başlangıç uygulamasını değerlendiriyor. Buradan bir değişiklik öneriyor, onu derliyor, çıktıları NumPy ile referansla karşılaştırıyor ve kernel gecikmesini ölçüyor. Bu sonuçlar bir sonraki denemeye besleniyor; geçersiz adaylar bütçe izin verdikçe onarılıyor. Son olarak, çalıştırma en hızlı doğrulanmış adayı, yürütme geçmişini ve bir zamanlama ısı haritasını kaydediyor.

Kullanıcılar imza, referans kernel, başlangıç kernel'i ve girdi durumları için bayraklar aracılığıyla kendi bileşenlerini sağlayabiliyor; belirtilmeyen her şey çıkarılıyor veya üretiliyor. Çalıştırmalar ayrıca önceki bir oturumun kayıtlı dosyalarından devam edebiliyor, böylece sonraki optimizasyonlar sıfırdan başlamak yerine daha önceki en iyi kernel üzerine inşa ediliyor.

Performans nasıl ölçülüyor

Her durum doğrulamadan geçmek zorunda, aksi halde aday eleniyor. Sıralama, performans durumları arasındaki gecikmelerin geometrik ortalamasına dayanıyor; yalnızca doğruluğu kontrol eden küçük durumlar puanı etkilemiyor. Zamanlama varsayılan olarak CUDA event'leriyle 10 ısınma başlatması ve ardından 100 ölçülen başlatma kullanıyor. Derleme süresi ve profilleyici yeniden oynatma zamanları sıralamaya dahil edilmiyor. README, zamanlamaları karşılaştırırken GPU'yu başka işlerden boş tutmayı öneriyor.

Gereksinimler ve çıktı

Proje, RTX 3060 Laptop GPU'lu bir Windows makinesinde geliştirildi. Python 3.12+, uyumlu CUDA Toolkit ve sürücüye sahip bir NVIDIA GPU, CMake 3.24+, bir C++17 derleyicisi ve bir OpenAI API anahtarı gerektiriyor. Varsayılan model orta akıl yürütme çabasıyla gpt-5-mini ve API kullanımı kullanıcının hesabına fatura ediliyor.

Her oturum kendi sonuç dizinine yazıyor; bu dizin kernel kaynaklarını, istekleri, girdi ve çıktı verilerini, model ve araç yanıtlarını, ayrıca geçmiş ve özet dosyalarını içeriyor. Başarılı çalıştırmalar en iyi kernel kaynağını ve ısı haritası görselleştirmelerini dışa aktarıyor. README, aracı bir float32 GEMM iş yükünde gösteriyor; buna daha önce üretilmiş bir kernel'i optimize etmeye devam eden bir takip çalıştırması da dahil.

Belirtilen sınırlamalar

Yazar, aracın sınırları konusunda alışılmadık derecede açık. Araç deneysel ve bireysel kernel'ler için tasarlanmış. Sağlanan test durumlarından geçmek genel doğruluğu kanıtlamıyor ve sistem tarafından üretilen bir referans kernel bağımsız bir doğruluk kaynağı değil. İyileştirmeler iş yüküne bağlı ve cuBLAS ya da diğer üretici kütüphaneleriyle bir karşılaştırma şu anda dahil değil.

Ayrıca pratik bir güvenlik notu var: üretilen girdi betikleri sandbox olmadan yerel olarak Python alt süreçleri olarak çalışıyor ve üretilen CUDA kernel'ler yerel GPU'da yürütülüyor.

Neden önemli

Kernel ayarlama geleneksel olarak bellek hiyerarşileri, occupancy ve donanım sayaçlarında derin insan uzmanlığı gerektirdi. Bu proje bu iş için uygulanabilir bir agent'lı desen gösteriyor: model yalnızca kod yazmıyor; gerçek donanıma karşı deneyler çalıştırıyor, profilleyici çıktısını okuyor ve sabit bir bütçe içinde yineliyor, doğruluk mekanik olarak kontrol ediliyor, körü körüne güvenilmiyor. Böyle bir çıktının üretici tarafından ayarlanmış kütüphanelerle rekabet edip edemeyeceği burada test edilmemiş olsa da, üret-doğrula-benchmark et-iyileştir döngüsü diğer performansa hassas mühendislik görevlerine genellenen bir şablon ve yapay zeka agent'larının sistem düzeyinde ölçülebilir, doğrulanabilir işler yaptığının somut bir örneği.

  • #cuda
  • #gpu
  • #ai-agents
  • #open-source
  • #kernel-optimization

İlgili yazılar