· kaynak Hacker News – Front Page (native)
Proje, Qwen modelini sulu boya resimleri düzenlenebilir JavaScript olarak çizmesi için eğitiyor
Surya Narreddi'nin Hacker News'te öne çıkan projesi, bir Qwen modelini sulu boya resimleri düzenlenebilir p5.brush JavaScript'i olarak çizmesi için eğitiyor ve öznel beğeniyi bir RL ödülüne dönüştürmek için ikili karşılaştırmalı bir jüri kullanıyor.

Şu anda Hacker News ana sayfasında yer alan Surya Narreddi'nin projesi, yapay zekâ ile görüntü üretiminin yapısal bir sınırına odaklanıyor: model bir resim ürettikten sonra tek ayar aracı başka bir prompt oluyor. Narreddi ve iş arkadaşı Cameron bunun yerine bir dil modelini görüntüleri kod yazarak üretmesi için eğitti — p5.brush JavaScript sketch'leri — böylece çıktı, modele bir tur daha gidilmeden doğrudan, satır satır açılabiliyor, okunabiliyor ve düzenlenebiliyor.
Model, pekiştirmeli öğrenme yöntemi olan GRPO ile ayarlanmış Qwen 3.5 35B. Yazımda belirtildiği gibi, teslim edilecek ürün pikseller değil sketch'in kendisi ve granüler düzenlemeleri mümkün kılan da tam olarak bu.
Eğitim döngüsü
Yazıma göre eğitim, dört adımlı bir döngünün binlerce kez tekrarlanmasından oluşuyor. Model, "sulu boya tarzında bir şeftali renkli hatmi çiz" gibi bir prompt alıyor ve eksiksiz bir p5.brush JavaScript sketch'i yazıyor. Sandbox içinde çalışan bir Puppeteer ortamı sketch'i PNG olarak render ediyor ve ayrı bir jüri modeli bu PNG'yi elle puanlanmış bir havuzdan rastgele seçilen iki referans tabloyla ikili olarak karşılaştırıp daha iyi sulu boyayı seçiyor. Karar bir ödül sinyaline dönüştürülüyor, GRPO modeli güncelliyor ve döngü yeniden çalışıyor.
Referans havuzu, tamamı model tarafından üretilmiş 581 tablo içeriyor; çünkü p5.brush niş bir kütüphane ve yazarlar yeterli sayıda insan yapımı örnek bulamadıklarını söylüyor. Havuz, 1.664 üretimden elle puanlanarak oluşturulmuş: en üst "harika" kademesinde 117 görsel, 266 görsel "eh işte" olarak puanlanmış ve puanlanmış örneklerin seyrek olduğu yerleri kapsamak için ayrı bir çalışmadan eklenen 198 tamamlayıcı görsel. Üretim iki hat üzerinden yürütüldü — Opus 4.6, GPT-5.4 ve Gemini 3.1 Pro'nun referans fotoğraflara karşı bir görsel-dil jürisi eşliğinde iterasyon yaptığı bir AutoResearch kurulumu ile Gemini 3.1 Pro üzerinde yapılan daha büyük bir toplu çalışma.
Beğeni için ödül yazmak
Narreddi'ye göre daha derin soru, yaratıcı işte pekiştirmeli öğrenmeyi hiç nasıl çalıştıracağınızdır. RL, doğrulanabilir ödüllere dayanır: aritmetik yanıtlar ya tutar ya tutmaz ve oyunlar kazanma ya da kayıpla biter. Estetik tercih ikisi de değildir; bu yüzden tasarım çabası ödül fonksiyonunun kendisine kayar. Aşırı dar bir değerlendirme ölçütü modele, puanlanmış az sayıda örneği taklit etmeyi öğretir; aşırı belirsiz olan hiçbir şeyi sabitleyemez.
Projenin ilk değerlendirme ölçütü dokuz sinyal kullanıyordu ve bunların beşi gereksizdi — aralarında yüzde 32 ağırlıklı bir uzunluk eğrisi, yüzde 15'lik bir estetik terimi ve beş üyeli bir jüri konseyi vardı — ve eğitim 0,65 ödül civarında platoya ulaştı. Revize edilmiş ölçüt dört sinyal tutuyor: yüzde 5'lik bir derleme kapısı, yüzde 5'lik bir uzunluk terimi, yüzde 30'luk HPSv3 estetik puanlayıcısı ve artık karışımı domine eden yüzde 60'lık ikili karşılaştırma hükmü.
Prompt dersi
Sistem prompt'unun bile eğitime ihtiyacı vardı. Erken sürümler 400 satırlık bir p5.brush API referansı içeriyordu ve model buna, var olmayan API'leri rahatça uyduran cilalı kodlarla yanıt verdi. Çözüm GEPA ile geldi; bu, bir prompt'u bir puanlama fonksiyonuna karşı evrimleştiren bir prompt optimizasyon kütüphanesi. Beğeniye demirlenmiş yedi örnekle (seven-shot) jüriye karşı yapılan 200 iterasyon, yalnızca sekiz brush metodundan oluşan sıkı bir izin listesi içeren bir prompt'a yakınsadı — ne API dokümantasyonu ne de işlenmiş örnekler vardı. Narreddi, üç üretimin her birinin tanınabilir bir hatmi render ettiği ilk çalışmanın, 400 satırlık referans tamamen çöpe atıldıktan sonra yazılan sürümden geldiğini bildiriyor. Bulgu genellenebilir, diye yazıyor: uzun referans dokümantasyonu API halüsinasyonuna davet çıkarırken, kısa ve iddialı bir izin listesi çıktıyı orijinal şartnameden daha iyi kısıtlıyor.
Neden önemli
Bunu bir hobi deneyinin üzerine çıkaran iki şey var. İlki iş akışı açısından: üretim opak pikseller yerine düzenlenebilir kod ürettiğinde, kullanıcılar prompt ile resim arasına, tam olarak müdahale edebilecekleri bir katman kazanıyor — daha etkileşimli üretim araçlarına doğru bir adım. İkincisi metodolojik: proje, öznel görevlere RL uygulamak için tekrarlanabilir bir reçete çiziyor; asıl iş, jürilerin tercihlerinin puanlanmış örneğin ötesine taşınması için bir ödülü — ve karşılaştırıldığı örnekleri — yeterince özenle yazmada yatıyor.
Narreddi bunun görüntü üretmenin daha iyi bir yolu olmadığı konusunda açık sözlü; üstelik önemli ölçüde daha yavaş. Proje sürüyor; ekibin keşfettiği sorunları ele almak için bir son eğitim çalışması planlanmış ve ardından eksiksiz bir teknik rapor gelecek.
- #reinforcement-learning
- #image-generation
- #generative-art
- #javascript
- #qwen