· kaynak Hacker News – Front Page (native)
ByteDance ve Tsinghua, AIME 2024'te 50 puan alan DAPO adlı RL sistemini açık kaynak yaptı
ByteDance Seed ve Tsinghua AIR, Qwen2.5-32B tabanlı checkpoint'i AIME 2024 matematik benchmark'ında 50 puan alan, LLM'ler için eksiksiz bir RL eğitim yığını olan DAPO'yu açık kaynak yaptı.
ByteDance'in Seed ekibi ve Tsinghua Üniversitesi'nin AIR laboratuvarı, büyük dil modelleri üzerinde pekiştirmeli öğrenme (RL) için eksiksiz bir açık kaynak sistem olan DAPO'yu yayımladı. Hacker News ana sayfasında yer alan projenin GitHub deposuna göre, Qwen2.5-32B temel modelinden eğitilmiş yayınlanan checkpoint — DAPO-Qwen-32B — AIME 2024 matematik benchmark'ında 50 puan alıyor; ekip bu sonucun, eğitim adımlarının yarısını kullanarak DeepSeek-R1-Zero-Qwen-32B'nin önceki en iyi sonucunu geride bıraktığını belirtiyor.
Neler yayımlanıyor
DAPO, Decoupled Clip and Dynamic sAmpling Policy Optimization'ın kısaltması. Yayın bir makalenin ötesine geçiyor: algoritmayı, eğitim ve doğrulama veri kümelerini, eğitim scriptlerini, model ağırlıklarını ve pipeline'ı yeniden çalıştırmak için gereken altyapı kodunu kapsıyor. Her şey açık kaynak verl RL çerçevesi üzerine inşa edilmiş durumda; ekip deneylerin Volcano Engine Machine Learning Platform üzerinde koşulduğunu belirtiyor ve bu platform için daha kapsamlı bir yeniden üretme kılavuzunun ileride yayımlanacağını söylüyor.
Benchmark sayıları
Manşetteki sonuç, Qwen2.5-32B temel modelinden başlayarak AIME 2024'te alınan 50 puan. Depo, bunu büyük ölçekli LLM pekiştirmeli öğrenmesi için en güncel performans (state-of-the-art) olarak nitelendiriyor ve DeepSeek-R1-Zero-Qwen-32B'nin yüzde 50 daha az eğitim adımıyla geçildiğini belirtiyor.
Yayın aşamalar halinde geldi. Mart 2025 güncellemesi, iki bileşenden yoksun erken bir varyantın — token-level policy gradient loss ve dynamic sampling içermeyen — eğitim kaydını yayımladı; bu varyant AIME 2024'te 44 puan almıştı. Mayıs 2025 güncellemesi ise tam DAPO tarifinin eğitim kayıtlarını, 50 puanı aşan checkpoint ile birlikte ve modeli AIME 2024 üzerinde değerlendirme talimatlarıyla ekledi.
Eğitim eğrileri ne gösteriyor
Bakımcılar metriklerini Weights & Biases üzerinden yayımlıyor ve README, sağlıklı eğitimin işaretleri olarak gördükleri üç eğilimi öne çıkarıyor. Yanıt uzunluğu koşu boyunca istikrarlı biçimde artıyor; ekip bunun daha fazla keşif imkânı sağladığını ve modelin daha karmaşık akıl yürütme davranışları öğrenmesine yardımcı olduğunu savunuyor. Ödül sinyali büyük dalgalanmalar olmadan istikrarlı biçimde yükseliyor; bu da modelin eğitim dağılımını tutarlı şekilde öğreniyor olduğunu gösteriyor. Entropi ise önce düşüyor, ardından kontrollü bir şekilde yükseliyor; ekip bunun keşif ile sömürü (exploitation) dengesini koruduğunu ve hem aşırı öğrenmeden (overfitting) hem de aşırı rastgelelikten uzak durduğunu söylüyor.
Koşuyu yeniden üretmek
Eğitim, özenle seçilmiş ve işlenmiş bir matematik veri kümesi olan DAPO-Math-17k ile yapılıyor; AIME 2024 ise doğrulama kümesi olarak hizmet ediyor. Depo her iki konfigürasyon için hazır çalıştırılabilir scriptler içeriyor ve bakımcılar her birinin mevcut verl sürümüyle doğrulandığını belirtiyor: basitleştirilmiş varyant 44 puanlık sonucu, tam pipeline ise 50 puanlık sonucu yeniden üretiyor; ilgili eğitim kayıtları çevrimiçi olarak görüntülenebiliyor.
Çıkarım (inference) için README, vLLM ile bfloat16 hassasiyeti ve sekiz GPU'ya yayılan bir tensor-parallel kurulumu kullanan örnek kod sağlıyor. AIME 2024 üzerindeki benchmark değerlendirmesi Ray Serve ve vLLM aracılığıyla yürütülüyor; model ağırlıkları ise Hugging Face üzerinde BytedTsinghua-SIA/DAPO-Qwen-32B tanımlayıcısıyla dağıtılıyor.
Neden önemli
Modern LLM'lerdeki akıl yürütme yeteneği büyük ölçüde ön eğitimden sonraki pekiştirmeli öğrenme süreciyle şekilleniyor ve öncü laboratuvarların kullandığı tam tarifler nadiren açıklanıyor. DAPO zincirin tamamını — algoritma, veri, kod, ağırlıklar ve eğitim kayıtları — yayımlıyor; bu da bir benchmark iddiasını geniş topluluğun doğrulayabileceği, denetleyebileceği ve üzerine inşa edebileceği bir şeye dönüştürüyor. Sonuç ayrıca, orta ölçekli bir 32B temel modelin rekabetçi matematik performansına özel bir pipeline değil açık bir yöntemle ulaşabileceğini gösteriyor. Öncü laboratuvar kaynaklarına sahip olmayan araştırma grupları için doğrulanmış scriptler, yayımlanmış veri kümesi ve şeffaf eğitim kayıtları, RL ile eğitilmiş akıl yürütme modelleriyle deney yapma eşiğini anlamlı ölçüde düşürüyor.
- #reinforcement-learning
- #open-source
- #llm
- #math-reasoning
- #qwen