deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (hnrss.org)

DeepSeek'in DSec makalesi, günde 3 milyon agent ortamı çalıştıran sandbox altyapısını anlatıyor

DeepSeek'in arXiv'de yayımladığı bir makale, büyük ölçekli agent RL eğitimi için günde yaklaşık 3 milyon agent ortamı ve 380.000'den fazla eşzamanlı ortam sunan üretim amaçlı DSec sandbox platformunu tanımlıyor.

DeepSeek'in DSec makalesi, günde 3 milyon agent ortamı çalıştıran sandbox altyapısını anlatıyor

DSec'in çözdüğü sorun

Büyük dil modellerini agent olarak eğitmek ve değerlendirmek — depoları okumaları, araç çağırması, komut çalıştırması ve göreve özgü hizmetlerle etkileşim kurmaları — uzun etkileşimler boyunca durumu koruyan izole yürütme ortamlarına bağlıdır. 19 Eylül 2026'da gönderilen ve yaklaşık bir hafta sonra Hacker News'in ana sayfasına ulaşan arXiv makalesine göre bu iş yükleri sandbox'ları ani patlamalar halinde başlatıyor, geniş bir yalıtım gereksinimi aralığını kapsıyor ve yeniden kullanımın sınırlı olduğu büyük image kütüphanelerine dayanıyor. Yazarların vardığı sonuç şu: Bu karışımı hiçbir tek sandbox runtime'ı karşılayamaz, dolayısıyla yürütme platformunun kendisi esnek olmak zorunda.

Tek SDK, dört backend

DSec, FnCall, container, microVM ve tam VM olmak üzere dört sandbox backend'ini birleşik bir SDK aracılığıyla sunuyor ve her iş yükünün kendi yalıtım-maliyet dengesini seçmesine izin veriyor. Cluster düzeyindeki bir katman, düğümler arası yerleştirme ve yaşam döngüsü yönetimini koordine ediyor. Ortamlar, birbirinden bağımsız sürümlenmiş katmanlardan oluşturuluyor; böylece yaygın yazılım yığınları her sandbox'ın içinde yeniden oluşturulmak yerine paylaşılabiliyor. Yoğunluk, bellek paylaşımı, bellek geri kazanımı ve CPU zamanlamasının birleşiminden geliyor; image verisi ise her makinede önceden hazırlanmak yerine DeepSeek'in cluster genelindeki dağıtık dosya sistemi 3FS'den talep üzerine yükleniyor.

Pekiştirmeli öğrenmeyle birlikte tasarlandı

Platform, genel amaçlı bir hesaplama hizmeti olarak değil, DeepSeek'in pekiştirmeli öğrenme (reinforcement learning) çerçevesiyle birlikte tasarlandı. Agent'ların sandbox'ları içinde hareket ettiği durum saklayan rollout yürütmesi, önceliklendirilebilir GPU eğitim işlerinden ayrıştırılmış durumda. Sandbox yaşam döngüsü eğitim döngüsüyle koordine ediliyor; böylece boşta kalan kaynaklar başka işlere geri kazandırılırken rollout durumu korunuyor. Makale ayrıca bu tasarımın, bir agent'ın amaçlanan görevi yerine getirmek yerine ödül sinyalini kandırarak istismar etmesi şeklindeki bir arıza olan reward hacking gibi istenmeyen agent davranışlarını hafifletmeye yardımcı olduğunu bildiriyor.

Üretim rakamları

Makaleye göre tek bir üretim ölçeğindeki DSec birimi yaklaşık 160 düğümden oluşuyor ve günde yaklaşık 3 milyon sandbox'a hizmet veriyor. Yoğun dönemlerde 380.000'den fazla eşzamanlı sandbox'ı destekliyor ve saniyede 5.000'den fazla sandbox oluşturmayı sürdürebiliyor. Bunlar kendi beyan edilen dağıtım rakamları; Hacker News girdisi, platformun mekanizmalarının ortam kurulumu ve image dağıtımı ek yükünü azalttığını, bellek verimliliğini iyileştirdiğini ve gecikmeye duyarlı iş yüklerinin yüksek yoğunluklu aşırı tahsis altında kabul edilebilir performans göstermesini sağladığını iddia eden arXiv özetine işaret ediyor.

Neden önemli

Agent tabanlı pekiştirmeli öğrenme, LLM geliştirmenin merkezine doğru ilerliyor ve DSec, bu altyapının üretim ölçeğinde neye benzediğine dair nadir rastlanan somut bir anlatı sunuyor. Agent'lar için hesaplama hikâyesi artık yalnızca GPU'larla ilgili değil — içinde hareket ettikleri ortamlar, yığının birinci sınıf, CPU ve bellek ağırlıklı bir katmanını oluşturuyor.

Tasarım fikirlerinin bir kısmı doğrudan daha küçük sistemlere aktarılabilir. Ortamları bağımsız sürümlenmiş katmanlardan oluşturmak, image verisini paylaşılan depolamadan talep üzerine çekmek ve sandbox yaşam döngüsünü eğitim döngüsüne bağlamak; agent değerlendirme düzenekleri, kodlama agent'ı test yatakları ve RL ortam sunucuları için geçerli örüntülerdir. Bildirilen ölçek — 160 düğümlü bir birimden yüz binlerce eşzamanlı sandbox — aynı zamanda ciddi agent eğitiminin GPU filosunun ötesinde ne talep ettiğine dair bir referans noktası oluşturuyor. Reward hacking'e değinilmesi ise, agent'lar keyfi komut çalıştırma yeteneği kazandıkça, altyapı düzeyinde kontrolün güvenlik hikâyesinin bir parçası hâline geldiğinin bir hatırlatıcısı.

  • #deepseek
  • #ai-infrastructure
  • #reinforcement-learning
  • #ai-agents
  • #containers

İlgili yazılar