· kaynak dev.to (home feed)
Human-Agent-Society'nin Reef'i agent geri bildirimi, öğrenme ve versiyonlu teslimatı birleştiriyor
Human-Agent-Society, agent serving, geri bildirim toplama, weight veya harness güncellemeleri ile versiyonlu teslimatı değerlendirmeyle kontrol edilen tek bir pipeline'da birleştiren açık kaynak altyapısı Reef'i yayınladı.

Human-Agent-Society projesi, AI agent'larının yayına alındıktan sonra da gelişmeye devam etmesini sağlamayı hedefleyen açık kaynak bir sistem olan Reef'i yayınladı. dev.to'daki bir yazıya göre Reef, genellikle ayrı pipeline'larda yaşayan dört konuyu — agent isteklerini serve etme, bu etkileşimlere dair geri bildirim toplama, geri bildirimi güncellemeye dönüştürme ve versiyonlu değişiklikleri yayınlama — model weight'lerini ve agent harness'lerini eşit derecede yönetilebilir artefaktlar olarak ele alan tek bir altyapıda birleştiriyor.
Dört aşamalı bir döngü
Reef, öğrenme döngüsünü dört aşamaya bölüyor. Serve istekleri yanıtlıyor ve her etkileşimi kaydediyor. Observe, daha sonra gelen geri bildirimi bu saklanan kayıtlara bağlıyor. Grow, uygun kayıtları aday güncellemelere dönüştürüyor. Commit, yapılandırılmış bir seçim politikasını uyguluyor ve yalnızca geçen versiyonları yayınlıyor. dev.to yazısı, repository'nin bu aşamaları service, storage, training, evaluation, artifact-history ve delivery modüllerine maplediğini belirtiyor.
Bir recipe'nin güncelleyebileceği iki yüzey
Bir deployment recipe'si gerçekte neyin değişeceğini belirliyor. Weight odaklı recipe'ler model parametrelerini Slime ve SGLang üzerinden eğitebiliyor. Harness odaklı recipe'ler ise bir agent'ın prompt'larını, kurallarını ve yeteneklerini düzenliyor ve yerel bir eğitim kümesi yerine bir model endpoint'ini kullanıyor.
Weight yolu için Reef, OpenAI ve Anthropic uyumlu inference endpoint'lerini belgeliyor. Her yanıt, sonraki raporların referans verebileceği bir etkileşim kaydı ID'si taşıyor; bu raporlar opsiyonel olarak metinsel veya yapılandırılmış geri bildirimin yanı sıra sayısal bir puan da içerebiliyor. Projenin belirttiğine göre bir recipe yeterli uygun geri bildirimi topladığında bir eğitim adımı çalıştırıp güncellenmiş weight'leri Reef'i yeniden başlatmadan serving runtime'ına senkronize edebiliyor.
Harness yolu ise hiçbir eğitim GPU'su gerektirmiyor. Projenin coding tutorial'ında, başarısız bir rapor bir aday yetenek güncellemesini tetikleyebiliyor; Reef daha sonra bu adayı mevcut harness ile üç coding görevinde karşılaştırıyor ve yalnızca kazanırsa yayınlıyor.
Farklı ön koşullar, tek kapı
dev.to yazısına göre iki yol farklı gereksinimler dayatıyor. Model weight eğitimi, eğitilebilir bir model, seçilen recipe'nin kullanabileceği geri bildirim ve desteklenen bir GPU yığını istiyor. Harness optimizasyonu ise bir model endpoint'i, temsili görevler ve bir evaluator istiyor — ama yerel eğitim donanımı gerekmiyor. Her iki yol da, seçim politikasının çalıştığı ve versiyon yönetimi ile artefakt teslimatı bileşenlerinin kabul edilen her şeyi gönderdiği Commit aşamasında birleşiyor. Güncellemeler sırasında canlı kalma, yerleşik bir yetenek olarak listeleniyor.
Neden önemli
dev.to analizinin çerçevelediği gibi Reef'in en sonuç doğuran tasarım tercihi, bir güncelleme üretmek ile onu yayınlamak işlemlerinin ayrı eylemler olması. Tamamlanmış bir eğitim adımı veya bir harness düzenlemesi otomatik olarak teslim edilen versiyon olmuyor; ortada aday değerlendirmesi ve seçimi duruyor. Bu, döngüyü ürettiği her değişikliği uygulayan bir döngüden daha kontrollü hale getiriyor; ancak kontrol, ancak etrafına yapılandırılan evaluator ve politika kadar güçlü.
Açık bırakılan ödünleşim otomasyon ile güven arasında. Reef etkileşim kayıtlarını, güncelleme işlerini, versiyon geçmişini ve teslimatı standartlaştırabiliyor; fakat operatörler yine de temsili görevleri ve kanıt olarak neyin sayılacağına karar verecek bir evaluator'ü sağlamak zorunda. Zayıf bir değerlendirme bu nedenle zayıf bir kapıya dönüşüyor: altyapı, kendisine verilen hangi kararı olursa olsun uygulayacak.
Üretimde agent çalıştıran ekipler için Reef, geliştirme döngüsüne hot-swap edilebilir weight güncellemeleri pratik bir bonus olarak sunan birleşik bir omurga sunuyor. Agent'ların gerçekten daha iyi olup olmayacağı hâlâ toplanan geri bildirimin kalitesine ile bir aday ve release arasındaki kontrollerin titizliğine bağlı.
- #ai-agents
- #open-source
- #reinforcement-learning
- #llm-serving
- #mlops