deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

ElderAI, 100 dolarlık coding model fine-tuning'undan dersler paylaştı; hiçbir çalışma kendi kalite eşiğini geçemedi

ElderAI, dev.to'da coding modelini yaklaşık 100 dolarlık kiralık GPU süresiyle fine-tune etme deneyimini anlatıyor: önceden kaydedilmiş kalite eşikleri, tool kullanımı ile beceri arasındaki ödünleşim ve her çalışmayı birkaç dolarla sınırlayan watchdog'lar.

ElderAI, 100 dolarlık coding model fine-tuning'undan dersler paylaştı; hiçbir çalışma kendi kalite eşiğini geçemedi

ATLAS Code adlı bir coding modeli geliştiren küçük bir ekip olan ElderAI, dev.to'da son fine-tuning çalışmalarına dair açık bir yazı yayımladı. Ana sonuç negatif: ekibin fine-tune'larının hiçbiri henüz kendi koyduğu kalite eşiğini geçemedi, bu yüzden davetli önizleme hâlâ geçmeye çalıştıkları başlangıç checkpoint'ini çalıştırıyor. Son tüm denemeler birleşik — birkaç pilot çalışma, yarı yolda durdurulan iki tam çalışma ve son eşiğe takılan çalışma — yaklaşık 100 dolarlık ön ödemeli bütçeden yaklaşık 15 dolarlık GPU süresine mal oldu.

Sonuçlardan önce yazılmış kalite eşikleri

Ekibin ilk disiplini prosedürel. Küçük bir bütçeyle hangi metrik iyileşmişse onu seçip çalışmayı başarılı ilan etmek caziptir; bu yüzden ElderAI artık herhangi bir metrik hesaplanmadan önce küçük bir gate dosyası yazıyor. Dosyanın hash'i alınıyor ve dosya değişirse launcher çalışmayı başlatmayı reddediyor. Son çalışmada gate, fine-tune'un bir düzenleme (edit) test setinde başlangıç checkpoint'inden daha fazla byte-exact doğru dosya üretmesini (beraberlik başarısız sayılır), standart bir Python coding benchmark'ında en fazla bir problem kaybetmesini ve tool çağrılarının en az %97'sinin parse edilebilir kalmasını gerektiriyordu — hepsi aynı işte, aynı harness ile baseline'a göre ölçülüyordu.

Gate zaten özkandırmasını önledi. Son çalışmada fine-tune, %40 checkpoint'inde düzenleme metriğinde öndeydi ama tool çağrısı parse eşiğini yüz çağrıda yaklaşık bir çağrı kadar kaçırdı ve çalışma durduruldu. Ekip, başlangıç checkpoint'inin aynı işte tam o eşikte durduğunu, yani eşiğin çok dar olduğunu belirtiyor — ancak kurallar sonuçlar görüldükten sonra eşik gevşetmeyi yasaklıyor.

Tool kullanımı eğitimi sessizce coding becerisini aşındırabilir

Ekibin ilk içgüdüsü eğitime agent tarzı yörüngeler dökmekti. Tool çağrısı formatı iyileşti ama genel coding becerisi benchmark kuralını başarısız kılacak kadar — birkaç çalışmada — geriledi. Önlemleri şunlar: her çalışmaya prova olarak aynı düz kod üretme örneklerini karıştırmak, düşük öğrenme oranlarıyla küçük LoRA adapter'lerine bağlı kalmak (MLP katmanlarını etkileyen daha büyük bir güncelleme düzenleme metriğini daha çok iyileştirdi ama riskli) ve eğitimin %40'ında birleştirilmiş checkpoint'i değerlendirip genel coding zaten düşmüşse çalışmayı erken sonlandırmak. Ekibe göre bu ödünleşim giderilecek bir bug değil, yönetilmesi gereken ana mesele.

Sorun test seti olduğunda

Erken bir düzenleme metriği, bir tool çağrısından sonra byte-exact eşleşme istiyordu ve baseline dahil neredeyse her şey bu metriği geçemedi. Manuel inceleme nedenini gösterdi: talimatlar, quadrature encoder'lar için boşluğu artırma gibi gerçek commit mesajlarıydı; gerçek commit değeri 3'ten 6'ya değiştiriyordu ve hiçbir model bunu çıkaramazdı. ElderAI, sayılar daha iyi görünene kadar scorer'ı ayarlamak yerine ölçtüğü şeyi değiştirdi: her düzenlemenin benzersiz bir eşleşme bulup dosyayı değiştirdiğine dair mekanik bir kontrol, girintiyi yine sayan ama boşlukları normalize eden bir exact match, talimatların değişikliği tam olarak tarif ettiği bir ayrım ve gerçek tool hataları geri beslenerek üç tool çağrısı içinde düzeltilen dosyalara kredi. Byte-exact resmi sayı olarak kalıyor; diğer metrikler teşhis amacıyla raporlanıyor.

Watchdog'lar ve dolar sınırları

Her çalışma, çalışma başına sert bir dolar durdurma eşiği, tahmini maliyet durdurması, wall-clock ve gece sınırları, duran loglar, boşta kalan GPU'lar veya NaN kaybı için otomatik durdurmalar ve kiralanan makinenin gerçekten silindiğinin doğrulanması içeren bir on-box watchdog altında. Tahmini maliyet kuralı fazla agresif çıktı — erken ETA oynamaları aksi halde sağlıklı iki işi öldürdü; bu ders yaklaşık 1,18 dolara mal oldu. En büyük tasarruf %40 ortak kontrolünden geliyor: başarısız bir çalışma yaklaşık 3 dolar yerine yaklaşık 1,40 dolara mal oluyor.

Sırada, hassas talimatlı düzenleme verisini kullanan bir gated çalışma daha var. Geçerse ATLAS Code fine-tune'u alır ve ekip neyin değiştiğini yayımlar; geçmezse onu da yazacaklarını söylüyorlar. Servis, OpenAI uyumlu bir API arkasında sınırlı planlı, aşım ücreti olmayan ve ekibin ifadesine göre müşteri prompt'ları veya kodu üzerinde eğitim yapılmayan davetli önizleme olarak kalıyor.

Neden önemli

Fine-tuning tartışmalarının çoğu küçük bir ekibin erişemeyeceği bütçeler varsayar. Bu yazı tam da kısıtlı eğitim için tekrarlanabilir bir şablon olduğu için değerli: sonuçlarla karşılaşmaya dayanan önceden kaydedilmiş gate'ler, başarısızlıkların dürüstçe raporlanması, agent formatı eğitiminin genel beceriye yük getirebileceği farkındalığı ve deneyi iterasyon yapacak kadar ucuz kılan maliyet watchdog'ları. Ayrıca sert bir metriğin çoğu zaman modelden çok test seti hakkında şey söylediği konusunda da yararlı bir hatırlatma.

  • #fine-tuning
  • #llms
  • #coding-agents
  • #machine-learning
  • #evaluation

İlgili yazılar