deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak GitHub Blog

GitHub, Copilot agent maliyetlerini tool call değil tüm görevleri optimize ederek düşürdü

GitHub'a göre tekil tool call'lar yerine bütün görevleri ölçmek, kalitede belirgin bir gerileme olmadan, Copilot CLI kullanıcıları için model-inference maliyetinde yaklaşık %3'lük düşüş de dahil olmak üzere ucuz verimlilik kazanımları ortaya çıkardı.

GitHub, Copilot agent maliyetlerini tool call değil tüm görevleri optimize ederek düşürdü

Tool call değil, görevi optimize etmek

GitHub, Copilot kodlama agent'larının işletme maliyetlerini sonuçları bozmadan nasıl düşürdüğüne dair ayrıntılı bir yazı yayımladı. GitHub Blog'da yazan ekip, tekil etkileşimlerin token sayılarının kötü bir ölçüt olduğunu savunuyor: kısa bir tool yanıtı, agent'ı ek çağrılara ve yeniden denemelere itebilir ve işi genel olarak yavaşlatıp pahalılaştırabilir. GitHub'a göre doğru hedef, kullanıcının isteğinden nihai sonuca kadar tamamlanmış görevin kendisidir.

Yazıda bu ilkeye dayanan ve hayata geçirilmiş dört değişiklik anlatılıyor: faydalı bağlamı korurken tekrarlayan çıktıyı azaltmak, bir işe yaramayan biçimlendirmeyi kaldırmak, davranışı değiştirmeden talimatları kısaltmak ve takip eden bir geri alma adımı olmadan tamamlanmış arka plan işini teslim etmek. Aday değişiklikler önce agentic kodlama benchmark'larında çevrimdışı değerlendirildi, ardından kontrollü çevrimiçi deneylerle doğrulandı. Örnekler GitHub Copilot CLI'dan gelse de GitHub, Copilot uygulaması ve Copilot code review'ın aynı temel altyapıyı paylaştığını ve aynı kazanımları elde ettiğini belirtiyor.

Agresif sıkıştırma neden ters tepti

Uyarı niteliğindeki bir deney, agent okumadan önce shell çıktısını küçülten RTK (Rust Token Killer) aracıyla yapıldı. GitHub'ın altyapısında ve benchmark kurulumunda kısaltılmış yanıtlar bazen modelin ihtiyaç duyduğu ayrıntıları atlıyor ve modeli kaydedilmiş çıktıyı yeniden açmaya ya da komutu yeniden çalıştırmaya zorluyordu. Bu kurtarma adımları tur sayısını artırıyor ve daha fazla bağlamı ileri taşıyordu; bu yüzden her yanıt daha küçük olsa da görevler ortalama olarak daha fazla token tüketiyor ve daha uzun sürüyordu. GitHub, bulguyu test ettiği entegrasyon ve iş yükleriyle sınırlı tutuyor; her RTK yapılandırmasına ya da genel olarak çıktı sıkıştırmaya genellemez.

Emniyet ağı olan seçici bir sıkıştırıcı

Benchmark koşularının analizi, install, build, test ve lint çıktısının çoğunlukla tekrarlayan gürültü olduğunu; source benzeri çıktının ve rastgele komut sonuçlarının ise daha sık agent'ın gerçekten ihtiyaç duyduğu şeyleri içerdiğini gösterdi. Bu içgörü seçici bir sıkıştırıcının şekillenmesini sağladı. Erken sürümler fazla agresifti — agent'lar orijinal çıktıyı sürekli yeniden açtığı için git diff üzerindeki bir filtre geri çekildi — ve yayımlanan sürüm üç parçalı bir ilkeyi izliyor: cat, git diff, git show gibi komutlar ve rastgele script'ler değiştirilmeden geçer; grep gibi araçlardan gelen arama sonuçları hiçbir eşleşmeyi atmadan yeniden düzenlenir; install, build, test ve ilerleme çıktısı ise yalnızca tasarruf önemli boyuttaysa sıkıştırılır.

Agent, tam orijinale her zaman bir kurtarma yolu üzerinden erişebilir; bu yol aynı zamanda bir değerlendirme sinyali olarak da işlev görür: GitHub, agent'ların kaydedilmiş orijinalleri açıp açmadığını, komutları yeniden çalıştırıp çalıştırmadığını veya ek turlar atıp atmadığını izledi. Çevrimdışı testlerde sıkıştırmanın tetiklendiği görevlerde istatistiksel olarak anlamlı bir başarı gerilemesi görülmedi ve agent'lar orijinalleri neredeyse hiç açmadı; çevrimiçi ise ortalama maliyet hafifçe düştü ve izlenen kalite metriklerinde belirgin bir gerileme olmadı.

Ölü biçimlendirmeyi silmek

En temiz kazanım, dosya içeriklerini bağlam içine okuyan view aracından geldi. Araç her satırın başına bir numara ekliyordu — bu, daha önce satır numarasına göre değişiklik hedefleyen düzenleme araçlarından kalma bir kalıntıydı. Güncel düzenleme araçları bunun yerine çevredeki kodu eşleştiriyor, bu yüzden önekler kaldırıldı. Çevrimdışı benchmark'larda model-inference maliyeti yaklaşık %5 düştü; başarı oranları ise normal koşudan koşuya sapma aralığındaydı. Copilot CLI kullanıcılarıyla yapılan çevrimiçi bir deney, kullanıcı başına ortalama günlük model-inference maliyetini yaklaşık %3 düşürdü; kalite ve memnuniyet metriklerinde belirgin bir gerileme olmadı.

Daha yalın prompt, aynı davranış

Prompt'lar her turda yeniden gönderildiği için GitHub, paralel iş için özel agent'lar doğuran task aracındaki birikmiş talimatları da ele aldı. Copilot'a kendi prompt'unu iteratif olarak yeniden yazdırarak bu talimatlar yaklaşık yarıya indi; tek şart, geliştiricilerin bel bağladığı davranışların korunmasıydı.

Neden önemli

AI kodlama agent'larını ölçekli çalıştıran ekipler için çağrı başına token sayıları cazip ama yanıltıcı bir optimizasyon hedefi — GitHub'ın kendi verisi, agresif kısaltmanın toplam maliyeti artırabildiğini gösteriyor. Yazı ayrıca en ucuz kazanımların nerede gizlendiğini de ortaya koyuyor: amacını doldurmuş biçimlendirme ve talimatlarda. En az bunun kadar değerli olan şeyse metodoloji: çevrimdışı benchmark'lar, kontrollü çevrimiçi deneyler ve kalite sinyali olarak kurtarma yolu telemetrisini birleştiren bu yaklaşımı her ekip, kendi agent pipeline'larına yapacağı değişiklikleri değerlendirirken yeniden kullanabilir.

  • #github-copilot
  • #ai-agents
  • #llms
  • #developer-tools
  • #cost-optimization

İlgili yazılar