deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak GitHub Blog

GitHub Copilot'ın HydraFusion'ı Opus 5 kodlama kalitesini yüzde 67'ye varan daha düşük maliyetle yakalıyor

GitHub, Copilot içinde her kodlama görevini single-model, cascade veya critique iş akışlarından geçiren bir araştırma önizlemesi yayınladı; sistem, üç agentic benchmark'ta Claude Opus 5 kalitesini çok daha düşük tahmini maliyetle eşit veya yakın seviyede yakalıyor.

GitHub Copilot'ın HydraFusion'ı Opus 5 kodlama kalitesini yüzde 67'ye varan daha düşük maliyetle yakalıyor

GitHub, runtime sırasında tek bir büyük modele bel bağlamak yerine birden fazla yapay zeka modelini yöneten Copilot içi bir araştırma önizlemesi olan Project HydraFusion'ı başlattı. GitHub Blog'a göre sistem her istek için bir yürütme planı oluşturuyor ve taslak hazırlamak, eleştirmek, revize etmek veya işi yükseltmek için birden çok sağlayıcıdan modeller arasından seçim yapıyor. GitHub'ın kontrollü çevrimdışı değerlendirmelerinde, tahmini iş akışı maliyetini yüzde 67'ye varan oranda düşürürken Claude Opus 5 kodlama kalitesini eşitledi veya ona yaklaştı.

Yönetim nasıl çalışıyor

GitHub Blog, yönlendirme kararını bir optimizasyon problemi olarak çerçeveliyor. HydraFusion, muhakeme, kod üretimi, hata ayıklama ve araç kullanımı için yetenek sinyallerini puanlıyor, ardından kalite çıtasını geçmesi muhtemel en basit deseni seçiyor. Önizlemede üç yürütme deseni bulunuyor:

  • Single: seçilen tek bir model görevi doğrudan çözer.
  • Cascade: verimli bir model bir çözüm taslağı hazırlar ve bir kalite kapısı bunu kabul etmeye mı yoksa daha güçlü bir modele geçmeye mi karar verir.
  • Critique: bir model bir sonuç taslağı hazırlar, farklı bir model ailesinden bağımsız, salt okunur bir eleştirmen onu inceler ve taslağı hazırlayan model bir kez revize eder.

Critique adımı, Copilot'ın Rubber Duck özelliğiyle aynı inceleme desenini izliyor ve eleştirmenler, depoya dokunmadan işi değerlendirebilmeleri için araçsız bağlamlarda çalışıyor. Seçicilik temel fikir: ek model çağrıları yalnızca sonucu iyileştirmeleri muhtemel olduğunda gerçekleşiyor; sistem kalite, maliyet ve gecikme süresini böyle dengeliyor.

GitHub, HydraFusion'ı yerel, bulut ve bileşik modeller arasında otomatik yönlendirmeye doğru daha geniş bir hareketin parçası olarak konumlandırıyor ve bu yılın başlarında tanıtılan Auto model seçimi özelliğini genişletiyor. Geliştiriciler bu mekanizmanın hiçbirini görmüyor — HydraFusion, model seçicide diğer herhangi bir seçenek gibi görünüyor. Model havuzu değiştirilebilir olduğu için Copilot'a eklenen yeni modeller geldikleri anda değerlendirilip HydraFusion'a dahit edilebiliyor.

Depo düzeyindeki iş için güvenceler

Gerçek bir depoya birden çok modeli yönlendirmek sıkı kontrol gerektiriyor ve yazı beş işletme ilkesi sıralıyor. Tam muhasebe, maliyet ve kullanımı taslak hazırlama, eleştiri, revizyon, yükseltme, yeniden deneme ve geri dönüş dahil her aşamada topluyor. Sınırlı yürütme, her aşamaya açık zaman aşımı ve iptal davranışı veriyor. Yalıtılmış inceleme, critique adımlarını araç döngüsünün dışında tutarken çözücü adımları paylaşılan çalışma alanını ve normal izin farkındalıklı agent döngüsünü kullanıyor. Güvenli başarısızlık uygulaması, bir iş akışı iptal edildiğinde veya doğrulamadan geçemediğinde her yamayı engelliyor ve doğrulanmış yönlendirme, yürütme başlamadan önce iş akışı tanımlarını, model bağlarını, geri dönüş davranışını ve model kullanılabilirliğini doğruluyor.

Dahili olarak runtime, her aşamanın rolünü, sonucunu, maliyetini, gecikme süresini ve tanılama bilgilerini kaydediyor, böylece bir iş akışı sonradan yeniden kurulabiliyor. Dışarıda ise geliştirici tek bir birleşik yanıt ve normal izin denetimlerinden geçen tek bir değişiklik seti alıyor.

Benchmark'lar ne gösteriyor

GitHub, sabit HydraFusion politikalarını üç agentic kodlama benchmark'ında değerlendirdi — TerminalBench 2.1, DeepSWE ve gerçek Copilot oturumlarından derlenen dahili bir benchmark olan CheckpointBench — ve karşılaştırma taban çizgisi olarak Claude Opus 5 ile GPT-5.6 Sol'u kullandı. Tüm çalışmalarda aynı görev girdileri, araçlar, yürütme limitleri, fiyatlandırma varsayımları, değerlendirme koşulları ve eksik sonuçların ele alınış biçimi kullanıldı ve her model aynı orta muhakeme seviyesine ayarlandı. Aşağıdaki rakamlar en iyi ayarlanmış yapılandırmadan geliyor ve Opus 5'e göre ölçülüyor:

  • TerminalBench 2.1: doğrulanmış görev kalitesi yüzde 4,9 puan yukarıda, tahmini maliyet yüzde 67 daha düşük
  • DeepSWE: 1,5 puan aşağıda, maliyet yüzde 36 daha düşük
  • CheckpointBench: 0,1 puan aşağıda, maliyet yüzde 65 daha düşük

HydraFusion bu nedenle TerminalBench 2.1'in çok adımlı terminal görevlerinde Opus 5'i açıkça geçti ve diğer ikisinde 1,5 puan içinde kaldı. GitHub ayrıca Microsoft'tan bir baş yazılım mühendisinin erken dahili geri bildirimine değiniyor; mühendis, sistemin muhakeme ve görev çözme yeteneğinin "Opus seviyesinde veya daha iyi" olduğunu söylüyor.

Neden önemli

Sonuç, sınırların kodlama kalitesinin her çağrıda sınırlar-seviye model fiyatları ödemeyi gerektirdiği varsayımına meydan okuyor. Daha ucuz modellerle taslak hazırlamak, yalnızca bir kalite kapısı adayı reddettiğinde yükseltmek ve incelemenin gerçekten yardımcı olduğu yerde bağımsız bir eleştirmen eklemek kalite çıtasını maliyetin küçük bir bölümüyle tutabiliyorsa, agentic kodlamanın birim ekonomisi değişir — özellikle yüksek hacimli otomatik görevler çalıştıran ekipler için.

Bu ayrıca ürün katmanının nereye gittiğinin bir sinyali: model seçimi runtime tarafından karar verilen bir uygulama detayı haline geliyor ve model kalitesi tek bir bahis olmaktan çıkıp yöneticinin üzerinde çalıştığı bir havuz oluyor. Ancak uyarılar gerçek. GitHub, rakamların değerlendirilen benchmark sürümlerine, iş akışı yapılandırmalarına, model havuzuna ve fiyatlandırma varsayımlarına özgü olduğunu belirtiyor ve araştırma önizlemesinin, üretim kalitesi, gecikme süresi, güvenilirlik, önbellekleme verimliliği, maliyet ve güvenlik için optimize etmeden önce bunların gerçek geliştirici iş yüklerine nasıl aktığını test etmek amacıyla var olduğunu söylüyor.

  • #github-copilot
  • #ai-agents
  • #multi-model
  • #llm-routing
  • #developer-tools

İlgili yazılar