· kaynak Hacker News – Front Page (native)
Kodlama ajanları, sonuçlar satır içi kaynak kod içermeyene kadar grep'i LSP araçlarına tercih ediyor
Üç Claude modeli üzerinde yapılan bir araştırma, ajanların rutin görevlerde LSP destekli gezinmeyi nadiren tercih ettiğini, zorlanınca başarı oranının düştüğünü — ancak araç çıplak konumlar yerine satır içi kaynak bağlamı döndürdüğünde durumun değiştiğini ortaya koydu.
Kodlama ajanlarının kod bağlamını nasıl aldığı üzerine yapılmış küçük bir araştırma, modellerin rutin görevlerde LSP destekli anlamsal gezinme yerine ezici bir çoğunlukla grep'i tercih ettiğini ve anlamsal yolu zorlamanın onları işte daha kötü hale getirebileceğini buldu. Sonuç, sözcüksel aramanın üstün olduğu değil, bir aracın LLM için yararlılığının sonuçlarının kesinliği kadar çıktısının biçimine de bağlı olduğudur.
AgentConnect'te blog yazısı olarak yayımlanan ve Hacker News ana sayfasında öne çıkan araştırma, kodlama ajanlarına verilen iki alma arayüzünü karşılaştırdı: metin eşleştiren düz grep ile tanımlar, referanslar ve belge sembolleri arasında gezinen ve bu sayede gerçek bir fonksiyon çağrısını yorumdaki aynı kelimenizden ayırt edebilen LSP destekli araçlar. Pilot çalışma, üç Claude modelini — Opus 4.8, Sonnet 4.6 ve Haiku 4.5 — birkaç Python ve TypeScript deposunda çalıştırdı. Token kullanımı yalnızca her iki yaklaşım da bir görevi başarıyla tamamladığında ölçüldü; yazar bunun yaygın bir değerlendirme hatasını önlediğini belirtiyor: başarısız koşular, yalnızca erken durduruldukları için verimli görünebilir.
Görev türü yönlendirmeyi belirledi
Basit kod konumu bulma görevlerinde modeller, ikisi de kullanılabilir olduğunda anlamsal aracı yalnızca %0 ile %6 oranında seçti. Anlamsal-önce yolunu zorlamak bu kolda başarıyı %100'den %89'a düşürdü. Referans tamlığı işleri — bir sembolün tüm çağıranlarını bulma — deseni tersine çevirdi: modeller, yönlendirme olmadan zamanın %45 ile %57'sinde LSP gezinmesine uzandı.
Orada bile tablo karışıktı. Araştırmaya göre LSP yolu, yanlış eşleşmeleri ortadan kaldırarak grep'in 0,76'sına karşılık 1,00 kesinliğe ulaştı, ancak hatırlama her iki kolda da 0,66 civarında kaldı. Anlamsal gezinme daha fazla gerçek çağrı ortaya çıkarmadı; kalan sınır, alma kesinliği değil, ajanın ne kadar titiz çalıştığıydı. Daha güçlü modeller için kesinlik kazancı, tasarruf yerine daha yüksek token kullanımıyla birlikte geldi.
Kod tabanı görev kadar önemliydi. Temiz TypeScript deposu remeda'da LSP gezinmesi F1 kazancı sağlamadı ve %16 daha fazla token kullandı. Gürültülü TypeScript deposu hono'da F1'i 0,246 iyileştirdi ve %12 daha az token kullandı. Anlamsal gezinmenin işe yarayıp yaramayacağının yararlı göstergesi, dilin statik tipli olup olmadığı değil, grep'in kesinliğinin belirli bir kod tabanında ne kadar kötüleştiği — sözcüksel gürültü — oldu.
Çıktı biçimi belirleyiciydi
En çarpıcı sonuç, LSP araçlarının yanıt biçiminde yapılan bir değişiklikten geldi. Test edilen araçlar başlangıçta yalnızca bir konum döndürüyordu — dosya yolu, satır ve sütun — ve ajanı kodu incelemek için dosyayı açmaya zorluyordu; grep ise eşleşen satırı hemen veriyordu. Yazar, anlamsal yanıtı her referansa kabaca iki satır çevresindeki kaynak kodu ekleyecek şekilde değiştirdi; anlamsal arka uç ve referans kümesi değişmeden kaldı.
Yalnızca bu değişiklik, çoklu dosya yeniden adlandırma görevlerinde pass@1'i 0,67'den 0,83'e yükseltti ve bölüm başına takip dosya okumalarını 15,2'den 3,2'ye düşürdü — grep'in kendi 4,3'ünün altına. Araştırma bunu, Anthropic'in ajanlar için etkili araçlar yazma konusunda yayımladığı rehberle ilişkilendiriyor: araçlar belirsiz olmayan değil, non-deterministik ajanlar için arayüzlerdir; dolayısıyla döndürdükleri bağlam tasarımın bir parçasıdır ve anlamsal olarak doğru bir araç, her sonuç yorumlamak için birkaç ekstra eylem gerektiriyorsa yine de kötü bir iş akışı yaratabilir.
İki açıklama, biri kanıtlanmış
Yazar, grep'in avantajı için iki açıklama öneriyor. Yapısal olanı doğrudan araçların ne aldığından kaynaklanıyor: bir yeniden adlandırma, find_references'in bilinçli olarak döndürmediği yorumlara, docstring'lere, yapılandırmaya veya dizgilere dokunmayı gerektirebilir; grep ise bunları bulabilir. Metin geneli düzenlemeler için grep, model LSP gezinmesinde ne kadar iyi eğitilmiş olursa olsun daha iyi bir alma aracıdır.
Dağılımsal açıklama ise bir hipotez: modeller eğitim sırasında somut eylem desenleri — prompt, araç çağrısı, okunabilir sonuç, sonraki eylem — öğrenmiş olabilir ve tanıdık döngüleri tercih ediyor olabilir. Araştırma eğitim verisini değiştirmedi, yazarın vurguladığı gibi bu kanıtlanmamış olarak kalıyor ve çıktı biçimi iyileştirmesi bunun kanıtı değil, bununla tutarlı.
Neden önemli
Ajan araçları geliştiren ekipler için çıkarım şudur: alma kesinliği, benimsenmeyi belirleyen metrik değildir. Çağrı başına döndürülen bağlam miktarı ve onu yorumlamak için gereken takip eylemlerinin sayısı, ajanların bir aracı etkili kullanıp kullanmadığını belirledi — yanıt yükünde yapılan tek bir değişiklik, alma arka ucunun herhangi bir özelliğinden daha iyi performans gösterdi.
Araştırma, harness'i — bağlamdaki talimatlar, kullanılabilir araçlar, adları, girdi şemaları, sonuçlarının ve hatalarının biçimi ve modelin sırada ne göreceğine karar veren döngü — modelin kendisiyle eşit düzeyde bir yetenek yüzeyinin parçası olarak çerçeveliyor. Bir model ve tanıdık araç döngüsü tek bir birim olarak davranır; dolayısıyla ajanların göz ardı ettiği daha akıllı alma araçları sunan ekiplerin sorunu model sorunu değil, arayüz sorunu olabilir.
Yazar, sonuçları kategorik değil koşullu olarak sunmaya özen gösteriyor: ajanlar göreve göre yönlendirildi ve anlamsal gezinmenin değeri depoya göre değişti. Bu, protokolü gezinmeden çok daha fazlasını kapsayan LSP aleyhine bir hüküm değil, daha iyi alma semantiğinin olduğu gibi benimseneceği varsayımına karşı bir uyarıdır.
- #coding-agents
- #lsp
- #developer-tools
- #llm
- #agent-design
İlgili yazılar
- OpenAI, 1,05 milyon token bağlam penceresine sahip GPT-6 Astra'yı yeni fiyatlandırma ve akıl yürütme kademeleriyle piyasaya sürdü
- SWE-Bench ProMax: en iyi model büyük çok dilli refactoring görevlerinin yalnızca yüzde 41,2'sini çözebiliyor
- GPT-6 Astra, CodeRabbit'ın erken incelemesinde dosyalar arası hataları %20'ye kadar daha fazla yakalıyor