· kaynak Hacker News – Front Page (native)
Anthropic, iki haftalık bir sprintte Claude'a mühendisliği yaptırarak claude.ai'yi 3 kat hızlandırdı
Anthropic, Ağustos'taki iki haftalık bir sprintin claude.ai'yi yaklaşık üç kat hızlandırdığını, beta bir Claude agent'ının darboğazları bulduğunu, benchmark'lar oluşturduğunu ve müşteriye dönük tek bir sorun yaşanmadan 3.000'den fazla değişikliği yayına aldığını bildiriyor.

Anthropic ne yaptığını anlatıyor
Anthropic, Ağustos ayında iki haftalık bir sprint sırasında claude.ai ve Claude masaüstü uygulamasının çekirdek deneyimini yaklaşık üç kat hızlandırdığını ve mühendislik işinin büyük kısmını beta bir AI agent'ının yaptığını bildiriyor. Hacker News ana sayfasına çıkan blog yazısında şirket, tek bir müşteriye dönük sorun veya geri alma yaşanmadan 3.000'den fazla değişikliği birleştirdiğini söylüyor. Kullanıcılar ürünün yavaş olduğunu şikayet ediyordu ve Anthropic haklı olduklarını kabul ediyor.
Ekip, kullanıcı etkinliğinin yaklaşık %95'ini kapsadığını söylediği dört kullanıcı yolculuğuna odaklandı: uygulamayı başlatma, yeni bir sohbet başlatma, mevcut bir sohbeti yükleme ve mesaj gönderme. 75. yüzdelikte, claude.ai'nin ilk yüklemesinde yazılabilir sayfaya ulaşma süresi 3,1 saniyeden 0,55 saniyeye düştü; yeni bir Claude Code oturumu başlatma 0,8 saniyeden 0,3 saniyeye inerken, bir Claude Cowork bulut oturumu yükleme süresi 2,6 saniyeden 0,73 saniyeye geriledi. Anthropic, bu kazanımların günde on binlerce kullanıcı saatinin beklemeden tasarruf sağladığını tahmin ediyor.
İnsanların her değişikliği onayladığı, agent tarafından yürütülen bir sprint
Her şey tek bir Slack kanalından yürütüldü. Anthropic, Opus 5.5'e kabaca denk olduğunu tanımladığı dahili bir araştırma modelini çalıştıran ve Claude Tag adını verdiği beta bir ürüne, site ve masaüstü uygulaması için performans işlerinin sahipliğini üstlenme talimatı verdi: deploy'larda gerileme izleme, dashboard'ları düzenleme, düzeltmeler uygulama ve projeler önerme. Şirket, tam otonominin henüz gerçekçi olmadığını açıkça söyledi — hedefleri insanlar koydu, ödünleşimleri insanlar yaptı ve her değişikliği insanlar onayladı.
Datadog MCP sunucusu üzerinden telemetriyi kullanarak Claude, en yüksek etkili yolculukları belirledi ve ekip, istemci ile sunucu işlerinin ayrıştırılabilmesi için web ile masaüstünde on üç ölçümü standartlaştırdı. Sprint, her biri Claude'dan milisaniye düzeyinde bir etki tahmini taşıyan yaklaşık yirmi özenle seçilmiş projeyle başladı. On üç hedeften on ikisi üçüncü günün sonunda karşılandı.
Somut düzeltmeler arasında, kullanıcılar React başlatılırken yazabilsin diye statik bir composer'ın HTML'e gömülmesi, masaüstü kabuğunun ana süreci için bir V8 code cache'in önceden derlenmesi, composer'ın sohbetler arasında monte edilmiş kalması, hover sırasında oturumların önceden getirilmesi ve kenar çubuğu yeniden render'larının %90 azaltılması yer aldı.
Milisaniye yerine instruction sayma
Duvar saati süresi kullanıcıların hissettiği şeydir ama gürültülüdür ve CI'ı buna bağlamak için fazla kararsızdır. Bu yüzden ekip deterministik laboratuvar metriklerine yöneldi: saf JS hot path'leri için node --predictable ile Valgrind altında ölçülen instruction sayıları ve etkileşim başına React commit'leri, hassas kapsamdan alınan V8 fonksiyon çağrı sayıları, stil yeniden hesaplamaları ve DOM mutasyonları gibi tarayıcı tarafı sayıların bir merdiveni.
Her benchmark'ın iki işi vardı: Claude'un laboratuvarda optimizasyon yapabileceği bir sayı ve yalnızca aşağı doğru sıkılaştırılabilecek bir CI koruma raili. Kararsız benchmark'lar ya da gerçek gecikmeyle ilişkilendirilemeyenler, agent'ın "yanlış tepeye tırmanmasına" izin vermek yerine çöpe atıldı. Yaklaşımı doğrulamak için Claude iki hot path'i profil etti — bir sohbetin mesaj ağacını oluşturan rutin ve Claude Code çıktısındaki durum satırlarını tarayan bir tarayıcı — ve ilk yolun instruction'larının dörtte birinin, aynı mesaj ID'sini üç ayrı kez çözen megamorphic sözlük aramaları olduğunu buldu. İki yolda instruction'lar %48 ve %31 düştü, duvar saati süresi %78 ve %44 geriledi. Ortaya çıkan ratchet mekanizmaları bu sayıları artıran her PR'ı başarısız kılıyor ve günlük bir iş, sayı her iyileştiğinde tavanı aşağı çekiyor.\n Anthropic bunu sprintin merkezî dersi olarak çerçeveliyor: bir agent'la, bir sorunu ölçmek onu çözülebilir kılan şeydir; dolayısıyla en yüksek kaldıraca sahip insan işi, ölçülecek yeni şeyler bulmak haline gelir.
Tekrarlanabilir bir yayına alma döngüsü
İş bir döngüye oturdu: bir mühendis, çoğunlukla ekran kaydıyla birlikte, bir yolculuğun yavaş bir bölümü hakkında bir thread açtı; Claude akışı izledi ve sorunu gösteren bir benchmark oluşturdu; risk boyutlandırılmış pull request'lerle, kullanıcıya görünür değişiklikler flag'lerin arkasında olacak şekilde geri döndü; sonra deploy'u izledi, sahadan verileri okudu ve kazancı ratchet'e aldı ya da flag'i kapatarak yineledi.
Bir örnek: bir kayıt, sayfa yüklendikten sonra kenar çubuğu satırlarının düzensiz biçimde belirdiğini gösterdi; mevcut izleyicilerden hiçbirinin yakalamadığı bir jank sorunu. En yakın metrik olan Cumulative Layout Shift, her bir kaymayı yaklaşık 0,008 puanladı — rahatça "iyi" eşiklerinin içinde.
Neden önemli
Bu, bir AI agent'ının yalıtılmış biçimde kod parçacıkları üretmek yerine, yaygın kullanılan bir ürün üzerinde gerçek üretim mühendisliği yaptığının ayrıntılı bir vaka çalışması. Bunu güvenli kılan desen aktarılabilir: CI koruma rayları olarak deterministik, yalnızca ratchet'li benchmark'lar; kullanıcıya görünür değişikliklerde feature flag'ler; ve her birleştirmede onay yetkisini elinde tutan insanlar. Sonuçlar ayrıca agent destekli optimizasyonun mühendislerin zamanlarını nereye harcadığını değiştirdiğini gösteriyor — neyin ölçüleceğini seçmeye ve ödünleşimleri yargılamaya doğru. Her zamanki uyarı geçerli: bunlar Anthropic'in kendi ürünüyle ilgili kendi rakamları, bağımsız bir doğrulama yok ve şirketin Claude'un Claude inşa etmesini sergilemek gibi bariz bir çıkarı var.
- #anthropic
- #claude
- #ai-agents
- #web-performance
- #ci-cd