deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (native)

Meta'nın Muse agent'ına stres testi: 120 subagent spawn'ının 87'si bir veritabanı hatasıyla başarısız oldu

Meta'nın yeni Muse agent'ına yapılan bağımsız bir black-box testte, 120 subagent spawn'ının 87'si aynı veritabanı hatasıyla başarısız oldu ve parent agent'lar çalışır durumda takılı kaldı.

Meta'nın Muse agent'ına stres testi: 120 subagent spawn'ının 87'si bir veritabanı hatasıyla başarısız oldu

120 spawn'lık patlama, 87 başarısızlık

Meta, kişisel yapay zeka agent'ı Muse'u 8 Eylül 2026'da yayınladı. Sıradan bir chatbot'un aksine Muse, kullanıcı adına hareket etmek üzere tasarlandı: kendi tarayıcısı var, uygulama kapatıldıktan sonra da çalışmaya devam ediyor ve adanmış bir Muse Secure VM içinde çalışıyor. Lansmandan günler sonra bağımsız bir testçi, kendi Muse oturumundan bir black-box stres testi gerçekleştirdi ve sonuçları blog.cygankiewicz.com adresinde yayınladı; yazı Hacker News ana sayfasına kadar yükseldi.

Temel deney sadeliğiyle çarpıcıydı. Yazar, UTC saatiyle 06:45:32'de oturumdan tek bir turda 120 subagent spawn'lamasını istedi; her birine basit bir iş verildi: bir shell'de sleep 30 komutunu çalıştırmak ve tek satır geri bildirmek. Çağrıların yalnızca 33'ü bir agent oluşturdu. Diğer 87'si aynı veritabanı hatasıyla başarısız oldu. Toplu yanıt hiç gelmedi ve sohbet arayüzü sonunda Error durumunu gösterdi.

Daha ilginç tutarsızlık sonrasında ortaya çıktı. Runtime'ın kalıcı trace kaydında, oluşturulan 33 agent'ın tamamı terminal completed kaydına ulaştı — 32'si doğrulanmış iş yükü tamamlanmasıyla, biri çözümlenmemiş olarak — buna karşın parent agent'ın kaydı hâlâ running diyordu. Çocuklar işini bitirdi; parent'ın defter tutma işlemi hiç yetişemedi.

Trace'in ortaya çıkardıkları

Yazar hiçbir erişim denetimini atlamadı. Her şey oturumun kendisine tanınan arayüzler üzerinden çalıştı: subagent.spawn, subagent.close, subagent.resume, atanan ortamda bir shell ve runtime'ın kendi defter tutma işi için kullandığı bir PostgreSQL veritabanının salt okunur görünümü. agent.agents, agent.subagent_spawns ve agent.subagent_progress_tool_events gibi tablolar hangi agent'ların var olduğunu, kimin onları spawn'ladığını, hangi araçları çalıştırdıklarını ve ne zaman bitirdiklerini kaydetti. Yazıda belirtildiği gibi, Muse'un çok agent'lı yapısı ancak böyle görünür hale geldi: sohbet tek bir konuşma sunarken, trace altındaki fan-out yapısını gösteriyor.

İki tanımlayıcı ortaya çıktı. Her agent satırı — root, coordinator ve 33 patlama işçisinin tamamı — aynı model dizesini taşıyordu: ipnext/avocado-5.16-v4. Yazar onu aynen yayınlıyor ama yorumlamayı reddediyor: dahili bir build, bir yönlendirme alias'ı ya da başka bir şey olabilir. Ayrıca runtime kendini Muse Spark 1.3 olarak tanımlıyor; yazı bunu doğrulanmış değil, self-reported olarak işaretliyor.

Çalıştırmalar nasıl ölçüldü

Dört yapılandırma, tek iş yükü, tekrar deneme yok: root agent'tan tek turluk patlamalar halinde verilen PROBE-40, BURST-80 ve BURST-120, ayrıca bir coordinator agent üzerinden zamana yayılan STAGGERED-80 — ancak yazar, o çalıştırmanın hem ritmi hem de topolojiyi değiştirdiğini kabul ediyor, bu yüzden patlama testleriyle temiz bir karşılaştırma değil. Kalibrasyon çalıştırması PROBE-40, 40 agent'tan 39'unu oluşturdu ve zirvede gözlemlenen eşzamanlılık 39 oldu; tek başarısızlığı sohbetten değil trace'den kurtarıldı, hata çağrıdan 12 saniye sonra geldi.

Yazı eşzamanlılığı dar tanımlıyor: bir agent, ilk araç çağrısından terminal kaydına kadar aktif sayılıyor ve bu, bir saniye çözünürlüklü zaman damgaları üzerinden taranıyor. Yazı bunun neyi göstermediği konusunda açık. Agent etkinlik pencerelerini ölçüyor, eşzamanlı inference çağrılarını değil; bir zirve bir gözlem, bir sınır değil; ayrıca başarısız spawn'lar hiç kayıt bırakmıyor, bu da başarısızlık sayılarını doğrulaması en zor rakamlar haline getiriyordu. Yeniden yapılandırmadan bir detay daha, daha zayıf provenance olarak işaretlendi: 39 probe agent'ından on biri, istenen tamamlanma satırı yerine bir background-processing durumuyla sonlandı — terminal durumu ile bitmiş işin aynı ifade olmadığının bir hatırlatması.

Sınırlarıyla birlikte bağımsız doğrulama

Yayından sonra yazar, Rohan Adwankar'ın "What's in a Muse?" başlıklı bağımsız teardown'ından mimari bağlam ekledi. Adwankar'ın örneğinde PostgreSQL, kullanıcı başına VM içinde yerel bir Unix socket üzerinden çalışıyordu ve harness binary'si hem avocado-5.16-v4 hem de ipnext/... yollarını içeriyordu. O, ipnext'i Meta'nın dahili transport'u veya gateway'i, avocado'yu dahili bir model ailesi olarak okuyor; ancak avocado'yu Muse Spark 1.3'e eşlemek hâlâ bir çıkarım. Yazarın kendi probe'u KVM görünürlüğünü belirlerken, Adwankar kendi örneğinde KVM üzerinde çalışan Cloud Hypervisor'ı tespit etti. Yazarın vurguladığı gibi, bunların hiçbiri zaman aşımlarından sorumlu spesifik lock, tablo, satır, sorgu veya transaction'ı tanımlamıyor.

Yazı kapsam konusunda da aynı derecede özenli: bu, Meta'nın yetkilendirdiği bir güvenlik değerlendirmesi değil ve yazarın kabul ettiği gibi, erişime sahip olmak, her yük deneyiminin ayrı ayrı yetkilendirildiğinin kendiliğinden kanıtı değil.

Neden önemli

Muse henüz günler önce çıktı ve arka planda, kalıcı şekilde, oturumlar arasında sizin için çalışan bir agent olarak konumlandırıldı. Subagent fan-out egzotik bir saldırı deseni değil — agent'ların araştırmayı ve çok adımlı işleri paralelleştirme yöntemi tam olarak bu. Kontrol düzleminin veritabanı katmanı bir patlama altındaki spawn çağrılarının çoğunu reddediyorsa ve parent agent'lar çocukları tamamlandıktan sonra kalıcı olarak running işaretli kalabiliyorsa, bu tam olarak Muse'un secure-VM mimarisinin dayandığı katmandaki bir güvenilirlik kusuru. Bu olay ayrıca, salt okunur tek bir trace'in büyük bir satıcının agent runtime'ı hakkında ne kadar mimari detayı ortaya çıkarabileceğini gösteriyor — kullanıcı başına VM'ler, yerel PostgreSQL, bir spawn defteri — lansmandan bir hafta içinde; ve gözlemlenen tanımlayıcıları çıkarımlardan ayıran teardown raporlaması için faydalı bir örnek oluşturuyor.

  • #meta
  • #ai-agents
  • #reliability
  • #stress-testing
  • #virtual-machines

İlgili yazılar