· kaynak Hacker News – Front Page (native)
Magnitude, kendi kendini ayarlayan inference motorunu açık kaynak yaptı ve llama.cpp'den 2 kata kadar hızlı olduğunu iddia ediyor
YC S25 girişimi Magnitude, çekirdekleri (kernel) kullanıcının kendi donanımında derleyip ayarlayan bir inference motorunu açık kaynak yaptı; açık model ajan çıkarımında llama.cpp'den 2 kata kadar hız iddia ediyorlar.
Y Combinator'ın S25 döneminden çıkan girişim Magnitude, yapay zeka ajanları için geliştirdiği kendi kendini optimize eden inference motorunu açık kaynak olarak yayınladı. Şirketin Hacker News'teki tanıtım yazısına göre motor, bir model çalışmadan önce hesaplama çekirdeklerini (kernel) kullanıcının kendi donanımında derleyip ayarlıyor ve ekip, bunun açık ağırlıklı modellerin llama.cpp'den iki kata kadar hızlı çalışmasını sağladığını iddia ediyor. Proje Apache 2.0 lisansıyla yayınlandı ve macOS, Windows ile Linux için bir masaüstü uygulaması olarak geliyor.
İddia edilen hız artışı nasıl çalışıyor
Şirketin temel argümanı, yerleşik yerel motorların — llama.cpp, Ollama ve LM Studio'yu sayıyor — geniş donanım sınıfları için önceden derlenmiş çekirdekler dağıtması ve bunun herhangi bir belirli çipte performansın kullanılmadan kalmasına yol açması. Magnitude ise çekirdekleri model çalışmadan önce gerçek cihazda derleyip ayarlıyor; böylece üretilen kod makinedeki donanıma tam olarak uyuyor.
Ancak "2 kata kadar" şeklindeki ana iddia platformlar arasında eşit dağılmıyor. Tanıtım yazısına göre decode, Apple'ın Metal grafik API'sinde %92 daha hızlı — neredeyse iki kat figürü buradan geliyor — ama NVIDIA'nın CUDA'sında yalnızca %19 daha hızlı. Şirket ayrıca en popüler açık ağırlıklı model aileleri için elle optimize edilmiş çekirdekler yazdığını, genel amaçlı motorları geçmesinin de bunu borçlu olduğunu söylüyor ve web sitesinde kıyaslama detayları ile desteklenen modeller listesine işaret ediyor. Bu rakamların tamamı şirketin kendi ölçümleri; duyuruya bağımsız sonuçlar eşlik etmedi.
Ajan iş yüklerine göre tasarlandı
Magnitude kendisini bir sohbet istemcisi olarak konumlamak yerine yerel inference'ı kodlama ajanları ve benzeri araçlar için bir altyapı olarak ele alıyor. Tanıtım yazısı ajan başına %27 daha az bellek kullanıldığını, ajan durduğunda bu belleğin serbest bırakıldığını ve eşzamanlı oturumların prefix cache'leri paylaştığını, dolayısıyla aynı anda birden fazla ajan çalıştırmanın yavaşlamaya yol açmadığını belirtiyor.
Masaüstü uygulaması magnitude CLI'yi içeriyor, yani ayrıca kurulum gerekmiyor. Başlamak için uygulamayı indirmek, Discover sekmesinden önerilen bir modeli seçmek ve Connections ekranından bir ajan bağlamak gerekiyor. Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi ve Cline için tek tıkla entegrasyonlar sunuluyor; diğer her araç OpenAI uyumlu bir API üzerinden bağlanabiliyor.
Donanım ve gizlilik
Magnitude Apple Silicon, NVIDIA GPU'ları, AMD GPU'ları ya da yalnızca CPU'lu makinelerde çalışıyor. Şirket sabit bir minimum donanım gereksinimi olmadığını söylüyor: daha küçük makineler daha küçük modeller çalıştırıyor, daha fazla bellek de yalnızca daha büyük modellere olanak tanıyor. Gizlilik konusunda tanıtım yazısı; prompt'ların, dosyaların ve modellerin makinede kaldığını, token maliyeti olmadığını ve bir model indirildikten sonra internet bağlantısı gerekmediğini belirtiyor.
Neden önemli
Ajan iş yükleri inference hızına alışılmadık derece duyarlıdır, çünkü ajanlar art arda pek çok model çağrısı yapar ve token başına verimlilik, yerel bir ajanın ne kadar kullanışlı hissettirdiğini doğrudan belirler. Magnitude'nun bahsi, önceden derlenmiş binary'ler dağıtmak yerine cihaz başına çekirdek ayarlamasının, insanların yerel modelleri çalıştırdığı çeşitli donanımdan performans sıkmak için daha iyi bir yol olduğu — ve açık ağırlıklar ile yerel çalıştırmanın ajan kullanımı büyüdükçe büyümeye devam edeceği yönünde.
Apache 2.0 lisansı ve OpenAI uyumlu API, bu bahsi test etmek isteyen geliştiriciler için geçiş maliyetini düşük tutuyor. Uyarılar da aynı derecede gerçek: performans rakamları şirketin kendi bildirdiği değerler, "2 kata kadar" figürü Metal'deki en iyi durumu yansıtıyor ve CUDA'daki %19'luk kazanç çok daha mütevazı. llama.cpp, Ollama ve LM Studio büyük topluluklarla kök salmış durumda. Cihaz üzerindeki kendi kendini optimize etmenin gerçek bir mimari avantaj mı yoksa marjinal bir optimizasyon mu olduğu, ancak bağımsız kıyaslamalar ortaya çıktığında netleşecek.
- #open-source
- #llm-inference
- #ai-agents
- #local-ai
- #developer-tools