deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

OmniCache: açık kaynak Python proxy, LLM API'lerine milisaniyenin altında semantik cache ekliyor

Bir geliştirici, OmniCache adlı MIT lisanslı Python reverse proxy'yi yayınladı; araç, anlamsal olarak benzer LLM prompt'larını yerel ve milisaniyenin altındaki bir cache'ten yanıtlayarak API faturalarını yarıya kadar düşürdüğünü iddia ediyor.

OmniCache: açık kaynak Python proxy, LLM API'lerine milisaniyenin altında semantik cache ekliyor

OmniCache adlı yeni bir açık kaynak proje, anlamsal olarak benzer prompt'ları yerel bir cache'ten yanıtlayan bir reverse proxy ile LLM API faturalarını hedefliyor. Projeyi duyuran dev.to yazısına göre, saf Python ile yazılan proxy, istemci uygulamaları ile OpenAI, Anthropic, Google Gemini gibi model arka uçları veya vLLM ve Ollama gibi yerel runtime'lar arasında duruyor ve önbelleğe alınmış bir completion'ı bir milisaniyenin altında sunabiliyor; geliştirici, yüzde 50'ye varan maliyet düşüşü iddia ediyor.

Önekleri değil anlamı eşleştiren cache

Temel fikir semantik caching: gelen prompt'lar embedding'e dönüştürülüp daha önce yanıtlanan isteklerle karşılaştırılıyor, böylece daha önce sorulmuş bir sorudan farklı bir dille sorulan soru bile cache'e isabet edebiliyor. Geliştiriciye göre embedder, tamamen bellekte çalışan, barındırılan bir embedding servisine hiç çağrı yapmayan 512 boyutlu bir özellik projeksiyonu; kosinüs benzerliği aramaları 0,8 milisaniyenin altında tamamlanıyor. Redis veya Qdrant gibi harici bir vector store gerektirmiyor. Yazı projeyi sıfır bağımlılıklı olarak tanımlasa da kurulum talimatları üç paket kuruyor: Starlette, Uvicorn ve HTTPX.

Amaç farkındalı benzerlik eşikleri

Semantik cache'lerin bilinen bir başarısızlık modu var: yalnızca benzer olan bir istek, kodu veya yapılandırılmış veriyi bozan bir yanıt alabilir. OmniCache'nin çözümü, geliştiricinin dinamik intent gating dediği şey — payload'a uyum sağlayan benzerlik eşikleri. Kod 0,98 benzerlik puanı gerektiriyor, JSON şemaları tam 1,0 eşleşme istiyor, SSS tarzı sorular 0,92'yi kabul ediyor ve yaratıcı yazım cache'i tamamen atlıyor. Buna karşılık geleneksel Redis tabanlı semantik cache'ler genellikle tek bir global eşik uygular; geliştiriciye göre bu, yapılandırılmış çıktıyı bozabilir.

Agent'lar, ses ve self-hosting için tasarlandı

Yazı, çekirdek cache'in ötesinde birkaç bileşen daha sayıyor. Bir tool-loop hızlandırıcısı, Claude Code veya Cursor gibi kodlama agent'larının yaptığı idempotent araç çağrılarını — dosya okumaları, git status, grep — önbelleğe alıyor; geliştiriciye göre tekrarlanan adımların tamamlanma süresi yaklaşık 15 saniyeden 350 milisaniyeye düşüyor. Uyarlanabilir yönlendirme adımı, prompt karmaşıklığını 0,2 milisaniyenin altında sınıflandırıp basit sınıflandırma sorgularını daha ucuz economy modellere gönderiyor. Bir vision cache, ekran görüntülerini ve belgeleri tekilleştirmek için 64 bitlik algısal hashing kullanıyor; bir maskeleme katmanı, istekler yukarı akıma gitmeden önce hassas kimlik bilgilerini tokenize ediyor; bir streaming replayer, önbelleğe alınmış completion'ları saniyede yaklaşık 65 token hızında, ilk tokena ulaşma süresi 10 milisaniyenin altında olacak şekilde geri oynatıyor; böylece cache'lenmiş yanıtlar hâlâ canlı akış gibi görünüyor.

Belirtilen hedef kitleler ise uygulama koduna dokunmadan token hacmini azaltmak isteyen altyapı mühendisleri, tekrarlayan dosya inceleme döngülerine takılan otonom kodlama agent'ları, her arama milisaniyesinin biriktiği gerçek zamanlı ses hatları ve verilerin makinede kalmasını isteyen self-hosted dağıtımlar.

Geliştiricisine göre karşılaştırması

Yazı, OmniCache'yi üç alternatifle karşılaştırıyor. LiteLLM ve Portkey'ye göre proje, 30 ila 80 milisaniye ağ gecikmesi ekleyen harici vector database'lere bağımlı. Sağlayıcıların yerel prompt caching'i yalnızca 1.024 tokenden uzun birebir önekleri eşleştiriyor ve çıktı üretimini hızlandırmaya hiç katkı sağlamıyor. Statik eşikli semantik cache'ler ise bozuk JSON veya kod döndürme riski taşıyor. Bu karşılaştırmalar bağımsız benchmark'lardan değil, projenin kendi duyurusundan geliyor.

Çalıştırma

Kurulum bilinçli olarak küçük: GitHub deposunu klonlayın, üç paketi kurun ve ana script'i başlatın. Mevcut uygulamaların tek yapması gereken, bir OpenAI SDK istemcisini proxy'nin 8000 portundaki yerel adresine yönlendirmek; ayrıca beraber gelen bir dashboard, cache metriklerini raporluyor.

Neden önemli

Tekrarlayan iş yüklerine sahip ekipler için — aynı dosyaları yeniden okuyan agent döngüleri, örtüşen soruları yanıtlayan destek botları — yukarı akım çağrısı yapılmadan önce yanıt veren yerel bir cache hem harcamayı hem gecikmeyi azaltıyor; yanıtların makinede kalması gizlilik açısından da değerli. Uyarıları açıkça belirtmek gerekir: buradaki her rakam, milisaniye altı aramalardan yüzde 50 tasarrufa kadar, geliştiricinin kendi yazısından geliyor; gerçek dünyadaki tasarruf büyük ölçüde trafiğin ne kadar tekrarlayıcı olduğuna bağlı olacak. Amaç kapı eşikleri, üretime geçmeden önce en çok test edilmesi gereken kısım; çünkü fazla gevşek ayarlanmış bir kesim ince yanlış yanıtlar döndürür, fazla sıkı ayarlanmış olan ise cache'i tamamen boşa çıkarır.

  • #open-source
  • #llm
  • #caching
  • #python
  • #proxy

İlgili yazılar