· kaynak dev.to (home feed)
FreeLLMAPI, 34 ücretsiz LLM katmanını tek bir OpenAI uyumlu uç nokta arkasında topluyor
Açık kaynaklı bir router, 34 LLM sağlayıcısının ücretsiz katman anahtarlarını tek bir yerel OpenAI uyumlu uç nokta arkasında birleştiriyor; otomatik yük devretme, hız limiti takibi ve gecikmeli katalog ücret duvarıyla birlikte.

FreeLLMAPI adlı açık kaynaklı bir proje, 34 LLM sağlayıcısının ücretsiz katmanlarını kendi makinenizde çalışan tek bir OpenAI uyumlu API arkasında birleştirmenin bir yolunu sunuyor. dev.to'da yayımlanan bir yazıya göre router, yerel bir /v1 uç noktasını hedefleyen herhangi bir OpenAI istemcisini kabul ediyor ve istekleri anahtar sağladığınız sağlayıcılar arasında dağıtıyor; Google AI Studio, Groq, Cerebras, Mistral, Cohere, NVIDIA, Cloudflare ve OpenRouter desteklenen seçenekler arasında yer alıyor.
Hedeflediği sorun
dev.to yazısı motivasyonu açıkça ortaya koyuyor: Bugün neredeyse her yapay zeka laboratuvarı bir ücretsiz katman işletiyor ve her birinin tek başına payı mütevazı — ayda birkaç milyon token ya da günde birkaç bin istek. Ancak birlikte ele alındığında, gerçek prototipleme için yeterli kapasiteye ulaşıyorlar. Engel ise entegrasyon: Eklediğiniz her sağlayıcı için ayrı SDK'lar, ayrı hız limitleri ve ayrı hata noktaları var. FreeLLMAPI'nin yanıtı, bu karmaşıklığı tek bir yerel bileşende toplamak.
Router ne yapıyor
Her istekte router, fallback zincirinize danışıyor ve sağlıklı bir anahtarı olan ile tüm hız limitlerinin altında kalan en yüksek öncelikli modeli seçiyor. Bir sağlayıcı 429 ya da 5xx yanıtı verirse, anahtar soğuma süresine alınıyor ve zincirdeki bir sonraki model hemen deneniyor. Sistem, her sağlayıcı, model ve anahtar kombinasyonu için dakika başına istek, gün başına istek ve karşılık gelen token sayaçlarını takip ediyor; amaç limitlere reddedilerek değil, sınırların altında kalarak uymak. X-Routed-Via yanıt başlığı, çağrıyı fiilen hangi sağlayıcının karşıladığını kaydediyor.
Çekirdek yönlendirmenin üzerinde birkaç kolaylık daha var. Yapışkan oturumlar yanıtların tutarlı kalması için bir konuşmayı 30 dakika boyunca tek bir modelde tutuyor, birden fazla sağlayıcı tarafından sunulan aynı model tek bir birleşik girdi olarak görünüyor ve adlandırılmış yönlendirme profilleri istek başına seçilebiliyor. Model alanı "auto" kabul ediyor ki router seçsin; hız ya da yeteneğe yönelmek için "auto:fast" ya da "auto:smart"; açık bir model kimliği ya da prompt'u birkaç ücretsiz modele paralel gönderip bir yargıç modelin sonuçları tek bir yanıtta birleştirdiği "fusion".
Yerel öncelikli anahtar tasarımı
Barındırılan bir kayıt yok. Ücretsiz katman anahtarlarını kendiniz topluyorsunuz ve bir panoya yapıştırıyorsunuz; burada AES-256-GCM ile şifrelenerek yerel bir SQLite veritabanına yazılıyor ve yalnızca bir isteğin ömrü boyunca bellekte şifresi çözülüyor. Router daha sonra freellmapi- önekiyle tek bir bearer token çıkarıyor; uygulamanızın elinde tuttuğu tek kimlik bilgisi bu. Proje token satmıyor ve yerel olarak çalıştığı için prompt'larınızı kendi uzak sunucularından geçirmiyor.
Kurulum seçenekleri arasında bir Docker kurulum betiği, npm ve sistem tepsisinden çalışan Windows ile macOS için masaüstü yükleyicileri var. Pano localhost:3001 adresini dinliyor, anahtarlar sağlık kontrolü durum göstergeleriyle görünüyor ve fallback sırası özel bir sayfada modelleri sürükleyerek yerleştirerek düzenleniyor.
Ücretsiz olan ve olmayan
Yazıya göre yazılım MIT lisanslı ve her özellik ücretsiz çalışıyor. Tek ücretli öğe, yılda 19 dolar ya da ömür boyu lisans için 49 dolar fiyatlı canlı bir model katalog akışı. Ücretsiz kurulumlar aynı imzalı kataloğu aylık bir anlık görüntü olarak alıyor; böylece yeni yayımlanan modeller yaklaşık 30 gün sonra geliyor. Proje, ücretsiz yapıların şu anda canlı akışın yaklaşık 303 model gerisinde olduğunu belirtiyor. Ücretsiz kurulumlarda hiçbir şey devre dışı değil — güncellemeler sadece daha sonra geliyor.
Neden önemli
Ücretsiz çıkarım kapasitesi sektörde zaten mevcut, ancak birçok sağlayıcıyla uğraşma yükü onu parçalı tuttu. Havuzlanmış ücretsiz katmanları standart bir OpenAI uyumlu arayüzde sarmalamak, mevcut araçların — proje tarafından tek bir komutla yapılandırılabildiği söylenen CLI kodlama ajanları dahil — kod değişikliği olmadan bu kapasiteden yararlanabileceği anlamına geliyor.
Sınırlar açıkça belirtilmiş. Bu, üretim değil kişisel deneme ve öğrenmeyi hedefliyor: frontier model yok, SLA yok ve gecikme değişken. dev.to yazısı ayrıca, popüler ücretsiz modeller günlük limitlerini tükettikçe günün ilerleyen saatlerinde etkin kalitenin düştüğünü (bu limitler UTC gece yarısı sıfırlanıyor) ve her sağlayıcı kullanımınızın kayıt olurken kabul ettiğiniz koşullara tabi olmaya devam ettiğini belirtiyor. Buradaki ayrıntılar projenin kendi duyurusundan geldiği için, şifreleme şeması ve model sayıları gibi iddialar bağımsız doğrulamadan yarar görürdü. Prototipleme ötesi her şey için öngörülen yol, ücretli bir API'ye geçmek.
- #open-source
- #llm
- #api
- #developer-tools
- #self-hosted