· kaynak dev.to (home feed)
Cloudflare Workers AI'nin Ücretsiz Katmanında Yaklaşık İki Düzine Açık Kaynak LLM Çalışıyor
dev.to'da yayımlanan uygulamalı testler, Cloudflare Workers AI'nin tek API'si üzerinden yaklaşık iki düzine açık kaynak LLM'in ücretsiz kullanılabilir olduğunu, katalogdaki birçok girdinin ise yalnızca ücretli erişime açık kaldığını ortaya koyuyor.

Deney neyi ortaya koydu
dev.to'da yayımlanan uygulamalı bir test, Cloudflare Workers AI'nin ücretsiz katmanında yaklaşık iki düzine açık kaynak LLM'in tek bir API uç noktası üzerinden inference isteklerini kabul ettiğini bildiriyor. interro-ai adıyla yazan yazar üç soruya yanıt aramış: hangi modeller gerçekten ödeme gerektirmeden çalışıyor, kodlama için en iyileri hangileri ve Cloudflare'ın limitleri Groq ve Cerebras gibi rakipleriyle karşılaştırıldığında nasıl bir durumda.
Başlangıç noktası, hesap için 300'den fazla model döndüren Cloudflare'ın model kataloğu API'si olmuş. Bu sayı yanıltıcı çıkmış, çünkü katalogda listelenmek erişim garantisi değil. Daha büyük modellerden bazıları — aralarında zai-org'un GLM 5.2 ve GLM 5.3 varyantları ile Moonshot'un Kimi K2.6 ve K2.7 Code'u — yazar gerçekten istek gönderdiğinde "Model is not available on the Workers Free plan" bildiren 5035 hatası döndürmüş.
Çalışan modelleri erişim kısıtlı olanlardan ayırmak için yazar, katalogda gezinen, her modele bir test inference isteği gönderen ve hangi çağrıların başarılı olduğunu, hangilerinin ücretli plan gerektirdiğini kaydeden bir keşif betiği yazmış.
Testi geçen modeller
Gönderiye göre ücretsiz katamandan geçen modeller dokuz model ailesine yayılıyor:
- OpenAI: gpt-oss-20b ve gpt-oss-120b
- Qwen: qwen2.5-coder-32b-instruct, qwen3-30b-a3b-fp8, qwen3.8-27b ve qwq-32b
- DeepSeek: deepseek-r1-distill-qwen-32b
- Meta: Llama 3.1 8B, Llama 3.2 1B ve 3B, Llama 3.3 70B (fp8-fast) ve Llama 4 Scout
- Google: Gemma 2B ve 7B LoRA varyantları, Gemma 4 26B ve AI Singapore'ın Gemma Sea-LION 27B'si
- Mistral: mistral-7b-instruct-v0.2-lora ve Mistral Small 3.1 24B
- ZAI: glm-4.7-flash
- IBM: granite-4.0-h-micro
- NVIDIA: nemotron-3-120b-a12b
Gönderinin başlığında 24 model sayılıyor, oysa madde madde liste 21'e ulaşıyor; dolayısıyla kesin sayıyı yaklaşık olarak değerlendirmek en doğrusu.
Bir sonuç yazarı şaşırtmış: Deneye özellikle GLM 5.3 Flash'ı çalıştırmak isteyerek başlamış, ancak yalnızca daha eski GLM 4.7 Flash ücretsiz çıkmış; daha yeni tüm GLM modelleri ödeme gerektirmiş.
Kodlama kısa listesi
Yazılım geliştirme için üç model ötekilerin önünde yer alıyor. GPT-OSS-120B yazarın genel galibi; Terraform, Kubernetes, genel DevOps işleri, AWS mimarisi, refactoring ve çok dosyalı repository'lerdeki güçlü performansıyla övülüyor. Qwen2.5-Coder-32B, amaca özel tasarlanmış bir kodlama modeli olarak ikinci sırada; kod üretme, pull request inceleme, hata düzeltme ve repository anlama konularında — Continue.dev ve Cline gibi editör araçlarında dahil — yüksek puan alıyor. DeepSeek-R1-Distill-Qwen-32B üçüncü tercih ve kök neden analizi, karmaşık hata ayıklama, mimari incelemeler ve agent iş akışları için akıl yürütme seçeneği — yazarın gece yarısı bir pipeline arızasında elini uzatacağı model.
Övgüye değer mentioned'lar arasında akıl yürütme için QWQ-32B, hız ile yetenek dengesi için Llama 4 Scout ve incelemeler, dokümantasyon ile sistem tasarımı için Llama 3.3 70B var.
Limitler nasıl işliyor
Gönderiye göre Cloudflare'ın kota modeli Groq'unkinden farklı. Groq genellikle model başına hız limiti uygularken, Cloudflare her ücretsiz hesaba günde 10.000 Neuron veriyor — bu fiilen hesap genelinde paylaşılan bir günlük bütçe — ve bunun yanı sıra metin üretimi için belgelenmiş dakikada 300 istek sınırı bulunuyor. Pratikteki tablo şu: hesap düzeyinde bir günlük bütçe, artı bir metin üretimi hız sınırı, artı modele özgü istisnalar.
Neden önemli
Gönderi, LLM'lerle geliştirme yapmanın ücretli bir OpenAI ya da Anthropic aboneliği, kiralanmış bir GPU sunucusu veya bir bulut inference uç noktası gerektirdiği yönündeki yaygın varsayıma meydan okuyor. Birçok proje için tek bir ücretsiz Cloudflare hesabı, tek bir API üzerinden GPT-OSS-120B, Qwen Coder 32B, DeepSeek R1 Distill, QWQ-32B, Llama 4 Scout ve Gemma 4 sunuyor — yazarın görüşüne göre bu, bir GPU'ya dokunmadan kodlama asistanlarını, agent'ları, dahili copilot'ları, RAG uygulamalarını, girişim MVP'lerini ve geliştirici araçlarını çalıştırmaya yetiyor.
Uyarılar da var. Bu, resmi Cloudflare dokümantasyonu değil tek bir geliştiricinin anlık görüntüsü; ayrıca erişim model bazında zorunlu kılındığı için ücretsiz katman değiştikçe kadro da değişebilir. 10.000 Neuron'luk bütçe ayrıca hesabın çalıştırdığı her şey arasında paylaşıldığından, daha yoğun iş yükleri bunu hızla tüketebilir. Yazar, günlük bütçeye kaç gerçek kodlama isteğinin sığdığını ölçen ve Groq ile Cerebras'la karşılaştırmalar içeren takip yazıları planlıyor. AI araçları üzerinde prototip geliştiren herkes için pratik ders şu: Taahhütte bulunmadan önce kataloğu gerçek bir inference çağrısıyla yoklayın, çünkü ücretsiz planda listelenmiş olmak ile kullanılabilir olmak aynı şey değil.
- #cloudflare
- #llm
- #open-source
- #inference
- #free-tier
İlgili yazılar
- Imp, DSPy'yi Elixir'e taşıdı: BEAM üzerinde kendi kendini optimize eden LLM programları
- Tinbase, Postgres 17'yi ve Supabase uyumlu katmanları 58 MB'lık bir ikili dosyada 2,5 saniyelik önyüklemeyle sunuyor
- Açık kaynak ESP32-S3 pedal, tam boyutlu Neural Amp Modeler capture'ları gerçek zamanlı çalıştırıyor