· kaynak dev.to (home feed)
Qwen3.6-35B-A3B, RTX 4070'de Qwen3.5 hızında çalışıyor; frontend tarafında %43'lük artış raporlandı
dev.to'da yayımlanan bir el yordamıyla test, Qwen3.6-35B-A3B ile Qwen3.5'in RTX 4070'de saniyede yaklaşık 37 token ürettiğini, model kartında ise frontend kod üretiminde %43'lük bir sıçrama bildirildiğini ortaya koyuyor.

Aynı hız, farklı hikâye
dev.to'da yayımlanan bir karşılaştırma testi, Qwen3.6-35B-A3B'yi öncülü Qwen3.5-35B-A3B ile tüketici sınıfı bir GPU üzerinde kıyaslıyor ve üretim hızında anlamlı bir değişiklik bulmuyor — buna karşılık model kartındaki sayılar agentic ve frontend kodlama işlerinde büyük bir yetenek sıçramasına işaret ediyor.
Gönderiye göre her iki model de 12 GB VRAM'e sahip tek bir RTX 4070'de çalıştı; mixture-of-experts katmanlarını CPU'ya aktarmak için llama.cpp'nin -ngl 99 --cpu-moe seçeneği, lmstudio-community aynasındaki GGUF quantization'ları ve ölçüm için llama-bench'in tg128 metriği kullanıldı. Her biri üç koşuyla ortalanınca Qwen3.6 saniyede 38,76 ± 0,82 token, Qwen3.5 ise 36,7 ± 1,4 token üretti; yani ikisi de kabaca 1,5 tok/s'lik bir bandın içinde kaldı.
Olmayan regresyon
Yazarın ilk ölçümü çok farklı bir tablo çiziyordu: Qwen3.6 için 12 tok/s'ye karşılık Qwen3.5 için 34,6 tok/s taban değeri, bu da ciddi bir yavaşlama gibi görünüyordu. Sorunun kaynağı, 9–11 GB VRAM'i tutan başka bir süreçti; GPU'da bulunması gereken katmanları sistem RAM'ine taşmak zorunda bırakıyordu. İpucu, Qwen3.5'in de sağlama koşusunda yavaşlamasıydı — bağımsız iki model birlikte bozulduğunda, değişken modelin kendisi değildir. Sorunlu süreç sonlandırılıp test tekrarlandığında hızlar birbirine yaklaştı.
Kazançların asıl nerede olduğu
Throughput hareket etmediyse, ilginç sayılar gönderide alıntılanan Qwen3.6-35B-A3B model kartındaki benchmark tablosundan geliyor:
| Benchmark | Qwen3.5 | Qwen3.6 | Artış |
|---|---|---|---|
| Terminal-Bench 2.0 | 40,5 | 51,5 | +%27 |
| QwenWebBench (frontend üretimi) | 978 | 1.397 | +%43 |
| SWE-bench Pro | 44,6 | 49,5 | +%11 |
| LiveCodeBench v6 | 74,6 | 80,4 | +%8 |
| SWE-bench Verified | 70,0 | 73,4 | +%5 |
| AIME26 | 91,0 | 92,7 | +%2 |
| GPQA | 84,2 | 86,0 | +%2 |
Yazarın çerçevesiyle, araç kullanımını, uzun bağlam akıl yürütmeyi ve çok turlu yürütmeyi ödüllendiren her benchmark çift haneli hareket ederken, tek soruluk bilgi testleri neredeyse yerinde sayıyor. Gönderi, AIME26 ve GPQA'daki durağanlığı doyuma bağlıyor: sırasıyla 91 ve 84 puanda bu formatlarda pek fazla gelişme payı kalmamış durumda. Buna karşılık Terminal-Bench 2.0 ve QwenWebBench uzun ufuklu davranışı puanlıyor — bir shell hatasından kurtulmak, CSS sınıflarını doğru bileşenlere bağlamak, bir planda durmak yerine görevi bitirmek — ve gerçek bir yetenek farkının hâlâ ortaya çıkabileceği yer tam olarak burası.
Hiçbir şeyi ayırmayan bir sağlama testi
İddiaları yerel donanımda test etmek için yazar, her iki modele kişisel yedi soruluk standart setini uyguladı. İkisi de 7/7 aldı ve yan yana karşılaştırmada Qwen3.5 çoğu kez daha kapsamlı yanıt veren taraftaydı; örneğin bir başkentler sorusunda ve bir WebRTC açıklamasında. Set, AIME ile aynı şekilde doygun durumda: iki model de her şeyi doğru yanıtladığında, koşudan koşuya örnekleme gürültüsü nesiller arası farkı yutuyor. Her iki modelin hâlâ başarısız olabileceği görevler — uzun agent izleri, bilinmeyen repository'ler, bir şartnameye göre kurulmuş frontend düzenleri — Qwen3.6'nın avantajlarının ortaya çıkacağı yerler.
Yerel çalıştıranlar için pratik okuma
Gönderiden iki çıkarım:
- Token'lar için upgrade yapmayın. Aynı 12 GB VRAM bütçesi ve aynı MoE-offload yapılandırmasıyla saniyedeki token sayısı değişmiyor; dolayısıyla bir throughput darboğazı hiçbir şey kazanmıyor.
- Modeli bir repository'ye teslim etmek üzereyseniz upgrade yapın. Frontend üretiminde +%43 ve Terminal-Bench'te +%27, coding-agent, IDE-plugin ve CLI-agent iş yükleri için asıl önemli sayılar bunlar.
Gönderi ayrıca modelin 2026-04-15'te Apache 2.0 ile yayımlandığını, Qwen3.5 ile aynı mimariye, toplam 35B içinden aynı 3B aktifleşen parametreye ve aynı MoE routing örüntüsüne sahip olduğunu belirtiyor.
Neden önemli
Sonuçlar bir araya değerlendirildiğinde Qwen3.6'yı bir hız sürümü değil, yetenek sürümü olarak yeniden çerçeveliyor: yerel kullanıcıların önem verdiği donanım ayak izi değişmedi, modelin iyileşmeleri ise agent davranışında yoğunlaştı — tool-call kararlılığı, uzun bağlam ve düşünme kontrolü. İş yükünüz tek atımlık soru yanıtlama ise gönderiye göre farkı görmeyeceksiniz; bir repo'yu okuyup bir PR'ı landed etmek ise göreceksiniz. Akılda tutulması gereken uyarılar var: bu tek bir yazarın tek bir GPU'daki deneyi, manşet rakamlar Qwen'in kendi model kartından geliyor ve QwenWebBench satıcının kendi frontend benchmark'ı. Ama metodolojik ders, yerel modelleri benchmark yapan herkes için genellenebilir — anlatınız için dramatik biçimde elverişli görünen bir sayı ikinci bir ölçümü hak eder ve VRAM'i yiyen arka plan süreçleri sahte bir regresyon üretmenin sessiz bir yoludur.
- #qwen
- #llm
- #local-llm
- #benchmarks
- #open-source
İlgili yazılar
- FineTune Studio, Qwen3-1.7B'yı yaklaşık 3,2 GB VRAM ile QLoRA üzerinden fine-tune ediyor
- Gemini 3.8 Flash değişmeyen fiyatlarla, 2027'de iki katına çıkacak tarifelerle ve erişim kısıtlı bir Cyber modeliyle geldi
- SWE-Bench ProMax: en iyi model büyük çok dilli refactoring görevlerinin yalnızca yüzde 41,2'sini çözebiliyor