deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Qwen3.6-35B-A3B, RTX 4070'de Qwen3.5 hızında çalışıyor; frontend tarafında %43'lük artış raporlandı

dev.to'da yayımlanan bir el yordamıyla test, Qwen3.6-35B-A3B ile Qwen3.5'in RTX 4070'de saniyede yaklaşık 37 token ürettiğini, model kartında ise frontend kod üretiminde %43'lük bir sıçrama bildirildiğini ortaya koyuyor.

Qwen3.6-35B-A3B, RTX 4070'de Qwen3.5 hızında çalışıyor; frontend tarafında %43'lük artış raporlandı

Aynı hız, farklı hikâye

dev.to'da yayımlanan bir karşılaştırma testi, Qwen3.6-35B-A3B'yi öncülü Qwen3.5-35B-A3B ile tüketici sınıfı bir GPU üzerinde kıyaslıyor ve üretim hızında anlamlı bir değişiklik bulmuyor — buna karşılık model kartındaki sayılar agentic ve frontend kodlama işlerinde büyük bir yetenek sıçramasına işaret ediyor.

Gönderiye göre her iki model de 12 GB VRAM'e sahip tek bir RTX 4070'de çalıştı; mixture-of-experts katmanlarını CPU'ya aktarmak için llama.cpp'nin -ngl 99 --cpu-moe seçeneği, lmstudio-community aynasındaki GGUF quantization'ları ve ölçüm için llama-bench'in tg128 metriği kullanıldı. Her biri üç koşuyla ortalanınca Qwen3.6 saniyede 38,76 ± 0,82 token, Qwen3.5 ise 36,7 ± 1,4 token üretti; yani ikisi de kabaca 1,5 tok/s'lik bir bandın içinde kaldı.

Olmayan regresyon

Yazarın ilk ölçümü çok farklı bir tablo çiziyordu: Qwen3.6 için 12 tok/s'ye karşılık Qwen3.5 için 34,6 tok/s taban değeri, bu da ciddi bir yavaşlama gibi görünüyordu. Sorunun kaynağı, 9–11 GB VRAM'i tutan başka bir süreçti; GPU'da bulunması gereken katmanları sistem RAM'ine taşmak zorunda bırakıyordu. İpucu, Qwen3.5'in de sağlama koşusunda yavaşlamasıydı — bağımsız iki model birlikte bozulduğunda, değişken modelin kendisi değildir. Sorunlu süreç sonlandırılıp test tekrarlandığında hızlar birbirine yaklaştı.

Kazançların asıl nerede olduğu

Throughput hareket etmediyse, ilginç sayılar gönderide alıntılanan Qwen3.6-35B-A3B model kartındaki benchmark tablosundan geliyor:

Benchmark Qwen3.5 Qwen3.6 Artış
Terminal-Bench 2.0 40,5 51,5 +%27
QwenWebBench (frontend üretimi) 978 1.397 +%43
SWE-bench Pro 44,6 49,5 +%11
LiveCodeBench v6 74,6 80,4 +%8
SWE-bench Verified 70,0 73,4 +%5
AIME26 91,0 92,7 +%2
GPQA 84,2 86,0 +%2

Yazarın çerçevesiyle, araç kullanımını, uzun bağlam akıl yürütmeyi ve çok turlu yürütmeyi ödüllendiren her benchmark çift haneli hareket ederken, tek soruluk bilgi testleri neredeyse yerinde sayıyor. Gönderi, AIME26 ve GPQA'daki durağanlığı doyuma bağlıyor: sırasıyla 91 ve 84 puanda bu formatlarda pek fazla gelişme payı kalmamış durumda. Buna karşılık Terminal-Bench 2.0 ve QwenWebBench uzun ufuklu davranışı puanlıyor — bir shell hatasından kurtulmak, CSS sınıflarını doğru bileşenlere bağlamak, bir planda durmak yerine görevi bitirmek — ve gerçek bir yetenek farkının hâlâ ortaya çıkabileceği yer tam olarak burası.

Hiçbir şeyi ayırmayan bir sağlama testi

İddiaları yerel donanımda test etmek için yazar, her iki modele kişisel yedi soruluk standart setini uyguladı. İkisi de 7/7 aldı ve yan yana karşılaştırmada Qwen3.5 çoğu kez daha kapsamlı yanıt veren taraftaydı; örneğin bir başkentler sorusunda ve bir WebRTC açıklamasında. Set, AIME ile aynı şekilde doygun durumda: iki model de her şeyi doğru yanıtladığında, koşudan koşuya örnekleme gürültüsü nesiller arası farkı yutuyor. Her iki modelin hâlâ başarısız olabileceği görevler — uzun agent izleri, bilinmeyen repository'ler, bir şartnameye göre kurulmuş frontend düzenleri — Qwen3.6'nın avantajlarının ortaya çıkacağı yerler.

Yerel çalıştıranlar için pratik okuma

Gönderiden iki çıkarım:

  • Token'lar için upgrade yapmayın. Aynı 12 GB VRAM bütçesi ve aynı MoE-offload yapılandırmasıyla saniyedeki token sayısı değişmiyor; dolayısıyla bir throughput darboğazı hiçbir şey kazanmıyor.
  • Modeli bir repository'ye teslim etmek üzereyseniz upgrade yapın. Frontend üretiminde +%43 ve Terminal-Bench'te +%27, coding-agent, IDE-plugin ve CLI-agent iş yükleri için asıl önemli sayılar bunlar.

Gönderi ayrıca modelin 2026-04-15'te Apache 2.0 ile yayımlandığını, Qwen3.5 ile aynı mimariye, toplam 35B içinden aynı 3B aktifleşen parametreye ve aynı MoE routing örüntüsüne sahip olduğunu belirtiyor.

Neden önemli

Sonuçlar bir araya değerlendirildiğinde Qwen3.6'yı bir hız sürümü değil, yetenek sürümü olarak yeniden çerçeveliyor: yerel kullanıcıların önem verdiği donanım ayak izi değişmedi, modelin iyileşmeleri ise agent davranışında yoğunlaştı — tool-call kararlılığı, uzun bağlam ve düşünme kontrolü. İş yükünüz tek atımlık soru yanıtlama ise gönderiye göre farkı görmeyeceksiniz; bir repo'yu okuyup bir PR'ı landed etmek ise göreceksiniz. Akılda tutulması gereken uyarılar var: bu tek bir yazarın tek bir GPU'daki deneyi, manşet rakamlar Qwen'in kendi model kartından geliyor ve QwenWebBench satıcının kendi frontend benchmark'ı. Ama metodolojik ders, yerel modelleri benchmark yapan herkes için genellenebilir — anlatınız için dra­matik biçimde elverişli görünen bir sayı ikinci bir ölçümü hak eder ve VRAM'i yiyen arka plan süreçleri sahte bir regresyon üretmenin sessiz bir yoludur.

  • #qwen
  • #llm
  • #local-llm
  • #benchmarks
  • #open-source

İlgili yazılar