· kaynak dev.to (home feed)
Qwen3 4B, yazım düzeltmede Qwen2.5 7B ile aynı başarıyı yarı cold-start süresiyle gösterdi
dev.to üzerinde yayımlanan, 60 yerel Ollama yanıtını kapsayan bir benchmark, Qwen3 4B'nin tüm yazım düzeltme vakalarında Qwen2.5 7B ile eşit sonuç verirken cold-start süresinin yarısından kısa sürdüğünü ortaya koydu.

dev.to'da yayımlanan uygulamalı bir benchmark, yerel olarak barındırılan üç Qwen modelini aynı yazım düzeltme iş yükünden geçirdi ve daha küçük, daha yeni Qwen3 4B'nin her vakada daha büyük Qwen2.5 7B ile aynı tempoyu korurken, test edilen Windows kurulumunda cold-start süresinin yarısından kısa bir sürede yanıt verdiğini buldu.
Test nasıl yapıldı
linguapilot-ai adıyla paylaşım yapan yazar, 20 eşleştirilmiş yazım vakası kullandı: 16 tanesi beklenen hataları içeren cümle, 4 tanesi ise zaten doğru olan kontrol cümleleriydi. Her vaka, Windows üzerinde Ollama ile yerel olarak barındırılan üç modelden — qwen2.5:7b ile qwen3:4b ve qwen3:8b'nin quantize edilmiş q4_K_M build'leri — geçti; toplam 60 yerel yanıt, değiştirilmemiş bir referans ve tek bir değerlendirme çerçevesi kullanılarak yargılandı.
Çerçeve birkaç boyutu bağımsız olarak puanladı: beklenen hataların tamamen düzeltilip düzeltilmediği, düzeltme kapsamı, hata bölgelerinin yerelleştirilmesi, özgün bilgilerin korunması, istenen çıktı yapısına uyum, açıklama dili davranışı ve cold-start yürütme süresi. Bir vaka yalnızca tüm beklenen düzeltmelerin, yanlış bir değişiklik, var olmayan bir hata veya yapılandırılmış bilgi kaybı olmadan uygulanması halinde tam sayıldı.
Deney, daha önce Qwen3 4B, 8B ve 14B'yı karşılaştıran bir turu izliyor; o turda iki daha büyük model de 20 vakanın 19'una ulaşmıştı.
Düzeltme sonuçları
Temel metrikte iki öne çıkan model ayırt edilemedi. Qwen3 4B ve Qwen2.5 7B'nin her ikisi de 20 vakanın 18'ini tamamladı (%90) ve daha çarpıcı olanı, tam olarak aynı 18 vakada başarılı olup aynı 2 vakada başarısız oldular. Aralarında farklı sonuç üreten tek bir eşleştirilmiş vaka bile yoktu.
Qwen3 8B, 19/20 (%95) ile öne geçti ve bu üstünlük ikincil ölçümlere de taşındı. 21 beklenen hata bölgesinin tamamını yanlış pozitif olmadan yerelleştirerek %100 F1 elde ederken, Qwen3 4B ve Qwen2.5 7B her biri 21 bölgenin 20'sini yerelleştirdi (%97,6 F1). Beklenen düzeltme kapsamı da aynı örüntüyü izledi: 4B ve 7B modeller için 19/21 (%90,5), 8B için ise 20/21 (%95,2).
Hız ve açıklama davranışı
Farkın açıldığı yer zamanlama oldu. Test edilen cold-start yapılandırmasında Qwen3 4B yanıt başına ortalama 23,99 saniye sürerken, Qwen2.5 7B için bu süre 54,37 saniye ve Qwen3 8B için 60,24 saniyeydi. Bu, 4B modeli yaklaşık 2,27 kat — yaklaşık %56 daha hızlı — yaparken, 7B ile 8B birbirine çok daha yakındı; Qwen2.5 7B, Qwen3 8B'den yaklaşık %9,7 daha hızlıydı.
Açıklama kalitesi, eski modeli öne çıkaran tek net farkı üretti. Benchmark'a göre Qwen2.5 7B değerlendirilen 40 açıklama dili alanının tamamını, Qwen3 8B ise 41'in tamamını geçti; buna karşılık Qwen3 4B 3 uyarıyla birlikte 37 geçiş kaydetti. Üçü de ayrıştırılabilir JSON üretmeye devam etti, her vakada çıktı sözleşmesine uydu, tüm 20 vakada bilgi koruma kontrolünü geçti ve hata içeren 16 cümlede tutarlı eylem-açıklama çiftleri üretti.
Neden önemli
Yerel bir yazım asistanı kurmak isteyen herkes için bu sonuç, model seçimini basit bir boyut yarışından çıkarıp birkaç ölçüt arasındaki bir dengeye dönüştürüyor. Daha yeni bir 4B model, her vakada önceki nesil bir 7B model ile aynı düzeltme sonucunu, ölçülen cold-start gecikmesinin kabaca yarısı kadar bir sürede elde etti — bellek ve yanıt süresinin belirleyici kısıtlar olduğu tüketici donanımında anlamlı bir fark.
Seçim yalnızca hızla ilgili değil. Qwen2.5 7B daha temiz bir açıklama dili davranışı gösterdi ve Qwen3 8B, bir ek tam vaka, bir ek beklenen düzeltme ve tam hata yerelleştirmesi karşılığında üçü arasında en yavaş cold-start süresini kabul etti. Gecikmeye, kapsama veya açıklama disiplinine değer veren bir uygulama gayet makul biçimde farklı bir kazanan ilan edebilirdi.
Uyarılar
Yazar kapsam konusunda açık. Yirmi eşleştirilmiş vaka odaklı bir set; evrensel bir sıralamayı desteklemek için çok küçük ve zamanlamalar genel bir hız sıralaması değil, tek bir yapılandırmayı — Windows üzerinde Ollama, cold-start çalıştırmaları — tanımlıyor. Ayrıca görev dar kapsamlı: İngilizce cümleleri Fransızca açıklamalarla düzeltmek; bu nedenle diğer diller ve görev türleri farklı davranabilir. Otomatik kontroller çıktı disiplinini ve tutarlılığı ölçüyor; daha derin pedagojik kaliteyi değil — o ek dilbilimsel veya insan değerlendirmesi gerektirirdi.
- #qwen
- #ollama
- #local-llm
- #benchmark
- #ai-models