deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (native)

Fireworks Research, reasoning tokenlerini %40 azaltan Kimi K3 türevi Ember-1'i duyurdu

Fireworks Research, Kimi K3 üzerinde eğitilmiş özel bir model olan Ember-1'in, temel modelin benchmark ve üretim performansıyla eşleşirken yaklaşık %40 daha az token ürettiğini söylüyor.

Fireworks Research, reasoning tokenlerini %40 azaltan Kimi K3 türevi Ember-1'i duyurdu

Fireworks ne duyurdu

Fireworks Research, Kimi K3 üzerine inşa edilmiş, şirkete göre temel modelin kalitesini yaklaşık %40 daha az token üreterek sunan özel bir model olan Ember-1'i yayımladı. Hacker News'in ana sayfasında yer bulan duyuru, Ember-1'i Fireworks Research ekibinin planladığı özel model serisinin ilki olarak konumlandırıyor; ilerideki modeller geliştirici talebine göre şekillenecek. Model, şu anda orijinal Kimi K3'ün yanında bir serving seçeneği olarak kullanıma sunuluyor.

Çok fazla düşünmenin bedeli

Fireworks'a göre Kimi K3 gibi reasoning modelleri, ürettiği tokenlerin %90'ından fazlasını cevabın kendisi yerine içsel chain-of-thought için harcayabiliyor. Bu yük tek bir istekte pahalıdır ama çok turlu agentic iş yüklerinde katlanarak büyür: her turda önceki akıl yürütme modele yeniden sunulur, böylece context tur sayısıyla kabaca kuadratik biçimde büyür ve erken turlardan gelen uzun izler sonraki her çağrıda yeniden okunup yeniden faturalandırılır.

Şirkete göre bariz çare — K3'ün reasoning-effort ayarını düşürmek — işe yaramadı, çünkü düşük efor çok fazla kaliteden vazgeçmek anlamına geliyordu. Fireworks'un deneyleri bunun yerine, K3'ün akıl yürütmesinin görevlerin gerçekte gerektirdiğinden çok daha uzun olduğunu ve cevabı değiştirmeden fazlalığın budanabileceğini, ancak modelin yalnızca daha az düşünmesi söylenmek yerine verimli akıl yürütmesi için eğitilmesi gerektiğini ortaya koydu.

Nasıl inşa edildi

Bunun için 50'den fazla eğitim deneyi, 200'ü aşan değerlendirme ve doğruluktan ödün vermeden akıl yürütmeden kısaltmayı hedefleyen yeni eğitim algoritmaları gerekti. Tümü, şirkete göre ekibin GPU provisioning veya yönetimi olmadan deney başlatmasını sağlayan Fireworks'un Serverless Training platformunda yürütüldü. Eğitim verisi matematiği, kodlamayı, talimat takibini, konuşmayı, aramayı, araç kullanımını ve yazılım mühendisliğini kapsıyordu; hem tek başına problemleri hem de uzun etkileşimleri içeriyordu. Fireworks, yaklaşımın yararlı öz-düşünmeyi — bir varsayımı yeniden gözden geçirmeyi ya da bir sonucu daha önceki bir karara kadar izlemeyi — kasıtlı olarak koruduğunu, üretken olmayan akıl yürütme döngülerini kestiğini ve öğrenilen davranışın başarısız denemelerde de token kullanımını dizginlediğini söylüyor.

Benchmark'lar ve fiyat matematiği

Fireworks, Ember-1'i ebeveyn modeliyle karşılaştırdı ve maliyeti K3'ün kamu API fiyatlandırmasından hesapladı: milyon başına 3 dolar önbelleğe alınmamış girdi tokeni, 0,30 dolar önbelleğe alınmış ve 15 dolar çıktı. Bildirilen sektör sonuçları:

  • Terminal Bench 2.1: Ember-1, maksimum efordaki K3'ün 80,9%'una karşılık 82,0% skor aldı, maliyet %51,9 daha düşük
  • SWE-bench Verified: 92,2%'ye karşı 93,2%, %15,5 daha ucuz
  • DeepSWE 1.1: 75,2%'ye karşı 66,4%, %23,7 daha ucuz — kalitede de maliyette de önde
  • SWE-Interact (7 örnek): 20,0%'ye karşı 21,3%, %32,5 daha ucuz
  • τ-2 Bench Airline: 66'ya karşı 64, %5,9 daha ucuz

50'den fazla test örneği olan her benchmark'ta şirket, Ember-1'in kalite-maliyet Pareto sınırında ya da ona yakın durduğunu, maliyetin çok küçük bir bölümüyle maksimum efordaki K3 ile eşleştiğini ve düşük efor ayarını kesin olarak domine ettiğini iddia ediyor. Fireworks ayrıca modeli GPT-6 Astra, Claude Opus-5 ve GLM 5.3 ile karşılaştırdı ve aynı sınırda önde olduğunu söylüyor. Fireworks'un aynı hafta tanıttığı Specialized Intelligence Index'in parçası olan, hekimler tarafından doğrulanmış 500 klinik vakadan oluşan Doximity'nin Bedside Bench'inde şirket, GPT-5.6 Sol, GPT-6 Astra ve Claude Opus 5 dahil modellere karşı yeni bir görev başına maliyet sınırı bildiriyor.

Üretim trafiği

Benchmark'lar bir yana, Fireworks iki müşteriyle üretim kodlama iş yüklerinde canlı A/B testleri yürüttü ve karşılaştırılabilir kalitede görev başına kabaca %35 daha az token bildirdi; görev tamamlama, başarı skorları ve hata oranları yerinde kaldı ya da iyileşti. Bir müşteri Ember-1'i şu anda canlı üretime taşıdı ve temel modeli tamamen replaced edene kadar ölçeklemeyi planlıyor. Fireworks dahili olarak modeli kendi geliştiricilerinin günlük kodlama araçlarına yerleştirdi ve kimsenin değişikliği fark etmediğini, buna karşılık reasoning tokenlerinin %71,3, toplam tokenlerin %39 düştüğünü söylüyor. Yedi benchmark ve iki müşterinin trafiği genelinde şirket, doğruluktan ödün vermeden K3'ün akıl yürütmesinin %35–50 kısaltılabildiğini belirtiyor.

Neden önemli

Reasoning modelleri ölçekte çalıştıran ekipler için token harcaması — yetenek değil — giderek asıl kısıt haline geliyor; özellikle akıl yürütmenin her turda yeniden oynatıldığı agentic boru hatlarında. Ember-1 bu maliyete model düzeyinde bir yanıt: prompt hilelerine ya da bir efor kadranına dayanmak yerine verimliliği doğrudan ağırlıklara işliyor ve gerçek üretim trafiğindeki A/B sonuçları hikayenin daha inandırıcı kısmı. Ayrıca başka inference sağlayıcılarının kopyalayabileceği bir ürün kategorisini — güçlü temel modellerin maliyete göre ayarlanmış özel türevleri — taslaklıyor. Akılda tutulması gereken iki uyarı var: buradaki her sayı bağımsız bir değerlendirme değil, Fireworks'un kendi duyurusundan geliyor; ayrıca model şirketin Serverless Training işi için bir vitrin görevi de görüyor. Dış benchmark'lar iddiaları doğrularsa, alıcılar için pratik çıkarım şu: Kimi K3'ü çalıştırmanın en ucuz yolu, onun bir türevini çalıştırmak olabilir.

  • #ai
  • #llm
  • #inference-costs
  • #kimi-k3
  • #fireworks

İlgili yazılar