deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (hnrss.org)

StartLux 27B modeli CAICT MCP testinde ikinci oldu, DeepSeek-V4-Pro'un 1,3 puan gerisinde

Çinli girişim StartLux'un ilk modeli, Qwen3.6-27B üzerine inşa edilmiş 27B parametreli bir yerel agent olan model, CAICT'in MCP kıyaslamasında ikinci sırada yer aldı — 1,6 trilyon parametreli DeepSeek-V4-Pro amiral gemisinin 1,3 puan gerisinde.

StartLux 27B modeli CAICT MCP testinde ikinci oldu, DeepSeek-V4-Pro'un 1,3 puan gerisinde

Çin'in model yarışında 27B'lik kara at

Daha önce Yuandian Xinghui adıyla bilinen StartLux adlı yeni bir Çin girişimi, büyük model sektörüne iddialı bir giriş yaptı. Şirketin ilk sürümü StartLux-V1.0-27B-Preview, 3 Eylül 2026'da Hacker News'in ana sayfasına ulaşan bir chinaonchina.com haberine göre, Çin Bilgi ve İletişim Teknolojileri Akademisi'nin (CAICT) güvenilir yapay zeka MCP kıyaslamasında genel olarak ikinci sırayı aldı. Önündeki tek sistem, yaklaşık 60 kat daha büyük, 1,6 trilyon parametreli bir bulut amiral gemisi olan DeepSeek-V4-Pro'du ve aralarındaki fark 1,3 puandı.

Model bir yerel agent olarak konumlandırıldı: Bulut gerektirmeden doğrudan tüketici sınıfı bilgisayarlarda çalışıyor ve bu durum şirketin vaadinin merkezinde yer alıyor.

Kıyaslama neyi ölçüyor

CAICT'in MCP özel kalemi (raporda MCP-Universe olarak da geçiyor), gerçek uygulama senaryoları etrafında altı görev kategorisi belirliyor: konum navigasyonu, web araması, tarayıcı otomasyonu, finansal analiz, kod deposu yönetimi ve 3D tasarım. Bunun üzerine, bir agent'ın birden fazla aracı nasıl koordine ettiği, karmaşık görevleri nasıl yürüttüğü ve gerçek dünya ortamlarıyla nasıl etkileşime girdiği değerlendiren kapsamlı bir değerlendirme oturuyor. Raporun çerçevesi, testin bir modeli verdiği yanıtlara göre değil, işleri gerçekten tamamlayıp tamamlayamadığına göre notlandırdığı yönünde.

StartLux-V1.0-27B-Preview genel olarak %39,25 puan aldı. DeepSeek-V4-Flash-0731 (284 milyardan fazla parametre) ve Step-3.7-Flash (198 milyar) da rapora göre liderin hemen ardından, aynı 1,3 puanlık bantta yer aldı. Eşit ölçekte StartLux, Alibaba'nın Qwen 3.6'sını 5,34 puan geride bıraktı ve üç alt kategoride — konum navigasyonu, finansal analiz ve tarayıcı otomasyonu — birinci oldu.

Claude Sonnet 4.6 ile baş başa karşılaştırma

Rapor, sonuçları Anthropic'in Claude Sonnet 4.6'ya karşı iki karşılaştırmayla somutlaştırıyor.

İki yıllık Microsoft hissesi yatırım hesaplamasında Claude 47.254 dolar ve %89,02 üretirken, StartLux 47.499,09 dolar ve %90,00 üretti. Akıl yürütme izlerinin incelenmesiyle ortaya çıkan fark, veri işlemeye dayanıyordu: Ham veri eksik olduğunda Claude, 8 Ocak 2025'i işlem yapılmayan bir gün olarak ele aldı ve önceki günün kapanış fiyatını kullandı; StartLux ise özgün verilere geri döndü, hedef tarihteki piyasa hareketlerini doğruladı, doğru kapanış fiyatını teyit etti ve ancak o zaman hesaplamayı tamamlayıp bir görselleştirme üretti. Rapor, finans alanında küçük farklılıkların büyük kayıplara yol açabileceğine dikkat çekiyor.

İkinci görev, tarayıcıda gerçek zamanlı olarak yapılan bir uçuş aramasıydı. StartLux görevi yaklaşık 95 saniyede tamamladı ve 12 adımda 299 dolarlık bir Air China bileti buldu. Claude Sonnet 4.6 ise tarih seçimi, açılır pencereleri kapatma ve filtre menüleri için ekran görüntüsü doğrulamalarına ihtiyaç duydu — bir noktada yanlışlıkla zaman filtresi panelini açtı — ve 200 saniyeden fazla süre ile 21 adım sonunda en düşük 556 dolarlık bir teklif döndürdü.

Qwen üzerine post-training

StartLux-V1.0-27B-Preview sıfırdan eğitilmedi. Qwen3.6-27B üzerine inşa edildi ve rapor, puan farkını görev odaklı eğitim verisi ile görev anlayışını, araç seçimini, parametre oluşturmayı, çok adımlı yürütmeyi, durum kontrolünü ve sonuç doğrulamasını pekiştiren otomatik post-training'e bağlıyor. Uygulamada model, yalnızca hangi metni çıktı olarak vereceğini değil, hangi araca ne zaman başvuracağını, bir araç hata döndürdüğünde nasıl ayar yapacağını ve bir görevin ne zaman tamamlanmış sayılabileceğini de öğreniyor.

Ekip, modelin gerçek bir araç ortamında özerk biçimde görevler yürüttüğü ve ortam geri bildirimine dayanarak stratejisini sürekli ayarladığı — bir yapay zekanın yapay zeka eğittiği bir döngü — çok boyutlu, doğrulanabilir ve ölçeklenebilir bir yineleme yöntemi olan Auto Research'ü bağımsız olarak geliştirdiklerini söylüyor. Şirket, post-training'i bu şekilde tamamlayan ülkenin ilk yerel agent modeli olduğunu iddia ediyor.

Chen Danian'ın dönüşü

Kurucu ve CEO Chen Danian (makale adını tutarsız biçimde Chen Danyan ve Chen Dawei olarak da yazıyor), Shanda Network'ün kurucu ortaklarından, Lian Sheng Network'ün başı ve shareware kavramını Çin'e tanıtan ilk programcılardan biri olarak tanımlanıyor. Sektörden yaklaşık on yıl uzak kaldıktan sonra yerel modellere oynayarak geri döndü.

Shanda Innovation Institute'ün 18. yıl dönümü buluşmasında, yapay zeka çağı için sekiz ortak olmayan görüş olarak adlandırdığı fikirleri sundu; bunların dördü yerel modeller merkezli — yerel modellerin üç yıl içinde Claude'a yetişeceği, pazarın %80'ini ele geçireceği ve parametre sayısı yarışını anlamsız kılacağı öngörüsü de dahil. Ölçeklendirme konusunda Scaling Law'ı geçici bir periye benzetti: Onsuz yapay zeka havalanamaz, ama geleceği mutlaka ona bağlı değil.

Neden önemli

Sayılar tutarlıysa, bu sonuç agent yeteneğinin mutlaka parametrelerle satın alınması gerektiği varsayımına karşı güçlü bir veri noktası. Açık bir temelden ince ayarlanıp agent odaklı post-training uygulanmış bir 27B model, gerçek görev tamamlamayı puanlayan bir kıyaslamada trilyon ölçeğindeki bir amiral gemisinin 1,3 puanına ulaştı — ve üzerine inşa edildiği modeli beş puandan fazla geride bıraktı. Bu, maliyet, gizlilik ve çevrimdışı kullanım açısından önemli, çünkü yerel yürütme bulut bağımlılığını tamamen ortadan kaldırıyor; ayrıca DeepSeek, Qwen ve Step'in referans noktaları olduğu Çin'in iç pazarındaki yarışı yeniden kızıştırıyor. Uyarılar geçerli: Bu bir preview sürümü, tek bir kıyaslama ve tek bir rapor; CAICT puanları ve Claude karşılaştırmaları burada bağımsız olarak doğrulanmadı.

  • #ai
  • #benchmarks
  • #local-models
  • #china
  • #startlux

İlgili yazılar