· kaynak Hacker News – Front Page (native)
Açıklayıcı yazı, 'saniyede milyon token' iddialarının LLM bağlamı ve çıktı hızı için ne anlama geldiğini ayıklıyor
echohive.ai'nin geniş ölçüde paylaşılan açıklayıcı yazısı, 'saniyede bir milyon token' ifadesini dört ayrı iddiaya bölüyor — bağlam boyutu, giriş hızı, toplam veri işleme hızı ve tek ajan çıktısı — ve aralarındaki farkların neden önemli olduğunu gösteriyor.

echohive.ai tarafından yayımlanan ve Hacker News ana sayfasında öne çıkan interaktif bir açıklayıcı yazı, bir yapay zeka ajanı saniyede bir milyon token yazabilseydi gerçekte neyin değişeceğini soruyor. Yazının ana fikri şu: bu ifade belirsiz ve model hızı iddiaları çevresindeki kafa karışıklığının çoğu, dört ayrı büyüklüğün tek bir sayıya indirilmesinden kaynaklanıyor.
Tek sayı, dört anlam
Yazıya göre "saniyede bir milyon" şu anlamlara gelebilir: bağlam kapasitesi — bir modelin tek bir istekte, yanıtı da dahil, tutabildiği metin; bu bir hız değil, bir boyut; giriş işleme — bir modelin bir prompt'u ne kadar hızlı okuduğu; bu belirli bir ölçüye kadar paralelleştirilebilir ve çıktı hızından farklıdır; toplam veri işleme hızı (aggregate throughput) — bir sunum sisteminin toplamda teslim ettiği miktar; dolayısıyla her biri saniyede 100 token olan 10.000 eşzamanlı akış zaten bir milyona ulaşır; ve tek ajan çıktısı — tek bir modelin gerçekte ne kadar hızlı yazdığı; standart üretim, her token kendinden öncekilerine bağlı olduğundan doğası gereği seri yürür.
Açıklayıcı yazı, bu kavramların nasıl birbirine karıştırıldığını göstermek için Anthropic'in Claude Opus 5.5 genel bakışını kullanıyor: burada bir milyonluk token bağlam penceresi, çok daha küçük bir istek başına çıktı sınırı ve yalnızca "orta düzey" olarak tanımlanan karşılaştırmalı bir gecikme listeleniyor. Büyük bir bağlam penceresi, metnin ne kadar hızlı üretildiği hakkında hiçbir şey söylemez; ayrıca milyonluk bir token'lık yanıt tek bir isteğe zaten sığmazdı.
Yazıya göre mühendislik sayıları yükseltiyor ama bağımlılık zincirini ortadan kaldırmıyor. 2023 tarihli vLLM makalesi, servislerin çok sayıda isteği birlikte batch'leyerek büyük toplamlara nasıl ulaştığını anlatıyor; speculative decoding ise bir geçişte birden çok taslak token'ın kabul edilmesini sağlıyor — ne var ki ikisi de ikinci adımın birinci adımın sonucuna ihtiyaç duyduğu durumları ortadan kaldırmıyor. Tekrarlanmayı hak eden bir dipnot: token bir metin parçasıdır, çoğunlukla bir kelimenin parçası, dolayısıyla token sayıları kelime sayıları değildir.
Hayali kadranın satın alacağı şeyler
Sayfadaki kaydırıcı saniyede 100 ile 1.000.000 token arasında değişiyor ve örneklere dayalı hesaplamaları — ölçüm değil, hayali karşılaştırma olarak etiketlenmiş — yalnızca üretilen çıktıyı sayıyor; okuma, sıralama, araç çağrıları, testler ve insan incelemesi hariç. Yavaş uçta, 1.000 token'lık 1.000 hikaye sonu yazmak yaklaşık 2 saat 46 dakika sürüyor; hayali hızda ise yaklaşık bir saniye. Bir kredi uygulamasının 20.000 token'lık 40 taslağı iki saatten fazla süreden 0,8 saniyeye düşüyor. Her biri 300 token'lık 10.000 adayı eleştirmek sekiz saatten fazla süreden üç saniyeye iniyor ve zor bir konuşmanın 1.000 token'lık 10.000 provası bir günden fazla süreden on saniyeye düşüyor.
Her thought experiment, kadranın dokunamayacağı bir darboğazda sona eriyor. Bin tane sonu hâlâ birini seçmek için birinin zevkine ihtiyaç duyuyor. Kırk uygulama taslağının hepsi, yedi günlük teslim tarihini hiç kontrol etmeyen testlerden geçebilir. Önerilen on bin deney hâlâ saatler, günler ya da bir mevsimle ölçülen laboratuvar süresini bekliyor ve tek bir modelden çıkan fikirler tek bir kör noktayı paylaşabilir. Yanlış kişiye karşı on bin kez prova yapmak doğruluk değil, özgüven üretir.
Amdahl yasası sahne alıyor
En keskin bölüm sabit seri maliyetlerle ilgili. 800.000 token'lık uygulama grubunu alın ve yazımın ardından 60 saniyelik tek bir kontrol ekleyin. Saniyede 100 token'da iş yaklaşık 2 saat 14 dakika sürüyor; hayali milyonda ise 60,8 saniye. Yazma 10.000 kat hızlandı, ama uçtan uca iş yaklaşık 132,57 kat hızlandı ve kalan sürenin yüzde 98,7'si artık kontrol. Sabit adımı 15 dakikaya çekin, kazanç 9,88 kata düşer; 24 saate çekin, 1,09 kata düşerek neredeyse yok olur. Hızlandırmadığınız her şey kalan sürenin neredeyse tamamı olur ve açıklayıcı yazı, gerçek isteklerde çok büyük prompt'ların, araç çağrılarının ve ağ gidiş-dönüşlerinin kendi gecikmelerini eklediğini belirtmek için OpenAI'nin gecikme rehberine atıf yapıyor.
Neden önemli
Token hızı rakamları artık pazarlamada, benchmark'larda ve yorumlarda çok az tutarlılıkla ortaya çıkıyor ve bu açıklayıcı yazı onları okumak için bir kontrol listesi işlevi görüyor: iddia bağlam boyutu hakkında mı, giriş hızı hakkında mı, çok sayıda kullanıcı genelinde batch'lenmiş veri işleme hızı hakkında mı, yoksa sizin gerçekten beklediğiniz tek akış hakkında mı? İsteğinizin ne zaman biteceğini yalnızca sonuncusu belirler. Yazının daha büyük sonuçlanışı ekonomik: üretim neredeyse bedava hale geldiğinde kıt girdiler yargı ve doğrulama olur — zevk, net şartnameler, fiziksel kanıt, gerçek insanlara bağlılık — artı modelin dışında duran, insan ya da mekanik, her seri adım.
- #llm
- #inference
- #latency
- #throughput
- #ai