· kaynak dev.to (home feed)
110 açık kaynak yapay zeka kullanım ölçümleme aracının denetiminde 45'ten fazla faturalandırma hatası bulundu
110 açık kaynak yapay zeka maliyet ve token ölçümleme aracının bir ay süren denetiminde, cache muhasebesinin kullanımı yüzde 99'a kadar eksik bildirmesi de dahil olmak üzere beş tekrarlayan kalıpta 45'ten fazla doğrulanmış hata tespit edildi.

Yapay zeka ürünleri sabit aboneliklerden kullanım tabanlı ve sonuç tabanlı fiyatlandırmaya geçiyor: token başına gateway faturalandırması, premium istek kotaları, çözülen destek talebi başına ücretlendirilen destek ajanları. Bu faturalardaki her rakam bir ölçüm aracından geliyor ve dev.to'da yayınlanan bir saha raporuna göre bu ölçüm araçları sık sık yanlış sonuç veriyor.
Rapor, token sayan, maliyet takibi yapan veya bütçe uygulayan 110 açık kaynak aracın bir ay süren denetimini ele alıyor. Denetçiler beş tekrarlayan ailede 45'ten fazla hatayı doğruladı ve 23 düzeltme langfuse (yaklaşık 34.000 GitHub yıldızı) ve codeburn (yaklaşık 11.000) dahil projelere upstream olarak merge edildi. Bağımsız bir denetçi, 236 kontrollük tam uygunluk paketini baştan sona yeniden üretti ve kullanımı yüzde 99'a yakın eksik bildiren bir cache muhasebe yolunu doğruladı.
Beş tekrarlayan hata kalıbı
En yaygın kusur aynı zamanda en dramatik olmayanuydu: güncelliğini yitirmiş fiyat tabloları. Yedi araçlık bir grupta beşi, güncel olmayan ya da güncel nesil modelleri eksik oran tablolarıyla geliyordu; böylece tüm aşağı akış toplamları aylar önce gerçeği yitirmiş rakamları devralıyordu.
İkinci aile cache çarpanlarıyla ilgili. Sağlayıcılar cache okuma ve yazmalarını farklı oranlarda faturalandırıyor ve yaygın bir kısayol, tek bir sağlayıcının oranlarını herkese sabit olarak gömüyor. Bir araç, Anthropic'in cache okuma indiririmini OpenAI modellerine uyguladı ve cache okumalarını beş kat低估 düştü — her satırda makul görünen ama toplamları yanlış olan bir hata.
Üçüncüsü, akış toplamalarında retry çift sayımı. Bir streaming isteği bayt bayt yeniden denendiğinde bazı toplayıcılar iki denemeyi birden sayıyor. 604 yeniden yayınlanmış olaylık bir genel veri setinde olayların yüzde 46'sı bayt düzeyinde aynıydı ve basit toplama bunları iki kez saydı. Aşırı agresif şekilde tekilleştiren araçlar ters hatayı yapıp gerçekten yeniden denenen işi gözden kaçırıyor; iki yön de birinin parasına mal oluyor.
Dördüncüsü, yok sayılan kullanım alanlarının sıfır kabul edilmesi. Eksik bir değer sessizce ücretsiz hale geliyor — savunmacı görünen ama yetkisiz indirim gibi davranan kod. Denetçilere göre çözüm sözdizimsel değil anlamsal: eksik veri eksik kalmalı ve özetler, sıfır döndürmek yerine bir rakamın kanıtlanamadığını söyleyebilmeli.
Beşincisi, pencere sınırı hataları. Duvar saatine sabitlenmiş kota pencereleri, mutlak tarihlere sabitlenmiş test verileriyle birleşince haftalarca testlerde tutabilir ve sonra her yerde aynı anda bozulabilir — denetim ekibinin kendi CI'sında da karşılaştığını söylediği bir hata modu.
Bağımsız kontroller ve merge edilen düzeltmeler
Ayrı çalışan harici bir denetçi 236 uygunluk kontrolünün tamamını yeniden üretti, ardından ticari bir sağlayıcının cache muhasebesinin nicelleştirilmiş bir denetimini katkı olarak sundu: belirli bir commit'e bağlı olarak, etkilenen yollarda kullanımı yüzde 98,9 ve yüzde 95,1 eksik bildiren dört başarısız kod yolu. O rapor artık denetimin kanıt ağacında isim verilen katkıyla yer alıyor. Upstream'de merge edilen 23 düzeltme fiyat tablosu güncellemeleri, sağlayıcı başına cache çarpanları, regresyon verileriyle retry-birleştirme korumaları ve açık eksik-versus-sıfır semantiğini kapsıyor. Gönderiye göre hiçbiri saldırgan bir keşif değilti; her biri, bakımcının sorunu zaten tartıştığı bir başlıkta başladı.
Hiçbir sağlayıcı düzeltme süreci yayınlamıyor
Denetim ayrıca 20 ticari sağlayıcıyı tek bir şey için inceledi: ölçüm aracı yanlış olduğunda ne olacağına dair yayınlanmış bir süreç — bir itiraz yolu, bir düzeltme politikası, herhangi bir şey. Hiçbirinde yoktu. Bir sağlayıcı ölçüm aracını işletir, kendi doğruluğunu değerlendirir ve hiçbir düzeltme prosedürü yayınlamazsa, müşteriler yalnızca sağlayıcının sözüne güvenmek zorunda kalıyor. Gönderi iki asgari standart öneriyor: isimlendirilmiş bir itiraz yolu ve makine tarafından doğrulanabilir faturalandırma beyanları. Denetçilerin, AMS-1 adını verdikleri bir mutabakat belirtimi etrafında kurulan uygunluk paketi MIT lisansıyla açık kaynak; dışa aktarılmış kullanım verileri üzerinde yerel olarak çalışıyor, mantıksal işlemleri fiziksel denemelerden, cache okumalarını cache yazmalarından ve eksik değerleri sıfırdan ayırıyor, her kararı isimlendirilmiş bir kurala izlenebilir şekilde bağlıyor.
Neden önemli
Yapay zeka fiyatlendirmesi token başına, istek başına ve sonuç başına modellere kayarken ölçüm aracı fiilen faturanın kendisi haline geliyor. Bu denetim, hataların sıradan mühendislik sorunları olduğunu — güncelliğini yitirmiş referans veriler, kopyala-yapıştır sabitler, eksik değerlerin belirsiz işlenmesi — gösteriyor ve bunların düzinelerce bağımsız araçta tekrarlandığını ortaya koyuyor. Sağlayıcı aynı zamanda ölçüm aracını işletiyor ve hiçbir düzeltme süreci yayınlamıyorsa, müşterilerin ne için ödeme yaptıklarını doğrulama yolu olmuyor. Yerel bir uygunluk denetleyicisi, önerilen itiraz yolu ve makine tarafından doğrulanabilir faturalandırma beyanı standartlarıyla birlikte basit bir teste işaret ediyor: faturadaki bir rakam bağımsız bir yeniden sayımdan sağ çıkabilmeli; çıkamazsa müşteri bunu kanıtlayabilmeli.
- #ai
- #billing
- #open-source
- #developer-tools
- #llm