· kaynak dev.to (home feed)
10.000 AWS Lambda üzerinde quantize Llama 3.2, 160 dolara bir milyon yapay zeka bülteni üretiyor
Bir dev.to yazısı, bir milyon kişiselleştirilmiş yapay zeka bültenini yaklaşık beş dakikada ve Lambda compute maliyetiyle kabaca 160 dolara üreten bir scatter-gather AWS hattının maliyetini hesaplıyor; günlük 10.000 dolarlık yönetilen API faturasıyla karşılaştırınca fark çarpıcı.

Birim ekonomisi sorunu
Dhananjay Lakkawar'ın bir dev.to yazısında ortaya koyduğu senaryo şöyle: bir milyon ücretsiz katman kullanıcısı olan bir tüketici uygulaması, her sabah 08.00'de her gelen kutusunda kişiselleştirilmiş bir günlük bülten istiyor. Bu hacmi OpenAI, Anthropic veya Amazon Bedrock gibi yönetilen bir API üzerinden çalıştırırsanız, yazıya göre iki şey ters gider. Birincisi, dakikadaki token limitleri bir milyon senkron isteği saatlerce sürecek yeniden deneme denemelerine ve üstel geri çekilmeye zorlar. İkincisi, prompt başına 0,01 dolarla yalnızca çıkarım maliyeti her sabah 10.000 dolardır. Çıkarım şu: ücretsiz katman üretken yapay zekası, maliyet doğrusal ölçeklendiğinde ve verim başkasının hız limitlerine bağlı olduğunda çöker.
Yedi hizmetli Lambda sürüsü
Önerilen alternatif, izole, yüksek hacimli toplu işlerde harici LLM API çağrılarını bırakıp AWS Lambda'yı geçici bir çıkarım kümesine dönüştürmek; scatter-gather desenini izleyerek:
- Gecelik bir veri hattı, saat 07.50'de kullanıcı bağlamından oluşan büyük bir CSV veya JSON Lines dosyasını Amazon S3'e bırakır.
- Bir AWS Step Functions iş akışı, Distributed Map durumunu kullanarak dosyayı okur, toplu işlere böler ve 10.000'e kadar eşzamanlı Lambda yürütmesi ister.
- Amazon ECR'de saklanan Lambda container imajı, llama.cpp ile birlikte yaklaşık 2GB'a sıkışan ve Lambda'nın 10GB imaj sınırına sığan quantize bir Llama 3.2 3B modelini içerir.
- Her fonksiyon ARM64 Graviton CPU'larda 4GB RAM ile çalışır; modeli yerel belleğe yüklediği için çıkarım tamamen CPU'da gerçekleşir: ağ çağrısı yok, API gecikmesi yok, TPM limiti yok.
- Çıktı, Postgres yerine Kinesis Data Firehose'a akar; çünkü 10.000 fonksiyonun doğrudan bir veritabanına yazması bağlantı havuzlarını tüketirdi.
- AWS Glue, tamponlanan çıktıyı S3'te optimize edilmiş bir Parquet dosyasına dönüştürür ve Amazon SES bültenleri saat 08.00'de e-postayla gönderir.
Maliyet hesabı
Yazıya göre, Graviton2/3 işlemcilerde çalışan ve quantize 3B modeli llama.cpp ile yürüten 4GB'lık bir Lambda, saniyede kabaca 15-20 token üretiyor. Kısa, yaklaşık 50 tokenlık bir günlük öngörü bu nedenle kullanıcı başına yaklaşık üç saniyelik compute gerektiriyor. 10.000 eşzamanlı fonksiyonun her biri 90 saniyelik yürütmede 30 kullanıcıyı işlerken, Step Functions nüfusu yaklaşık 3,3 kez turluyor ve bir milyonun tamamını yaklaşık beş dakikada bitiriyor.
Fiyatlandırma hesabı us-east-1 ARM64 ücretlerini kullanıyor: bir milyon kullanıcının üçer saniyesi 3.000.000 compute saniyesi eder; 4GB ile bu 12.000.000 GB-saniyedir ve GB-saniye başına 0,0000133334 dolarla toplam 160 dolara ulaşıyor — 10.000 dolarlık API faturasına göre yüzde 98,4'lük bir kesinti. 15 tokenlık sınıflandırma etiketleri gibi daha kısa çıktılarda ise compute süresi o kadar düşüyor ki, yazıya göre toplam 48 dolara yaklaşıyor. Bu aritmetik yalnızca Lambda compute'u kapsıyor; hattaki çevre hizmetler ayrıca fiyatlandırılıyor.
Kopyalamadan önceki kısıtlar
Yazı, tasarımı şekillendiren üç sert sınıra dikkat çekiyor:
- Eşzamanlılık kotaları: yeni bir AWS hesabı bölge başına varsayılan olarak 1.000 eşzamanlı yürütmeye izin veriyor; dolayısıyla 10.000 fonksiyonluk bir sürüye ulaşmak için kota artışı isteyen bir destek talebi gerekiyor — yazıya göre AWS bunu gerçek toplu iş yükleri için onaylamaya eğilimli.
- Cold start'lar: 2GB'lık bir modeli RAM'e yüklemek 5-15 saniye alıyor. Bu, kullanıcıların uyuduğu asenkron gece işi için önemsiz; ama yazı bu mimariyi gerçek zamanlı bir sohbet botu için yeniden kullanmaya karşı uyarıyor.
- Model tavanı: bu kurulum yalnızca 3B-8B parametreli açık kaynak modellere uyuyor. Bunlar özetleme, varlık çıkarma ve temel kişiselleştirmeyi iyi yönetiyor; ancak yazı, zorlu akıl yürütme görevlerinde başarısız olacakları konusunda net ve iş yükünün modele uyması gerekiyor.
Neden önemli
Yazı, üretken yapay zekanın sınır modeller sunan bir sağlayıcıya token başına ücret ödemeyi gerektirdiği varsayımına fiyatlandırılmış bir karşı argüman. Özetler, etiketleme, sınıflandırma ve hafif kişiselleştirme dahil birçok tüketici yapay zeka özelliği sınır zekâsına muhtaç değil ve bu mimari, bunları sonrasında sıfıra ölçeklenen compute üzerinde zamanlanmış toplu işler olarak çalıştırmanın somut bir yolunu gösteriyor. Ücretsiz katmanı her aktif kullanıcıyı zarara çeviren ürün ekipleri için, günlük 10.000 dolar ile kabaca 160 dolar arasındaki fark, gemiye çıkamayan bir özellik ile çıkabilen özellik arasındaki fark. Takas açık: çok daha küçük bir model ve toplu iş şeklinde gecikme karşılığında emtia fiyatlı çıkarım — bu, sabah bültenleri için çalışır ama etkileşimli kullanımı dışlar.
- #serverless
- #aws-lambda
- #batch-inference
- #llm
- #cost-optimization