deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Kesilebilir GPU instance'ları on-demand fiyatın %18'ine mal oluyor, uygulayıcı hesabına göre

Bir dev.to hesabı, tek GPU'lu spot instance'ların on-demand 3,04 dolarlık oranına karşı saatte 0,55–0,70 dolar arasında çalıştığını, ayrıca %80 indirimnin ardındaki kota ve izleme tuzaklarını anlatıyor.

Kesilebilir GPU instance'ları on-demand fiyatın %18'ine mal oluyor, uygulayıcı hesabına göre

Dev üzerinde yazan bir uygulayıcı, on-demand olarak saatte 3,0421 dolar tutan tek kartlı bir instance'da GPU iş yüklerini kesilebilir kapasitede saatte 0,55 ile 0,70 dolar arasında çalıştırdığını bildiriyor — bu, on-demand fiyatın kabaca %18–20'si, yani yaklaşık %80 indirim demek.

Yazara göre Rémi Etien, GPU indirimleri AWS'nin duyurduğu aralığın ( %90'a kadar indirim) tepesine yakın seyrediyor; oysa yaygın kanı, gerçek tasarrufun pazarlama rakamının çok altında kaldığı yönünde. Yayınlanan rehberlerin çoğu CPU filolarıyla ilgilidir ve orada %55–75 indirim tipiktir; GPU'lar istisna.

Fiyat verileri

Yazı, tek bir öğleden sonra üç bölgede yapılan bir fiyat araştırmasını içeriyor:

Instance On-demand (saatlik) Kesilebilir (saatlik) On-demand payı
Tek kart, en iyi zone $3.0421 $0.5503 %18
Tek kart, yazarın zone'u $3.0421 $0.5996 %20
İki kart, en iyi zone $7.1283 $1.2721 %18
Tek kart, üçüncü bölge $3.0421 $1.4175 %47

İki örüntü dikkat çekiyor. On-demand fiyatlama bölgeler arasında aynıyken kesilebilir fiyatlama öyle değil: bir bölgedeki availability zone'lar arasındaki fark bir vakada %27, başka bir vakada %1,2'ydi. Dolayısıyla zone seçimi bölge seçiminden daha önemli ve yararlı soru şu: bu hafta hangi zone ucuz?

İndirimin bedeli

Hesap, artan önem sırasıyla üç kısıt listeliyor. Birincisi, instance'lar iki dakikalık bildirimle geri alınabilir — tanıdık bir durum ve üçünün en çok mühendislikle çözülebileni. İkincisi, en ucuz zone aynı zamanda AWS'nin kullanılabilir kapasite açısından en düşük derecelendirdiği zone'du; yazar, bu zone'un iş yükünü bir kez düşürdüğünü ve saatte birkaç sentlik tasarrufu bir kesintiye dönüştürdüğünü yazıyor. Üçüncüsü ve en az konuşulanı: kesilebilir GPU kapasitesi bir vCPU kotasıyla sınırlı. Yazarın limiti 64 vCPU ve kontrol edilen her bölgede 64; yani taşınmak işe yaramıyor. 128'e çıkarılma talebi aynı gün kısmen onaylandı ve bu eşiğin ötesindeki artırımlar self-servisten kaldırıldı; artık yalnızca bir hesap ekibi üzerinden ulaşılabilen bir inceleme gerektiriyorlar.

Kota mimariyi yeniden şekillendiriyor: iki kartlı bir instance 48 vCPU kullanıyor ve ikisi 96 gerektiriyor, arada bir basamak bırakmıyor. Yazar, ölçeklendirmeyi kapasiteyi artımlı eklemek yerine sabit bir şekil seçip ona sığmak olarak tanımlıyor. On-demand GPU kotaları ayrı belirleniyor ve bu hesapta bölgelere göre geniş biçimde değişiyordu — 64, 16 ve 8 vCPU — dolayısıyla geri dönüş yolu ana yoldan çok daha dar, ayrıca başka bir yerde olabilir.

Bu anlaşmayı kim kabul etmeli

Durdurulup devam edilebilen iş yükleri — checkpoint'li eğitim koşuları, çevrimdışı render, değerlendirme taramaları, veri hazırlama — yazara göre bir retry'dan fazlasını gerektirmeden kesilebilir kapasiteye uyuyor. Bekleyen bir kullanıcısı olan canlı oturumlar da yararlanabilir, ama o zaman tasarruf, kesintileri saklayan mühendisliği finanse etmelidir.

Anlatıldığı şekliyle bu mühendisliğin dört parçası var: belirli bir makineyi veya zone'u değil, sağlıklı slot sayısını hedefleyen bir controller; iki kartlı instance'dan tek kartlı instance'lara, oradan geçici ve bilinçli olarak pahalı bir on-demand köprüsüne uzanan bir geri dönüş merdiveni; zone'lar arasındaki sapmayı işaretleyen bir fiyat izleyici; ve yazarın daha agresif yapılmasına karşı uyardığı, 30, 60 ve 120 dakikalık bir backoff takvimi — çünkü kapasite kıtlığı sırasında hevesli retry'lar süreyi uzatıyor. On-demand fiyatlar her yerde aynı olduğu için köprü, birincil bölgede değil, on-demand kotanın olduğu yerde çalışmalı. Gerçek bir öğle saati kesintisi sırasında bu kurulum, makineyi değiştirdi, slotları geri getirdi ve adresi yaklaşık yarım saatte, insan müdahalesi olmadan yeniden ekledi.

Sessiz başarısızlık biçimleri

En öğretici bölüm, sistemin başarısız olurken başarı bildirdiği üç hatayla ilgili. Bir fiyat izleyici bölgeleri karşılaştırdı ama bir bölgedeki zone'ları değil; bu yüzden komşusundan ayda yaklaşık 91 dolar pahalıya çalışan bir zone aylarca işaretlenmedi ve uyarı yeşil kaldı. Bir uyarı topic'ine abone yoktu, yani olaylar kimseye iletilmedi — bu durum, memnun abonelerden ayırt edilemez. Ve bilinçli değişimlerin ardından eski instance'ları kapatması gereken bir temizlik işi yalnızca birincil bölgeyi kapsıyordu; hata üretimde gizli kaldı, çünkü gerçek kesintilerde AWS zaten eski makineyi geri alıyor, dolayısıyla hata ancak işler yolunda gittiğinde ortaya çıkıyordu.

Yazarın çıkarımı şu: otomasyon sizinle donanım arasına girdiğinde, görünürlüğünüz o otomasyonun kendi kendini raporlamasıyla sınırlıdır — ve o raporlama yapısı gereği sessizce başarısız olur.

Neden önemli

GPU eğitimi veya render için bütçe planlayan herkes için bu, kabaca beş katlık bir maliyet farkının somut kanıtı ve ardındaki küçük yazılar: zone düzeyinde fiyat değişkenliği, fiyatla ters korelasyonlu kapasite derecelendirmeleri ve filo şeklini kesinti riskinin kendisinden daha sıkı kısıtlayan vCPU kotaları. Veriler tek bir kullanıcının hesabından ve tek bir öğleden sonranın fiyatlarından geliyor; rakamları evrensel değil, yol gösterici olarak değerlendirin. İşletme dersleri rakamlardan daha genelde geçerli: maliyetin gerçekten değiştiği ayrıntı düzeyinde ölçün ve otomasyonunuzun yeşil ışıklarını yalnızca kontrollerinin görebildiği anlamda yorumlayın.

  • #cloud
  • #aws
  • #gpu
  • #spot-instances
  • #cost-optimization

İlgili yazılar