deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Dokuz nesne algılama modelinin aynı GPU üzerindeki karşılaştırması, yayınlanmış gecikme sıralamalarını altüst etti

Bir geliştirici dokuz nesne algılama modelini tek bir V100 üzerinde özdeş ayarlarla çalıştırdı ve her modelin yayınlanmış değerinden yavaş olduğunu, hız sıralamasının değiştiğini ve lisansların paketeye göre farklılık gösterdiğini ortaya koydu.

Dokuz nesne algılama modelinin aynı GPU üzerindeki karşılaştırması, yayınlanmış gecikme sıralamalarını altüst etti

Tek bir GPU üzerinde kontrollü bir karşılaştırma

dev.to'da yazan bir geliştirici, dokuz nesne algılama modelinin yan yana karşılaştırmasını yayımladı; tümü özdeş ölçüm koşulları altında tek bir NVIDIA Tesla V100-PCIE-32GB üzerinde çalıştırıldı. Kadro YOLOv8m, YOLOv9m, YOLO11n, YOLO11m, YOLO26m, Faster R-CNN R50, Mask R-CNN R50, RF-DETR-B ve RT-DETR-L modellerini kapsıyor. Gönderiye göre motivasyon şudur: yayınlanmış gecikme rakamları büyük ölçüde test sırasında kullanılan GPU'ya, hassasiyete, batch boyutuna, framework'e ve optimizasyonlara bağlıdır; bu da farklı proje sayfalarından alınan rakamların doğrudan karşılaştırılmasını zorlaştırır.

Test nasıl yapıldı

Her model düz PyTorch ile çalıştırıldı; TensorRT yok, FP16 quantisation yok ve batching yok. Her model kendi yerel ekosistemi aracılığıyla — Ultralytics, torchvision, Hugging Face Transformers veya RF-DETR paketi — yüklendi ve kendi ön işleme ile giriş boyutlandırma pipeline'ına dokunulmadı. Zamanlama, açık CUDA senkronizasyonuyla sahne başına yapıldı ve raporlanan değer 48 sahne boyunca medyan. Bu sahneler sıradan görüntüleri sis, hareket bulanıklığı, düşük ışık, kar, parlama, termal görüntüleme ve havadan çekim gibi daha zor koşullarla harmanlıyor.

Baştan bir uyarı belirtiliyor: bu bir doğruluk (accuracy) karşılaştırması değil. Sahnelerde insan tarafından doğrulanmış ground-truth etiketleri bulunmadığından hiçbir mAP skoru hesaplanmadı. Karşılaştırma bunun yerine inference gecikmesine, görsel tespitlere, güven skorlarına ve lisanslamaya odaklanıyor.

Her model yayınlanmış rakamından daha yavaştı

Genel olarak ölçülen gecikmeler yayınlanmış olanları 1.6x ile 11.6x arasında değişen oranlarda aştı.

Model Yayınlanan Ölçülen Fark
YOLO11n 1.5 ms 17.4 ms 11.6x
RF-DETR-B 6.0 ms 69.1 ms 11.5x
RT-DETR-L 9.3 ms 66.2 ms 7.1x
YOLOv8m 4.8 ms 16.2 ms 3.4x
Faster R-CNN R50 45.0 ms 73.3 ms 1.6x

Yazar, bunun yayınlanmış benchmark'ların yanlış olduğu anlamına gelmediğini özenle belirtiyor; muhtemelen farklı donanım, giriş boyutları, hassasiyet ayarları veya ölçüm yöntemleriyle üretilmişlerdir. Önemli nokta, rakamların yalnızca test koşulları eşleştiğinde birbirine göre anlamlı olmasıdır.

Sıralama değişti

Daha önemli sonuç, sıralamanın kendisinin değişmiş olmasıdır. Yayınlanmış rakamlara göre en hızlı model YOLO11n'ydi, ardından YOLO26m ve YOLOv8m geliyordu. Aynı koşullar altında ölçüldüğünde YOLOv8m birinci oldu, YOLO11n ikinciye düştü ve RF-DETR-B beşincilikten yedinciliğe geriledi. Faster R-CNN R50 ve Mask R-CNN R50 tablonun alt sıralarında kaldı, ancak göreli cezaları ciddi ölçüde küçüldü; çünkü en çok yavaşlayanlar daha hafif modellerdi.

Lisanslar beklenenden fazla farklılaşıyordu

Yazarın öne çıkardığı ikinci bulgu lisanslarla ilgili. Dokuz modelin beşi — YOLOv8m, YOLOv9m, YOLO11n, YOLO11m ve YOLO26m'den oluşan Ultralytics ailesi — AGPL-3.0 ile lisanslı. torchvision çifti olan Faster R-CNN R50 ve Mask R-CNN R50 ise BSD-3-Clause. RF-DETR-B ve RT-DETR-L genellikle Apache-2.0, ama bir pürüz var: gerçek şartlar spesifik dağıtıma veya pakete bağlı olabilir. RT-DETR'nin orijinal Baidu sürümü Apache-2.0, diğer implementasyonlar farklı olabilir. Sunulan pratik sonuç, mimari adına güvenmek yerine kullanmaya niyetlendiğiniz spesifik implementasyonun, paketin ve ağırlıkların (weights) lisansını doğrulamaktır.

Yazar ayrıca her model için 48 sahne boyunca bounding box'ları, güven skorlarını, ölçülen gecikmeyi ve lisans bilgisini gösteren interaktif bir görüntüleyici de geliştirmiş; ücretsiz bir demo mevcut ve segmentation ile pose-estimation karşılaştırmalarının ardından planlanıyor.

Neden önemli

Üretim için bir algılama modeli seçen ekipler için bu benchmark üç pratik noktaya dikkat çekiyor. Birincisi, yayınlanmış gecikme rakamları taşınabilir değildir: donanım, hassasiyet ve optimizasyon farkları ölçülen hızı bir büyüklük mertebesi kaydırabilir. İkincisi, sıralamalar koşullar arasında istikrarsızdır — kendi proje sayfasında kazanan bir model sizin GPU'nuzda kazanmayabilir; bu yüzden kısa listeler hedef donanımda tutarlı bir yöntemle yeniden ölçülmelidir. Üçüncüsü, lisans şartları en baştan seçim kriterlerine dahil edilmelidir: kâğıt üzerinde en hızlı olan AGPL-3.0 lisanslı bir model, hızından bağımsız olarak kapalı kaynaklı bir ticari üründe kullanılamaz olabilir; buna karşılık izin verici lisanslı bir alternatif yalnızca birkaç milisaniyeye mal olabilir.

  • #object-detection
  • #benchmarks
  • #computer-vision
  • #deep-learning
  • #gpu

İlgili yazılar