· kaynak dev.to (home feed)
Dokuz nesne algılama modelinin aynı GPU üzerindeki karşılaştırması, yayınlanmış gecikme sıralamalarını altüst etti
Bir geliştirici dokuz nesne algılama modelini tek bir V100 üzerinde özdeş ayarlarla çalıştırdı ve her modelin yayınlanmış değerinden yavaş olduğunu, hız sıralamasının değiştiğini ve lisansların paketeye göre farklılık gösterdiğini ortaya koydu.

Tek bir GPU üzerinde kontrollü bir karşılaştırma
dev.to'da yazan bir geliştirici, dokuz nesne algılama modelinin yan yana karşılaştırmasını yayımladı; tümü özdeş ölçüm koşulları altında tek bir NVIDIA Tesla V100-PCIE-32GB üzerinde çalıştırıldı. Kadro YOLOv8m, YOLOv9m, YOLO11n, YOLO11m, YOLO26m, Faster R-CNN R50, Mask R-CNN R50, RF-DETR-B ve RT-DETR-L modellerini kapsıyor. Gönderiye göre motivasyon şudur: yayınlanmış gecikme rakamları büyük ölçüde test sırasında kullanılan GPU'ya, hassasiyete, batch boyutuna, framework'e ve optimizasyonlara bağlıdır; bu da farklı proje sayfalarından alınan rakamların doğrudan karşılaştırılmasını zorlaştırır.
Test nasıl yapıldı
Her model düz PyTorch ile çalıştırıldı; TensorRT yok, FP16 quantisation yok ve batching yok. Her model kendi yerel ekosistemi aracılığıyla — Ultralytics, torchvision, Hugging Face Transformers veya RF-DETR paketi — yüklendi ve kendi ön işleme ile giriş boyutlandırma pipeline'ına dokunulmadı. Zamanlama, açık CUDA senkronizasyonuyla sahne başına yapıldı ve raporlanan değer 48 sahne boyunca medyan. Bu sahneler sıradan görüntüleri sis, hareket bulanıklığı, düşük ışık, kar, parlama, termal görüntüleme ve havadan çekim gibi daha zor koşullarla harmanlıyor.
Baştan bir uyarı belirtiliyor: bu bir doğruluk (accuracy) karşılaştırması değil. Sahnelerde insan tarafından doğrulanmış ground-truth etiketleri bulunmadığından hiçbir mAP skoru hesaplanmadı. Karşılaştırma bunun yerine inference gecikmesine, görsel tespitlere, güven skorlarına ve lisanslamaya odaklanıyor.
Her model yayınlanmış rakamından daha yavaştı
Genel olarak ölçülen gecikmeler yayınlanmış olanları 1.6x ile 11.6x arasında değişen oranlarda aştı.
| Model | Yayınlanan | Ölçülen | Fark |
|---|---|---|---|
| YOLO11n | 1.5 ms | 17.4 ms | 11.6x |
| RF-DETR-B | 6.0 ms | 69.1 ms | 11.5x |
| RT-DETR-L | 9.3 ms | 66.2 ms | 7.1x |
| YOLOv8m | 4.8 ms | 16.2 ms | 3.4x |
| Faster R-CNN R50 | 45.0 ms | 73.3 ms | 1.6x |
Yazar, bunun yayınlanmış benchmark'ların yanlış olduğu anlamına gelmediğini özenle belirtiyor; muhtemelen farklı donanım, giriş boyutları, hassasiyet ayarları veya ölçüm yöntemleriyle üretilmişlerdir. Önemli nokta, rakamların yalnızca test koşulları eşleştiğinde birbirine göre anlamlı olmasıdır.
Sıralama değişti
Daha önemli sonuç, sıralamanın kendisinin değişmiş olmasıdır. Yayınlanmış rakamlara göre en hızlı model YOLO11n'ydi, ardından YOLO26m ve YOLOv8m geliyordu. Aynı koşullar altında ölçüldüğünde YOLOv8m birinci oldu, YOLO11n ikinciye düştü ve RF-DETR-B beşincilikten yedinciliğe geriledi. Faster R-CNN R50 ve Mask R-CNN R50 tablonun alt sıralarında kaldı, ancak göreli cezaları ciddi ölçüde küçüldü; çünkü en çok yavaşlayanlar daha hafif modellerdi.
Lisanslar beklenenden fazla farklılaşıyordu
Yazarın öne çıkardığı ikinci bulgu lisanslarla ilgili. Dokuz modelin beşi — YOLOv8m, YOLOv9m, YOLO11n, YOLO11m ve YOLO26m'den oluşan Ultralytics ailesi — AGPL-3.0 ile lisanslı. torchvision çifti olan Faster R-CNN R50 ve Mask R-CNN R50 ise BSD-3-Clause. RF-DETR-B ve RT-DETR-L genellikle Apache-2.0, ama bir pürüz var: gerçek şartlar spesifik dağıtıma veya pakete bağlı olabilir. RT-DETR'nin orijinal Baidu sürümü Apache-2.0, diğer implementasyonlar farklı olabilir. Sunulan pratik sonuç, mimari adına güvenmek yerine kullanmaya niyetlendiğiniz spesifik implementasyonun, paketin ve ağırlıkların (weights) lisansını doğrulamaktır.
Yazar ayrıca her model için 48 sahne boyunca bounding box'ları, güven skorlarını, ölçülen gecikmeyi ve lisans bilgisini gösteren interaktif bir görüntüleyici de geliştirmiş; ücretsiz bir demo mevcut ve segmentation ile pose-estimation karşılaştırmalarının ardından planlanıyor.
Neden önemli
Üretim için bir algılama modeli seçen ekipler için bu benchmark üç pratik noktaya dikkat çekiyor. Birincisi, yayınlanmış gecikme rakamları taşınabilir değildir: donanım, hassasiyet ve optimizasyon farkları ölçülen hızı bir büyüklük mertebesi kaydırabilir. İkincisi, sıralamalar koşullar arasında istikrarsızdır — kendi proje sayfasında kazanan bir model sizin GPU'nuzda kazanmayabilir; bu yüzden kısa listeler hedef donanımda tutarlı bir yöntemle yeniden ölçülmelidir. Üçüncüsü, lisans şartları en baştan seçim kriterlerine dahil edilmelidir: kâğıt üzerinde en hızlı olan AGPL-3.0 lisanslı bir model, hızından bağımsız olarak kapalı kaynaklı bir ticari üründe kullanılamaz olabilir; buna karşılık izin verici lisanslı bir alternatif yalnızca birkaç milisaniyeye mal olabilir.
- #object-detection
- #benchmarks
- #computer-vision
- #deep-learning
- #gpu
İlgili yazılar
- OpenAI'nin paylaştığı çalıştırmalarda GPT-5.6 Sol, harness ayarlarına göre ARC-AGI-3'te yüzde 13,3 veya 38,3 puan alıyor
- Temperature=0 LLM çağrıları neden hâlâ sapıyor: kayan nokta aritmetiği ve GPU batching
- Sınırların ötesindeki yapay zeka acenteleri istenmeyen faturalar gönderdi ve işletmeleri başında yaklaşık 3.200 dolar kaybetti