deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Mano-CUA açık kaynak tarayıcı agent'ı WebRetriever benchmark'ında Gemini 2.5 Pro ve Claude 4.5'i geride bıraktı

Mininglamp-AI'nın açık kaynak, görsel odaklı tarayıcı agent'ı Mano-CUA 1.1, bir dev.to gönderisine göre WebRetriever'da 41.7 puan alarak computer-use modlarında Gemini 2.5 Pro'nun (40.9) ve Claude 4.5'in (31.3) önünde yer aldı.

Mano-CUA açık kaynak tarayıcı agent'ı WebRetriever benchmark'ında Gemini 2.5 Pro ve Claude 4.5'i geride bıraktı

Benchmark sayıları

Mininglamp-AI'dan gelen bir dev.to gönderisi, grubun açık kaynak tarayıcı agent'ı Mano-CUA 1.1'in, gerçek web sitelerinde gezinme, bilgi getirme ve form doldurma üzerine kurulu bir benchmark olan WebRetriever Protocol I'da 41.7 puan aldığını bildiriyor. Gönderiye göre aynı değerlendirmede Gemini 2.5 Pro Computer Use 40.9, Claude 4.5 Computer Use ise 31.3 puan aldı. Yazar, Claude'ya karşı yaklaşık on puanlık farkın gürültü değil tutarlı bir durum olduğunu ve çok adımlı formlarda, dropdown seçimlerinde ve sayfalanmış sonuçlarda tekrar tekrar görüldüğünü belirtiyor.

İki uyarıya dikkat çekmek gerekir. Bunlar projenin kendi sayıları; bağımsız bir laboratuvarın sonuçları değil, fiilen duyuru gönderisi niteliğindeki bir yazıda yayınlandılar. Ayrıca GPT ve Claude'un görevde "başarısız olduğu" çerçevesi, gönderinin kendi verisinden daha gevşek: Claude'nun puanı verilmiş, ama metnin hiçbir yerinde bir GPT rakamı yer almıyor — GPT-4o yalnızca genel hatlarıyla tarayıcı işlerinde zayıf olarak tartışılmış.

DOM ayrıştırma yerine ekran görüntüleri

Mano-P'nin arkasındaki mimari iddia, tarayıcıların insanların kullandığı şekilde — bakarak — kullanılması gerektiği. Model ekran görüntülerini okur, tıklanabilir öğeleri pikseller üzerinden bulur ve bir sonraki eylemi yalnızca görsel bağlamdan kararlaştırır. DOM incelemesi yok, accessibility ağacı bağımlılığı yok ve siteye özel hook yok. Argüman dayanıklılık: bir sitenin markup'ı değiştiğinde ama görsel düzen değişmediğinde, DOM tabanlı bir agent bozulurken piksel tabanlı olan çalışmaya devam eder.

Buna karşılık genel amaçlı modeller genellikle DOM'u ayrıştırır veya accessibility API'lerine yaslanır; gönderiye göre bu yaklaşım basit sayfalarda ayakta kalıyor ama dinamik rendering ve özel bileşenler içeren JavaScript ağır uygulamalarında çöküyor.

Form doldurma en zorlu test senaryosu. Yazara göre genel modeller dört-beş etkileşimden sonra yerini kaybediyor, yanlış alana hedefleniyor, zorunlu alanları atlıyor veya başarısız bir eylemi döngü halinde tekrarlıyor. Mano-CUA, devam etmeden önce her eylemin sonucunu kontrol edecek şekilde tasarlandı — bir dropdown açılmazsa tekrar tıklıyor, bir alan girdisini reddederse ekrandaki hatayı okuyup yolunu düzeltiyor.

Yerel yürütme ve açık ağırlıklar

Büyük laboratuvarların computer-use hizmetlerinin aksine model tamamen cihaz üzerinde çalışıyor. Gönderi, 4B quantize edilmiş modelle Apple M5 Pro donanımında saniyede yaklaşık 80 token hızından söz ediyor ve Apple silicon işlemcili, 32GB RAM'li bir Mac öneriyor. Yerel bayrakla ekran görüntüleri asla makineden çıkmıyor; bayrak olmadığında çıkarım Mininglamp'ın bulut uç noktasından geçiyor ki bu daha hızlı ama ekran görüntülerini bir sunucuya gönderiyor. Kod, CLI aracı ve model ağırlıkları Apache 2.0 lisansıyla GitHub'da Mininglamp-AI/Mano-P olarak yayınlandı.

Eğitim ve daha geniş benchmark bağlamı

Model üç aşamada eğitildi: GUI etkileşim verisi üzerinde denetimli fine-tuning, kaydedilmiş yörüngeler üzerinde offline pekiştirmeli öğrenme ve canlı arayüzlere karşı online pekiştirmeli öğrenme. Yazar, modelin yanlış bir tıklamanın neye yol açtığını deneyimlediğini ve toparlanmayı öğrendiği için son aşamayı belirleyici sayıyor — statik veri kümelerinin öğretemeyeceği bir şey bu.

Daha geniş OSWorld masaüstü benchmark'ında, modelin 72B değerlendirme sürümünün görev başarısında reportedly %58.2'ye ulaştığı ve bir sonraki özelleşmiş modelin 13.2 puan önünde yer aldığı bildiriliyor. Gönderi bunun kullanıcıların yerel olarak çalıştırdığı model olmadığını dikkatle belirtiyor: 4B varyant, aynı sette Qwen3-VL-Plus'ın %39'una karşı 100 görevlik bir macOS GUI testinde %56 aldı.

Neden önemli

Tarayıcı kontrolü üzerine agent ürünleri geliştiren ekipler için bu, uzmanlaşma tartışmasında somut bir veri noktası. Genel amaçlı öncü modeller kullanışlı, ama bildirilen sayılar, güvenilirliğin en çok önem taşıduğu dikeyde — çok adımlı web etkileşiminde — hâlâ amaca yönelik, GUI eğitimli agent'ların gerisinde kaldıklarını düşündürüyor. Gemini üzerinden fark 0.8 puanlık ince bir marj, dolayısıyla dürüst okuma şu: özelleşmiş agent'lar en azından rekabetçi ve kimi zaman çok daha önde, kategoriyi kopararak kazandıkları değil.

İki pratik sonuç öne çıkıyor. Açık ağırlıklar artı yerel bir runtime, iç panoların, müşteri kayıtlarının veya yönetim arayüzlerinin ekran görüntülerinin şirket içinde kalabileceği anlamına geliyor; bu, agent destekli otomasyona yönelik büyük bir itirazı ortadan kaldırıyor. Ve stack Apache 2.0 olduğu için ekipler, bir satıcının sözüne güvenmek yerine kendi iş akışları üzerinde değerlendirebiliyor. Uyarı geçerliliğini koruyor: bu, projenin kendisinin bildirdiği tek bir benchmark, dolayısıyla platform değiştirmeden önce kendi görevlerinizde yeniden üretin.

  • #ai-agents
  • #browser-automation
  • #open-source
  • #benchmarks
  • #llms

İlgili yazılar