· kaynak Hacker News – Front Page (native)
Desert Ant Labs, ses, görüntü ve metin için 18 cihaz üstü yapay zeka modeli yayınladı
Video uygulaması Detail'ın geliştirici ekibi tarafından kurulan Avrupa merkezli laboratuvar; Swift, Kotlin ve JavaScript için SDK'larla birlikte, aylık 100.000 aktif cihaza kadar ücretsiz olan 18 küçük cihaz üstü modeli yayınladı.

Yerel çıkarıma bahis oynayan bir Avrupa laboratuvarı
Yeni bir Avrupa yapay zeka laboratuvarı olan Desert Ant Labs, ses, görüntü ve metni kapsayan, tamamen kullanıcının cihazında çalışacak şekilde tasarlanmış 18 küçük, göreve özgü modelle yayına başladı. On iki model kararlı sürüm olarak, altısı beta olarak sunuluyor ve tümüne Swift, Kotlin ve JavaScript için tek bir SDK üzerinden erişilebiliyor. Hacker News'in ana sayfasına çıkan şirketin lansman duyurusuna göre modeller, aylık 100.000 aktif cihaza kadar ücretsiz; token başına fiyatlandırma yok ve giriş yapmak gerekmiyor.
Marjinal maliyeti olmayan çıkarım
Laboratuvarın temel savısı, yapay zeka destekli ürün özelliklerinin büyük bir bölümünün — bir kaydı temizlemek, fotoğrafa etiket eklemek, bir cümleden tarih çıkarmak, metin sunucuya ulaşmadan önce bir ismi maskelemek — uç bir modele ihtiyaç duymadığı. Şirkete göre çağrı başına fiyatlandırma ve ağ gecikmesi, hangi etkileşimlerin gerçekten zeka kazanacağını sessizce belirliyor; yerel modeller ise her iki kısıtı da ortadan kaldırıyor: yanıtlar milisaniyeler içinde geliyor ve her ek çağrı hiçbir ücrete mal olmuyor.
Bu savı desteklemek için duyuru, üç ajan sistemini inceleyen ve büyük bir modele yapılan çağrıların yüzde 40 ila 70'inin küçük, uzmanlaşmış bir model tarafından ele alınabileceğini tahmin eden NVIDIA araştırmacılarına atıfta bulunuyor. Duyuru ayrıca sektörün bu yıl veri merkezlerine harcayacağı yaklaşık 450 milyar dolar ile tam da bu iş yükleri için son derece uygun silikonla gönderilen bir milyardan fazla telefon, tablet ve dizüstü bilgisayarı karşılaştırıyor.
Modeller ve şirketin kıyaslamaları
Dört model lansmanın bel kemiğini oluşturuyor. Voz, bir iPhone'da on dakikalık bir sesi yaklaşık iki saniyede yazıya döküyor — şirket bunun Whisper'dan 4,7 kat daha hızlı olduğunu söylüyor — ve her kelimeye başlangıç ve bitiş zamanları ekliyor. M3 Ultra üzerinde 30 dakikalık sesle Desert Ant Labs, Voz için 319'luk bir gerçek zaman faktörü rapor ediyor; Apple SpeechAnalyzer için bu değer 78, Whisper large-v3-turbo için ise 50.
Clear, beş dakikalık bir dizüstü kaydını bir saniyede stüdyo kalitesinde sese dönüştürdüğü söylenen 9MB'lık bir model; iPhone 16 Pro'da 302 kat, M5 çipli bir MacBook Pro'da 345 kat gerçek zaman hızında çalışıyor. Redact, 12MB'lık ağırlıklarla 27 dilde isimleri, adresleri ve kart numaralarını gerçek zamanlı olarak maskeliyor ve laboratuvarın testlerinde kişisel verilerin yüzde 88,8'ini yakalıyor — bu değer, 2,3GB'lık bir model olan GLiNER-PII için ölçtüğü yüzde 91,1'e yakın. Tongue, 2MB'lık bir modelle üç sözlü kelimeden 84 dili tanımlıyor ve 0,933 doğruluk elde ediyor; 293MB'lık bir dedektör içinse bu değer 0,887.
Beşinci model olan Clips, kurucuların kendi ürününde Claude Sonnet'in yerine geçmek üzere geliştirildi: 284MB boyutundaki modelin, on dakikalık bir videoyu beş saniyede bir düzine klipe dönüştürdüğü bildiriliyor; şirket bunu eşdeğer kalitede on kat daha hızlı ve 470 kat daha enerji verimli olarak sunuyor. Tüm bu rakamlar şirketin kendisi tarafından açıklanıyor. Kalan modellerin tam özellikleri şirketin sitesinde ve Hugging Face'te yayımlandı; SDK'lar ise modelleri yerel olarak denemek için bir Mac CLI'ının yanı sıra GitHub'da yer alıyor.
Bir video uygulamasının bulut faturalarından büyüdü
Laboratuvar, ekibin beş yıldır cihaz-öncelikli bir felsefeyle geliştirdiği Detail adlı video uygulamasından doğdu. Otomatik klip düzenleme ve podcast ses iyileştirme gibi özellikler sürekli bulut API'lerine geri düşüyordu ve Detail yaygınlaştıkça altyapı faturaları da büyüyordu. Ekibin dağıtılabilir yerel modeller için Hugging Face'te yaptığı dönemsel aramalar, sevk edilecek bir ürüne doğrudan dahil edebilecekleri hiçbir şey ortaya çıkarmadı; bu yüzden eksik parçanın araştırma değil ürün tasarımı olduğu sonucuna vardılar ve kendi modellerini eğittiler. iOS 27 ile birlikte lansman edilecek Detail 6, uygulamadaki tüm bulut API'lerini laboratuvarın kendi modelleriyle değiştirecek.
Önce "küçük beyin", sonra yönlendirme
Yol haritası bilinçli olarak aşağıdan yukarıya doğru. Desert Ant Labs, ilk yüz modelini serebellum — kullanıcının hiç düşünmediği becerileri üstlenen, her zaman açık katman — olarak tanımlıyor; ardından bir yönlendirme korteksi gelecek: önce küçük bir yerel model yanıtlıyor, iş gerektirdiğinde daha büyük bir model devreye giriyor ve bulut yalnızca işin cihazdan çıkması gerektiğinde kullanılıyor. Laboratuvar token satmadığı için, değiştirme kollarını açık tutarken tarafsız modeller yerine görüşü belli olan varsayılanlar sunabileceğini söylüyor. Runtime ile ağırlıklar birlikte ayarlanıyor: iPhone'da Voz ve Clear Neural Engine üzerinde çalışıyor, tarayıcıda ise Clear'ın ağırlıkları WebAssembly üzerinden yürütülüyor.
Neden önemli
Çoğu yapay zeka yol haritası, bir API'nin arkasında genelci bir model varsayar. Desert Ant Labs tersine bahis oynuyor: rutin, yüksek frekanslı görevler, kullanıcının zaten sahip olduğu donanıma aittir — orada çıkarım ücretsizdir, gecikme ihmal edilebilir ve veri asla cihazdan çıkmaz; bu çerçeve, veri egemenliği kurallarının geçerli olduğu Avrupa'da net bir yankı buluyor. Kıyaslama sonuçları bağımsız testler altında doğrulanırsa, sonuç token bütçelerinden kurtulmuş bir ürün tasarımı olur: bir kontrol, ancak bir ekibin karşılayabildiği mesajlarda değil, her mesajda çalışabilir. O zamana kadar bu rakamları lansman yazısı pazarlaması olarak görün ve şirketin 100.000 cihazlık ücretsiz katmanın ötesinde hangi fiyatlandırmanın geçerli olacağını söylemediğini not edin.
- #on-device-ai
- #machine-learning
- #edge-computing
- #startups
- #speech-recognition