· kaynak Hacker News – Front Page (hnrss.org)
Screen Memories, macOS'ta her fotoğrafa ve video karesine cihaz üzerinde yapay zekâ araması getiriyor
Hacker News'in ana sayfasına çıkan açık kaynak macOS uygulaması SCM, fotoğrafları ve her video karesini yerel olarak indeksleyerek hiçbir verinin cihazdan çıkmadığı, doğal dil, OCR ve konuşulan diyalog araması sunuyor.
Neler yayına girdi
Bir geliştirici, Screen Memories'in kısaltması olan SCM'yi yayınladı; bu açık kaynak macOS uygulaması, kişisel medya kitaplıkları üzerinde yapay zekâ modellerini çalıştırarak kullanıcıların fotoğrafları ve tek tek video karelerini düz dildeki ifadelerle bulabilmesini sağlıyor. Proje, 4 Ekim'de GitHub deposuna bağlanan bir Show HN gönderisiyle Hacker News'in ana sayfasına ulaştı; README'si temel vaadi şöyle özetliyor: model çıkarımı makinenin kendisinde gerçekleşiyor, hesap gerekmiyor ve hiçbir medya hiçbir yere yüklenmiyor. Model ağırlıkları ilk kullanımda bir kez indiriliyor; sonrası tamamen çevrimdışı.
Uygulama, macOS 12 veya üzerini çalıştıran Apple Silicon Mac'ler için bir Homebrew tap üzerinden dağıtılan bir Electron derlemesi; 0.2.4 sürümü şu anda DMG ve ZIP kurulum dosyaları halinde sunuluyor. Geliştirme sürecinde paket yöneticisi ve çalıştırıcı olarak Bun kullanılıyor ve ilk görsel model indirmesi yaklaşık 435MB.
Beş arama yolu
GitHub README'sine göre arama beş moda ayrılıyor:
- Dosyalar — bütün fotoğraf ve videolar üzerinde semantik sıralama. Dosya adı anahtar kelime turu anında sonuç döndürüyor, ardından görsel model görselleri embedding'lerle kosinüs benzerliğine göre puanlıyor; benzerlik puanlarını anlamlı kılmak için model başına kalibrasyon uygulanıyor ve neredeyse aynı olan sonuçları bastıran bir filtre bulunuyor. Her sonuç kutusu eşleşmeyi hangi sinyalin tetiklediğini açıklıyor ve CJK sorguları örtüşen bigramlar olarak işleniyor.
- Sahneler — ffmpeg çekim geçişlerini tespit ederek her video için bir segment planı oluşturuyor; her segmentin orta noktasındaki kare embedding'leniyor. Bir eşleşme, tam zaman koduyla ilgili çekime denk geliyor ve sonucu açmak doğrudan o ana atlıyor. Bir gürültü eşiği, sonuçları boğmak yerine eşleşme yoksa hiçbir şey döndürmüyor ve her video en fazla üç sahneye katkıda bulunuyor.
- OCR — Tesseract tarafından çıkarılan metinle sorgu terimlerinin birebir eşleştirilmesi; İngilizce ve isteğe bağlı 35 dil desteği var. Görsel model devrede olmadığından, yapay zekâ motoru ısınırken veya kullanılamazken de çalışmaya devam ediyor.
- Diyalog — Whisper transkriptleri üzerinde üç hassasiyet düzeyiyle kelime bazında konuşma araması; tek bir söylem içindeki bitişik bir ifadeden, videonun herhangi bir yerinde geçen tüm kelimelere kadar. Embedding gerektirmiyor ve motor kesintilerinde ayakta kalıyor.
- LLM'ler — tamamen isteğe bağlı bir sohbet katmanı. Loopback'e bağlı bir llama.cpp sidecar'ı, uygulamanın zaten çıkardığı kanıtları kullanarak soruları numaralı ve tıklanabilir atıflarla, akış halinde yanıtlıyor. Varsayılan model Qwen3 1.7B (1.1GB); daha uzun yanıtlar için Llama 3.2 3B (2GB) sunuluyor.
Video indeksleme yoğunluğu ayarlanabilir: Eco ön ayarında 60 saniyede bir embedding noktasından Ultra Pro'da 2.5 saniyede bir embedding noktasına kadar; her ön ayar, işleme onaylanmadan önce ölçülmüş zaman ve disk maliyetini gösteriyor.
Modeller ve kitaplık bakımı
Dört görsel model ONNX Runtime üzerinden çalışıyor ve kitaplık başına değiştirilebiliyor. CLIP ViT-L/14@336, CPU'da görsel başına yaklaşık 480–570ms ile varsayılan model; SigLIP varyantları ise hız ile ayrıntı arasında denge kuruyor: SigLIP-2-B/16, toplu içe aktarmalar için görsel başına 50–100ms ile en hızlısı, SigLIP-B/16@384 ise en yüksek ayrıntıyı hedefliyor. Model değiştirildiğinde kitaplık arka planda yeniden embedding'lenirken arama geçici olarak dosya adı anahtar kelimelerine geri düşüyor.
README'ye göre kitaplık büyük ölçüde kendini idame ettiriyor: izlenen klasörler otomatik içe aktarılıyor, içerik karma değerleri dosyaları yeniden adlandırsanız bile yinelenenleri ayıklıyor ve herhangi bir sorgu, videolar, ekran görüntüleri ve e-posta için yerleşik görünümlerin yanı sıra kayıtlı bir sekme olarak sabitlenebiliyor. E-posta sekmesi, görünür metninde bir e-posta adresi içeren fotoğrafları ortaya çıkarıyor; Tesseract'ın kelime kutularına böldüğü adresleri yeniden birleştiriyor ve allen [at] gmail [dot] com gibi gizletme biçimlerine tolerans gösteriyor. Ekran görüntüleri sekmesi, manuel geçersiz kılma, yerelleştirilmiş ekran görüntüsü dosya adları, PNG ve EXIF metadata yoklamaları ve klasör ipuçlarından oluşan bir öncelik zinciriyle, yeniden adlandırmaya dayanıklı sınıflandırma yapıyor.
Neden önemli
Tüketicilerin bugün karşılaştığı yapay zekâ fotoğraf aramasının büyük kısmı bulut platformlarına bağlı; bu da kişisel medyanın yüklenmesini ya da başkasının kontrolünde analiz edilmesini gerektiriyor. SCM, görsel-dil modellerinin, konuşma transkripsiyonunun ve küçük yerel LLM'lerin artık bir tüketici dizüstü bilgisayarında, atıflar ve zaman kodu düzeyinde video atlamalarıyla birlikte tam kare, tam metin arama deneyimi olarak birleştirilebileceğinin çalışan bir kanıtı. Maliyetler somut — yüzlerce megabaytlık model ağırlıkları, CPU'a bağlı embedding süreleri ve kendi kendini idame ettiren bir indeks — ama büyük yerel arşivleri ya da gizliliğe duyarlı koleksiyonları olan herkes için, daha önce bulutun kapısı ardında tutulan bir yeteneği cihazın kendisine taşıyor; bu desen, cihaz üzerindeki modeller gelişmeye devam ettikçe yaygınlaşmaya aday.
- #macos
- #local-first
- #image-search
- #open-source
- #machine-learning
İlgili yazılar
- Seçimler öncesi üç dilli dev.to rehberleri DIY gerçek zamanlı deepfake tespitini ileri taşıyor
- Strata, 12GB VRAM'lı tüketici GPU'larında 125 milyar parametreli Qwen3.8 Flash Next'i çalıştırıyor
- Jev yapay zekâ modeli, Bitcoin yönünü tahmin etmede yazı-turadan kötü çıktı: dev.to testinde gradient boosting'e yenildi