· kaynak Hacker News – Front Page (native)
OCR It, seçilemeyen belge görüntüleyicileri yerel Tesseract ile LLM'ye hazır metne dönüştürüyor
Hacker News'in ana sayfasına çıkan açık kaynaklı bir Chrome uzantısı, sabitlenmiş bir ekran bölgesini her sayfada yakalıyor, paket içinde gelen Tesseract ile tamamen çevrimdışı OCR yapıyor ve LLM'ye hazır bir metin dosyası dışa aktarıyor.
Nedir
24 Ağustos'ta Hacker News'in ana sayfasına çıkan açık kaynaklı Chrome uzantısı OCR It, tanıdık bir çıkmaz sokağı hedefliyor: sayfaları görüntüleyen ama metin seçimini engelleyen taranmış bir kitap, slayt destesi veya web okuyucu. Projenin GitHub deposuna göre fikir şu: yakalama bölgesini bir kez işaretleyin, sonra her sayfada bir kısayol tuşuna basın; her basış tam olarak o dikdörtgenin ekran görüntüsünü alır, üzerinde OCR çalıştırır ve sonucu sürekli büyüyen bir metne ekler.
Tanıma işlemi, paket içinde gelen bir Tesseract derlemesiyle tamamen yerel makinede çalışır. Uzantı hiçbir giden istek yapmaz; dolayısıyla yapılandırılacak API anahtarı yoktur ve hiçbir ekran görüntüsü bilgisayardan dışarı çıkmaz.
Yakalama nasıl çalışır
Kurulum bilinçli olarak en temel hâlde: depoyu klonlayın, chrome://extensions adresinde Geliştirici modunu etkinleştirin ve klasörü paketsiz yükleyin. Derleme adımı yoktur; gerekli her şey depoya işlenmiştir ve npm yalnızca testleri çalıştırmak veya dil verilerini yeniden gömmek için gereklidir.
Aracı üç kısayol tuşu yönetir. İlki, metnin üzerine yakalama bölgesini çizer veya yeniden çizer; kaydetmeden önce piksel düzeyinde ayar için sürükleme tutamaçları ve ok tuşlarıyla ince ayar sunar. İkincisi bölgeyi istendiğinde yakalar — ekran görüntüsü hemen alınırken OCR arka planda kuyruğa girer, böylece sayfalar arasında bekleme olmaz; araç çubuğu simgesi aynı zamanda bekleyen okumaların sayacıdır. Üçüncüsü otomatik çalıştırmayı başlatır ve durdurur.
Gözetimsiz çalıştırmak
Bir sonraki sayfa denetimi yapılandırıldığında OCR It her şeyi devralabilir: yakala, ilerle, belge bitene kadar tekrarla. Sayfa çevirme hedefi ya görüntüleyicinin kendi sonraki sayfa düğmesine tıklanarak ya da yakalama bölgesinin ortasına sahip olan çerçeveye yapay bir tuş vuruşu (varsayılan olarak ArrowRight) gönderilerek ayarlanır.
README, bir tasarım kararını ayrıntıyla açıklıyor: her döngü, sayfayı çevirmeden önce geçerli sayfanın OCR işleminin bitmesini bekler. Yazar, bunun pratikte hiçbir maliyeti olmadığını söylüyor çünkü tanıma, sayfa çevirmekten daha hızlıdır ve bu, güvenilir bitiş algısı sağlar — yalnızca zamanlayıcıyla yönetilen bir döngü son sayfayı da aşar ve onu sonsuza dek yineler. Çalışmalar iki özdeş sayfadan sonra (varsayılan), sayfa artık çevrilemediğinde, OCR hatası veya takılmada, 300 sayfalık üst sınıra ulaşıldığında veya sekme kapatıldığında kendiliğinden durur. Çalışmayı neyin bitirdiği açılır pencerede bildirilir.
Selector yerine nokta
Kaydedilen sonraki sayfa hedefi bir CSS selector değil, ekran koordinatıdır. Projenin belgelerine göre bu, selector'ları düzenli olarak geçersiz kılan DOM yeniden render'larından etkilenmemesini sağlar ve bir selector'ın ulaşamadığı iki yere ulaşır: gömülü okuyucuların çoğunun yaşadığı cross-origin iframe'lere ve querySelector'ın içini göremediği shadow DOM'a. İlerleme anında her çerçeveye bu nokta sunulur ve ona sahip olan çerçeve pointerdown'dan click'e kadar tam diziyi sentezler; böylece pointerdown ile sayfa çeviren görüntüleyiciler, click dinleyenlerle aynı şekilde davranır.
Sınırlar ve çıktı
Kısıtlar açıkça belgelenmiş. Hedef ekranda sabit bir nokta olduğu için pencereyi yeniden boyutlandırmak veya çalışma ortasında yakınlaştırmayı değiştirmek bunu bozar. Chrome'un yerleşik PDF görüntüleyicisi manuel yakalama için çalışır ama otomatik ilerleme ona ulaşamaz; çünkü görüntüleyici, uzantıların içine kod enjekte edemediği bir eklentidir. file:// URL'lerinden açılan PDF'ler ayrıca uzantı için dosya erişiminin etkinleştirilmesini gerektirir. İngilizce, Portekizce ve İspanyolca varsayılan olarak gelir; Tesseract'ın yaklaşık yüz diğer dilinden herhangi biri önce uzantıya gömülmelidir.
Dışa aktarılan sayfalar, tam olarak kırpılan şeyin küçük resimleriyle görünür; böylece kaymış bir bölge düzineden fazla sayfa sonra değil, hemen fark edilir. Metin yerinde düzenlenebilir, tek tek sayfalar yeniden tanınabilir, tümünü kopyala ve .txt dışa aktarma sayfaları sayfa numarası ayırıcıları arkasında sırayla verir ve öncekiyle özdeş sayfalar yinelenen olarak işaretlenir.
Neden önemli
Devasa miktarda başvuru malzemesi, metin yerine piksel render eden görüntüleyicilerin içinde hapsolmuş durumda. Bu araç o yüzlerce sayfayı düz bir metin dosyasına dönüştürüyor — Claude, ChatGPT ya da başka herhangi bir LLM'in özetlemesi, araması veya soruları yanıtlaması için doğal girdi. Tamamen çevrimdışı OCR, kolayı bir ekran görüntüsünü bulut API'sinden geçirmek olduğu bir dönemde anlamlı bir gizlilik özelliği; cross-origin iframe'lere ve shadow DOM'a tıklamak için nokta-ye-selector-değil tekniği ise diğer uzantı yazarlarının ödünç almak isteyeceği bir mühendislik parçası. Developer mode kurulumu onu şimdilik hobi kullanıcılarının aracı yapıyor ama tamamen denetlenebilir koda sahip olmak çekiciliğin bir parçası.
- #chrome-extension
- #ocr
- #tesseract
- #open-source
- #llm-tools