deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (native)

turbopuffer v3, depolama yenilemesinde vektör aramasını ikincil indekse indiriyor

turbopuffer, v3'te depolama katmanını baştan inşa ediyor; kendisini tanımlayan vektör-öncelikli mimariyi emekliye ayırıyor ve ANN aramasını birçok ikincil indeksten biri konumuna indiriyor.

turbopuffer v3, depolama yenilemesinde vektör aramasını ikincil indekse indiriyor

turbopuffer, vektör-öncelikli depolamayı emekliye ayırıyor

Arama altyapısı şirketi turbopuffer, platformunun 3. sürümünün depolama mimarisini sıfırdan yeniden inşa ettiğini ve şirkete adını kazandıran tasarımı terk ettiğini duyurdu. Mühendis Dan Harrison tarafından kaleme alınan ve şu anda Hacker News ana sayfasında yer alan "RIP, vector database" başlıklı bir blog yazısında şirket, v3'ün belgelerin ve indekslerin nasıl depolandığını, yazıldığını, sıkıştırıldığını ve sorgulandığını değiştirdiğini belirtiyor.

Temel karar şu: turbopuffer yeni bir birincil indekse geçiyor ve yaklaşık en yakın komşu (ANN) aramasını sistemin merkezinden alıp birçok ikincil indeksten biri konumuna indiriyor. Yazıya göre amaç, her tür aramayı — vektör araması dahil — daha hızlı hale getirmek ve platformda çok daha fazla SQL sorgusunun hızlı çalışması için temel atmaktır.

Vektör-öncelikli tasarımın kısa tarihi

turbopuffer, son derece ucuz ve makul hızda vektör araması için tasarlanmış serverless bir vektör veritabanı olarak piyasaya çıktı. Nesne depolama, ekonomi açısından doğruluk kaynağı olarak hizmet verirken, kademeli NVMe SSD ve bellek önbellekleri performansı sağlıyordu. Cursor ve Notion gibi ilk müşteriler bu ödünleşimleri doğruladı ve 2. sürüm daha sonra güçlü metin ve regex aramasının yanı sıra Linear'ın senkronizasyon motoru gibi arama dışı iş yüklerini de ekledi.

v1'de bir belge, yalnızca bir ID ve bir vektördü. Graf tabanlı indeksler o dönemde yaygın kabul görse de turbopuffer, hiyerarşik kümelemenin nesne depolamayla daha iyi çalıştığını fark etti: SPANN ile başladı ve artımlı indekslemeyi desteklemek için daha sonra SPFresh'e geçti. Vektörler, ID'ler ve nitelikler, birlikte şirketin ANN adresi dediğini oluşturan bir küme ID'si ve yerel ID ile anahtarlanan bir anahtar-değer haritasında saklanıyordu. Bu, vektör indeksini sistemin yapısal kalbi haline getiriyordu.

  1. Sürüm, üzerine nitelik filtrelemeyi ve BM25 tam metin aramasını, ANN adreslerine geri dönüş yapan ters indeksler olarak ekledi ve şirket bundan sonra aggregasyonları, regex aramayı, fuzzy eşleştirmeyi, seyrek vektör aramasını ve nitelik sıralamayı sundu — hepsi hâlâ vektör-öncelikli düzenin etrafında dönen yapılar olarak.

Vektör-öncelikli bir birincil indeksin üç sorunu

Mimari performans sergiliyor: turbopuffer, 100 milyardan fazla vektör içeren tek indekslerin saniyede 1.000'den fazla sorguyla 200 ms p99 okuma sunduğunu bildiriyor. Ancak yazı, şirketi yol değişikliğine iten üç yapısal maliyet tespit ediyor.

Depolama genişlemesi: belgelerin tam içeriği her vektörün ANN adresi altında yaşadığı için, belge iç içe geçirme veya late interaction gibi çoklu vektör temsilleri içeriği her vektör için çoğaltıyor. Şirket, bunun daha sinir bozucu limitlerinden bazılarının nedeni olduğunu söylüyor.

Yazma genişlemesi: SPFresh, kümelerin iyi gruplanmış kalmasını sağlamak için vektörleri yeniden dengeler ve her şey vektörün adresiyle anahtarlandığından, yeniden dengeleme tüm belgeleri ve onlara referans veren nitelik ve tam metin indekslerini taşıma şeklinde zincirleme ilerler. Tek bir vektörün güncellenmesi yüzlerce niteliği kaydırabilir ve indeksleme verimini ayarlama çabaları azalan getiriyle karşılaşmıştır.

Sınırlı vektörizasyon: modern sorgu motorları veriyi bloklar halinde işler; DuckDB 2.048 satırlık gruplarla, ClickHouse kabaca 65.000'e kadar, Lucene ise 256 belgelik posting bloklarıyla çalışır. turbopuffer'ın kümeleri yaklaşık 100 ila 200 belge tuttuğundan, her sorgu planı, gerçekte hangisinin optimal olacağına bakılmaksızın o blok boyutuyla sınırlıdır. Bu düzen, GROUP BY ve aggregasyonlar gibi planları da kısıtlamıştır.

Sırada ne var

30 Eylül 2026 tarihli yazı, açıkça bir dizinin ilki. turbopuffer, kapıları açmak ve okuyucuların göçü gerçekleşirken takip etmesini sağlamak istediğini söylüyor; bu da yeni birincil indeksin somut biçiminin gelecekteki güncellemelerde anlatılacağı anlamına geliyor.

Neden önemli

Vektör veritabanları, yapay zeka patlamasının öne çıkan altyapı kategorisiydi ve bu, o kategoride öne çıkan bir tedarikçinin, adanmış vektör veritabanı biçimini kendi yol haritası için bir çıkmaz sokak ilan etmesidir. Erişim iş yükleri giderek artan biçimde tek bir sorgu içinde embedding'leri, anahtar kelime aramasını, filtrelemeyi ve SQL tarzı aggregasyonu birleştiriyor ve turbopuffer'ın bahsi, kazanan mimarinin ucuz nesne depolama üzerinde genel amaçlı, vektörize edilmiş bir sorgu motoru olduğu — ANN'nin düzenleyici ilke değil, birkaç erişim yolundan biri olduğu yönünde. Arama ve RAG sistemleri kuran ekipler için bu, yalnızca vektör araması için seçilen altyapının iyi yaşlanmayabileceğine ve nesne depolama tabanlı motorların artık analitik veritabanlarıyla kendi sahalarında rekabet etmeyi amaçladığına dair bir sinyal.

  • #vector-database
  • #search-infrastructure
  • #object-storage
  • #query-engines
  • #cloud

İlgili yazılar