deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Paxa Labs, tek bir API üzerinden Tayca konuşma, çeviri ve OCR hizmeti veren Bangkok yapay zeka laboratuvarını başlattı

Bangkok merkezli Paxa Labs, metinden konuşmaya, çeviri ve belge OCR için Tayca ve İngilizce modellerle ortaya çıktı; tümü tek bir ölçümlü API üzerinden sunuluyor ve konuşma tanıma ise henüz araştırma aşamasında.

Paxa Labs, tek bir API üzerinden Tayca konuşma, çeviri ve OCR hizmeti veren Bangkok yapay zeka laboratuvarını başlattı

Neler başlatıldı

Bangkok merkezli yeni bir yapay zeka araştırma laboratuvarı olan Paxa Labs, ilk ürünlerini duyurdu: Tayca ve İngilizce metinden konuşmaya, belge OCR ve çeviriyi kapsayan tescilli modellerden oluşan bir set, tümü tek bir API üzerinden sunuluyor. Duyuru, şirketin kendisi tarafından dev.to üzerinde yapılan bir gönderiyle yapıldı; gönderide laboratuvar, genel amaçlı modellerin genellikle hata yaptığı bir dile özel olarak kurulmuş olarak konumlandırılıyor.

Bugün itibarıyla üç hizmet yayında. Metinden konuşmaya işini, İngilizce ağırlıklı seslerin yanı sıra İsan, Kuzey ve Güney Tayland'a özgü bölgesel Tayca aksanları dahil 26 ses sunan paxa-tts-flash-v1 üstleniyor. Çıktı MP3, Opus veya WAV olabilir; tamponlanmış veya akış halinde sunulur, kelime, cümle veya söylem düzeyinde isteğe bağlı zaman damgalarıyla birlikte. Bir WebSocket endpoint'i, metin geldikçe sesi sentezliyor; bu, agent uygulamaları ve canlı altyazı için tasarlanmış durumda. /v1/audio/speech adresindeki OpenAI uyumlu takma ad sayesinde mevcut istemciler yalnızca base URL'yi değiştirerek geçiş yapabiliyor.

Belge OCR, paxa-ocr-lite-v1'den geliyor; PDF, PNG, JPEG ve WebP dosyalarını kabul ediyor ve sayfa başına Markdown ya da başlıklar, paragraflar, listeler, tablolar ve şekiller gibi tiplendirilmiş bloklar döndürüyor. Çeviri, on dört kaynak dili Taycaya çeviren paxa-translation-lite-v1 tarafından yapılıyor; resmiyet düzeyi, ödünç kelime kullanımı, sözlükler, çevrilmemesi gereken terimler ve referans bağlam için kontroller sunuyor. Ayrıca düz metni çevirirken markup'a dokunmayan Markdown ve HTML modları da var; şirket, tek bir karakterin kaymasıyla bir etiketin Tayca kelime sınırını değiştirebileceği için bunun önemli olduğunu belirtiyor.

Konuşma tanıma ise lansmanlar arasında yok. Gönderiye göre bu hâlâ bir araştırma projesi ve yalnızca gerçek Tayca sesi karşısında ayakta kalabildiğinde yayımlanacak.

Taycanın neden kendi modellerine ihtiyacı var

dev.to gönderisi laboratuvarın gerekçesini ortaya koyuyor: Tayca metin, kelimeler arasında boşluk olmadan yazılıyor, dolayısıyla bir kelimenin nerede bittiğini ve diğerinin nerede başladığına bir bileşen karar vermek zorunda. Ton, kelimenin anlamını değiştiriyor; konuşmacılar tek bir cümle içinde Tayca ve İngilizceyi routinely karıştırıyor ve gerçek iş belgeleri her iki yazı sistemini tablolar, damgalar ve el yazısıyla aynı sayfada bir araya getiriyor.

Şirketin konumu şu: genel amaçlı modeller bu koşulları uç durum olarak ele alırken, Tayca kullanıcıları için ürün geliştiren herkes bunları sıradan girdi olarak yaşıyor. Laboratuvarın geliştirme döngüsü bunu yansıtıyor: gerçek Tayca konuşma, metin ve belgelerde gözlemlenen hatalardan yola çıkılıyor, her hata bir veri örneğine ve bir değerlendirmeye dönüştürülüyor ve tekrarlayan örüntülerin modele, eğitim yöntemine ve sunum altyapısına şekil vermesine izin veriliyor. İyileştirilmiş sistem ürüne geri dönüyor ve bir sonraki zor girdi araştırma gündemini belirliyor.

Fiyatlandırma ve API tasarımı

Üç ürünün tamamı krediyle faturalandırılıyor; 1.000 kredi bir Amerikan dolarına denk geliyor ve kullandıkça öde veya aylık planlarla sunuluyor. Duyuruya göre metinden konuşma milyon karakter başına 15 dolar, çeviri milyon karakter metin başına 25 dolar ve OCR sayfa başına 0,0065 dolar. Yeni hesaplar ücretsiz kredilerle başlıyor.

Olağandışı bir tasarım tercihi de faturalandırma sırası: istekler çıkarım çalışmadan önce tahsil ediliyor ve çıkarım başarısız olursa iade ediliyor; böylece başarısız bir çağrı hiçbir zaman ücrete tabi olmuyor. Şirket bu sırayı savunan ayrı bir yazı yayımladı.

Onboarding hafif tutulmuş. Kullanıcılar Google, GitHub veya Hugging Face ile oturum açıp bir anahtar üretebilir ve kod yazmadan önce üç ürünü de tarayıcıdaki playground'da deneyebilir. Şirket belgelerini makine dostu da yapmış: her belge sayfası yolunun sonuna .md eklenerek Markdown olarak sunuluyor, /llms.txt seçilmiş bir dizin görevi görüyor, /llms-full.txt tüm külliyatı açığa çıkarıyor ve npx üzerinden kurulabilir bir agent skill mevcut.

Neden önemli

Öncü yapay zeka çabalarının çoğu kaynak bakımından zengin dillere odaklanıyor; Tayca gibi diller ise yapısına göre hiç optimize edilmemiş modeller tarafından hizmet veriliyor. Paxa Labs, tek bir dilin belirli hata modellerine — kelime aralığının olmaması, tonun anlam belirlemesi, yoğun kod değiştirme ve dağınık gerçek dünya belgeleri — odaklanan bir laboratuvarın, yerel geliştiriciler için önemli olan noktalarda genel modelleri geçebileceğine bahis yapıyor.

OpenAI uyumlu endpoint geçiş maliyetlerini düşürüyor, karakter ve sayfa başına ölçümlü fiyatlandırma hesaplaması kolay ve başarısızlıkta iade politikası yaygın bir faturalandırma sorununu ortadan kaldırıyor. Kalite tutarsa, bu lansman daha geniş bir örüntüye işaret ediyor: bölgesel laboratuvarlar derin, dile özgü uzmanlığı öncü ölçeğinde modellerin peşinden koşmak yerine sıradan API'ler olarak paketliyor.

  • #ai
  • #text-to-speech
  • #ocr
  • #translation
  • #thai
  • #api

İlgili yazılar