deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

150 GB'lık açık veri seti, Orta Asya dillerini LLM eğitimi için kaynak kodla eşleştiriyor

Bir geliştirici, Kırgız, Kazak, Özbek, Tacik ve Rusça metni 20 GB kodla birleştiren yaklaşık 150 GB'lık açık bir veri setini Hugging Face'te yayımladı; hedef, düşük kaynaklı dil eğitim verisindeki boşluğu doldurmak.

150 GB'lık açık veri seti, Orta Asya dillerini LLM eğitimi için kaynak kodla eşleştiriyor

Ne oldu

Bağımsız bir geliştirici, Orta Asya dillerinde metin ile kaynak kodu birleştiren yaklaşık 150 GB'lık açık bir veri seti yayımladı; bu, büyük laboratuvarların çoğunlukla atladığı bir makine öğrenmesi köşesini hedefliyor. dev.to'daki bir yazıya göre koleksiyon; Kırgızca, Kazakça, Özbekçe ve Tacikçe'nin yanı sıra Rusça ve İngilizce metin ile Python, C++, Rust ve Go kodunu kapsıyor ve Hugging Face'te CC BY 4.0 lisansıyla erişime açık.

Veri seti neler içeriyor

Yazarın sıkıştırılmamış veriye ilişkin dökümü:

  • Rusça: 60 GB
  • Kırgızca: 23 GB — yazı bunu Kırgızca NLP için bir dönüm noktası olarak nitelendiriyor
  • Kazakça: 22 GB
  • Özbekçe: 7 GB
  • Tacikce: 7 GB
  • İngilizce: 1,5 GB
  • Kaynak kod: 20 GB; Python, C++, Rust ve Go için yaklaşık 5 GB'er

Malzeme yapılandırılmış .txt ve .l dosyaları olarak geliyor. Bir eğitim çalışması planlamadan önce belirtmek gerekir: dil başına rakamlar toplandığında yaklaşık 140 GB ediyor, bu da başlıktaki ~150 GB'nin biraz altında kalıyor ve yalnızca Rusça en büyük tek payı oluşturuyor. Dört Orta Asya dili birlikte yaklaşık 59 GB'a karşılık geliyor — teknik derlemeleri kıt olan diller için hâlâ kayda değer bir büyüklük, ancak seti değerlendiren herkes etikete değil gerçek bileşime bakmalı.

Paketleme sorunu

Yazarın anlattığına göre veriyi toplamak emeğin yalnızca yarısıydı. 150 GB ham hâlde yüklemek topluluk bant genişliğini tüketebilirdi; bu yüzden arşiv 7z ile en yüksek ayarında sıkıştırıldı — bu tercih geliştiricinin makinesini sınırlarına kadar zorladı. Bu ölçekte metin sıkıştırma, sözlük tamponları için büyük miktarda bellek gerektiriyor; yazı, parametreler sonunda işbirliği yapmadan önce yaklaşık on saatlik çöken sıkıştırma denemelerini, tekrar tekrar donan işletim sistemini ve sürekli bellek yetersizliği hatalarını anlatıyor. Bitmiş arşiv yaklaşık 27,7 GB; orijinal boyutunun beşte birinin biraz altında.

Hedeflenen kullanımlar

Yazar üç ana uygulama öneriyor:

  • StarCoder veya CodeLlama gibi kod modellerini ince ayarla (fine-tuning) geliştirmek, böylece Orta Asya dillerinde yazılmış teknik şartnameleri, dokümantasyonu ve yorumları işleyebilmeleri için.
  • IT terminolojisini doğru şekilde aktarabilen çeviri modelleri eğitmek; örnek olarak Rust'taki threading kavramları ve Go'daki mikroservis söz dağarı veriliyor.
  • Sürekli ön eğitim veya alan uyarlaması; ulusal dil derlemeleri, 1B ile 2.5B parametreli küçük modelleri sıfırdan eğitmeye yetecek büyüklükte olarak tanımlanıyor.

Yazının yanıtsız bıraktığı sorular

Bu, belgelenmiş bir sürüm değil birebir deneyim anlatısı ve eğitim kararları için önemli bazı ayrıntılar ele alınmıyor. Metnin nereden toplandığı, nasıl filtrelendiği veya tekilleştirildiği ya da kazınan malzemenin orijinal lisanslamasının nasıl ele alındığına dair bir açıklama yok. CC BY 4.0 koşulları, yayımın yazarın paketlediği hâline uygulanıyor; bu, her bir altta yatan belgeyi telif açısından temizlemekle aynı şey değil. Özellikle, sıkıştırma sorunlarını çözme süreci yazının büyük kısmını kaplarken veri kalitesi çalışması tek bir geçiş cümlesiyle özetleniyor. Bağımsız bir değerlendirme ya da benchmark henüz yok ve veri seti üçüncü taraflarca incelenmedi.

Neden önemli

Açık eğitim verileri hâlâ büyük ölçüde İngilizceye ve bir avuç yüksek kaynaklı dile eğilimlidir ve bu boşluk teknik içerikte en geniştir: Kırgızca veya Tacikce gibi dillerde dokümantasyon, kod yorumları ve IT terminolojisi kamuya açık derlemelerde neredeyse hiç yok. Bu kıtlık, ilerleyen aşamalarda zayıf model performansı ve güvenilmez çeviri olarak kendini gösteriyor. Bu boyutta bir topluluk yapımı sürüm boşluğu tek başına kapatmaz; gerçek değeri ham gigabaytlardan çok kökene ve kaliteye bağlı olacak. Ancak düşük kaynaklı NLP üzerinde çalışan araştırmacılara değerlendirebilecekleri, ince ayar yapabilecekleri ve üzerinde iyileştirebilecekleri somut bir şey veriyor ve bölgesel dillerin kaynak kodla sıra dışı eşleşmesi, onu düz bir metin dökümünden daha ilginç kılıyor.

  • #datasets
  • #low-resource-languages
  • #llm-training
  • #hugging-face
  • #open-source

İlgili yazılar