deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (hnrss.org)

OpenArch: modern LLM mimarilerinin sıfırdan PyTorch uygulamaları

Hacker News'te öne çıkan bir GitHub projesi, üretim kullanımı için değil yan yana mimari karşılaştırması için tasarlanmış, Llama, DeepSeek, Gemma, Qwen, Kimi ve GPT-OSS'un tek dosyalık PyTorch uygulamalarını sunuyor.

OpenArch: modern LLM mimarilerinin sıfırdan PyTorch uygulamaları

OpenArch nedir

Hacker News ana sayfasında öne çıkan OpenArch adlı GitHub deposu, modern açık kaynak LLM'lerin mimarilerini, model başına tek bir okunabilir dosya olacak biçimde sade PyTorch ile yeniden uygulamayı hedefliyor. Projenin README'sine göre yazar (GitHub kullanıcısı anuj0456), her uygulamayı özgün makalelerden, teknik raporlardan, referans konfigürasyon dosyalarından ve Sebastian Raschka ile Machine Learning Mastery'nin açıklayıcı yazılarından yararlanarak sıfırdan inşa etmiş.

Proje kendisini bir üretim kütüphanesinin tam tersi olarak konumlandırıyor. Amacı Hugging Face'in transformers kütüphanesine ya da model geliştiricilerin kendi kod tabanlarına rakip olmak değil; öncelik, okuyucunun tek bir model.py dosyasını açıp yapıyı baştan sona takip edebilmesi ve her klasördeki kısa README'nin tasarım kararlarını ve dayandığı kaynakları açıklaması.

Şu ana kadar neler uygulanmış

Yaklaşık bir düzine metin mimarisi forward pass çalıştırabilecek durumda olarak işaretlenmiş; ölçek ve dönem olarak geniş bir yelpazeyi kapsıyorlar: 1,5 milyar parametrelik GPT-2 XL, Llama 2 (7B) ve Llama 3 (8B), OLMo 2 (7B), Gemma 3 (27B), Mistral 3 (24B) ve Qwen 3 (4B, ayrıca 30B-A3B mixture-of-experts varyantı da listelenmiş), buna ek olarak seyrek MoE sistemleri DeepSeek R1 (671B), Llama 4 Maverick (400B), Kimi K2 (1T), GLM 4.5 (355B) ve GPT-OSS (20B). Çok modlu tarafta PaliGemma (3B) tamamlanmış; Grok-2.5, çok modlu bir Qwen3 ve DALL-E ise devam eden çalışmalar olarak işaretlenmiş. Nihai hedef, Sebastian Raschka'nın LLM Architecture Gallery'sindeki 72 mimarinin tamamı.

Belgelendirdiği tasarım eksenleri

Projenin önkabulü, günümüz LLM'lerinin ortak bir iskelet paylaştığı ve çok sayıda küçük ama sonuç doğuran kararla ayrıştığı. OpenArch bu kararları inceleme nesnesi yapıyor; dikkat (attention) varyantları (multi-head, grouped-query, multi-head latent, sliding-window ve lineer/DeltaNet hibritleri), normalizasyon seçimleri (pre- ve post-norm, RMSNorm, QK-Norm, sandwich norm), konumsal kodlamalar (RoPE, NoPE, kısmi RoPE, YaRN), decoder türleri (yoğun ve seyrek mixture-of-experts, ortak uzmanlı ya da uzmansız; hibrit Mamba/attention katmanları) ve multi-token prediction, latent experts ve gated attention gibi eğitim zamanı teknikleri ele alınıyor.

README'nin projenin varlığına dair gerekçesi, resmi model kodlarının verimlilik, sharding ve geriye dönük uyumluluğa hizmet edecek şekilde yazıldığı, bu yüzden öğretici bir metin olarak zayıf kaldığı. Bu yeniden uygulamalar tüm bunları okunabilirlik lehine feda ediyor.

Katkılar ve lisanslama

Yazar açıkça katkıcı arıyor. Önerilen giriş noktaları arasında galeriye henüz eklenmemiş bir modeli uygulamak, mevcut bir uygulamanın mimari tercihleri için belge yazmak ya da resmi ağırlıkları yükleyip birkaç token üzerinde çıktıları eşleştiren forward-pass testleri eklemek yer alıyor. Büyük bir iş üstleneceklerden, emeğin çiftlenmemesi için önce bir issue açmaları isteniyor.

Depo Apache 2.0 lisansıyla lisanslanmış; ilgili durumlarda tek tek model klasörleri özgün lisanslarını izliyor. Bir uyarı notunda, kodun kamuya açık materyalin elden geldiğince bir yorumu olduğu, özgün model yazarlarıyla bir bağı bulunmadığı ve onlar tarafından onaylanmadığı ile üretim kullanımına uygun olmadığı belirtiliyor.

Neden önemli

Çoğu mühendis LLM iç yapısıyla ya soyut olan makaleler üzerinden ya da okunmaları zorlaşana dek optimize edilmiş üretim kod tabanları üzerinden tanışıyor. Dosya düzenini modeller arasında sabit tutan paralel bir uygulama seti, "Llama 4 Maverick'i DeepSeek R1'den gerçekte ne ayırıyor" gibi bir soruyu iki dosyayı yan yana okuyarak cevaplanabilecek bir hâle getiriyor. Ayrıca Raschka'nın mimari galerisine çalışabilir bir karşılık kazandırıp şema ile kod arasındaki boşluğu kapatıyor. Önerilen ağırlık eşleştirme testleri hayata geçerse proje, bu mimarileri taşıyan, denetleyen ya da öğreten herkes için güvenilir bir referans olabilir; ayrıca bir modele katkı vermek, makaleleri ve konfigürasyon dosyalarını dikkatle okuma konusunda titiz bir alıştırmanın kendisi.

  • #pytorch
  • #llm
  • #open-source
  • #machine-learning

İlgili yazılar