· kaynak dev.to (home feed)
Uygulama raporu: GPT-6, yayında olan bir bilgi-ağı blogunda iki tur düzeltme yaptı
Bir geliştiricinin dev.to üzerindeki yazısı, yayındaki bir bloga GPT-6 ile yapılan iki tur iyileştirmeyi anlatıyor — arama ve mobil düzeltmeler, yıldız haritası cila çalışmaları — ve modelin gizlemeyi reddettiği test hataları.

Olgun bir proje test vakası olarak
GPT-6'nın gerçek geliştirme işlerinde kullanımına dair ilk detaylı el prevailing raporlarından biri dev.to'da yayınlandı. perrinyong adıyla yazan yazar, modele erişim elde etmesini ve See the Forest (见林) adlı, halihazırda yayınlanmış ve birkaç tur tasarım ile iterasyondan geçmiş kişisel bir bilgi blogunda çalıştırmasını anlatıyor.
Blog alışılmadık bir yapıda: ana gezinmesi, yazarın notlarından oluşan etkileşimli bir "yıldız haritası" ve test anında 558 herkese açık düğüm ile 846 ilişki içeriyor; hem insanlar hem de yazılım agent'ları tarafından okunabilir şekilde tasarlanmış. Sorulan soru, modelin sıfırdan bir şey inşa edip edemeyeceği değil, olgun bir projede projeyi özgün kılan nitelikleri ezmeden gerçek iyileştirmeler bulup bulamayacağıydı.
Yazar ikinci bir motivasyonunu da açıkça dile getiriyor — GPT-6 etrafındaki ilgiyi ödünç alarak projeyi tanıtmak — ve raporu değerlendirirken bunu bilmek önemli. Ayrıca bu, modelin erişimi veya davranışına dair bağımsız doğrulama içermeyen, tek kişinin kendi anlattığı bir hikâye.
Birinci tur: daha yoğun arama, okunabilir mobil
Yazıya göre ilk tur, yıldız haritasının görsel tarzına bilinçli olarak dokunmadı ve okuma ile aramaya odaklandı. Arama sayfasında GPT-6, sonuç başlıklarına tekdüze bir yazı tipi boyutu verdi, aşırı büyük başlık alanını küçülttü ve başlıklarının birebir tekrarı olan snippet'leri kaldırdı. Sıralamaya dokunulmadı ve hiçbir içerik yeniden yazılmadı. Pratik etkisi, 1440 × 900 pencerede ikinci bir sonuç satırının ilk ekrana sığması oldu.
Mobilde ise içindekiler tablosu yalnızca masaüstünde vardı ve okuyucular bölümleri bulmak için ileri geri kaydırmak zorundaydı. GPT-6, JavaScript devre dışıyken bile çalışan, varsayılan olarak daraltılmış, genişletilebilir bir içindekiler tablosu ekledi ve ikinci seviye başlıkla başlayan bir notun ilk bölümünün içindekilerden atlanmasına yol açan bir hatayı düzeltti. Ayrıca başarısız aramalar için yeniden deneme düğmesi, boş sonuç sayfalarına konu bağlantıları ekledi ve azaltılmış hareket etkin olan kullanıcılarda hâlâ çalışan bir fade-in gecikmesini düzeltti.
İkinci tur: daha keskin yıldızlar, reddedilen bir deney
İkinci tur, yıldız haritasının görsellerini hedefledi. Konu düğümlerini tanınması zorlaştıran daha temiz bir görüntü denemesi, korunmak yerine çöpe atıldı. Ayakta kalan değişiklikler yıldızların ve ince bağlantı çizgilerinin kenarlarını keskinleştirdi; bir düğüm seçildiğinde ana bağlantı yolları artık ikincil olanlardan daha güçlü çiziliyor ve ilişkilerin hiyerarşisi daha kolay okunur hâle geliyor. Renkler aynı kaldı ve hiçbir düğüm yeniden düzenlenmedi.
Başarısız kontrolleri nasıl ele aldı
Raporun en öğretici kısmı, modelin başarısızlıkla nasıl başa çıktığı. Birinci turun browser kontrolleri iki API hatası ve bir sürükleme-yerleşme hatası ortaya çıkardı. API hatalarının test hatası olduğu anlaşıldı — üretim sitesinin adresi yerel önizleme adresiyle karşılaştırılıyordu — ve ürün yerine testlerde düzeltildi. Yerleşme hatası için yazıya göre model aynı işlemleri eski sürümde yeniden çalıştırdı, hataları orada da yeniden üretti ve isteğe bağlı reklam isteklerinden kaynaklanan yükleme gecikmelerini dışlayarak, önceden var olan ürün sorunlarını kendi değişikliklerinin getirdiği sorunlardan ayırdı.
İkinci turun doğrulaması daha da ileri gitti: ekran boyutları, piksel yoğunlukları ve açık/koyu temalar boyunca on set durum karşılaştırması; düğüm sayıları, ilişki sayıları, kamera konumları ve etiket konumları değişmedi; 180 seçim, 36 sürükleme ve altı gezinme gidiş-dönüşünü kapsayan etkileşim kontrolleri; 180 Atlas unit testi ve 108 blog unit testi geçildi, ayrıca 25 sayfa görüntüleme üzerinde browser kontrolleri yapıldı. İki Atlas dinamik kontrolü hâlâ başarısızdı; bunlar hareket yörüngesi karşılaştırmaları ve sürükleme yayılımının görünürlüğüyle ilgiliydi. Yazıya göre model kabul kriterlerini gevşetmedi ve her iki sorunu da raporda belgeli bıraktı; gerekçesi aynı hatanın eski sürümde de var olması, dolayısıyla yeni değişikliklerin suçlanamayacağıydı.
Neden önemli
Benchmark puanları, bir modelin gerçek ve dağınık bir codebase içinde nasıl davrandığı hakkında pek bir şey söylemez. Olduğu gibi kabul edilen bu anlatıda öne çıkan şey yargı gücü: mevcut bir görsel kimliği korumak, kendi deneylerinden birini reddetmek, hataların değişikliklerinden önceye dayanıp dayanmadığını teşhis etmek ve testleri geçirmek için testleri zayıflatmayı reddetmek. Rapor tutarlıysa, AI destekli geliştirmenin yönüne işaret ediyor — boş bir sayfadan kod üretmekten çok, zaten çalışan projelerin özenli bakımı. Ayrıca erken erişim raporlarını yazarın motivasyonlarını akılda tutarak okumak için de faydalı bir hatırlatma.
- #gpt-6
- #ai
- #developer-tools
- #testing
- #hands-on