deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

OpenAI, hızlanan model yarışında Claude Fable 5.1'in ardından günler sonra GPT-6 Astra'yı duyurdu

OpenAI'nin GPT-6 Astra'sı, Anthropic'in Claude Fable 5.1'inden günler sonra kendi bildirdiği bilgisayar kullanımı ve kodlama benchmarklarında öne geçti; ancak daha geniş muhakeme testlerinde Claude'un gerisinde kaldı ve OpenAI'nin en yüksek siber risk seviyesine ulaştı.

OpenAI, hızlanan model yarışında Claude Fable 5.1'in ardından günler sonra GPT-6 Astra'yı duyurdu

OpenAI, en yeni frontier modeli GPT-6 Astra'yı, Anthropic'in Claude Fable 5.1'i piyasaya sürmesinden bir hafta az bir süre sonra duyurdu. Lansmanla ilgili dev.to'daki bir yazıya göre OpenAI, Astra'yı şimdiye kadarki en zeki ve en iyi hizalanmış modeli olarak sunuyor; vurgu, işin nasıl yapılacağını anlatmak yerine işi tamamlamak üzerine kurulmuş.

Makineyi çalıştırmak için tasarlanmış bir model

Öne çıkan yetenek, uçtan uca bilgisayar kullanımı. Yazıya göre Astra, adım adım yönlendirme olmadan formları doldurabili, CRM kayıtlarını güncelleyebiliyor, frontend QA kontrollerini çalıştırabili ve ekranda olup biteni izleyerek yazılım sorunlarını çözebiliyor. OpenAI'nin kendi bildirdiği rakamlara göre model, OSWorld 2.0'da yüzde 72,6 ile yüzde 70,2'lik Claude Opus 5'in ve yüzde 65,7'lik selefi GPT-5.6 Sol'un hemen önünde yer alıyor. Lansman materyalindeki bir örnek, modelin bir W-2'deki rakamları çıkarıp Form 1040'e girmesini gösteriyor; bu, nihai beyanı insan incelemesine bırakırken rutin vergi hazırlığını otomatikleştiriyor.

İlgili bir başka değişiklik de ne zaman söz edeceğine dair daha iyi muhakeme. Yan yana bir demoda GPT-5.6 Sol yaklaşık 13 dakikada yardımsız bir kişisel kariyer web sitesi kurarken, Astra 20 saniye sonra duraklayıp kullanıcının gerçekte hangi kariyere geçtiğini sordu. Demonun anlatmak istediği, otonom hareket etmenin yanlış sonuç riski taşıyıp taşımadığını tartan bir model.

Uzun kodlama oturumları için kalıcı notlar

Codex'te Astra, uzun hata ayıklama oturumlarını tekrar tekrar tek bir özete sıkıştırmak yerine context pencereleri arasında aranabilir notlar tutabiliyor; böylece daha önceki bir düzeltmenin neden başarısız olduğu gibi, sıkıştırmanın genellikle kaybettiği ayrıntılar korunuyor. Bu özellik şu an için Codex'in config dosyası üzerinden opt-in; OpenAI, önümüzdeki haftalarda varsayılan hale geleceğini söylüyor.

Siber güvenlik yeteneği OpenAI'nin en yüksek risk seviyesine ulaşıyor

En keskin değişiklik bir üretkenlik özelliği değil. OpenAI, Astra'nın kendi Preparedness Framework'ü altında siber güvenlikte Kritik eşiğine, yani en yüksek risk seviyesine ulaştığını bildiriyor; bu, modelin daha önce bilinmeyen zafiyetler için kendi başına çalışan exploit'ler tespit edip geliştirebileceği anlamına geliyor. Şirket, ExploitBench'te tam puan ve SRE-Bench tersine mühendislik görevlerinde ilk denemede yüzde 88 başarı oranı bildiriyor. Bu değerlendirme nedeniyle riskli bölümler lansmanda kapalı tutuluyor: Astra, güvenli kod incelemesi ve yama doğrulaması gibi savunma çalışmalarına yardım edecek, ancak OpenAI Daydream programı aracılığıyla erişimi genişletene kadar proof-of-concept exploit oluşturmayı reddedecek.

Benchmark tablosu tutarsız

Tüm rakamlar OpenAI'nin kendi lansman materyallerinden geliyor ve bunlar net bir üstünlük oluşturmuyor. Astra, Terminal-Bench 4.0'da yüzde 57,7 ile Claude Fable 5.1'in yüzde 55,8'inin önünde ama ancak dar bir farkla; GPQA Diamond'da ise Gemini 3.8 Flash'ın yüzde 95,3'ünün hemen üzerinde yüzde 96,0 alıyor. FrontierMath Tier 4'te yüzde 97,6 bildiriyor; bu, GPT-5.6 Sol'un yüzde 83,0'ından ciddi bir yükseliş. Ancak araçlarla Humanity's Last Exam'de yüzde 57,2 alarak hem yüzde 65,0'lık Claude Fable 5.1'in hem de yüzde 63,6'lık Claude Opus 5'in gerisinde kalıyor.

Öne çıkan bir rakam da yıldız işareti taşıyor. Astra'nın pazarlamada kullanılan ARC-AGI-3'teki yüzde 99,9'luk sonucu, pahalı ve durum bilgisi taşıyan (stateful) bir değerlendirme ortamına dayanıyor; yazıya göre ARC Prize Foundation'ın bağımsız testleri, standart bir stateless API çağrısının, kullanılan muhakeme seviyesine bağlı olarak yüzde 17 ile yüzde 63 arasında kaldığını bulmuş.

Fiyatlandırma ve kullanılabilirlik

Astra aşamalı olarak yayılıyor: önce sınırlı sayıda kuruluş, ardından sonraki günlerde ChatGPT Plus, Pro, Business ve Enterprise kullanıcıları. Geliştiriciler modeli OpenAI API, Microsoft Azure ve Amazon Bedrock üzerinden gpt-6-astra adıyla kullanabiliyor; fiyat, milyon input token başına 10 dolar ve milyon output token başına 50 dolar; hızlı mod ise yaklaşık 2,5 kat hız 2 kat fiyat sunuyor. Bu, GPT-5.6 Terra'nın 2/12 dolarlık ve Claude Opus 5'in 5/25 dolarlık ücretlerinin oldukça üzerinde; yazıya göre bu, modelin toplu metin üretiminden çok yüksek değerli otonom işleri hedeflediğinin bir işareti. Uygun API müşterileri için sıfır veri saklama (zero data retention) mevcut. Erişimi olan kullanıcıların yaptığı ilk karşılaştırmalar — geliştirici Karan Kendre'nin paylaştığı bir Blender villa sahnesi dahil — genellikle Astra lehine, ancak iki model de henüz geniş çapta erişilebilir değil.

Neden önemli

İki şey öne çıkıyor. Birincisi, frontier model yarışı sıklaşıyor: Astra, Anthropic'in sürümünden bir hafta içinde geldi ve rekabet artık sohbet kalitesinden çok agentic güvenilirlikle — bilgisayar kullanımı, oturum belleği ve ne zaman durup soracağını bilmekle — ölçülüyor. İkincisi, Astra'nın siber güvenlik değerlendirmesi, yeteneğin dağıtım politikasının önüne geçtiğini gösteriyor: OpenAI, kendi en yüksek risk seviyesinde sınıflandırdığı bir model inşa etti ve yine de piyasaya sürüyor; tehlikeli bölümler ayrı bir erişim programının ardına çitlenmiş. Tartışmalı değerlendirme kurulumları ve otonom iş yüklerine yönelik fiyatlandırma arasında gerçek karar, kuruluşların Astra'ya dağınık, çok adımlı görevler verip sonuca güvenip güvenemeyeceğinden gelecek — hiçbir leaderboard'ın yakalamadığı bir test bu.

  • #openai
  • #gpt-6-astra
  • #anthropic
  • #llms
  • #benchmarks
  • #ai-safety

İlgili yazılar