YGT Labs AIGPT‑5.6 ATLASI
EN
34/34 canlı test

MODEL SEÇİMİ / 10 TEMMUZ 2026

3 model.
Tek doğru rota.

En yüksek skor her iş için en iyi seçim değil. Önce darboğazını seç; model cevabı aşağıda.

Canlı atlası aç
40 resmî benchmark5 bağımsız laboratuvar34 izole koşu17 Standard/Fast eşleşmesi

REHBERLİ THREE.JS DENEYİMİ

Bir sahne.
Beş net soru.

Kontrol paneli değil. Sorunu seç; kamera veriyi senin için düzenlesin.

Model evreni hazırlanıyor…

GENEL BAKIŞ

Üç ekonomik rol

Sağa gittikçe genel zekâ, yukarı çıktıkça ölçülen Fast hızı artar. Veri heykelleri eşit boyuttadır.

Sürükle: döndürKaydır: yakınlaşNoktaya tıkla: ayrıntı
İleri düzey Eksenleri kendin düzenle +
1
Önce soru seç

Zekâ, hız, maliyet veya doğrudan karar.

2
Modele tıkla

Kamera yaklaşır; diğer gürültü geri çekilir.

3
Kanıtı aç

Ham tablo aşağıda; hiçbir sayı saklanmaz.

3D verisini liste olarak göster +

Sol — Kapasite tavanı

Genel zekâ
58.9
Fast efektif hız
51,75 tok/s
Standard efektif hız
46,35 tok/s
Output fiyatı
$30 / 1M

Terra — Günlük sürücü

Genel zekâ
55
Fast efektif hız
60,69 tok/s
Standard efektif hız
41,31 tok/s
Output fiyatı
$15 / 1M

Luna — Hız ve ölçek

Genel zekâ
51.2
Fast efektif hız
68,4 tok/s
Standard efektif hız
43,34 tok/s
Output fiyatı
$6 / 1M

10 SANİYELİK KARŞILAŞTIRMA

Önce karar.
Sonra ayrıntı.

Üç modelin ekonomik rolü tek tabloda.

Sol

Kapasite tavanı

58.9genel zekâ

En zor coding, araştırma, cyber ve uzun ufuklu ajan işleri.

Standard süre
21,32 sn
Fast süre
17,8 sn
Standard hız
46,35 tok/s
Fast hız
51,75 tok/s
API output
$30 / 1M
Mimari · zor debug · cyber

Terra

Günlük sürücü

55genel zekâ

Sol’a yakın üretim gücü; yarı token fiyatı ve dengeli günlük akış.

Standard süre
21,46 sn
Fast süre
13,12 sn
Standard hız
41,31 tok/s
Fast hız
60,69 tok/s
API output
$15 / 1M
Günlük coding · araştırma · plan

Luna

Hız ve ölçek

51.2genel zekâ

Yüksek hacimli, kısa ve maliyet hassas yardımcı-agent işleri.

Standard süre
22 sn
Fast süre
15,5 sn
Standard hız
43,34 tok/s
Fast hız
68,4 tok/s
API output
$6 / 1M
Özet · sınıflama · yardımcı agent
Varsayılan rotaTerra ile başla → görev zorlaşırsa Sol → hacim artarsa Luna.Bu bir YGT canlı test çıkarımıdır; evrensel zekâ hükmü değildir.

KAPASİTE OKUMASI / IQ + HIZ + REASONING

Hız ayrı.
Kapasite IQ ayrı.

Tek sayı hüküm vermez. Üstteki model kartları AA Max referansını, 100 merkezli göreli bir Kapasite IQ ölçeğine çevirir; effort bazlı gerçek eğri aşağıdadır.

Kapasite tavanıSol
136Max-ref. IQ
100120140
AA Max zekâ
58,9
Fast efektif hız
51,8 tok/s
Yerel koşu üst modu
Ultra
Günlük sürücüTerra
120Max-ref. IQ
100120140
AA Max zekâ
55
Fast efektif hız
60,7 tok/s
Yerel koşu üst modu
Ultra
Hız ve ölçekLuna
105Max-ref. IQ
100120140
AA Max zekâ
51,2
Fast efektif hız
68,4 tok/s
Yerel koşu üst modu
Max
REASONING + ORKESTRASYON

Low–Max reasoning bütçesi; Ultra ayrı çalışma modudur.

Hız ve reasoning tokenları aynı sabit görevdeki canlı koşuların ortalamasıdır. Low–Max düşünme bütçesini değiştirir; Codex Ultra ise bölünebilir işlerde subagent orkestrasyonudur.

  1. L01
    Refleks

    Kısa plan, hızlı dönüş.

    Ort. reasoning
    532,8 tok
    Ort. Fast hız
    53,4 tok/s
    SolTerraLuna
    n=6
  2. L02
    Dengeli

    Günlük çözüm bütçesi.

    Ort. reasoning
    624,8 tok
    Ort. Fast hız
    51,3 tok/s
    SolTerraLuna
    n=6
  3. L03
    Planlı

    Daha uzun zincir, daha çok kontrol.

    Ort. reasoning
    785,2 tok
    Ort. Fast hız
    55,5 tok/s
    SolTerraLuna
    n=6
  4. L04
    Çok adımlı

    Ara adımları genişletir.

    Ort. reasoning
    863,3 tok
    Ort. Fast hız
    63,6 tok/s
    SolTerraLuna
    n=6
  5. L05
    Derin

    Zor problem için üst bütçe.

    Ort. reasoning
    1.079,8 tok
    Ort. Fast hız
    68,6 tok/s
    SolTerraLuna
    n=6
  6. L06
    Codex Ultra

    Tek agent effort değil; bölünebilir işte subagent orkestrasyonu.

    Ort. reasoning
    1.328,5 tok
    Ort. Fast hız
    69,7 tok/s
    SolTerra
    n=4
ÜRÜN GELİŞTİRME YÜZEYLERİ

UI/UX ve backend aynı düşünme seviyesini istemez.

Bu iki yüz, tek “coding puanı” değildir. Aşağıdaki göreli fit; profil metriklerinin açık formülle birleştirilmiş okuyuşudur.

FRONTEND / UI-UX UYGULAMA

Arayüzü üretme ve sistemi tutarlı kılma.

Component mimarisi, responsive akış, erişilebilirlik ve görsel uygulama için göreli fit.

Coding %55 · Multimodal %25 · Context %20
Sol77
Terra74
Luna67
  1. 01Medium: hızlı UI / bakım
  2. 02High: design system / erişilebilirlik
  3. 03XHigh: karmaşık ürün akışı
BACKEND / MİMARİ GELİŞTİRME

Sözleşmeyi, bağlamı ve riski birlikte taşıma.

API sözleşmesi, domain modelleme, uzun bağlam ve güvenlik temelli mimari kararlar için göreli fit.

Coding %45 · Context %35 · Cyber %20
Sol80
Terra74
Luna63
  1. 01High: servis / API geliştirme
  2. 02XHigh: mimari / refactor
  3. 03Max: kritik iş · Ultra: bölünebilir iş
KARŞILAŞTIRMA LABORATUVARI

Bir koşuyu.
Diğer koşuya karşı.

Sol’un High, XHigh ve Ultra koşularını Terra ya da Luna Max ile hazır eşleştir. Sonra iki tarafın modelini, effort’ını ve Standard/Fast modunu serbestçe değiştir.

A · İlk koşuSol · Planlı · Fast
B · Karşı koşuTerra · Derin · Fast
9 ham parametre + 2 oran. Aynı sabit görev, iki seçili koşu.Yüksek hız tek başına daha iyi karar demek değildir.
MODEL + REASONING / İKİ AYRI GERÇEK

Zekâ effort ile değişir. Profil tavanı ayrı.

AA zekâ endeksi ve türetilmiş Kapasite IQ seçili Low–Max effort’a göre değişir. Coding, UI/UX ve backend satırları için yayımlanmış effort eğrisi olmadığından Max referansı gösterilir.

Sol · PlanlıKAPASİTE / FARKTerra · Derin
56 endeks
AA zekâ · seçili effortB − A: -1 endeks
55 endeks
124 IQ
Kapasite IQ · seçili effortB − A: -4 IQ
120 IQ
80 puan
Coding gücü · Max ref.B − A: -2,6 puan
77,4 puan
77 fit
Frontend / UI-UX fit · Max ref.B − A: -3 fit
74 fit
80 fit
Backend / mimari fit · Max ref.B − A: -6 fit
74 fit
49,4 puan
Bilim iş akışı · Max ref.B − A: -6,4 puan
42,9 puan
71,9 puan
Siber kapasite · Max ref.B − A: -10,4 puan
61,5 puan
83,3 puan
Uzun bağlam · Max ref.B − A: -5,7 puan
77,6 puan
88,9 puan
Akademik reasoning · Max ref.B − A: -6,8 puan
82 puan
66,1 puan
Multimodal · Max ref.B − A: -3,6 puan
62,5 puan
7,78 puan
ARC-AGI-3 · Max ref.B − A: -6,98 puan
0,8 puan
SEÇİLİ KOŞU / EFFORTA BAĞLIToken, hız, süre ve maliyet.
Sol · Planlı · FastPARAMETRE / FARKTerra · Derin · Fast
17,3 sn
Duvar süresiB − A: -0,8 sn
16,5 sn
20.491 tok
Input tokenB − A: 195 tok
20.686 tok
8.960 tok
Cache tokenB − A: 512 tok
9.472 tok
764 tok
Toplam outputB − A: 371 tok
1.135 tok
654 tok
Reasoning tokenB − A: 380 tok
1.034 tok
110 tok
Görünür outputB − A: -9 tok
101 tok
44,1 tok/s
Efektif hızB − A: 24,6 tok/s
68,7 tok/s
6,4 tok/s
Görünür hızB − A: -0,2 tok/s
6,1 tok/s
$0.170
API eşdeğeri maliyetB − A: $-0.075
$0.095
43,7 %
Cache oranıB − A: 2,1 %
45,8 %
85,6 %
Reasoning payıB − A: 5,5 %
91,1 %

Ölçüler aynı problemi çözen iki izole koşudan gelir. Output/reasoning token miktarı kalite puanı değildir; zaman ve maliyet daha düşük, hız daha yüksek olduğunda yalnız ilgili eksende avantaj gösterir. Hücre başına n=1.

Kapasite IQ insan IQ’su, bilinç ölçümü ya da başarı garantisi değildir. UI/UX fit estetik zevk ölçümü değildir; backend fit de production güvence puanı değildir. Yerel hız verisi hücre başına n=1’dir; burada amaç Sol, Terra ve Luna’nın hız / kapasite / düşünme bütçesi dengesini görünür kılmaktır.

YGT Labs AIAPPLIED AI / FIELD NOTE

YGT LABS AI İLE UYGULAMA

Model seçmek değil.
Çalışan sistem kurmak.

YGT Labs AI; ürün mühendisliği, AI, IoT ve entegre otomasyonu aynı iş akışında birleştirir. Bu atlas, GPT‑5.6 ailesini hangi görevde, hangi düşünme seviyesiyle ve hangi maliyet sınırıyla başlatacağımızı netleştiren karar katmanıdır.

SOLZor karar

Mimari, karmaşık debug, yüksek etkili araştırma. High/xhigh yalnız hatanın maliyeti bunu haklı çıkarıyorsa.

TERRAGünlük üretim

Coding, araştırma, ürün içeriği ve kontrollü agent akışı. Varsayılan rota: önce burada ölç.

LUNAHızlı hacim

Özet, sınıflama, taslak ve yardımcı agent işleri. Fast modu ancak kalite eşiğini ölçtükten sonra aç.

Ultra, standart tek-agent thinking seviyesi değildir. Orkestrasyon rotasını ayrı görev değerlendirmesiyle doğrula.

01

Ürün ve kod tabanı

Karmaşık backlog’u mimari karara, inceleme planına ve testlenebilir küçük işlere böl. Sol zor debug, geniş etki analizi ve yüksek doğruluk maliyeti olan işlerde; Terra günlük uygulama akışında iyi başlangıç noktasıdır.

02

Agent akışları

Destek, dosya inceleme, araştırma özeti ve operasyon adımlarını sınıflandır; insan onayı gerektiren eşiği görünür tut. Model tek başına süreç değildir: rol, araç sınırı, ölçüm ve geri alma akışı birlikte tasarlanır.

03

İçerik, SEO ve GEO

Kaynaklı uzmanlık içeriği, yapılandırılmış veri, çok dilli kalite kontrolü ve içerik güncelleme hattı kur. Hedef arama motorunu doldurmak değil; kullanıcı sorusuna denetlenebilir ve yararlı cevap vermektir.

04

Veri ve araştırma

Dağınık kaynakları kanıt matrisi, karar notu ve açık belirsizliklere çevir. Terra ile hacimli ilk ayrıştırma; Sol ile çelişki, istisna ve yüksek riskli son kontrol için rota kurulabilir.

05

Dikey SaaS ve otomasyon

Portal, CRM, IoT veya operasyon sisteminde formdan iş akışına kadar yardımcı katmanlar üret. YGT Labs yaklaşımı modeli mevcut iş kuralları, veri sahipliği ve ölçülebilir sonuçla bağlar.

YGT çalışma alanı: ürün portalları · AI destekli operasyon · çok dilli içerik sistemleri · CRM/iş akışı · IoT ve erişim otomasyonu.

Effort ve yetenek farkını incele YGT Labs AI çalışmalarını aç
Bu atlas uygulamada nasıl kullanılır? +

1. Görevi ayır: hız, doğruluk, maliyet ve insan onayı gereksinimini yaz. 2. Küçük pilot kur: Terra ile ölç; zor istisnalarda Sol’a yükselt; tekrarlı düşük riskli işte Luna’yı dene. 3. Kanıtı kaydet: kabul oranı, duvar saati, token maliyeti ve geri alma durumunu görev bazında izle.

Buradaki yerel hız testleri tek bir kontrollü görevden gelir. Yeni iş yükünde aynı modelin gerçek davranışını yeniden ölçmek gerekir.

VERİ MÜZESİ / 28 GÖRSEL

Her soru için
doğru görsel dil.

Tek bir “zeka puanı” üretmedik. Profil, hız, maliyet ve kanıt ayrı salonlarda; tüm çizimler gerçek kaynak verisinden.

SALON A

Zekâ bir çizgi değil, imza.

Model-seviyesi profil. Koşu telemetrisiyle karıştırılmadı.

SALON B

Hız tek sayı değil, bir yörünge.

Standard ve Fast; aynı model, aynı effort, aynı görev.

SALON C

Fiyat değil, değer geometrisi.

Liste fiyatı, ölçülen koşu maliyeti ve üretim hızı ayrı okunur.

SALON D

Kanıtın ağırlığı görünür.

Resmî, bağımsız ve canlı ölçüm aynı iddia sınıfı değildir.

YENİ / HARNESS LABORATUVARI

Tek model değil.
Çalışan ekip.

Başlangıç seviyesi Türkçe anlatımla 60 günlük kullanım günlüğü, 34 kontrollü model koşusu, beş full-stack A/B ve 5–6 rol ensemble felsefesi.
Support security audit0 → 7Hesap Atölyesi71 → 94Sinyal Bahçesi86 → 84Karanlık Ege84 → 90Host security assessment61 → 14
60 günlük raporu, metodolojiyi ve grafikleri aç

FİNAL / GÖREV ROTASI

Görevi söyle.
Rotayı çıkaralım.

İki seçim. Model, çalışma modu ve effort önerisi. Kararın arkasındaki ölçüm görünür kalır.

1 · Ne yapacaksın?
2 · Önceliğin?
ÖNERİLEN ROTA

Terra

Fast · high effort

Günlük coding için fiyat, hız ve kabiliyet dengesi.

Genel zekâ
55,0
Ölçülen Fast hız
60,69 tok/s
Output fiyatı
$15 / 1M
3D rotayı aç

KANIT KATMANI

İddia değil.
İz bırakıyoruz.

Önce altı temsilî benchmark. Sonra isteyen için bütün ham kayıtlar.

40
Tüm resmî benchmarklarOpenAI GA tablosu · kategori, model ve önceki nesil
+
40 sonuç
GPT-5.6 Sol, Terra, Luna ve GPT-5.5 resmî benchmark karşılaştırması
BenchmarkSolTerraLunaGPT‑5.5Not
ProfesyonelAgents’ Last Exam52,750,450,346,9Uzun profesyonel görevler
ProfesyonelGDPval-AA v21.747,81.5931.591,81.493,7Elo; yüzdeyle aynı eksene konmaz
ProfesyonelManagement Consulting43,237,235,431,3Danışmanlık görevleri
ProfesyonelBig Finance Bench53,051,036,049,0Finansal analiz
ProfesyonelAA Intelligence Index58,955,051,254,8Bağımsız endeks; GA tablosu aktarımı
KodAA Coding Agent Index80,077,474,676,4Coding bileşik endeksi
KodSWE-Bench Pro64,663,462,759,4Repository-level mühendislik
KodDeepSWE v1.172,769,667,267,0Bağımsız tekrar aşağıda
KodTerminal-Bench 2.188,8 · Ultra 91,987,484,785,6Terminal ajan görevleri
BilimGeneBench Pro28,723,310,812,0Uzun bilimsel workflow
BilimLifeSciBench59,956,051,250,4Yaşam bilimleri
BilimMedChemBench48,335,030,435,5Tıbbi kimya
BilimHealthBench Professional60,557,755,749,5Profesyonel sağlık
BilgisayarOSWorld 2.062,650,245,647,5Görsel bilgisayar kullanımı
BilgisayarBrowseComp90,4 · Ultra 92,287,583,384,4Web araştırması
BilgisayarBenchCAD70,662,363,144,4CAD görevleri
BilgisayarBenchCAD + Python83,478,273,955,8Python aracı açık
SiberCapture-the-Flag96,791,885,288,1Azaltılmış safeguard koşulu
SiberSEC-Bench Pro71,2 · Ultra 74,357,748,945,8Güvenlik görevleri
SiberCyberGym84,581,877,981,8Siber ajan görevleri
SiberExploitBench73,552,933,247,95 seed + reasoning continuity
SiberExploitGym33,723,212,415,1Alpha latency public API’ye ölçeklendi
Öz-gelişimResearch Debugging Eval68,367,850,850,0Araştırma debug
Öz-gelişimKernelGen 1P61,149,222,429,3Kernel üretimi
Öz-gelişimNanoGPT9,6914,51,662,65Model geliştirme
Öz-gelişimPostTrainBench Lite50,351,529,638,8Post-training işleri
Öz-gelişimRSI Index57,956,341,941,7Araştırma öz-gelişim
MultimodalMMMU Pro · araçsız83,080,778,481,2Multimodal reasoning
MultimodalMMMU Pro · araçlı84,682,079,583,2Araç erişimi açık
Multimodalgdp.pdf30,724,722,726,0Belge anlama
AkademikGPQA Diamond94,692,992,393,6Uzman seviye bilim Q&A
AkademikFrontierMath T1–389,084,978,685,3İleri matematik
AkademikFrontierMath T483,068,358,572,5En zor matematik
AraçAutomationBench18,115,214,912,9Otomasyon görevleri
AraçToolathlon58,053,153,455,6Geniş araç kullanımı
Uzun bağlamMRCR 256K–512K91,589,641,381,5Çok iğneli retrieval
Uzun bağlamMRCR 512K–1M73,872,541,374,0512K–1M retrieval
Uzun bağlamGraphWalks BFS 256K90,776,981,373,7Graf yürüyüşü
Uzun bağlamGraphWalks BFS 1M77,171,251,245,41M bağlam
SoyutARC-AGI-37,780,800,180,43Etkileşimli soyut reasoning
17
Standard / Fast hız defteriHer desteklenen model × effort eşleşmesi
+
17 Standard ve Fast hız eşleşmesi
Model / effortStd snStd tok/sFast snFast tok/sTok/s farkı
Sol low16,6745,0615,4137,560,83×
Sol medium16,1244,3723,3834,560,78×
Sol high19,5843,2117,3244,121,02×
Sol xhigh22,8448,4316,8757,091,18×
Sol max30,7750,6413,8166,411,31×
Sol ultra21,9346,3819,9870,781,53×
Terra low18,1222,249,556,142,52×
Terra medium14,2141,598,2454,481,31×
Terra high21,9339,914,2652,181,31×
Terra xhigh13,3644,481263,91,44×
Terra max23,0348,3216,5268,711,42×
Terra ultra38,1451,3218,1868,721,34×
Luna low16,7240,4413,8166,491,64×
Luna medium21,6342,6213,8164,971,52×
Luna high23,1439,8916,5170,061,76×
Luna xhigh25,844,7316,5169,71,56×
Luna max22,6949,0116,8770,81,44×
09
Topluluk sinyalleriAnekdot; benchmark değil
+
Sol Ultra · olumluYüksek tavan ve repo farkındalığı

Erken kullanıcılar zor game/debug ve browser işlerinde prompt dışı sorunları da bulduğunu bildiriyor. Tekil ilk-gün deneyimleri.

Sol Ultra · karışıkOverthinking ve kota tüketimi

Aynı sebat, basit görevlerde gereksiz scope büyütme ve hızlı kota tüketimi olarak da raporlanıyor.

Sol · olumluZor debugging escalation

Bazı kullanıcılar eski modellerin çözemediği bug’larda geniş proje anlayışı ve güçlü skill/tool seçimi gördüğünü söylüyor.

Terra · olumluNetlik ve günlük akış

Kısa cevap, daha az tool call ve temiz daily-driver davranışı en sık tekrarlanan olumlu Terra teması.

Terra · karışıkEffort–kota gerilimi

Max/XHigh kaliteyi yükseltirken bazı Plus kullanıcıları hızlı limit düşüşü raporluyor; meter bug olasılığı ayrıştırılamıyor.

Luna · olumluKısa işler ve background agent

Sınıflandırma, tek-adımlı tool call, cron ve yardımcı-agent işlerinde hızlı/ucuz alternatif olarak öne çıkıyor.

Luna · karışıkZincir uzadığında shortcut

Araştır–kaydet–mail gibi çok adımlı akışlarda son adımı inceltme ve ayrıntı kaybı bildiren karşı örnekler var.

Aile · karışıkBenchmark ≠ gerçek iş

HN tartışması chart ölçeği, adaptive/max kıyası, harness tarafsızlığı ve tekrar üretilebilirliği sorguluyor.

Operasyon · karışıkRelease-day routing

Sol availability, Luna engine ve Azure Responses-Lite issue’ları model zekâsından ayrı operasyonel olaylar.

34
Metodoloji ve ham veriFresh süreç, sabit görev, 34/34 doğru
+

Ne yaptık?

  1. Her hücre ayrı ephemeral Codex süreci.
  2. Aynı weighted interval scheduling problemi.
  3. Sol/Terra 6; Luna 5 effort seviyesi.
  4. Her effort Standard ve Fast koştu.
  5. Süre, token, reasoning, cache ve maliyet kaydedildi.

Sınırlar

Her hücre n=1. Servis kuyruğu, cache ve sampling gürültüsü var. Efektif token/s decoder throughput değildir. Tek görev genel zekâ kanıtı değildir.

ANA KAYNAKLAR

ResmîOpenAI GPT‑5.6 GA ↗ResmîAPI fiyatları ↗BağımsızDeepSWE ↗BağımsızARC Prize ↗BağımsızArtificial Analysis ↗
HIZLI GEÇİŞAtlas içinde ara