Zekâ, hız, maliyet veya doğrudan karar.
MODEL SEÇİMİ / 10 TEMMUZ 2026
3 model.
Tek doğru rota.
En yüksek skor her iş için en iyi seçim değil. Önce darboğazını seç; model cevabı aşağıda.
Canlı atlası aç ↓REHBERLİ THREE.JS DENEYİMİ
Bir sahne.
Beş net soru.
Kontrol paneli değil. Sorunu seç; kamera veriyi senin için düzenlesin.
İleri düzey Eksenleri kendin düzenle +
Kamera yaklaşır; diğer gürültü geri çekilir.
Ham tablo aşağıda; hiçbir sayı saklanmaz.
3D verisini liste olarak göster +
Sol — Kapasite tavanı
- Genel zekâ
- 58.9
- Fast efektif hız
- 51,75 tok/s
- Standard efektif hız
- 46,35 tok/s
- Output fiyatı
- $30 / 1M
Terra — Günlük sürücü
- Genel zekâ
- 55
- Fast efektif hız
- 60,69 tok/s
- Standard efektif hız
- 41,31 tok/s
- Output fiyatı
- $15 / 1M
Luna — Hız ve ölçek
- Genel zekâ
- 51.2
- Fast efektif hız
- 68,4 tok/s
- Standard efektif hız
- 43,34 tok/s
- Output fiyatı
- $6 / 1M
10 SANİYELİK KARŞILAŞTIRMA
Önce karar.
Sonra ayrıntı.
Üç modelin ekonomik rolü tek tabloda.
Sol
Kapasite tavanı
En zor coding, araştırma, cyber ve uzun ufuklu ajan işleri.
- Standard süre
- 21,32 sn
- Fast süre
- 17,8 sn
- Standard hız
- 46,35 tok/s
- Fast hız
- 51,75 tok/s
- API output
- $30 / 1M
Terra
Günlük sürücü
Sol’a yakın üretim gücü; yarı token fiyatı ve dengeli günlük akış.
- Standard süre
- 21,46 sn
- Fast süre
- 13,12 sn
- Standard hız
- 41,31 tok/s
- Fast hız
- 60,69 tok/s
- API output
- $15 / 1M
Luna
Hız ve ölçek
Yüksek hacimli, kısa ve maliyet hassas yardımcı-agent işleri.
- Standard süre
- 22 sn
- Fast süre
- 15,5 sn
- Standard hız
- 43,34 tok/s
- Fast hız
- 68,4 tok/s
- API output
- $6 / 1M
KAPASİTE OKUMASI / IQ + HIZ + REASONING
Hız ayrı.
Kapasite IQ ayrı.
Tek sayı hüküm vermez. Üstteki model kartları AA Max referansını, 100 merkezli göreli bir Kapasite IQ ölçeğine çevirir; effort bazlı gerçek eğri aşağıdadır.
- AA Max zekâ
- 58,9
- Fast efektif hız
- 51,8 tok/s
- Yerel koşu üst modu
- Ultra
- AA Max zekâ
- 55
- Fast efektif hız
- 60,7 tok/s
- Yerel koşu üst modu
- Ultra
- AA Max zekâ
- 51,2
- Fast efektif hız
- 68,4 tok/s
- Yerel koşu üst modu
- Max
Low–Max reasoning bütçesi; Ultra ayrı çalışma modudur.
Hız ve reasoning tokenları aynı sabit görevdeki canlı koşuların ortalamasıdır. Low–Max düşünme bütçesini değiştirir; Codex Ultra ise bölünebilir işlerde subagent orkestrasyonudur.
- L01Refleks
Kısa plan, hızlı dönüş.
- Ort. reasoning
- 532,8 tok
- Ort. Fast hız
- 53,4 tok/s
SolTerraLunan=6 - L02Dengeli
Günlük çözüm bütçesi.
- Ort. reasoning
- 624,8 tok
- Ort. Fast hız
- 51,3 tok/s
SolTerraLunan=6 - L03Planlı
Daha uzun zincir, daha çok kontrol.
- Ort. reasoning
- 785,2 tok
- Ort. Fast hız
- 55,5 tok/s
SolTerraLunan=6 - L04Çok adımlı
Ara adımları genişletir.
- Ort. reasoning
- 863,3 tok
- Ort. Fast hız
- 63,6 tok/s
SolTerraLunan=6 - L05Derin
Zor problem için üst bütçe.
- Ort. reasoning
- 1.079,8 tok
- Ort. Fast hız
- 68,6 tok/s
SolTerraLunan=6 - L06Codex Ultra
Tek agent effort değil; bölünebilir işte subagent orkestrasyonu.
- Ort. reasoning
- 1.328,5 tok
- Ort. Fast hız
- 69,7 tok/s
SolTerran=4
UI/UX ve backend aynı düşünme seviyesini istemez.
Bu iki yüz, tek “coding puanı” değildir. Aşağıdaki göreli fit; profil metriklerinin açık formülle birleştirilmiş okuyuşudur.
Arayüzü üretme ve sistemi tutarlı kılma.
Component mimarisi, responsive akış, erişilebilirlik ve görsel uygulama için göreli fit.
- 01Medium: hızlı UI / bakım
- 02High: design system / erişilebilirlik
- 03XHigh: karmaşık ürün akışı
Sözleşmeyi, bağlamı ve riski birlikte taşıma.
API sözleşmesi, domain modelleme, uzun bağlam ve güvenlik temelli mimari kararlar için göreli fit.
- 01High: servis / API geliştirme
- 02XHigh: mimari / refactor
- 03Max: kritik iş · Ultra: bölünebilir iş
Bir koşuyu.
Diğer koşuya karşı.
Sol’un High, XHigh ve Ultra koşularını Terra ya da Luna Max ile hazır eşleştir. Sonra iki tarafın modelini, effort’ını ve Standard/Fast modunu serbestçe değiştir.
Zekâ effort ile değişir. Profil tavanı ayrı.
AA zekâ endeksi ve türetilmiş Kapasite IQ seçili Low–Max effort’a göre değişir. Coding, UI/UX ve backend satırları için yayımlanmış effort eğrisi olmadığından Max referansı gösterilir.
Ölçüler aynı problemi çözen iki izole koşudan gelir. Output/reasoning token miktarı kalite puanı değildir; zaman ve maliyet daha düşük, hız daha yüksek olduğunda yalnız ilgili eksende avantaj gösterir. Hücre başına n=1.
Kapasite IQ insan IQ’su, bilinç ölçümü ya da başarı garantisi değildir. UI/UX fit estetik zevk ölçümü değildir; backend fit de production güvence puanı değildir. Yerel hız verisi hücre başına n=1’dir; burada amaç Sol, Terra ve Luna’nın hız / kapasite / düşünme bütçesi dengesini görünür kılmaktır.
APPLIED AI / FIELD NOTEYGT LABS AI İLE UYGULAMA
Model seçmek değil.
Çalışan sistem kurmak.
YGT Labs AI; ürün mühendisliği, AI, IoT ve entegre otomasyonu aynı iş akışında birleştirir. Bu atlas, GPT‑5.6 ailesini hangi görevde, hangi düşünme seviyesiyle ve hangi maliyet sınırıyla başlatacağımızı netleştiren karar katmanıdır.
Mimari, karmaşık debug, yüksek etkili araştırma. High/xhigh yalnız hatanın maliyeti bunu haklı çıkarıyorsa.
Coding, araştırma, ürün içeriği ve kontrollü agent akışı. Varsayılan rota: önce burada ölç.
Özet, sınıflama, taslak ve yardımcı agent işleri. Fast modu ancak kalite eşiğini ölçtükten sonra aç.
Ultra, standart tek-agent thinking seviyesi değildir. Orkestrasyon rotasını ayrı görev değerlendirmesiyle doğrula.
Ürün ve kod tabanı
Karmaşık backlog’u mimari karara, inceleme planına ve testlenebilir küçük işlere böl. Sol zor debug, geniş etki analizi ve yüksek doğruluk maliyeti olan işlerde; Terra günlük uygulama akışında iyi başlangıç noktasıdır.
Agent akışları
Destek, dosya inceleme, araştırma özeti ve operasyon adımlarını sınıflandır; insan onayı gerektiren eşiği görünür tut. Model tek başına süreç değildir: rol, araç sınırı, ölçüm ve geri alma akışı birlikte tasarlanır.
İçerik, SEO ve GEO
Kaynaklı uzmanlık içeriği, yapılandırılmış veri, çok dilli kalite kontrolü ve içerik güncelleme hattı kur. Hedef arama motorunu doldurmak değil; kullanıcı sorusuna denetlenebilir ve yararlı cevap vermektir.
Veri ve araştırma
Dağınık kaynakları kanıt matrisi, karar notu ve açık belirsizliklere çevir. Terra ile hacimli ilk ayrıştırma; Sol ile çelişki, istisna ve yüksek riskli son kontrol için rota kurulabilir.
Dikey SaaS ve otomasyon
Portal, CRM, IoT veya operasyon sisteminde formdan iş akışına kadar yardımcı katmanlar üret. YGT Labs yaklaşımı modeli mevcut iş kuralları, veri sahipliği ve ölçülebilir sonuçla bağlar.
YGT çalışma alanı: ürün portalları · AI destekli operasyon · çok dilli içerik sistemleri · CRM/iş akışı · IoT ve erişim otomasyonu.
Bu atlas uygulamada nasıl kullanılır? +
1. Görevi ayır: hız, doğruluk, maliyet ve insan onayı gereksinimini yaz. 2. Küçük pilot kur: Terra ile ölç; zor istisnalarda Sol’a yükselt; tekrarlı düşük riskli işte Luna’yı dene. 3. Kanıtı kaydet: kabul oranı, duvar saati, token maliyeti ve geri alma durumunu görev bazında izle.
Buradaki yerel hız testleri tek bir kontrollü görevden gelir. Yeni iş yükünde aynı modelin gerçek davranışını yeniden ölçmek gerekir.
VERİ MÜZESİ / 28 GÖRSEL
Her soru için
doğru görsel dil.
Tek bir “zeka puanı” üretmedik. Profil, hız, maliyet ve kanıt ayrı salonlarda; tüm çizimler gerçek kaynak verisinden.
Zekâ bir çizgi değil, imza.
Model-seviyesi profil. Koşu telemetrisiyle karıştırılmadı.
AA Intelligence Index; yüzde değildir.
İlgili resmî yüzde-tabanlı benchmarkların ortalaması.
İlgili resmî yüzde-tabanlı benchmarkların ortalaması.
İlgili resmî yüzde-tabanlı benchmarkların ortalaması.
İlgili resmî yüzde-tabanlı benchmarkların ortalaması.
İlgili resmî yüzde-tabanlı benchmarkların ortalaması.
Hız tek sayı değil, bir yörünge.
Standard ve Fast; aynı model, aynı effort, aynı görev.
Output tokenlarının reasoning alt kümesi.
Reasoning hariç görünür çıktı / duvar süresi.
Fiyat değil, değer geometrisi.
Liste fiyatı, ölçülen koşu maliyeti ve üretim hızı ayrı okunur.
Output token / API fiyat eşdeğeri; bu tek görev için.
Aynı mini-swe-agent harness.
Koşular arası cache asimetrisi maliyet karşılaştırmasını etkiler.
Kanıtın ağırlığı görünür.
Resmî, bağımsız ve canlı ölçüm aynı iddia sınıfı değildir.
Eşitlikler her modele yazılır.
Aynı satır metriği içinde doğrudan karşılaştırma.
CI’lar çakışıyor; küçük farkı mutlak sıralama sayma.
Genel zekâ eşitliği değil; benchmark bütünlüğü kontrolü.
FİNAL / GÖREV ROTASI
Görevi söyle.
Rotayı çıkaralım.
İki seçim. Model, çalışma modu ve effort önerisi. Kararın arkasındaki ölçüm görünür kalır.
Terra
Fast · high effort
Günlük coding için fiyat, hız ve kabiliyet dengesi.
- Genel zekâ
- 55,0
- Ölçülen Fast hız
- 60,69 tok/s
- Output fiyatı
- $15 / 1M
KANIT KATMANI
İddia değil.
İz bırakıyoruz.
Önce altı temsilî benchmark. Sonra isteyen için bütün ham kayıtlar.
Agents’ Last Exam
Uzun profesyonel görevler
AA Coding Agent Index
Coding bileşik endeksi
GeneBench Pro
Uzun bilimsel workflow
SEC-Bench Pro
Güvenlik görevleri
MRCR 512K–1M
512K–1M retrieval
ARC-AGI-3
Etkileşimli soyut reasoning
Pass@1 ± CI
Kaynağı aç ↗BAĞIMSIZARC PrizeARC-AGI 1 / 2 / 3
Kaynağı aç ↗BAĞIMSIZArtificial AnalysisIndex · tok/sn · TTFT
Kaynağı aç ↗BAĞIMSIZMETR50% time horizon
Kaynağı aç ↗BAĞIMSIZIrregularHarici cyber eval
Kaynağı aç ↗40Tüm resmî benchmarklarOpenAI GA tablosu · kategori, model ve önceki nesil+
| Benchmark | Sol | Terra | Luna | GPT‑5.5 | Not |
|---|---|---|---|---|---|
| ProfesyonelAgents’ Last Exam | 52,7 | 50,4 | 50,3 | 46,9 | Uzun profesyonel görevler |
| ProfesyonelGDPval-AA v2 | 1.747,8 | 1.593 | 1.591,8 | 1.493,7 | Elo; yüzdeyle aynı eksene konmaz |
| ProfesyonelManagement Consulting | 43,2 | 37,2 | 35,4 | 31,3 | Danışmanlık görevleri |
| ProfesyonelBig Finance Bench | 53,0 | 51,0 | 36,0 | 49,0 | Finansal analiz |
| ProfesyonelAA Intelligence Index | 58,9 | 55,0 | 51,2 | 54,8 | Bağımsız endeks; GA tablosu aktarımı |
| KodAA Coding Agent Index | 80,0 | 77,4 | 74,6 | 76,4 | Coding bileşik endeksi |
| KodSWE-Bench Pro | 64,6 | 63,4 | 62,7 | 59,4 | Repository-level mühendislik |
| KodDeepSWE v1.1 | 72,7 | 69,6 | 67,2 | 67,0 | Bağımsız tekrar aşağıda |
| KodTerminal-Bench 2.1 | 88,8 · Ultra 91,9 | 87,4 | 84,7 | 85,6 | Terminal ajan görevleri |
| BilimGeneBench Pro | 28,7 | 23,3 | 10,8 | 12,0 | Uzun bilimsel workflow |
| BilimLifeSciBench | 59,9 | 56,0 | 51,2 | 50,4 | Yaşam bilimleri |
| BilimMedChemBench | 48,3 | 35,0 | 30,4 | 35,5 | Tıbbi kimya |
| BilimHealthBench Professional | 60,5 | 57,7 | 55,7 | 49,5 | Profesyonel sağlık |
| BilgisayarOSWorld 2.0 | 62,6 | 50,2 | 45,6 | 47,5 | Görsel bilgisayar kullanımı |
| BilgisayarBrowseComp | 90,4 · Ultra 92,2 | 87,5 | 83,3 | 84,4 | Web araştırması |
| BilgisayarBenchCAD | 70,6 | 62,3 | 63,1 | 44,4 | CAD görevleri |
| BilgisayarBenchCAD + Python | 83,4 | 78,2 | 73,9 | 55,8 | Python aracı açık |
| SiberCapture-the-Flag | 96,7 | 91,8 | 85,2 | 88,1 | Azaltılmış safeguard koşulu |
| SiberSEC-Bench Pro | 71,2 · Ultra 74,3 | 57,7 | 48,9 | 45,8 | Güvenlik görevleri |
| SiberCyberGym | 84,5 | 81,8 | 77,9 | 81,8 | Siber ajan görevleri |
| SiberExploitBench | 73,5 | 52,9 | 33,2 | 47,9 | 5 seed + reasoning continuity |
| SiberExploitGym | 33,7 | 23,2 | 12,4 | 15,1 | Alpha latency public API’ye ölçeklendi |
| Öz-gelişimResearch Debugging Eval | 68,3 | 67,8 | 50,8 | 50,0 | Araştırma debug |
| Öz-gelişimKernelGen 1P | 61,1 | 49,2 | 22,4 | 29,3 | Kernel üretimi |
| Öz-gelişimNanoGPT | 9,69 | 14,5 | 1,66 | 2,65 | Model geliştirme |
| Öz-gelişimPostTrainBench Lite | 50,3 | 51,5 | 29,6 | 38,8 | Post-training işleri |
| Öz-gelişimRSI Index | 57,9 | 56,3 | 41,9 | 41,7 | Araştırma öz-gelişim |
| MultimodalMMMU Pro · araçsız | 83,0 | 80,7 | 78,4 | 81,2 | Multimodal reasoning |
| MultimodalMMMU Pro · araçlı | 84,6 | 82,0 | 79,5 | 83,2 | Araç erişimi açık |
| Multimodalgdp.pdf | 30,7 | 24,7 | 22,7 | 26,0 | Belge anlama |
| AkademikGPQA Diamond | 94,6 | 92,9 | 92,3 | 93,6 | Uzman seviye bilim Q&A |
| AkademikFrontierMath T1–3 | 89,0 | 84,9 | 78,6 | 85,3 | İleri matematik |
| AkademikFrontierMath T4 | 83,0 | 68,3 | 58,5 | 72,5 | En zor matematik |
| AraçAutomationBench | 18,1 | 15,2 | 14,9 | 12,9 | Otomasyon görevleri |
| AraçToolathlon | 58,0 | 53,1 | 53,4 | 55,6 | Geniş araç kullanımı |
| Uzun bağlamMRCR 256K–512K | 91,5 | 89,6 | 41,3 | 81,5 | Çok iğneli retrieval |
| Uzun bağlamMRCR 512K–1M | 73,8 | 72,5 | 41,3 | 74,0 | 512K–1M retrieval |
| Uzun bağlamGraphWalks BFS 256K | 90,7 | 76,9 | 81,3 | 73,7 | Graf yürüyüşü |
| Uzun bağlamGraphWalks BFS 1M | 77,1 | 71,2 | 51,2 | 45,4 | 1M bağlam |
| SoyutARC-AGI-3 | 7,78 | 0,80 | 0,18 | 0,43 | Etkileşimli soyut reasoning |
17Standard / Fast hız defteriHer desteklenen model × effort eşleşmesi+
| Model / effort | Std sn | Std tok/s | Fast sn | Fast tok/s | Tok/s farkı |
|---|---|---|---|---|---|
| Sol low | 16,67 | 45,06 | 15,41 | 37,56 | 0,83× |
| Sol medium | 16,12 | 44,37 | 23,38 | 34,56 | 0,78× |
| Sol high | 19,58 | 43,21 | 17,32 | 44,12 | 1,02× |
| Sol xhigh | 22,84 | 48,43 | 16,87 | 57,09 | 1,18× |
| Sol max | 30,77 | 50,64 | 13,81 | 66,41 | 1,31× |
| Sol ultra | 21,93 | 46,38 | 19,98 | 70,78 | 1,53× |
| Terra low | 18,12 | 22,24 | 9,5 | 56,14 | 2,52× |
| Terra medium | 14,21 | 41,59 | 8,24 | 54,48 | 1,31× |
| Terra high | 21,93 | 39,9 | 14,26 | 52,18 | 1,31× |
| Terra xhigh | 13,36 | 44,48 | 12 | 63,9 | 1,44× |
| Terra max | 23,03 | 48,32 | 16,52 | 68,71 | 1,42× |
| Terra ultra | 38,14 | 51,32 | 18,18 | 68,72 | 1,34× |
| Luna low | 16,72 | 40,44 | 13,81 | 66,49 | 1,64× |
| Luna medium | 21,63 | 42,62 | 13,81 | 64,97 | 1,52× |
| Luna high | 23,14 | 39,89 | 16,51 | 70,06 | 1,76× |
| Luna xhigh | 25,8 | 44,73 | 16,51 | 69,7 | 1,56× |
| Luna max | 22,69 | 49,01 | 16,87 | 70,8 | 1,44× |
09Topluluk sinyalleriAnekdot; benchmark değil+
Erken kullanıcılar zor game/debug ve browser işlerinde prompt dışı sorunları da bulduğunu bildiriyor. Tekil ilk-gün deneyimleri.
Sol Ultra · karışıkOverthinking ve kota tüketimiAynı sebat, basit görevlerde gereksiz scope büyütme ve hızlı kota tüketimi olarak da raporlanıyor.
Sol · olumluZor debugging escalationBazı kullanıcılar eski modellerin çözemediği bug’larda geniş proje anlayışı ve güçlü skill/tool seçimi gördüğünü söylüyor.
Terra · olumluNetlik ve günlük akışKısa cevap, daha az tool call ve temiz daily-driver davranışı en sık tekrarlanan olumlu Terra teması.
Terra · karışıkEffort–kota gerilimiMax/XHigh kaliteyi yükseltirken bazı Plus kullanıcıları hızlı limit düşüşü raporluyor; meter bug olasılığı ayrıştırılamıyor.
Luna · olumluKısa işler ve background agentSınıflandırma, tek-adımlı tool call, cron ve yardımcı-agent işlerinde hızlı/ucuz alternatif olarak öne çıkıyor.
Luna · karışıkZincir uzadığında shortcutAraştır–kaydet–mail gibi çok adımlı akışlarda son adımı inceltme ve ayrıntı kaybı bildiren karşı örnekler var.
Aile · karışıkBenchmark ≠ gerçek işHN tartışması chart ölçeği, adaptive/max kıyası, harness tarafsızlığı ve tekrar üretilebilirliği sorguluyor.
Operasyon · karışıkRelease-day routingSol availability, Luna engine ve Azure Responses-Lite issue’ları model zekâsından ayrı operasyonel olaylar.
34Metodoloji ve ham veriFresh süreç, sabit görev, 34/34 doğru+
Ne yaptık?
- Her hücre ayrı ephemeral Codex süreci.
- Aynı weighted interval scheduling problemi.
- Sol/Terra 6; Luna 5 effort seviyesi.
- Her effort Standard ve Fast koştu.
- Süre, token, reasoning, cache ve maliyet kaydedildi.
Sınırlar
Her hücre n=1. Servis kuyruğu, cache ve sampling gürültüsü var. Efektif token/s decoder throughput değildir. Tek görev genel zekâ kanıtı değildir.
ANA KAYNAKLAR