YGT Labs AIHARNESS LABModel atlası ↗

FULL-STACK A/B / 11 TEMMUZ 2026

Tek model değil.
Çalışan ekip.

Beş workload, on çekirdek A/B koşusu ve iki yeni topology koşusu. Root ve bütün child ağacı birlikte ölçüldü; gate’ler ham puanı veto etti.
REC / FULL-STACK-AB-20260711COMPLETE
Workload
05
Koşu
12
Topology
0/3/5/6
Canlı deploy
02
0 CHILDVS3 CHILD
Bilimsel sınır

Beş-workload suite doğrudan 0 vs 3 child ölçtü. Calculator için doğrudan 0/3/5/6 pilotu da tamamlandı; fakat topology başına n=1 olduğu için evrensel agent sayısı iddiası üretmez.

HARNESS FELSEFESİ

Kanıta dayalı ensemble.
Kör swarm değil.

Çoğulluk maliyet kusuru değil; doğru ayrıştırıldığında araştırma kapasitesidir.
  1. 01

    agent count retires uncertainty; it is not a goal

  2. 02

    unique question, evidence ownership, and failure mode per lane

  3. 03

    specialize, challenge, then integrate

  4. 04

    deterministic gates outrank consensus and aesthetics

  5. 05

    root owns scope, evidence ledger, integration, and final verification

  6. 06

    20x is breadth and falsification budget, not a bill to minimize

  7. 07

    five-to-six roles run in waves; peak children remain three

  8. 08

    generic defaults require at least five comparable repetitions

85+ SCORE / İKİ DALGA5 rol, gate kırılırsa 6.
ROOTKapsam · ledger · entegrasyon · final evidence
LUNA XHIGH
Uzman 1
LUNA XHIGH
Uzman 2
LUNA XHIGH
Uzman 3
↓ çıktılar hazır
LUNA XHIGH
Bağımsız challenger
LUNA MAX · KOŞULLU
Adjudicator
Peak child concurrency: 3 · max_threads: 4 · max_depth: 1

ROOT ACCOUNT / 11–12 TEMMUZ

Root hesabı.
29 thread, gerçek model karışımı.

2026-07-11 10:00:00 — 2026-07-12 02:08:21 UTC · İçerik değil, davranış ve maliyet yayımlandı.
THREAD2912 root · 17 child
LIFECYCLE%89,6626/29 graceful complete
MARJİNAL TOKEN277,04 Mnnaif sayaç 10.793×
GERÇEK KREDİ4.586,7Sol + Luna model karışımı
API EŞDEĞERİ$183.47standard processing
ACTIVE421,4dkparallel overlap dahil

MODEL MIX / ACTUAL

Sol yükü taşıdı.
Luna keşif yaptı.

LUNA13 thread6,42 Mn token
Complete
%84,62
Kredi
45,9
API
$1.84
TPS
22,62
SOL16 thread270,62 Mn token
Complete
%93,75
Kredi
4.540,8
API
$181.63
TPS
41,83
HER ŞEY SOL4.770,29 kredi$190.81 · kalite eşitliği varsayılmadı
HER ŞEY TERRA2.385,14 kredi$95.41 · kalite eşitliği varsayılmadı
HER ŞEY LUNA954,06 kredi$38.16 · kalite eşitliği varsayılmadı

ORCHESTRATOR / DELEGATE

Child çok; ana maliyet yine root.

ROOT265,22 Mn
Thread
12
Complete
%83,33
Cache
%97,78
Kredi
4.284
API
$171.36
TPS
37,31
CHILD11,82 Mn
Thread
17
Complete
%94,12
Cache
%93,96
Kredi
302,7
API
$12.11
TPS
31,46

29 / 29 THREAD LEDGER

Her session ayrı satır.

Child maliyeti fork baseline çıkarıldıktan sonra hesaplandı. Incomplete kayıtlar lower-bound’dur.
IDParentRolModelDurumSpanActiveTokenKrediTPSKalite
AGENT-01Specialist laneSOLCOMPLETE2,41dk2,41dk464,7 B14,7744,0397
AGENT-02Specialist laneSOLCOMPLETE2,84dk2,84dk194,01 B10,3244,285
AGENT-03Specialist laneSOLCOMPLETE1,78dk1,78dk342,6 B12,640,8297
ROOT-01Root orchestratorSOLCOMPLETE354,17dk223,39dk174,35 Mn2.876,3227,79100
AGENT-04Specialist laneSOLCOMPLETE2,03dk2,02dk487,88 B18,7242,4497
AGENT-05Specialist laneSOLCOMPLETE6dk5,99dk1,1 Mn31,1646,9397
AGENT-06Specialist laneSOLCOMPLETE1,63dk1,63dk474,78 B15,6443,1785
AGENT-07Specialist laneSOLCOMPLETE7,36dk7,35dk3,44 Mn63,5428,6597
ROOT-02Root orchestratorLUNACOMPLETE0,17dk0,17dk55,63 B0,6546,485
ROOT-03Root orchestratorLUNACOMPLETE0,15dk0,15dk53,98 B0,6350,6985
ROOT-04Root orchestratorLUNACOMPLETE0,19dk0,19dk54,19 B0,5142,8985
ROOT-05Root orchestratorLUNACOMPLETE0,21dk0,21dk36,16 B0,5836,485
ROOT-06Root orchestratorLUNACOMPLETE0,15dk0,15dk53,98 B0,2548,0985
ROOT-07Root orchestratorSOLCOMPLETE8,19dk8,19dk3,78 Mn80,5240,7197
ROOT-08Root orchestratorSOLCOMPLETE137,34dk85,89dk58,21 Mn901,5615,7197
AGENT-08Specialist laneSOLCOMPLETE5,44dk5,43dk1,76 Mn46,1354,2997
AGENT-09Specialist laneSOLCOMPLETE4,12dk4,11dk1,82 Mn40,1343,697
ROOT-09Root orchestratorSOLCOMPLETE46,33dk24,01dk22,46 Mn379,740,02100
AGENT-10ROOT-09Specialist laneSOLINTERRUPTED9,81dk0dk165,68 B5,6963
AGENT-11ROOT-09Specialist laneSOLCOMPLETE2,58dk2,58dk986,53 B25,450,5697
AGENT-12ROOT-09Specialist laneSOLCOMPLETE2,07dk2,07dk577,66 B18,6164,6197
ROOT-10Root orchestratorLUNAINTERRUPTED12,9dk0dk2,07 Mn13,8963
ROOT-11Root orchestratorLUNACOMPLETE7,29dk7,29dk826,33 B4,9924,3697
AGENT-13ROOT-10Specialist laneLUNACOMPLETE11,33dk11,33dk00097
AGENT-14ROOT-10Specialist laneLUNACOMPLETE3,44dk3,44dk00088
AGENT-15ROOT-11Specialist laneLUNACOMPLETE5,19dk5,19dk00097
AGENT-16ROOT-11Specialist laneLUNACOMPLETE5,57dk5,57dk00097
ROOT-12Root orchestratorLUNAINTERRUPTED19,9dk0dk3,26 Mn24,475
AGENT-17ROOT-12Specialist laneLUNACOMPLETE8,03dk8,03dk00085

20 BULGU

Hacimden davranışa.

  1. 01
    29 thread, iki katman

    12 root chat ve 17 child lane hesaplandı.

  2. 02
    Lifecycle completion %89.7

    26 thread graceful task_complete ile kapandı; bu ürün başarısı değil lifecycle ölçüsüdür.

  3. 03
    Eksik kullanım lower-bound

    Tamamlanmamış turn süre ve tokenları son gözlenen sayaçla sınırlıdır; gerçek tüketim daha yüksek olabilir.

  4. 04
    Root maliyet merkezi

    Root katmanı 4284.00 kredi ve 265,216,229 marjinal token üretti.

  5. 05
    Span compute değildir

    Kanıtlanabilen completed-active süre 421.4 dakikadır; span insan beklemesi ve paralel overlap içerebilir.

  6. 06
    Child üretim hızı

    Tamamlanan child active-output TPS ortalaması 31.45; root ortalaması 37.31.

  7. 07
    Child token payı

    Child lane'ler doğru marjinal tokenın %4.27'sini oluşturdu.

  8. 08
    Model karışımı

    En yüksek token hacmi gpt-5.6-sol üzerinde; gerçek maliyet thread modeline göre ayrı ayrı fiyatlandı.

  9. 09
    Fork baseline zorunlu

    Doğru marjinal toplam 277,038,343; child kümülatif sayaçları baseline çıkarılmadan toplanmadı.

  10. 10
    Cache ekonomik omurga

    Input tokenların %97.618'i cached; uncached ve output ayrı fiyatlandı.

  11. 11
    Naif sayaç şişmesi

    Ham kümülatif sayaç toplamı doğru marjinal sonucun 10.793 katı olurdu.

  12. 12
    4586.70 kredi

    Resmî Codex token rate card uygulandı; pakete dahil kullanım nedeniyle bu doğrudan nakit charge değildir.

  13. 13
    $183.47 API eşdeğeri

    Gerçek model karışımı standard API token fiyatlarıyla hesaplandı; priority processing dahil değildir.

  14. 14
    Luna child counterfactual

    Bütün child token karışımı Luna olsaydı teorik toplam kredi farkı 242.16; kalite eşitliği varsayılmıyor.

  15. 15
    Tool closure ayrı sinyal

    1835 tool call ve 1835 output görüldü; wrapper kapanışı ürün başarısı sayılmadı.

  16. 16
    Build gate görünürlüğü

    Session payloadlarında 171 build/test ve 288 smoke/health eşleşmesi bulundu.

  17. 17
    Tekrar yükü ölçüldü

    Exact payload fingerprint'iyle 205 yinelenen tool call görüldü; her tekrar otomatik israf değildir.

  18. 18
    Evidence-quality ürün kalitesi değil

    Ortalama skor 90.48/100; lifecycle, tool closure, gate ve final evidence varlığını ölçer.

  19. 19
    Reasoning iki kez fiyatlanmadı

    201,252 reasoning token output subset'idir ve tekrar ücretlendirilmedi.

  20. 20
    Atıf hesabı sınırlar

    Rapor root OS/Codex hesabını ölçer; fiziksel insan kimliği veya her operasyonun yazarı olduğunu iddia etmez.

HESAP UÇUŞ KAYDI / SON 24 SAAT

Enes Codex hesabı.
On iki chat, tek tek.

2026-07-11 01:24:50 — 2026-07-12 01:24:50 UTC · Prompt ve yanıt içeriği yayımlanmadı.
THREAD124 root · 8 child
LIFECYCLE%58,337/12 graceful complete
MARJİNAL TOKEN28,81 Mnnaif toplam 1.926× şişirirdi
CODEX KREDİ555,01paket dahil kullanım önce harcanır
API EŞDEĞERİ$22.20standard GPT‑5.6 Sol
COMPLETED ACTIVE66,01dkidle hariç · overlap dahil

ROOT / CHILD MUHASEBESİ

Fork snapshot’ı fatura değildir.

Child state sayaçlarını doğrudan toplamak 55,49M gösterirdi. Gerçek marjinal toplam 28,81M.
ROOT27,16 Mn
Input
27,06 Mn
Cached
%97,55
Output
101,15 B
Kredi
488,74
API
$19.55
Active TPS
31,22
CHILD1,65 Mn
Input
1,63 Mn
Cached
%85,12
Output
24,98 B
Kredi
66,27
API
$2.65
Active TPS
39,82

MALİYET / MODEL ROUTING

Child lane’ler ucuz; ama uncached oranı yüksek.

MEVCUT / SOL CHILD66,27 kredi$2.65
COUNTERFACTUAL / LUNA CHILD13,25 kredi$0.53
ModelInput / 1MCached / 1MOutput / 1M
gpt-5.6-sol125 cr · $512.5 cr · $0.5750 cr · $30
gpt-5.6-terra62.5 cr · $2.56.25 cr · $0.25375 cr · $15
gpt-5.6-luna25 cr · $12.5 cr · $0.1150 cr · $6

12 / 12 THREAD LEDGER

Her chat ayrı satır, her child ayrı maliyet.

Span insan beklemesini içerebilir. Active yalnız tamamlanan turn çiftlerinden gelir.
ROOT-01
Astro/PM2 deploy ve recoveryRoot orchestrator
COMPLETE
Span
21,82 dk
Input
958,6 B
Cached
901,89 B
Output
13,69 B
TTFT
TPS
33,66
Tool
23/23
Gate
13
Evidence quality100/100
AGENT-01
PM2 auditPM2 audit · ROOT-01
COMPLETE
Span
1,57 dk
Input
163,21 B
Cached
143,87 B
Output
4,28 B
TTFT
TPS
45,31
Tool
5/5
Gate
0
Evidence quality85/100
ROOT-02
Deployment discovery fan-outRoot orchestrator
INTERRUPTED
Span
1,56 dk
Input
167,16 B
Cached
129,02 B
Output
1,63 B
TTFT
TPS
248,97
Tool
9/8
Gate
3
Evidence quality73/100
AGENT-02
Repo/build auditRepo/build audit · ROOT-02
INTERRUPTED
Span
0,52 dk
Input
71,51 B
Cached
52,48 B
Output
1,08 B
TTFT
TPS
Tool
3/3
Gate
1
Evidence quality75/100
AGENT-03
Infra target discoveryInfra target discovery · ROOT-02
INTERRUPTED
Span
0,44 dk
Input
32,1 B
Cached
29,18 B
Output
486
TTFT
TPS
Tool
3/2
Gate
1
Evidence quality68/100
AGENT-04
Deployment pattern auditDeployment pattern audit · ROOT-02
INTERRUPTED
Span
0,32 dk
Input
35,91 B
Cached
29,18 B
Output
629
TTFT
TPS
Tool
2/2
Gate
0
Evidence quality63/100
ROOT-03
Kısa karar turuRoot orchestrator
INTERRUPTED
Span
0,45 dk
Input
15,01 B
Cached
6,91 B
Output
120
TTFT
TPS
36,17
Tool
0/0
Gate
0
Evidence quality43/100
ROOT-04
Landing geliştirme ve yayınlamaRoot orchestrator
COMPLETE
Span
459,67 dk
Input
25,92 Mn
Cached
25,36 Mn
Output
85,7 B
TTFT
TPS
28,78
Tool
175/175
Gate
70
Evidence quality97/100
AGENT-05
Public ingress probePublic ingress probe · ROOT-04
COMPLETE
Span
2,71 dk
Input
270,2 B
Cached
243,97 B
Output
7,36 B
TTFT
TPS
45,37
Tool
10/10
Gate
1
Evidence quality97/100
AGENT-06
Landing content inventoryLanding content inventory · ROOT-04
COMPLETE
Span
1,4 dk
Input
385,16 B
Cached
323,58 B
Output
3,18 B
TTFT
TPS
37,88
Tool
7/7
Gate
0
Evidence quality85/100
AGENT-07
Concept B directionConcept B direction · ROOT-04
COMPLETE
Span
1,56 dk
Input
239,44 B
Cached
163,33 B
Output
3,25 B
TTFT
TPS
34,67
Tool
5/5
Gate
0
Evidence quality85/100
AGENT-08
Concept B QAConcept B QA · ROOT-04
COMPLETE
Span
2,19 dk
Input
427,82 B
Cached
397,82 B
Output
4,72 B
TTFT
TPS
35,86
Tool
9/9
Gate
2
Evidence quality97/100

OPERASYON KANITI

Build geçti. Runtime yine kırıldı. Recovery tamamlandı.

0149 helper çağrısı

UID + PWD + zaman kesişimiyle doğrudan atıf.

025 deploy

Ortalama 29.6sn · medyan 15sn.

033 artifact

Build süreleri 12.4 / 11.9 / 11.9sn.

04Runtime wall

Build success deployment success olmadı.

052 rollback

Log okuma ve yeniden deploy ile yaklaşım değişti.

06Restart + health

İki güncel local service HTTP 200; current state Enes’e retroaktif atfedilmedi.

20 BULGU / KARAR NOTU

Sayıdan davranışa.

Observation, historical report ve inference birbirine karıştırılmadı.
  1. 01
    12 thread, iki katman

    Dört root chat sekiz child lane açtı; maksimum gözlenen ağaç genişliği root dahil dört eşzamanlı roldü.

  2. 02
    Lifecycle completion %58,3

    Yedi thread son task_complete ile kapandı; beşi metadata açısından yarım kaldı. Bu oran ürün başarısı değil, graceful finalization ölçüsüdür.

  3. 03
    Kayıp tek ağaçta kümelendi

    Beş incomplete threadin dördü ROOT-02 ve üç child lane'inde; sorun agent sayısından çok await/finalization disiplinine işaret ediyor.

  4. 04
    Uzun root maliyet merkezi

    ROOT-04 toplam marjinal tokenın %90,26'sını üretti; ilk optimizasyon hedefi kısa child lane'ler değil bu uzun bağlamdır.

  5. 05
    8,07 saat compute değildir

    Root span toplamı 8,069 saat; insan beklemesi içerir. Kanıtlanabilen completed-active süre 66,0 dakikadır ve paralel overlap içerir.

  6. 06
    Child dönüşü hızlı

    Tamamlanan child TTFT ortalaması 3,895 saniye; uzun root turn ortalamaları 6,508 ve 10,476 saniyeydi.

  7. 07
    Child üretim hızı

    Tamamlanan child active-output TPS ortalaması 39,82; iki büyük root için yaklaşık 33,66 ve 28,78.

  8. 08
    Paralellik gerçek süre kazandırdı

    Concept direction ve QA lane'leri birlikte çalışarak seri toplamın yaklaşık %38,9'unu, 87,6 saniyeyi kurtardı.

  9. 09
    Doğru token toplamı 28,81M

    Child fork baseline'ı çıkarılınca 28.814.049 marjinal token kaldı; state sayaçlarını naif toplamak sonucu yaklaşık 1,93 kat şişirirdi.

  10. 10
    Cache ekonomik omurga

    Input tokenların %96,845'i cached; bu uzun Sol akışını ekonomik olarak mümkün kılan ana unsur.

  11. 11
    Child az token, fazla uncached

    Child lane'ler toplam tokenın %5,73'ü fakat uncached inputun %26,73'ü; marjinal child inputu root cache'inden daha pahalı.

  12. 12
    555,01 kredi

    Resmî Codex token rate card ile marjinal tüketim 555,009 kredi; pakete dahil kullanım önce harcandığından bu doğrudan kredi satın alımı demek değildir.

  13. 13
    $22,20 API eşdeğeri

    Standart GPT-5.6 Sol API rate'iyle aynı token karışımı yaklaşık 22,200 USD; priority processing karşılığı bunun yaklaşık iki katıdır.

  14. 14
    Child'larda Luna fırsatı

    Sekiz child aynı token karışımında Sol ile 66,271 kredi; Luna karşılığı 13,254 kredi. Teorik toplam tasarruf %9,55, kalite eşitliği varsayılmıyor.

  15. 15
    Wrapper başarısı ürün başarısı değil

    221/222 tamamlanmış wrapper sonucu %99,55 teknik kapanış verir; lifecycle, gate ve public readback ayrı tutulmalıdır.

  16. 16
    Recovery kalitesi yüksek

    Üç build artifact sonrası runtime duvarı görüldü; log, iki rollback, yeniden deploy, restart ve health zinciriyle servis toparlandı.

  17. 17
    Build ve runtime ayrı gate

    Üç artifact build'i yaklaşık 12 saniyede geçti ama runtime daha sonra hata verdi; build success tek başına deployment success değildir.

  18. 18
    49 helper çağrısı

    UID/PWD/zaman kesişimi 49 root-helper çağrısını Enes hesabına bağladı; beş deployun ortalaması 29,6, medyanı 15 saniye.

  19. 19
    Git atfı sıfır

    Pencerede Enes author/committer ile doğrulanan commit yok. Bu başarısızlık değil, atfedilebilir Git teslim kanıtı yok demektir.

  20. 20
    Finalization önce düzelmeli

    Daha fazla agent açmadan önce kısa fan-out ağacında SubagentStop/await/final receipt kapanışı zorunlu hale getirilmeli.

METODOLOJİ / SINIR

Başarı tek sayı değildir.

attribution

UID 10019, home ownership, state thread metadata, rollout source/CWD/time; Git claims require matching author evidence.

child marginal

Final cumulative usage minus the last fork baseline before the actual child turn; unresolved boundaries fail closed.

completion

The latest actual turn has task_complete. It is not synonymous with product success.

quality

0-100 evidence rubric: lifecycle 30, tool closure 20, build/smoke evidence 20, recovery 15, final evidence 15.

privacy

No prompt, response, secret, full path, repository content, title, UUID or raw journal line is published.

limitations
  • root span contains human idle
  • completed-active time excludes unfinished turns
  • tool wrapper success is not product success
  • Luna cost comparison is token-equivalent, not a quality claim
  • current service health is not retroactively attributed

GERÇEK KULLANIM / 60 GÜNLÜK PENCERE

İki aylık çalışma günlüğü.
Ralli pisti değil, gerçek trafik.

Kesin UTC pencere12 May 2026 → 11 Tem 2026

Önemli: Pencere 60 gün, fakat GPT‑5.6 ilk kez 9 Tem 2026 tarihinde göründü. Yani bugün elimizde iki aylık 5.5 geçmişi, yalnız birkaç günlük erken GPT‑5.6 operasyon fotoğrafı var.

01 / TEKİL485

Mantıksal iş kaydı

Aynı branch’in kopyaları tek sayıldı.

02 / TEMİZLENDİ82

Kopya artefakt

Şişirilmiş toplam üretmemek için elendi.

03 / GPT‑5.650

Erken dönem kayıt

Sol, Terra ve Luna toplamı; kalite puanı değil.

04 / KONTROLLÜ34/34

Doğru izole koşu

Aynı sabit problem, fresh process.

ÖNCE ROLLERİ ANLAYALIM

Üç model, üç ekip rolü.

Bunlar bir yarış sıralaması değil; harness içindeki görev tanımlarıdır.
GPT-5.6 SolKıdemli teknik lider

Zor karar, geniş kapsam ve nihai entegrasyon.

33 mantıksal kayıt · Kullanım yoğunluğu
GPT-5.6 TerraDengeli uygulayıcı

Sınırı belli günlük geliştirmede hız ve muhakeme dengesi.

4 mantıksal kayıt · Sınırlı örnek
GPT-5.6 LunaUzman yardımcı

Paralel araştırma, doğrulama ve challenger lane’leri.

13 mantıksal kayıt · Sınırlı örnek
GPT‑5.5Önceki dönem referansı

Pencerenin eski bölümündeki gerçek işleri gösterir. Görev, tarih ve harness eşit olmadığı için kontrollü 5.5 ↔ 5.6 testi değildir.

Karşılaştırma çizgisi, hüküm değil

GÖZLEMSEL VERİ

Bu tablo performans yarışı değil, kullanım haritasıdır.

Her logical session, o kayıtta son görülen model ve effort altında bir kez sayılır.
60 günlük pencerede son görülen modele göre mantıksal session dağılımı
ModelRolİş kaydıPayEffort dağılımıİlk → son gözlemYorum
GPT-5.6 SolKıdemli teknik lider33%6,8high: 18 · xhigh: 6 · medium: 5 · ultra: 49 Tem 2026 → 11 Tem 2026Kullanım yoğunluğu; kalite sıralaması değil
GPT-5.6 TerraDengeli uygulayıcı4%0,8ultra: 410 Tem 2026 → 10 Tem 2026Sınırlı örnek; genelleme yapma
GPT-5.6 LunaUzman yardımcı13%2,7max: 10 · xhigh: 310 Tem 2026 → 11 Tem 2026Sınırlı örnek; genelleme yapma
GPT-5.5Önceki dönem referansı380%78,4xhigh: 181 · medium: 106 · high: 9314 May 2026 → 9 Tem 2026Kullanım yoğunluğu; kalite sıralaması değil
Model kaydı yokEski kayıt biçimi52%10,7unknown: 527 Haz 2026 → 11 Haz 2026Kullanım yoğunluğu; kalite sıralaması değil
Diğer modellerSınırlı örnek3%0,6xhigh: 33 Haz 2026 → 14 Haz 2026Sınırlı örnek; genelleme yapma

Neden token/test toplamı yok? Eski telemetry collector, aynı branch geçmişini birden fazla kez okuyordu. Yeni exporter 567 dosyayı 485 logical session’a düşürdü; yine de model bazlı token, wall ve TPS attribution’ı kesinleşmeden bunları operasyon yarışı gibi yayınlamıyoruz.

KONTROLLÜ SNAPSHOT / 34 KOŞU

Hız ve token için doğru masa burası.

Aynı sabit problem, 34 fresh process, 34 doğru cevap. Her hücre yalnız n=1 olduğu için genel zekâ iddiası değildir.
16/17

Fast eşleşmesi daha kısa sürdü

Toplam wall: 629,628 sn
9 Temmuz 2026 tarihli kontrollü 34 koşunun model toplamları
ModelDoğruToplam wallInputCachedOutputReasoning
Sol12/12234,665 sn246.91398.56011.43810.421
Terra12/12207,482 sn247.30366.30410.4109.384
Luna10/10187,481 sn194.37089.60010.1048.825
Toplam34/34629,628 sn688.586254.46431.95228.630

TEKNİK SÖZLÜK

Grafikleri okumak için beş kavram.

Token

Modelin okuduğu ve yazdığı küçük metin parçalarıdır. Bir kitabı kelime yerine hece parçalarıyla saymak gibi. İş hacmini gösterir; kalite puanı değildir.

Cached input

Daha önce okunmuş içeriğin yeniden kullanılabilen kısmıdır. Masada hazır duran dosya gibi; input toplamının içindedir, ayrıca üstüne eklenmez.

TPS

Saniyedeki output token miktarıdır. Buradaki kontrollü TPS, output / uçtan uca süredir; modelin “düşünme hızı” veya decoder throughput değildir.

Session / rollout

Codex’in bıraktığı iş kaydıdır. Root ve her alt ajan ayrı kayıt bırakabildiği için bir kullanıcı isteği birden fazla session üretebilir.

Subagent

Root modelin sınırı belli bir alt işi incelemesi için çağırdığı yardımcı modeldir. Nihai kararı vermez; uzman kanıtı üretir.

AYNI ŞEY DEĞİLLER

Üç ölçüm, üç ayrı soru.

01 / GÖZLEMSEL60 günlük gerçek kullanım

Harness günlük işte nasıl kullanıldı? Gerçek trafik gösterir; adil model yarışı değildir.

02 / KONTROLLÜ34 izole model koşusu

Aynı küçük görevde model, effort ve Fast neyi değiştirdi? Dar ama karşılaştırılabilir hız fotoğrafıdır.

03 / TESLİMAT10 full-stack A/B koşusu

0 child ile 3 child teslimatı nasıl değişti? Test, build, browser gate ve kör review içerir.

Kısaca: 60 gün kullanım alışkanlığını, 34 koşu dar hız deneyini, full-stack A/B ise ekip şeklinin teslimata etkisini anlatır. Bunları tek bir “sihirli puan” içinde eritmek yanlış olur.

BEN HANGİSİNİ SEÇMELİYİM?

Tek cümlelik rota.

  • Zor ve belirsiz işSol High root
  • Sınırı belli günlük uygulamaTerra
  • Paralel araştırma ve doğrulamaLuna XHigh
  • Çatışan kanıt veya kırılan gateLuna Max
  • Basit, kısa işAlt ajan açmadan root
Bu rota yalnız 60 günlük sayaçtan çıkarılmadı; kontrollü benchmark, full-stack A/B, harness sözleşmesi ve gerçek kullanım birlikte yorumlandı.

UÇUŞ KAYDI / BEŞ DENEY

Aynı prompt.
Farklı ekip şekli.

Ham kalite tek başına kazananı belirlemez. Mandatory gate, puanı veto edebilir.

GRAFİK 01 / KALİTE

Multi her yerde kazanmadı.

Calculator’da +23. Host security’de −47. 3D’de ham puan düşük olsa da performans gate’i sonucu tersine çevirdi.

Beş workload için single ve multi kalite puanıHer satırda single ve multi puanlarını bağlayan bir çizgi bulunur. Calculator multi lehine, host security single lehine en büyük farkı gösterir.020406080100Support security audit07Hesap Atölyesi7194Sinyal Bahçesi8684Karanlık Ege8490Host security assessment6114
Single Multi / düzeltilmiş multi
Support security audit+7 kalite
Wall
+68,54%
Token
+508,46%
Hesap Atölyesi+23 kalite
Wall
+3,66%
Token
+131,22%
Sinyal Bahçesi-2 kalite
Wall
+12,16%
Token
+418,48%
Karanlık Ege+6 kalite
Wall
+23,69%
Token
+10,86%
Host security assessment-47 kalite
Wall
-13,21%
Token
+453,1%

GRAFİK 02 / AĞAÇ TELEMETRİSİ

Root değil, bütün ağaç ölçüldü.

Aggregate token root ve child toplamıdır. TPS, tree output / root wall’dır; decoder throughput değildir.

Duvar süresisingle / multi
Support security audit
380,52sn
641,34sn
Hesap Atölyesi
650,53sn
674,35sn
Sinyal Bahçesi
845,87sn
948,7sn
Karanlık Ege
504,72sn
624,29sn
Host security assessment
850,26sn
737,91sn
Aggregate tokensingle / multi
Support security audit
3,1 Mn
19,1 Mn
Hesap Atölyesi
1,5 Mn
3,4 Mn
Sinyal Bahçesi
2 Mn
10,2 Mn
Karanlık Ege
1,3 Mn
1,4 Mn
Host security assessment
1,1 Mn
5,8 Mn
Uncached inputsingle / multi
Support security audit
202,3 B
1 Mn
Hesap Atölyesi
127,4 B
286,1 B
Sinyal Bahçesi
152,2 B
670,5 B
Karanlık Ege
121,6 B
173,7 B
Host security assessment
88,8 B
568,8 B
Aggregate TPSsingle / multi
Support security audit
44,53
79,96
Hesap Atölyesi
44,82
65,53
Sinyal Bahçesi
42,17
95,57
Karanlık Ege
37,71
38,57
Host security assessment
33
72,49

GRAFİK 03 / 0–3–5–6 PİLOT

Daha çok agent,
otomatik olarak daha iyi değil.

Aynı Calculator prompt’u ve aynı başlangıç yüzeyi. 0 ve 3 önceki donmuş koşudan; 5 ve 6 yeni, treatment-compliant iki-dalga koşulardan.

0 CHILD71/100

Root only

Kalite71
Wall650,53 sn
Token1,5 Mn
Uncached
127,4 B
TPS
44,82
3 CHILD94/100

3 specialist

Kalite94
Wall674,35 sn
Token3,4 Mn
Uncached
286,1 B
TPS
65,53
5 CHILD82/100

3 specialist + 2 challenger

Kalite82
Wall1.174,85 sn
Token8,1 Mn
Uncached
657,6 B
TPS
70,43
6 CHILD89/100

3 specialist + 2 challenger + adjudicator

Kalite89
Wall1.366,23 sn
Token9,3 Mn
Uncached
583,7 B
TPS
59,28

GRAFİK 04 / KARAR HARİTASI

Hız başka, kalite başka eksen.

Sağa gittikçe multi daha yavaş; yukarı gittikçe kalite artar. Balon çapı aggregate token çarpanını gösterir.

Multi koşulunun wall ve kalite farkı karar haritasıCalculator sağ üstte yüksek kalite kazancı, host security sol altta daha hızlı fakat daha düşük kalite olarak görünür.multi daha yavaş →← multi daha hızlıkalite artışı ↑kalite kaybı ↓SupportHesapSinyalKaranlıkHost

BEŞ CHAPTER / TAM KANIT

Her kazananın
başka bir nedeni var.

01

defensive security

Support security audit

HOLD
Multi found slightly more signal, but both failed precision and confirmation quality.

Two disjoint evidence lanes; HIGH requires independent reproduction and Luna-max veto.

single0/100
Wall
380,52 sn
Child
0
Aggregate
3,1 Mn
Uncached
202,3 B
TPS
44,53
× precision fail
multi7/100
Wall
641,34 sn
Child
3
Aggregate
19,1 Mn
Uncached
1 Mn
TPS
79,96
× precision fail

Lane’lerroutes_auth · services_storage · views_tests

  • Customer thread/message lookups needed tenant scope at every reference step.
  • Customer close needed normalization from reply/message ID to thread head.
  • Broad discovery lanes produced unsupported CONFIRMED claims.
02

deterministic build

Hesap Atölyesi

MULTI KAZANDI
Finite-result guards and stronger formula/domain edge cases added 23 quality points for 3.66% wall time.

Three specialist lanes at score 85+: parser, finance/state, and UI/a11y/offline.

single71/100
Wall
650,53 sn
Child
0
Aggregate
1,5 Mn
Uncached
127,4 B
TPS
44,82
✓ tests pass✓ build pass
multi94/100
Wall
674,35 sn
Child
3
Aggregate
3,4 Mn
Uncached
286,1 B
TPS
65,53
✓ tests pass✓ build pass✓ finite result pass

Lane’lercalculation_contracts · ux_review · qa_plan

  • Both candidates passed 48 tests and production build.
  • Single could render non-finite results for extreme finite inputs.
03

interactive 3d build

Sinyal Bahçesi

MULTI KAZANDI
Single won aesthetics but failed the frame budget; multi was the only release-eligible candidate.

Core and renderer lanes first; fixed-host performance and gameplay judge second; max only on failed gate.

single86/100
Wall
845,87 sn
Child
0
Aggregate
2 Mn
Uncached
152,2 B
TPS
42,17
✓ tests pass✓ build pass× performance fail
multi84/100
Wall
948,7 sn
Child
3
Aggregate
10,2 Mn
Uncached
670,5 B
TPS
95,57
✓ tests pass✓ build pass✓ performance pass

Lane’lergame_core · renderer · visual_system

  • Single median frame 66.7ms (~15 FPS).
  • Multi median frame 16.7ms (~60 FPS), p95 33.4ms.
04

visual landing

Karanlık Ege

MULTI KAZANDI
Multi had the stronger conversion system; contrast and DOM rendering fixes moved it to 90 and release-ready.

Two initial advisory lanes, then an Axe/browser judge; max only after a failed gate.

single84/100
Wall
504,72 sn
Child
0
Aggregate
1,3 Mn
Uncached
121,6 B
TPS
37,71
× contrast fail
multi90/100
Wall
624,29 sn
Child
3
Aggregate
1,4 Mn
Uncached
173,7 B
TPS
38,57
△ contrast fixed△ dom sink fixed✓ build pass

Lane’lerfixture_inventory · harness_audit · ux_contract

  • Both initial candidates failed serious contrast.
  • Multi user-derived innerHTML was replaced with textContent/replaceChildren.
  • Corrected candidate passed Axe with zero serious/critical nodes.
05

defensive security

Host security assessment

SINGLE KAZANDI
Multi was faster but promoted raw freshness and hardening signals to unsupported HIGH findings.

Evidence ledger, raw-count guard, independent reproducer, and HIGH-severity adjudicator veto.

single61/100
Wall
850,26 sn
Child
0
Aggregate
1,1 Mn
Uncached
88,8 B
TPS
33
✓ read only pass△ claim calibration partial
multi14/100
Wall
737,91 sn
Child
3
Aggregate
5,8 Mn
Uncached
568,8 B
TPS
72,49
✓ read only pass× severity precision fail

Lane’leros_network · web_tls_files · runtime_logs

  • Multi wall time was 13.21% lower.
  • Multi quality fell 47 points after false-positive penalties.
  • Both read-only workspace digests remained unchanged.

GRAFİK 05 / GATE VETO

Puan değil, eligibility.

İki örnek, gate’in kör estetik puanını neden geçersiz kılabildiğini gösteriyor.

THREE.JSFrame budget
Single median 66.7msMulti median 16.7ms
16.7ms / 60 FPS33.4ms / 30 FPS80ms gate
ASTROAxe serious contrast nodes

Single12

Multi ilk15

Multi fixed0

12 TEMMUZ / 20 GEÇERLİ KOŞU

Ucuzluk, hız ve kalite
aynı kazananı seçmedi.

Beş eşlenik tekrar · 20/20 bağımsız test/build gate · üç kör adjudicator

Luna single85.6kalite
Kredi / görev
15.042
API eşdeğeri
$0.6017
Medyan süre
976 sn
Toplam token
2164K
Sol single77.2kalite
Kredi / görev
52.988
API eşdeğeri
$2.1195
Medyan süre
687 sn
Toplam token
1290K
Router auto78.6kalite
Kredi / görev
59.296
API eşdeğeri
$2.3719
Medyan süre
615 sn
Toplam token
3903K
Router + 387.2kalite
Kredi / görev
89.845
API eşdeğeri
$3.5938
Medyan süre
1041 sn
Toplam token
5965K

METODOLOJİ / PROVENANCE

Neyi sabitledik?
Neyi sabitleyemedik?

SABİT
  • same prompt hash
  • same starting surface
  • Sol-high root
  • same tool availability
  • same time ceiling
TEDAVİ
Single
delegation disabled
Multi
live score-based Luna routing
İZOLASYON

security cases read-only with before/after digest; build cases used separate disposable condition workspaces

SINIRLAR
  • n=1 per workload and topology
  • service/cache noise
  • scores are rubric-specific
  • gate eligibility can override raw quality
  • calculator topology pilot does not generalize to every workload
aggregate total

root input+output plus every child total token

uncached input

tree input minus tree cached input

aggregate tps

tree output token divided by root wall seconds; not decoder speed

CANLI / 0–100 ROUTING

Görevin ekip şeklini hesapla.

Altı boyutu değiştir. Sonuç aynı scorer felsefesini tarayıcıda görünür kılar.
TOPLAM SKOR100

5 rol council

Root + üç specialist + challenger. Failed gate veya conflict olursa Luna max ile 6.

Peak child: 3 · iki dalga
0–9root local10–29root + one probe30–59root + specialist + verifier60–84root + two specialists + challenger85–100root + three specialists + challenger; conditional max adjudicator

CANLI KANIT

İki kazanan yayında.

Public readback, HSTS ve gerçek browser etkileşimi doğrulandı.

HTTP 200xxxharnes.ygtlabs.ai

calculation 30, no overflow, no console errors

Canlı yüzeyi aç ↗
HTTP 200threejsdeneme.ygtlabs.ai

canvas and start/pause flow, no overflow, no console errors

Canlı yüzeyi aç ↗

ÖNERİLER / KALAN DENEY

Uygulananlar ve
bilerek açık bırakılanlar.

P0 / done01

Workload-specific confirmation and release gates

P0 / done02

Two-wave five-to-six-role council planning

P1 / pilot_done03

Repeat 0/3/5/6 topology across at least five seeds per workload

Başarı metriği: calculator n=1 pilot complete and executable 100-run matrix exists; general conclusion still requires the remaining repeated runs

P1 / partially_done04

Add phase/role/rework/escaped-defect telemetry

Başarı metriği: wave roles and treatment compliance are captured; rework and escaped-defect labels remain scorer inputs

HAM VERİ / AÇIK KANIT

Grafiğe güvenme.
Kaydı indir.