FULL-STACK A/B / 11 TEMMUZ 2026
Tek model değil.
Çalışan ekip.
Beş workload, on çekirdek A/B koşusu ve iki yeni topology koşusu. Root ve bütün child ağacı birlikte ölçüldü; gate’ler ham puanı veto etti.- Workload
- 05
- Koşu
- 12
- Topology
- 0/3/5/6
- Canlı deploy
- 02
Beş-workload suite doğrudan 0 vs 3 child ölçtü. Calculator için doğrudan 0/3/5/6 pilotu da tamamlandı; fakat topology başına n=1 olduğu için evrensel agent sayısı iddiası üretmez.
HARNESS FELSEFESİ
Kanıta dayalı ensemble.
Kör swarm değil.
Çoğulluk maliyet kusuru değil; doğru ayrıştırıldığında araştırma kapasitesidir.- 01
agent count retires uncertainty; it is not a goal
- 02
unique question, evidence ownership, and failure mode per lane
- 03
specialize, challenge, then integrate
- 04
deterministic gates outrank consensus and aesthetics
- 05
root owns scope, evidence ledger, integration, and final verification
- 06
20x is breadth and falsification budget, not a bill to minimize
- 07
five-to-six roles run in waves; peak children remain three
- 08
generic defaults require at least five comparable repetitions
Uzman 1LUNA XHIGH
Uzman 2LUNA XHIGH
Uzman 3
Bağımsız challengerLUNA MAX · KOŞULLU
Adjudicator
ROOT ACCOUNT / 11–12 TEMMUZ
Root hesabı.
29 thread, gerçek model karışımı.
2026-07-11 10:00:00 — 2026-07-12 02:08:21 UTC · İçerik değil, davranış ve maliyet yayımlandı.MODEL MIX / ACTUAL
Sol yükü taşıdı.
Luna keşif yaptı.
- Complete
- %84,62
- Kredi
- 45,9
- API
- $1.84
- TPS
- 22,62
- Complete
- %93,75
- Kredi
- 4.540,8
- API
- $181.63
- TPS
- 41,83
ORCHESTRATOR / DELEGATE
Child çok; ana maliyet yine root.
- Thread
- 12
- Complete
- %83,33
- Cache
- %97,78
- Kredi
- 4.284
- API
- $171.36
- TPS
- 37,31
- Thread
- 17
- Complete
- %94,12
- Cache
- %93,96
- Kredi
- 302,7
- API
- $12.11
- TPS
- 31,46
29 / 29 THREAD LEDGER
Her session ayrı satır.
Child maliyeti fork baseline çıkarıldıktan sonra hesaplandı. Incomplete kayıtlar lower-bound’dur.| ID | Parent | Rol | Model | Durum | Span | Active | Token | Kredi | TPS | Kalite |
|---|---|---|---|---|---|---|---|---|---|---|
| AGENT-01 | — | Specialist lane | SOL | COMPLETE | 2,41dk | 2,41dk | 464,7 B | 14,77 | 44,03 | 97 |
| AGENT-02 | — | Specialist lane | SOL | COMPLETE | 2,84dk | 2,84dk | 194,01 B | 10,32 | 44,2 | 85 |
| AGENT-03 | — | Specialist lane | SOL | COMPLETE | 1,78dk | 1,78dk | 342,6 B | 12,6 | 40,82 | 97 |
| ROOT-01 | — | Root orchestrator | SOL | COMPLETE | 354,17dk | 223,39dk | 174,35 Mn | 2.876,32 | 27,79 | 100 |
| AGENT-04 | — | Specialist lane | SOL | COMPLETE | 2,03dk | 2,02dk | 487,88 B | 18,72 | 42,44 | 97 |
| AGENT-05 | — | Specialist lane | SOL | COMPLETE | 6dk | 5,99dk | 1,1 Mn | 31,16 | 46,93 | 97 |
| AGENT-06 | — | Specialist lane | SOL | COMPLETE | 1,63dk | 1,63dk | 474,78 B | 15,64 | 43,17 | 85 |
| AGENT-07 | — | Specialist lane | SOL | COMPLETE | 7,36dk | 7,35dk | 3,44 Mn | 63,54 | 28,65 | 97 |
| ROOT-02 | — | Root orchestrator | LUNA | COMPLETE | 0,17dk | 0,17dk | 55,63 B | 0,65 | 46,4 | 85 |
| ROOT-03 | — | Root orchestrator | LUNA | COMPLETE | 0,15dk | 0,15dk | 53,98 B | 0,63 | 50,69 | 85 |
| ROOT-04 | — | Root orchestrator | LUNA | COMPLETE | 0,19dk | 0,19dk | 54,19 B | 0,51 | 42,89 | 85 |
| ROOT-05 | — | Root orchestrator | LUNA | COMPLETE | 0,21dk | 0,21dk | 36,16 B | 0,58 | 36,4 | 85 |
| ROOT-06 | — | Root orchestrator | LUNA | COMPLETE | 0,15dk | 0,15dk | 53,98 B | 0,25 | 48,09 | 85 |
| ROOT-07 | — | Root orchestrator | SOL | COMPLETE | 8,19dk | 8,19dk | 3,78 Mn | 80,52 | 40,71 | 97 |
| ROOT-08 | — | Root orchestrator | SOL | COMPLETE | 137,34dk | 85,89dk | 58,21 Mn | 901,56 | 15,71 | 97 |
| AGENT-08 | — | Specialist lane | SOL | COMPLETE | 5,44dk | 5,43dk | 1,76 Mn | 46,13 | 54,29 | 97 |
| AGENT-09 | — | Specialist lane | SOL | COMPLETE | 4,12dk | 4,11dk | 1,82 Mn | 40,13 | 43,6 | 97 |
| ROOT-09 | — | Root orchestrator | SOL | COMPLETE | 46,33dk | 24,01dk | 22,46 Mn | 379,7 | 40,02 | 100 |
| AGENT-10 | ROOT-09 | Specialist lane | SOL | INTERRUPTED | 9,81dk | 0dk | 165,68 B | 5,69 | — | 63 |
| AGENT-11 | ROOT-09 | Specialist lane | SOL | COMPLETE | 2,58dk | 2,58dk | 986,53 B | 25,4 | 50,56 | 97 |
| AGENT-12 | ROOT-09 | Specialist lane | SOL | COMPLETE | 2,07dk | 2,07dk | 577,66 B | 18,61 | 64,61 | 97 |
| ROOT-10 | — | Root orchestrator | LUNA | INTERRUPTED | 12,9dk | 0dk | 2,07 Mn | 13,89 | — | 63 |
| ROOT-11 | — | Root orchestrator | LUNA | COMPLETE | 7,29dk | 7,29dk | 826,33 B | 4,99 | 24,36 | 97 |
| AGENT-13 | ROOT-10 | Specialist lane | LUNA | COMPLETE | 11,33dk | 11,33dk | 0 | 0 | 0 | 97 |
| AGENT-14 | ROOT-10 | Specialist lane | LUNA | COMPLETE | 3,44dk | 3,44dk | 0 | 0 | 0 | 88 |
| AGENT-15 | ROOT-11 | Specialist lane | LUNA | COMPLETE | 5,19dk | 5,19dk | 0 | 0 | 0 | 97 |
| AGENT-16 | ROOT-11 | Specialist lane | LUNA | COMPLETE | 5,57dk | 5,57dk | 0 | 0 | 0 | 97 |
| ROOT-12 | — | Root orchestrator | LUNA | INTERRUPTED | 19,9dk | 0dk | 3,26 Mn | 24,4 | — | 75 |
| AGENT-17 | ROOT-12 | Specialist lane | LUNA | COMPLETE | 8,03dk | 8,03dk | 0 | 0 | 0 | 85 |
20 BULGU
Hacimden davranışa.
- 0129 thread, iki katman
12 root chat ve 17 child lane hesaplandı.
- 02Lifecycle completion %89.7
26 thread graceful task_complete ile kapandı; bu ürün başarısı değil lifecycle ölçüsüdür.
- 03Eksik kullanım lower-bound
Tamamlanmamış turn süre ve tokenları son gözlenen sayaçla sınırlıdır; gerçek tüketim daha yüksek olabilir.
- 04Root maliyet merkezi
Root katmanı 4284.00 kredi ve 265,216,229 marjinal token üretti.
- 05Span compute değildir
Kanıtlanabilen completed-active süre 421.4 dakikadır; span insan beklemesi ve paralel overlap içerebilir.
- 06Child üretim hızı
Tamamlanan child active-output TPS ortalaması 31.45; root ortalaması 37.31.
- 07Child token payı
Child lane'ler doğru marjinal tokenın %4.27'sini oluşturdu.
- 08Model karışımı
En yüksek token hacmi gpt-5.6-sol üzerinde; gerçek maliyet thread modeline göre ayrı ayrı fiyatlandı.
- 09Fork baseline zorunlu
Doğru marjinal toplam 277,038,343; child kümülatif sayaçları baseline çıkarılmadan toplanmadı.
- 10Cache ekonomik omurga
Input tokenların %97.618'i cached; uncached ve output ayrı fiyatlandı.
- 11Naif sayaç şişmesi
Ham kümülatif sayaç toplamı doğru marjinal sonucun 10.793 katı olurdu.
- 124586.70 kredi
Resmî Codex token rate card uygulandı; pakete dahil kullanım nedeniyle bu doğrudan nakit charge değildir.
- 13$183.47 API eşdeğeri
Gerçek model karışımı standard API token fiyatlarıyla hesaplandı; priority processing dahil değildir.
- 14Luna child counterfactual
Bütün child token karışımı Luna olsaydı teorik toplam kredi farkı 242.16; kalite eşitliği varsayılmıyor.
- 15Tool closure ayrı sinyal
1835 tool call ve 1835 output görüldü; wrapper kapanışı ürün başarısı sayılmadı.
- 16Build gate görünürlüğü
Session payloadlarında 171 build/test ve 288 smoke/health eşleşmesi bulundu.
- 17Tekrar yükü ölçüldü
Exact payload fingerprint'iyle 205 yinelenen tool call görüldü; her tekrar otomatik israf değildir.
- 18Evidence-quality ürün kalitesi değil
Ortalama skor 90.48/100; lifecycle, tool closure, gate ve final evidence varlığını ölçer.
- 19Reasoning iki kez fiyatlanmadı
201,252 reasoning token output subset'idir ve tekrar ücretlendirilmedi.
- 20Atıf hesabı sınırlar
Rapor root OS/Codex hesabını ölçer; fiziksel insan kimliği veya her operasyonun yazarı olduğunu iddia etmez.
HESAP UÇUŞ KAYDI / SON 24 SAAT
Enes Codex hesabı.
On iki chat, tek tek.
2026-07-11 01:24:50 — 2026-07-12 01:24:50 UTC · Prompt ve yanıt içeriği yayımlanmadı.ROOT / CHILD MUHASEBESİ
Fork snapshot’ı fatura değildir.
Child state sayaçlarını doğrudan toplamak 55,49M gösterirdi. Gerçek marjinal toplam 28,81M.- Input
- 27,06 Mn
- Cached
- %97,55
- Output
- 101,15 B
- Kredi
- 488,74
- API
- $19.55
- Active TPS
- 31,22
- Input
- 1,63 Mn
- Cached
- %85,12
- Output
- 24,98 B
- Kredi
- 66,27
- API
- $2.65
- Active TPS
- 39,82
MALİYET / MODEL ROUTING
Child lane’ler ucuz; ama uncached oranı yüksek.
12 / 12 THREAD LEDGER
Her chat ayrı satır, her child ayrı maliyet.
Span insan beklemesini içerebilir. Active yalnız tamamlanan turn çiftlerinden gelir.- Span
- 21,82 dk
- Input
- 958,6 B
- Cached
- 901,89 B
- Output
- 13,69 B
- TTFT
- —
- TPS
- 33,66
- Tool
- 23/23
- Gate
- 13
- Span
- 1,57 dk
- Input
- 163,21 B
- Cached
- 143,87 B
- Output
- 4,28 B
- TTFT
- —
- TPS
- 45,31
- Tool
- 5/5
- Gate
- 0
- Span
- 1,56 dk
- Input
- 167,16 B
- Cached
- 129,02 B
- Output
- 1,63 B
- TTFT
- —
- TPS
- 248,97
- Tool
- 9/8
- Gate
- 3
- Span
- 0,52 dk
- Input
- 71,51 B
- Cached
- 52,48 B
- Output
- 1,08 B
- TTFT
- —
- TPS
- —
- Tool
- 3/3
- Gate
- 1
- Span
- 0,44 dk
- Input
- 32,1 B
- Cached
- 29,18 B
- Output
- 486
- TTFT
- —
- TPS
- —
- Tool
- 3/2
- Gate
- 1
- Span
- 0,32 dk
- Input
- 35,91 B
- Cached
- 29,18 B
- Output
- 629
- TTFT
- —
- TPS
- —
- Tool
- 2/2
- Gate
- 0
- Span
- 0,45 dk
- Input
- 15,01 B
- Cached
- 6,91 B
- Output
- 120
- TTFT
- —
- TPS
- 36,17
- Tool
- 0/0
- Gate
- 0
- Span
- 459,67 dk
- Input
- 25,92 Mn
- Cached
- 25,36 Mn
- Output
- 85,7 B
- TTFT
- —
- TPS
- 28,78
- Tool
- 175/175
- Gate
- 70
- Span
- 2,71 dk
- Input
- 270,2 B
- Cached
- 243,97 B
- Output
- 7,36 B
- TTFT
- —
- TPS
- 45,37
- Tool
- 10/10
- Gate
- 1
- Span
- 1,4 dk
- Input
- 385,16 B
- Cached
- 323,58 B
- Output
- 3,18 B
- TTFT
- —
- TPS
- 37,88
- Tool
- 7/7
- Gate
- 0
- Span
- 1,56 dk
- Input
- 239,44 B
- Cached
- 163,33 B
- Output
- 3,25 B
- TTFT
- —
- TPS
- 34,67
- Tool
- 5/5
- Gate
- 0
- Span
- 2,19 dk
- Input
- 427,82 B
- Cached
- 397,82 B
- Output
- 4,72 B
- TTFT
- —
- TPS
- 35,86
- Tool
- 9/9
- Gate
- 2
OPERASYON KANITI
Build geçti. Runtime yine kırıldı. Recovery tamamlandı.
UID + PWD + zaman kesişimiyle doğrudan atıf.
Ortalama 29.6sn · medyan 15sn.
Build süreleri 12.4 / 11.9 / 11.9sn.
Build success deployment success olmadı.
Log okuma ve yeniden deploy ile yaklaşım değişti.
İki güncel local service HTTP 200; current state Enes’e retroaktif atfedilmedi.
20 BULGU / KARAR NOTU
Sayıdan davranışa.
Observation, historical report ve inference birbirine karıştırılmadı.- 0112 thread, iki katman
Dört root chat sekiz child lane açtı; maksimum gözlenen ağaç genişliği root dahil dört eşzamanlı roldü.
- 02Lifecycle completion %58,3
Yedi thread son task_complete ile kapandı; beşi metadata açısından yarım kaldı. Bu oran ürün başarısı değil, graceful finalization ölçüsüdür.
- 03Kayıp tek ağaçta kümelendi
Beş incomplete threadin dördü ROOT-02 ve üç child lane'inde; sorun agent sayısından çok await/finalization disiplinine işaret ediyor.
- 04Uzun root maliyet merkezi
ROOT-04 toplam marjinal tokenın %90,26'sını üretti; ilk optimizasyon hedefi kısa child lane'ler değil bu uzun bağlamdır.
- 058,07 saat compute değildir
Root span toplamı 8,069 saat; insan beklemesi içerir. Kanıtlanabilen completed-active süre 66,0 dakikadır ve paralel overlap içerir.
- 06Child dönüşü hızlı
Tamamlanan child TTFT ortalaması 3,895 saniye; uzun root turn ortalamaları 6,508 ve 10,476 saniyeydi.
- 07Child üretim hızı
Tamamlanan child active-output TPS ortalaması 39,82; iki büyük root için yaklaşık 33,66 ve 28,78.
- 08Paralellik gerçek süre kazandırdı
Concept direction ve QA lane'leri birlikte çalışarak seri toplamın yaklaşık %38,9'unu, 87,6 saniyeyi kurtardı.
- 09Doğru token toplamı 28,81M
Child fork baseline'ı çıkarılınca 28.814.049 marjinal token kaldı; state sayaçlarını naif toplamak sonucu yaklaşık 1,93 kat şişirirdi.
- 10Cache ekonomik omurga
Input tokenların %96,845'i cached; bu uzun Sol akışını ekonomik olarak mümkün kılan ana unsur.
- 11Child az token, fazla uncached
Child lane'ler toplam tokenın %5,73'ü fakat uncached inputun %26,73'ü; marjinal child inputu root cache'inden daha pahalı.
- 12555,01 kredi
Resmî Codex token rate card ile marjinal tüketim 555,009 kredi; pakete dahil kullanım önce harcandığından bu doğrudan kredi satın alımı demek değildir.
- 13$22,20 API eşdeğeri
Standart GPT-5.6 Sol API rate'iyle aynı token karışımı yaklaşık 22,200 USD; priority processing karşılığı bunun yaklaşık iki katıdır.
- 14Child'larda Luna fırsatı
Sekiz child aynı token karışımında Sol ile 66,271 kredi; Luna karşılığı 13,254 kredi. Teorik toplam tasarruf %9,55, kalite eşitliği varsayılmıyor.
- 15Wrapper başarısı ürün başarısı değil
221/222 tamamlanmış wrapper sonucu %99,55 teknik kapanış verir; lifecycle, gate ve public readback ayrı tutulmalıdır.
- 16Recovery kalitesi yüksek
Üç build artifact sonrası runtime duvarı görüldü; log, iki rollback, yeniden deploy, restart ve health zinciriyle servis toparlandı.
- 17Build ve runtime ayrı gate
Üç artifact build'i yaklaşık 12 saniyede geçti ama runtime daha sonra hata verdi; build success tek başına deployment success değildir.
- 1849 helper çağrısı
UID/PWD/zaman kesişimi 49 root-helper çağrısını Enes hesabına bağladı; beş deployun ortalaması 29,6, medyanı 15 saniye.
- 19Git atfı sıfır
Pencerede Enes author/committer ile doğrulanan commit yok. Bu başarısızlık değil, atfedilebilir Git teslim kanıtı yok demektir.
- 20Finalization önce düzelmeli
Daha fazla agent açmadan önce kısa fan-out ağacında SubagentStop/await/final receipt kapanışı zorunlu hale getirilmeli.
METODOLOJİ / SINIR
Başarı tek sayı değildir.
UID 10019, home ownership, state thread metadata, rollout source/CWD/time; Git claims require matching author evidence.
Final cumulative usage minus the last fork baseline before the actual child turn; unresolved boundaries fail closed.
The latest actual turn has task_complete. It is not synonymous with product success.
0-100 evidence rubric: lifecycle 30, tool closure 20, build/smoke evidence 20, recovery 15, final evidence 15.
No prompt, response, secret, full path, repository content, title, UUID or raw journal line is published.
- root span contains human idle
- completed-active time excludes unfinished turns
- tool wrapper success is not product success
- Luna cost comparison is token-equivalent, not a quality claim
- current service health is not retroactively attributed
GERÇEK KULLANIM / 60 GÜNLÜK PENCERE
İki aylık çalışma günlüğü.
Ralli pisti değil, gerçek trafik.
Önemli: Pencere 60 gün, fakat GPT‑5.6 ilk kez 9 Tem 2026 tarihinde göründü. Yani bugün elimizde iki aylık 5.5 geçmişi, yalnız birkaç günlük erken GPT‑5.6 operasyon fotoğrafı var.
Mantıksal iş kaydı
Aynı branch’in kopyaları tek sayıldı.
Kopya artefakt
Şişirilmiş toplam üretmemek için elendi.
Erken dönem kayıt
Sol, Terra ve Luna toplamı; kalite puanı değil.
Doğru izole koşu
Aynı sabit problem, fresh process.
ÖNCE ROLLERİ ANLAYALIM
Üç model, üç ekip rolü.
Bunlar bir yarış sıralaması değil; harness içindeki görev tanımlarıdır.Zor karar, geniş kapsam ve nihai entegrasyon.
33 mantıksal kayıt · Kullanım yoğunluğuSınırı belli günlük geliştirmede hız ve muhakeme dengesi.
4 mantıksal kayıt · Sınırlı örnekParalel araştırma, doğrulama ve challenger lane’leri.
13 mantıksal kayıt · Sınırlı örnekPencerenin eski bölümündeki gerçek işleri gösterir. Görev, tarih ve harness eşit olmadığı için kontrollü 5.5 ↔ 5.6 testi değildir.
Karşılaştırma çizgisi, hüküm değilGÖZLEMSEL VERİ
Bu tablo performans yarışı değil, kullanım haritasıdır.
| Model | Rol | İş kaydı | Pay | Effort dağılımı | İlk → son gözlem | Yorum |
|---|---|---|---|---|---|---|
| GPT-5.6 Sol | Kıdemli teknik lider | 33 | %6,8 | high: 18 · xhigh: 6 · medium: 5 · ultra: 4 | 9 Tem 2026 → 11 Tem 2026 | Kullanım yoğunluğu; kalite sıralaması değil |
| GPT-5.6 Terra | Dengeli uygulayıcı | 4 | %0,8 | ultra: 4 | 10 Tem 2026 → 10 Tem 2026 | Sınırlı örnek; genelleme yapma |
| GPT-5.6 Luna | Uzman yardımcı | 13 | %2,7 | max: 10 · xhigh: 3 | 10 Tem 2026 → 11 Tem 2026 | Sınırlı örnek; genelleme yapma |
| GPT-5.5 | Önceki dönem referansı | 380 | %78,4 | xhigh: 181 · medium: 106 · high: 93 | 14 May 2026 → 9 Tem 2026 | Kullanım yoğunluğu; kalite sıralaması değil |
| Model kaydı yok | Eski kayıt biçimi | 52 | %10,7 | unknown: 52 | 7 Haz 2026 → 11 Haz 2026 | Kullanım yoğunluğu; kalite sıralaması değil |
| Diğer modeller | Sınırlı örnek | 3 | %0,6 | xhigh: 3 | 3 Haz 2026 → 14 Haz 2026 | Sınırlı örnek; genelleme yapma |
Neden token/test toplamı yok? Eski telemetry collector, aynı branch geçmişini birden fazla kez okuyordu. Yeni exporter 567 dosyayı 485 logical session’a düşürdü; yine de model bazlı token, wall ve TPS attribution’ı kesinleşmeden bunları operasyon yarışı gibi yayınlamıyoruz.
KONTROLLÜ SNAPSHOT / 34 KOŞU
Hız ve token için doğru masa burası.
Fast eşleşmesi daha kısa sürdü
Toplam wall: 629,628 sn| Model | Doğru | Toplam wall | Input | Cached | Output | Reasoning |
|---|---|---|---|---|---|---|
| Sol | 12/12 | 234,665 sn | 246.913 | 98.560 | 11.438 | 10.421 |
| Terra | 12/12 | 207,482 sn | 247.303 | 66.304 | 10.410 | 9.384 |
| Luna | 10/10 | 187,481 sn | 194.370 | 89.600 | 10.104 | 8.825 |
| Toplam | 34/34 | 629,628 sn | 688.586 | 254.464 | 31.952 | 28.630 |
TEKNİK SÖZLÜK
Grafikleri okumak için beş kavram.
Modelin okuduğu ve yazdığı küçük metin parçalarıdır. Bir kitabı kelime yerine hece parçalarıyla saymak gibi. İş hacmini gösterir; kalite puanı değildir.
Daha önce okunmuş içeriğin yeniden kullanılabilen kısmıdır. Masada hazır duran dosya gibi; input toplamının içindedir, ayrıca üstüne eklenmez.
Saniyedeki output token miktarıdır. Buradaki kontrollü TPS, output / uçtan uca süredir; modelin “düşünme hızı” veya decoder throughput değildir.
Codex’in bıraktığı iş kaydıdır. Root ve her alt ajan ayrı kayıt bırakabildiği için bir kullanıcı isteği birden fazla session üretebilir.
Root modelin sınırı belli bir alt işi incelemesi için çağırdığı yardımcı modeldir. Nihai kararı vermez; uzman kanıtı üretir.
AYNI ŞEY DEĞİLLER
Üç ölçüm, üç ayrı soru.
Harness günlük işte nasıl kullanıldı? Gerçek trafik gösterir; adil model yarışı değildir.
Aynı küçük görevde model, effort ve Fast neyi değiştirdi? Dar ama karşılaştırılabilir hız fotoğrafıdır.
0 child ile 3 child teslimatı nasıl değişti? Test, build, browser gate ve kör review içerir.
Kısaca: 60 gün kullanım alışkanlığını, 34 koşu dar hız deneyini, full-stack A/B ise ekip şeklinin teslimata etkisini anlatır. Bunları tek bir “sihirli puan” içinde eritmek yanlış olur.
BEN HANGİSİNİ SEÇMELİYİM?
Tek cümlelik rota.
- Zor ve belirsiz işSol High root
- Sınırı belli günlük uygulamaTerra
- Paralel araştırma ve doğrulamaLuna XHigh
- Çatışan kanıt veya kırılan gateLuna Max
- Basit, kısa işAlt ajan açmadan root
UÇUŞ KAYDI / BEŞ DENEY
Aynı prompt.
Farklı ekip şekli.
Ham kalite tek başına kazananı belirlemez. Mandatory gate, puanı veto edebilir.- Single
- 0
- Multi
- 7
- Single
- 71
- Multi
- 94
- Single
- 86
- Multi
- 84
- Single
- 84
- Multi
- 90
- Single
- 61
- Multi
- 14
GRAFİK 01 / KALİTE
Multi her yerde kazanmadı.
Calculator’da +23. Host security’de −47. 3D’de ham puan düşük olsa da performans gate’i sonucu tersine çevirdi.
GRAFİK 02 / AĞAÇ TELEMETRİSİ
Root değil, bütün ağaç ölçüldü.
Aggregate token root ve child toplamıdır. TPS, tree output / root wall’dır; decoder throughput değildir.
GRAFİK 03 / 0–3–5–6 PİLOT
Daha çok agent,
otomatik olarak daha iyi değil.
Aynı Calculator prompt’u ve aynı başlangıç yüzeyi. 0 ve 3 önceki donmuş koşudan; 5 ve 6 yeni, treatment-compliant iki-dalga koşulardan.
Root only
- Uncached
- 127,4 B
- TPS
- 44,82
3 specialist
- Uncached
- 286,1 B
- TPS
- 65,53
3 specialist + 2 challenger
- Uncached
- 657,6 B
- TPS
- 70,43
3 specialist + 2 challenger + adjudicator
- Uncached
- 583,7 B
- TPS
- 59,28
GRAFİK 04 / KARAR HARİTASI
Hız başka, kalite başka eksen.
Sağa gittikçe multi daha yavaş; yukarı gittikçe kalite artar. Balon çapı aggregate token çarpanını gösterir.
BEŞ CHAPTER / TAM KANIT
Her kazananın
başka bir nedeni var.
defensive security
Support security audit
Two disjoint evidence lanes; HIGH requires independent reproduction and Luna-max veto.
- Wall
- 380,52 sn
- Child
- 0
- Aggregate
- 3,1 Mn
- Uncached
- 202,3 B
- TPS
- 44,53
- Wall
- 641,34 sn
- Child
- 3
- Aggregate
- 19,1 Mn
- Uncached
- 1 Mn
- TPS
- 79,96
Lane’lerroutes_auth · services_storage · views_tests
- Customer thread/message lookups needed tenant scope at every reference step.
- Customer close needed normalization from reply/message ID to thread head.
- Broad discovery lanes produced unsupported CONFIRMED claims.
deterministic build
Hesap Atölyesi
Three specialist lanes at score 85+: parser, finance/state, and UI/a11y/offline.
- Wall
- 650,53 sn
- Child
- 0
- Aggregate
- 1,5 Mn
- Uncached
- 127,4 B
- TPS
- 44,82
- Wall
- 674,35 sn
- Child
- 3
- Aggregate
- 3,4 Mn
- Uncached
- 286,1 B
- TPS
- 65,53
Lane’lercalculation_contracts · ux_review · qa_plan
- Both candidates passed 48 tests and production build.
- Single could render non-finite results for extreme finite inputs.
interactive 3d build
Sinyal Bahçesi
Core and renderer lanes first; fixed-host performance and gameplay judge second; max only on failed gate.
- Wall
- 845,87 sn
- Child
- 0
- Aggregate
- 2 Mn
- Uncached
- 152,2 B
- TPS
- 42,17
- Wall
- 948,7 sn
- Child
- 3
- Aggregate
- 10,2 Mn
- Uncached
- 670,5 B
- TPS
- 95,57
Lane’lergame_core · renderer · visual_system
- Single median frame 66.7ms (~15 FPS).
- Multi median frame 16.7ms (~60 FPS), p95 33.4ms.
visual landing
Karanlık Ege
Two initial advisory lanes, then an Axe/browser judge; max only after a failed gate.
- Wall
- 504,72 sn
- Child
- 0
- Aggregate
- 1,3 Mn
- Uncached
- 121,6 B
- TPS
- 37,71
- Wall
- 624,29 sn
- Child
- 3
- Aggregate
- 1,4 Mn
- Uncached
- 173,7 B
- TPS
- 38,57
Lane’lerfixture_inventory · harness_audit · ux_contract
- Both initial candidates failed serious contrast.
- Multi user-derived innerHTML was replaced with textContent/replaceChildren.
- Corrected candidate passed Axe with zero serious/critical nodes.
defensive security
Host security assessment
Evidence ledger, raw-count guard, independent reproducer, and HIGH-severity adjudicator veto.
- Wall
- 850,26 sn
- Child
- 0
- Aggregate
- 1,1 Mn
- Uncached
- 88,8 B
- TPS
- 33
- Wall
- 737,91 sn
- Child
- 3
- Aggregate
- 5,8 Mn
- Uncached
- 568,8 B
- TPS
- 72,49
Lane’leros_network · web_tls_files · runtime_logs
- Multi wall time was 13.21% lower.
- Multi quality fell 47 points after false-positive penalties.
- Both read-only workspace digests remained unchanged.
GRAFİK 05 / GATE VETO
Puan değil, eligibility.
İki örnek, gate’in kör estetik puanını neden geçersiz kılabildiğini gösteriyor.
Single12
Multi ilk15
Multi fixed0
GÖRSEL KANIT / A-B
Çıktıyı da yan yana koyduk.
Grafiklerden sonra gerçek desktop ürün yüzeyleri. Mobil ve ek screenshot’lar public veri klasöründe.








12 TEMMUZ / 20 GEÇERLİ KOŞU
Ucuzluk, hız ve kalite
aynı kazananı seçmedi.
Beş eşlenik tekrar · 20/20 bağımsız test/build gate · üç kör adjudicator
- Kredi / görev
- 15.042
- API eşdeğeri
- $0.6017
- Medyan süre
- 976 sn
- Toplam token
- 2164K
- Kredi / görev
- 52.988
- API eşdeğeri
- $2.1195
- Medyan süre
- 687 sn
- Toplam token
- 1290K
- Kredi / görev
- 59.296
- API eşdeğeri
- $2.3719
- Medyan süre
- 615 sn
- Toplam token
- 3903K
- Kredi / görev
- 89.845
- API eşdeğeri
- $3.5938
- Medyan süre
- 1041 sn
- Toplam token
- 5965K
20 CANLI UYGULAMA
Her koşuyu tek tek aç.
Aynı prompt, farklı model ve ekip şekli. Her link ayrı statik build.Luna singleortalama kalite 85.6
Sol singleortalama kalite 77.2
Router autoortalama kalite 78.6
Router + 3ortalama kalite 87.2
METODOLOJİ / PROVENANCE
Neyi sabitledik?
Neyi sabitleyemedik?
- same prompt hash
- same starting surface
- Sol-high root
- same tool availability
- same time ceiling
- Single
- delegation disabled
- Multi
- live score-based Luna routing
security cases read-only with before/after digest; build cases used separate disposable condition workspaces
- n=1 per workload and topology
- service/cache noise
- scores are rubric-specific
- gate eligibility can override raw quality
- calculator topology pilot does not generalize to every workload
root input+output plus every child total token
tree input minus tree cached input
tree output token divided by root wall seconds; not decoder speed
CANLI / 0–100 ROUTING
Görevin ekip şeklini hesapla.
Altı boyutu değiştir. Sonuç aynı scorer felsefesini tarayıcıda görünür kılar.CANLI KANIT
İki kazanan yayında.
Public readback, HSTS ve gerçek browser etkileşimi doğrulandı.
ÖNERİLER / KALAN DENEY
Uygulananlar ve
bilerek açık bırakılanlar.
Workload-specific confirmation and release gates
Two-wave five-to-six-role council planning
Repeat 0/3/5/6 topology across at least five seeds per workload
Başarı metriği: calculator n=1 pilot complete and executable 100-run matrix exists; general conclusion still requires the remaining repeated runs
Add phase/role/rework/escaped-defect telemetry
Başarı metriği: wave roles and treatment compliance are captured; rework and escaped-defect labels remain scorer inputs
HAM VERİ / AÇIK KANIT