MDL×DCC · REASONING TRACE ARENA

MDL×DCC Reasoning Trace Arena

Preregistered engineering experiment · 18 August 2026
MDL×DCC Reasoning Trace Arena

Can the evolving compressibility of a permitted, visible reasoning or search trajectory tell a governor whether deliberation is progressing, looping, ready to branch, or ready to stop?

PREREGISTERED ENGINEERING EXPERIMENTNO RESULT YETMODEL-AGNOSTIC CANDIDATENOT CONSCIOUSNESS EVIDENCE
partial visible trace → process sensors → MDL comparison → DCC action: CONTINUE · STOP · BRANCH · SWITCH · TOOL · ESCALATE
Claim boundary. This page specifies a test. It does not claim solved AGI or ASI, universal transfer, access to proprietary hidden chain-of-thought, artificial phenomenality, or support for AC, CFH, or biological CCH. Use user-visible reasoning, structured agent events, tool/search logs, or open-model traces only where policy and consent permit.
Preregistrirani inženirski eksperiment · 18. avgust 2026
MDL×DCC Arena sledi sklepanja

Ali lahko spreminjanje stisljivosti dovoljene, vidne sledi sklepanja ali iskanja governorju pove, ali proces napreduje, kroži, potrebuje vejo ali je pripravljen na ustavitev?

PREREGISTRIRANI INŽENIRSKI EKSPERIMENTREZULTATA ŠE NIMODELNO NEODVISEN KANDIDATNI DOKAZ ZAVESTI
delna vidna sled → procesni senzorji → MDL primerjava → DCC dejanje: NADALJUJ · USTAVI · RAZVEJI · PREKLOPI · ORODJE · ESKALIRAJ
Meja trditve. Ta stran določa test. Ne trdi rešene AGI ali ASI, univerzalnega prenosa, dostopa do lastniške skrite verige misli, umetne fenomenalnosti ali podpore za AC, CFH oziroma biološko CCH. Uporabi le uporabniku vidno sklepanje, strukturirane agentne dogodke, dnevnike orodij/iskanja ali sledi odprtih modelov, kjer pravila in soglasje to dovoljujejo.
01 · Exact research object

Not the answer. Not the dataset. The trajectory.

The candidate contribution is narrower than “compression is intelligence.” It asks whether compression dynamics of the process add online control value beyond answer quality, response length, confidence, entropy, self-consistency, and trained critics.

What is measured

Prefixes of a visible reasoning/search trace, operator sequence, tool trajectory, or structured event stream. The sensor sees only information available at that point in time.

What is predicted

Final correctness, recoverability after an error, future marginal gain, impending repetition, and the value of more compute or a strategy switch.

What is governed

Continue, stop, branch, change representation, call a tool, retrieve another perspective, or escalate to a stronger model under a fixed budget.

Candidate differentiator — not a priority claim

A lightweight or training-free, model-agnostic online governor built from trajectory-compression dynamics, whose sensors and control laws compete under MDL and are evaluated across held-out tasks and model families at matched compute. Individual ingredients have important predecessors; the proposed contribution is the combined empirical programme.

AGI position. MDL×DCC is not proposed as the learning substrate of AGI. It is a candidate process-governance component for allocating test-time compute and deciding when to continue, branch, switch, use a tool, escalate, or stop.
01 · Natančen raziskovalni objekt

Ne odgovor. Ne podatki. Trajektorija.

Kandidatni prispevek je ožji od »kompresija je inteligenca«. Sprašuje, ali kompresijska dinamika procesa doda sprotno krmilno vrednost onkraj kakovosti odgovora, dolžine, samozavesti, entropije, samokonsistentnosti in naučenih kritikov.

Kaj merimo

Predpone vidne sledi sklepanja/iskanja, zaporedja operatorjev, poti orodij ali strukturiranega toka dogodkov. Senzor vidi samo informacije, ki so v tistem trenutku na voljo.

Kaj napovedujemo

Končno pravilnost, možnost okrevanja po napaki, prihodnjo mejno korist, bližajoče ponavljanje in vrednost dodatnega računanja ali preklopa strategije.

Kaj upravljamo

Nadaljuj, ustavi, razveji, spremeni reprezentacijo, uporabi orodje, prikliči drugo perspektivo ali eskaliraj na močnejši model pri fiksnem budgetu.

Kandidatna razlika — ne trditev o prvenstvu

Lahek ali brez dodatnega učenja, modelno neodvisen sprotni governor iz kompresijske dinamike trajektorije, pri katerem senzorji in kontrolni zakoni tekmujejo pod MDL ter se preverijo na held-out nalogah in modelnih družinah pri izenačenem računanju. Posamezne sestavine imajo pomembne predhodnike; predlagani prispevek je združen empirični program.

Položaj glede AGI. MDL×DCC ni predlagan kot učna podlaga AGI. Je kandidatna komponenta upravljanja procesa za dodeljevanje test-time računske moči ter odločanje, kdaj nadaljevati, razvejiti, preklopiti, uporabiti orodje, eskalirati ali ustaviti.
02 · Intellectual neighbourhood

The ingredients have ancestors. That strengthens the test.

Algorithmic induction, compression progress, active inference, adaptive test-time compute, repetition penalties, reward prediction, trace segmentation, and chain-of-thought monitoring already occupy adjacent territory. The experiment must beat them, not pretend the territory is empty.

Prior line
What it already establishes
Relation to this arena
Remaining distinction to test
Solomonoff · Hutter
Algorithmic description length and universal prediction/decision theory connect compression, induction, and action.
Deep conceptual ancestry.
A computable, online process governor under real budgets.
Schmidhuber
Compression progress can drive curiosity and exploration.
Closest classical process-side intuition.
Task-correctness, stopping, switching, and held-out transfer rather than intrinsic reward alone.
Friston / active inference
Prediction error and control can be described in a broad generative framework.
Biological/control neighbour.
A model-agnostic engineering sensor and governor, not a biological identity claim.
LZ Penalty
LZ77 code length can suppress degenerate repetition during decoding.
Direct Lempel–Ziv neighbour.
Use multiscale trajectory dynamics for decisions beyond repetition suppression.
Token complexity
Question-level reasoning length can strongly predict success and yields an accuracy–compression trade-off.
Length/rate-distortion baseline.
Incremental value beyond length from structure of the partial trajectory.
Compute-optimal scaling · Re-FORC
Adaptive allocation and reward prediction can improve accuracy–compute trade-offs and early stopping.
Strong direct competitor.
Can cheap compression sensors match or complement trained predictors across models?
ReasonOps / trace evaluators
Operator structure and partial traces can support early correctness prediction.
Trace-structure competitor.
Training-free or light MDL-selected sensor families with action policies and transfer tests.
CoT monitoring
Visible reasoning can improve oversight, but monitorability may be fragile and optimization can induce obfuscation.
Safety constraint.
Test utility without treating the trace as faithful inner cognition or optimizing it into unreadability.
02 · Intelektualna soseščina

Sestavine imajo prednike. To test okrepi.

Algoritemska indukcija, kompresijski napredek, aktivna inferenca, prilagodljivo test-time računanje, kazni za ponavljanje, napoved nagrade, segmentacija sledi in nadzor verige misli že zasedajo bližnje ozemlje. Eksperiment jih mora premagati, ne pa se pretvarjati, da je prostor prazen.

Predhodna linija
Kaj že kaže
Odnos do te arene
Razlika, ki jo je treba preveriti
Solomonoff · Hutter
Algoritemska opisna dolžina ter univerzalna teorija napovedovanja/odločanja povezujejo kompresijo, indukcijo in dejanje.
Globoki konceptualni predniki.
Izračunljiv spletni procesni governor pod realnimi budgeti.
Schmidhuber
Kompresijski napredek lahko poganja radovednost in raziskovanje.
Najbližja klasična procesna intuicija.
Pravilnost naloge, ustavljanje, preklapljanje in held-out prenos, ne le intrinzična nagrada.
Friston / aktivna inferenca
Napako napovedi in krmiljenje je mogoče opisati v širokem generativnem okviru.
Biološki/kontrolni sosed.
Modelno neodvisen inženirski senzor in governor, ne trditev o biološki identiteti.
LZ Penalty
Dolžina kode LZ77 lahko med dekodiranjem zavira degenerativno ponavljanje.
Neposredni Lempel–Ziv sosed.
Uporaba večskalnih dinamik trajektorije za odločitve onkraj zatiranja ponavljanja.
Token complexity
Dolžina sklepanja na ravni vprašanja lahko močno napoveduje uspeh in poda trade-off pravilnost–kompresija.
Baseline dolžine/rate-distortion.
Dodatna vrednost strukture delne trajektorije onkraj dolžine.
Compute-optimal scaling · Re-FORC
Prilagodljiva dodelitev in napoved nagrade lahko izboljšata trade-off pravilnost–računanje ter zgodnje ustavljanje.
Močan neposredni konkurent.
Ali poceni kompresijski senzorji izenačijo ali dopolnijo naučene napovednike čez modele?
ReasonOps / evaluatorji sledi
Struktura operatorjev in delne sledi lahko podprejo zgodnjo napoved pravilnosti.
Konkurent na ravni strukture sledi.
Brez-učenja ali lahke MDL-izbrane družine senzorjev z akcijskimi politikami in testi prenosa.
Nadzor CoT
Vidno sklepanje lahko izboljša nadzor, vendar je monitorabilnost lahko krhka, optimizacijski pritisk pa lahko povzroči prikrivanje.
Varnostna omejitev.
Preveriti korist brez obravnavanja sledi kot zanesljivega notranjega mišljenja ali njene optimizacije v neberljivost.
03 · Existing engineering priors

Why the test is justified — and why it is not pre-won

TSP trajectory signal

The public Domain Map reports a strong relation between tour/search quality and LZ-based process structure (ρ≈0.80). This is a domain prior, not an LLM result.

Sudoku Demon

The public Demon page reports process-side information outranking static state information, with 6,156 run-summary rows, 29 gates, and 8 promotion candidates against matched controls.

Chess ambiguity prior

The current Domain Map reports a DCC tiebreak signal in near-equal engine positions: H1 confirmed in 17/18 TCEC Cup 14 games and an 80% winner-selection rate in the stated comparison. For agent relevance, this ambiguity-tiebreak form is the sharper prior than correlation alone. Treat it as a seed for preregistration, not universal proof.

The transferred hypothesis

When outcome evaluators are nearly tied, a process prior may distinguish trajectories that are stable, productive, and recoverable from those that are repetitive, brittle, or drifting. The LLM arena must test that claim independently.

03 · Obstoječi inženirski priorji

Zakaj je test upravičen — in zakaj še ni dobljen

Signal trajektorije TSP

Javni Domain Map poroča o močnem odnosu med kakovostjo poti/iskanja in procesno strukturo na osnovi LZ (ρ≈0,80). To je domenski prior, ne rezultat na LLM.

Sudoku Demon

Javna stran Demon poroča, da procesna informacija prekaša statično informacijo stanja, pri 6.156 run-summary vrsticah, 29 vratih in 8 kandidatih za promocijo proti matched kontrolam.

Prior šahovske dvoumnosti

Sedanji Domain Map poroča o DCC tiebreak signalu pri skoraj enakih engine pozicijah: H1 potrjen v 17/18 partijah TCEC Cup 14 in 80-odstotna izbira zmagovalca v navedeni primerjavi. Za agentno relevantnost je ta oblika razreševanja dvoumnosti ostrejši prior kot sama korelacija. To je seme preregistracije, ne univerzalni dokaz.

Prenesena hipoteza

Ko so evaluatorji izida skoraj izenačeni, lahko procesni prior loči stabilne, produktivne in popravljive trajektorije od ponavljajočih, krhkih ali drsečih. LLM arena mora to preveriti neodvisno.

04 · Frozen test ladder

Seed → passive prediction → selection → active governor → transfer

P0 REPRESENTATION FREEZEP1 PASSIVE PREDICTIONP2 BEST-OF-NP3 ACTIVE GOVERNORP4 HELD-OUT TRANSFER

Trace unit

  • Visible prefix at fixed token/step fractions.
  • Operator/event sequence where available.
  • Tool calls, search nodes, revisions, and answer changes.
  • No future tokens or final correctness label in the sensor.

Task families

  • Verifiable mathematics and logic.
  • Code generation with executable tests.
  • Knowledge/reasoning tasks with sealed answers.
  • Tool-using agent tasks with observable state transitions.
  • At least one held-out family never used for sensor selection.

Candidate sensors

LZ76 / LZ77 code lengthNormalized phrase count and codelength over tokens, operator IDs, or structured events.
Compression slopeChange in normalized codelength across successive prefixes.
Local noveltyNew phrases/operators relative to the trace’s own past.
Loop / stagnation signatureRepeated spans, repeated operator motifs, answer-flip cycles, and low marginal novelty.
Differentiate → cascade → compressTemporary structure growth followed by a productive collapse of uncertainty.
Change pointsTransitions between exploration, exploitation, correction, and convergence regimes.

Matched conditions

Arm
System
Online action
Budget
Purpose
B0
Base model/agent, fixed maximum reasoning budget
None
Reference
Ordinary accuracy, tokens, latency, repetition, and correction uptake
B1
Length/confidence/answer-stability heuristic
Continue or stop
Matched
Strong cheap non-compression baseline
B2
PRM, critic, or lightweight trained predictor
Score, reject, stop, or allocate
Matched including training/inference cost
Strong learned baseline
D1
Fixed declared compression sensor and fixed law
Continue / stop / branch
Matched
Does a simple process-compression rule help?
SS
Self-selecting MDL×DCC: sensor, representation, and law compete
Continue / stop / branch / switch / tool / escalate
Matched; full overhead charged
Does self-selection add net value?
04 · Zamrznjena testna lestev

Seme → pasivna napoved → izbor → aktivni governor → prenos

P0 ZAMRZNITEV REPREZENTACIJEP1 PASIVNA NAPOVEDP2 BEST-OF-NP3 AKTIVNI GOVERNORP4 HELD-OUT PRENOS

Enota sledi

  • Vidna predpona pri fiksnih deležih tokenov/korakov.
  • Zaporedje operatorjev/dogodkov, kjer je na voljo.
  • Klici orodij, vozlišča iskanja, revizije in spremembe odgovora.
  • V senzorju ni prihodnjih tokenov ali končne oznake pravilnosti.

Družine nalog

  • Preverljiva matematika in logika.
  • Generiranje kode z izvršljivimi testi.
  • Naloge znanja/sklepanja z zapečatenimi odgovori.
  • Agentne naloge z orodji in opaznimi prehodi stanja.
  • Vsaj ena held-out družina, ki ni bila uporabljena za izbor senzorjev.

Kandidatni senzorji

Dolžina kode LZ76 / LZ77Normalizirano število fraz in dolžina kode nad tokeni, ID-ji operatorjev ali strukturiranimi dogodki.
Naklon kompresijeSprememba normalizirane dolžine kode med zaporednimi predponami.
Lokalna novostNove fraze/operatorji glede na lastno preteklost sledi.
Podpis zanke / stagnacijePonovljeni odseki, motivi operatorjev, cikli menjave odgovora in nizka mejna novost.
Diferenciraj → kaskada → stisniZačasna rast strukture, ki ji sledi produktiven kolaps negotovosti.
Prelomne točkePrehodi med raziskovanjem, izkoriščanjem, popravkom in konvergenco.

Izenačeni pogoji

Pogoj
Sistem
Spletno dejanje
Budget
Namen
B0
Osnovni model/agent, fiksen največji budget sklepanja
Brez
Referenca
Običajna pravilnost, tokeni, latenca, ponavljanje in sprejem popravkov
B1
Hevristika dolžine/samozavesti/stabilnosti odgovora
Nadaljuj ali ustavi
Izenačen
Močan poceni nekompresijski baseline
B2
PRM, kritik ali lahek naučen napovednik
Oceni, zavrni, ustavi ali dodeli
Izenačen, vključno s stroškom učenja/inference
Močan naučen baseline
D1
Fiksen deklariran kompresijski senzor in zakon
Nadaljuj / ustavi / razveji
Izenačen
Ali preprosto pravilo procesne kompresije pomaga?
SS
Samoselektivni MDL×DCC: senzor, reprezentacija in zakon tekmujejo
Nadaljuj / ustavi / razveji / preklopi / orodje / eskaliraj
Izenačen; ves overhead zaračunan
Ali samoselekcija doda neto vrednost?
05 · Decision table

Win only on the accuracy–compute frontier

Primary outcomes

  • Accuracy at a fixed total compute/token budget.
  • Total compute/tokens required to reach a fixed accuracy.
  • Held-out calibration of stop/continue and branch/switch decisions.
  • Cross-model and cross-task transfer after the sensor contract is frozen.

Secondary outcomes

  • False-stop and false-continue rates.
  • Best-of-n selection accuracy.
  • Recovery after an incorrect intermediate commitment.
  • Latency, tool calls, monitor cost, and human attention.
  • Robustness when visible traces are summaries or structured events rather than free-form CoT.

Promotion rule

Promote MDL×DCC only if it moves the held-out accuracy–compute Pareto frontier after every sensor, selector, tool call, model escalation, and monitoring cost is charged. A pretty correlation, a win on one benchmark, or a gain that disappears against length/confidence/PRM baselines is not enough.

05 · Odločitvena tabela

Zmaga samo na fronti pravilnost–računanje

Primarni izidi

  • Pravilnost pri fiksnem skupnem budgetu računanja/tokenov.
  • Skupno računanje/tokeni za dosego fiksne pravilnosti.
  • Held-out kalibracija odločitev ustavi/nadaljuj in razveji/preklopi.
  • Prenos čez modele in naloge po zamrznitvi pogodbe senzorjev.

Sekundarni izidi

  • Delež napačnih ustavitev in napačnih nadaljevanj.
  • Pravilnost izbire best-of-n.
  • Okrevanje po napačni vmesni zavezi.
  • Latenca, klici orodij, strošek monitorja in človeška pozornost.
  • Robustnost, ko so vidne sledi povzetki ali strukturirani dogodki namesto prostega CoT.

Pravilo promocije

MDL×DCC se promovira samo, če premakne held-out Pareto fronto pravilnost–računanje po tem, ko zaračunamo vsak senzor, selektor, klic orodja, eskalacijo modela in strošek nadzora. Lepo korelacijo, zmaga na enem benchmarku ali korist, ki izgine proti baselineom dolžine/samozavesti/PRM, ne zadošča.

06 · What would count against it

The experiment must be able to kill the idea

No incremental signalCompression features add no held-out value beyond length, confidence, entropy, answer stability, self-consistency, PRMs, or critics.
Domain lockGains require task-specific thresholds or retraining and fail on held-out task/model families.
False-stop harmSaved compute is purchased with unacceptable loss of correctness, calibration, or recoverability.
Overhead erases gainMonitoring, branching, or escalation costs consume the apparent advantage.
Trace gamingOptimization makes visible traces more compressible while reasoning quality or monitorability degrades.
Hidden humanBD or another expert makes the crucial decisions that the governor claims to make.
Result moves targetSensors, encodings, thresholds, task families, or success criteria change after outcomes are inspected.
Replication failureAn independent team cannot recover the result from the frozen data, code, seeds, budgets, and manifests.
06 · Kaj bi govorilo proti

Eksperiment mora biti sposoben ubiti idejo

Ni dodatnega signalaKompresijske značilke ne dodajo held-out vrednosti onkraj dolžine, samozavesti, entropije, stabilnosti odgovora, samokonsistentnosti, PRM-jev ali kritikov.
Zaklep domeneKoristi zahtevajo pragove ali učenje po meri naloge in padejo na held-out družinah nalog/modelov.
Škoda napačne ustavitvePrihranjeno računanje je kupljeno z nesprejemljivo izgubo pravilnosti, kalibracije ali popravljivosti.
Overhead izbriše koristStroški nadzora, razvejanja ali eskalacije porabijo navidezno prednost.
Igranje slediOptimizacija naredi vidne sledi bolj stisljive, medtem ko kakovost sklepanja ali monitorabilnost pade.
Skriti človekBD ali drug ekspert opravi ključne odločitve, ki naj bi jih opravil governor.
Premik cilja po rezultatuSenzorji, kodiranja, pragovi, družine nalog ali kriteriji uspeha se spremenijo po vpogledu v izid.
Replikacija padeNeodvisna ekipa ne more ponoviti rezultata iz zamrznjenih podatkov, kode, seedov, budgetov in manifestov.
07 · Governance evidence already visible

The R2 → R4 correction loop is a process artifact

The ACP/CCH release chain used an independent reviewer, a targeted builder, and a second independent verifier. The verifier recomputed CRC, SHA-256, and SHA3-256, checked old hashes against independently retained baseline bytes, and confirmed that only declared files changed. This is a concrete example of auditable multi-agent correction.

OPUS RED TEAMGPT TARGETED PATCHFABLE INDEPENDENT VERIFICATIONMANIFEST + LINEAGE HASHES
Boundary. The workflow shows that multi-agent review can be made traceable. It does not prove that MDL×DCC governed the process, that the reasoning-trace hypothesis is correct, or that the reviewers are independent in the institutional sense. It is a method artifact worth preserving and testing against simpler review workflows.
07 · Že vidni dokaz upravljanja

Korekcijska zanka R2 → R4 je procesni artefakt

Veriga izdaje ACP/CCH je uporabila neodvisnega reviewerja, ciljnega graditelja in drugega neodvisnega verifierja. Verifier je ponovno izračunal CRC, SHA-256 in SHA3-256, preveril stare hashe proti samostojno ohranjenim bajtom baselinea in potrdil, da so se spremenile samo deklarirane datoteke. To je konkreten primer revizijsko sledljive večagentne korekcije.

OPUS RED TEAMGPT CILJNI PATCHFABLE NEODVISNA VERIFIKACIJAMANIFEST + LINEAGE HASHI
Meja. Workflow kaže, da je večagentni review mogoče narediti sledljiv. Ne dokazuje, da je MDL×DCC upravljal proces, da je hipoteza sledi sklepanja pravilna ali da so reviewerji neodvisni v institucionalnem smislu. Je metodološki artefakt, ki ga je vredno ohraniti in primerjati s preprostejšimi review workflowi.
08 · ASI-facing frontier

Complexity resilience, not an ASI declaration

The longer-horizon question is whether a governance advantage survives when the reachable search space becomes too large for exhaustive evaluation. The relevant test is not “does this create ASI?” but “does the governor preserve calibration, correction, least-regret switching, and shutdown under expanding branching factor, horizon, tool count, and model heterogeneity?”

Future matched test

Scale the same task family through increasing search-space size and compare fixed heuristics, learned allocators, and self-selecting MDL×DCC under equal compute. Measure when each loses calibration, hides overhead, or collapses into exploit lock or noise. A disappearing advantage is a valid negative result.

08 · Frontier, usmerjen proti ASI

Odpornost na kompleksnost, ne razglasitev ASI

Dolgoročnejše vprašanje je, ali prednost upravljanja preživi, ko dosegljivi prostor iskanja postane prevelik za izčrpno ocenjevanje. Pravi test ni »ali to ustvari ASI?«, ampak »ali governor ohrani kalibracijo, popravek, preklapljanje z najmanjšim obžalovanjem in izklop ob rastočem branching faktorju, horizontu, številu orodij in heterogenosti modelov?«

Prihodnji matched test

Isto družino nalog stopnjuj skozi rast prostora iskanja in primerjaj fiksne hevristike, naučene allocatorje ter samoselektivni MDL×DCC pri enakem računanju. Izmeri, kdaj kdo izgubi kalibracijo, skrije overhead ali pade v exploit lock oziroma šum. Izginotje prednosti je veljaven negativen rezultat.

09 · External replication

The engineering line needs its own independent reviewer

The most important remaining step is not another internal score. It is an outside team that selects at least one task family, runs the frozen baselines, challenges the encodings and sensors, and reports both positive and negative outcomes.

Minimum replication pack

  • Exact task and trace corpus with licence.
  • Frozen representation and sensor contract.
  • One-command baseline and governor runs.
  • Seeds, budgets, environment and dependency hashes.
  • Expected schemas, not expected winners.
  • Raw outputs, failure cases, and analysis script.

Independent choices reserved

  • At least one baseline chosen by the replicator.
  • At least one encoding challenge.
  • One held-out task family unavailable during development.
  • Adversarial examples of fluent loops and productive repetition.
  • Permission to publish contradiction without approval.
09 · Zunanja replikacija

Inženirska linija potrebuje svojega neodvisnega reviewerja

Najpomembnejši preostali korak ni nova interna ocena. Je zunanja ekipa, ki izbere vsaj eno družino nalog, požene zamrznjene baseline, napade kodiranja in senzorje ter objavi pozitivne in negativne izide.

Minimalni replikacijski paket

  • Natančen korpus nalog in sledi z licenco.
  • Zamrznjena pogodba reprezentacije in senzorjev.
  • Enoukazni zagoni baselineov in governorja.
  • Seedi, budgeti, okolje in hashi odvisnosti.
  • Pričakovane sheme, ne pričakovani zmagovalci.
  • Surovi izhodi, primeri padcev in analiza.

Neodvisne izbire replikatorja

  • Vsaj en baseline izbere replikator.
  • Vsaj en napad na kodiranje.
  • Ena held-out družina nalog, nedostopna pri razvoju.
  • Adversarial primeri tekočih zank in produktivnega ponavljanja.
  • Dovoljenje za objavo protislovja brez odobritve.