What is measured
Prefixes of a visible reasoning/search trace, operator sequence, tool trajectory, or structured event stream. The sensor sees only information available at that point in time.
Can the evolving compressibility of a permitted, visible reasoning or search trajectory tell a governor whether deliberation is progressing, looping, ready to branch, or ready to stop?
Ali lahko spreminjanje stisljivosti dovoljene, vidne sledi sklepanja ali iskanja governorju pove, ali proces napreduje, kroži, potrebuje vejo ali je pripravljen na ustavitev?
The candidate contribution is narrower than “compression is intelligence.” It asks whether compression dynamics of the process add online control value beyond answer quality, response length, confidence, entropy, self-consistency, and trained critics.
Prefixes of a visible reasoning/search trace, operator sequence, tool trajectory, or structured event stream. The sensor sees only information available at that point in time.
Final correctness, recoverability after an error, future marginal gain, impending repetition, and the value of more compute or a strategy switch.
Continue, stop, branch, change representation, call a tool, retrieve another perspective, or escalate to a stronger model under a fixed budget.
A lightweight or training-free, model-agnostic online governor built from trajectory-compression dynamics, whose sensors and control laws compete under MDL and are evaluated across held-out tasks and model families at matched compute. Individual ingredients have important predecessors; the proposed contribution is the combined empirical programme.
Kandidatni prispevek je ožji od »kompresija je inteligenca«. Sprašuje, ali kompresijska dinamika procesa doda sprotno krmilno vrednost onkraj kakovosti odgovora, dolžine, samozavesti, entropije, samokonsistentnosti in naučenih kritikov.
Predpone vidne sledi sklepanja/iskanja, zaporedja operatorjev, poti orodij ali strukturiranega toka dogodkov. Senzor vidi samo informacije, ki so v tistem trenutku na voljo.
Končno pravilnost, možnost okrevanja po napaki, prihodnjo mejno korist, bližajoče ponavljanje in vrednost dodatnega računanja ali preklopa strategije.
Nadaljuj, ustavi, razveji, spremeni reprezentacijo, uporabi orodje, prikliči drugo perspektivo ali eskaliraj na močnejši model pri fiksnem budgetu.
Lahek ali brez dodatnega učenja, modelno neodvisen sprotni governor iz kompresijske dinamike trajektorije, pri katerem senzorji in kontrolni zakoni tekmujejo pod MDL ter se preverijo na held-out nalogah in modelnih družinah pri izenačenem računanju. Posamezne sestavine imajo pomembne predhodnike; predlagani prispevek je združen empirični program.
Algorithmic induction, compression progress, active inference, adaptive test-time compute, repetition penalties, reward prediction, trace segmentation, and chain-of-thought monitoring already occupy adjacent territory. The experiment must beat them, not pretend the territory is empty.
Algoritemska indukcija, kompresijski napredek, aktivna inferenca, prilagodljivo test-time računanje, kazni za ponavljanje, napoved nagrade, segmentacija sledi in nadzor verige misli že zasedajo bližnje ozemlje. Eksperiment jih mora premagati, ne pa se pretvarjati, da je prostor prazen.
The public Domain Map reports a strong relation between tour/search quality and LZ-based process structure (ρ≈0.80). This is a domain prior, not an LLM result.
The public Demon page reports process-side information outranking static state information, with 6,156 run-summary rows, 29 gates, and 8 promotion candidates against matched controls.
The current Domain Map reports a DCC tiebreak signal in near-equal engine positions: H1 confirmed in 17/18 TCEC Cup 14 games and an 80% winner-selection rate in the stated comparison. For agent relevance, this ambiguity-tiebreak form is the sharper prior than correlation alone. Treat it as a seed for preregistration, not universal proof.
When outcome evaluators are nearly tied, a process prior may distinguish trajectories that are stable, productive, and recoverable from those that are repetitive, brittle, or drifting. The LLM arena must test that claim independently.
Javni Domain Map poroča o močnem odnosu med kakovostjo poti/iskanja in procesno strukturo na osnovi LZ (ρ≈0,80). To je domenski prior, ne rezultat na LLM.
Javna stran Demon poroča, da procesna informacija prekaša statično informacijo stanja, pri 6.156 run-summary vrsticah, 29 vratih in 8 kandidatih za promocijo proti matched kontrolam.
Sedanji Domain Map poroča o DCC tiebreak signalu pri skoraj enakih engine pozicijah: H1 potrjen v 17/18 partijah TCEC Cup 14 in 80-odstotna izbira zmagovalca v navedeni primerjavi. Za agentno relevantnost je ta oblika razreševanja dvoumnosti ostrejši prior kot sama korelacija. To je seme preregistracije, ne univerzalni dokaz.
Ko so evaluatorji izida skoraj izenačeni, lahko procesni prior loči stabilne, produktivne in popravljive trajektorije od ponavljajočih, krhkih ali drsečih. LLM arena mora to preveriti neodvisno.
Promote MDL×DCC only if it moves the held-out accuracy–compute Pareto frontier after every sensor, selector, tool call, model escalation, and monitoring cost is charged. A pretty correlation, a win on one benchmark, or a gain that disappears against length/confidence/PRM baselines is not enough.
MDL×DCC se promovira samo, če premakne held-out Pareto fronto pravilnost–računanje po tem, ko zaračunamo vsak senzor, selektor, klic orodja, eskalacijo modela in strošek nadzora. Lepo korelacijo, zmaga na enem benchmarku ali korist, ki izgine proti baselineom dolžine/samozavesti/PRM, ne zadošča.
The ACP/CCH release chain used an independent reviewer, a targeted builder, and a second independent verifier. The verifier recomputed CRC, SHA-256, and SHA3-256, checked old hashes against independently retained baseline bytes, and confirmed that only declared files changed. This is a concrete example of auditable multi-agent correction.
Veriga izdaje ACP/CCH je uporabila neodvisnega reviewerja, ciljnega graditelja in drugega neodvisnega verifierja. Verifier je ponovno izračunal CRC, SHA-256 in SHA3-256, preveril stare hashe proti samostojno ohranjenim bajtom baselinea in potrdil, da so se spremenile samo deklarirane datoteke. To je konkreten primer revizijsko sledljive večagentne korekcije.
The longer-horizon question is whether a governance advantage survives when the reachable search space becomes too large for exhaustive evaluation. The relevant test is not “does this create ASI?” but “does the governor preserve calibration, correction, least-regret switching, and shutdown under expanding branching factor, horizon, tool count, and model heterogeneity?”
Scale the same task family through increasing search-space size and compare fixed heuristics, learned allocators, and self-selecting MDL×DCC under equal compute. Measure when each loses calibration, hides overhead, or collapses into exploit lock or noise. A disappearing advantage is a valid negative result.
Dolgoročnejše vprašanje je, ali prednost upravljanja preživi, ko dosegljivi prostor iskanja postane prevelik za izčrpno ocenjevanje. Pravi test ni »ali to ustvari ASI?«, ampak »ali governor ohrani kalibracijo, popravek, preklapljanje z najmanjšim obžalovanjem in izklop ob rastočem branching faktorju, horizontu, številu orodij in heterogenosti modelov?«
Isto družino nalog stopnjuj skozi rast prostora iskanja in primerjaj fiksne hevristike, naučene allocatorje ter samoselektivni MDL×DCC pri enakem računanju. Izmeri, kdaj kdo izgubi kalibracijo, skrije overhead ali pade v exploit lock oziroma šum. Izginotje prednosti je veljaven negativen rezultat.
The most important remaining step is not another internal score. It is an outside team that selects at least one task family, runs the frozen baselines, challenges the encodings and sensors, and reports both positive and negative outcomes.
Najpomembnejši preostali korak ni nova interna ocena. Je zunanja ekipa, ki izbere vsaj eno družino nalog, požene zamrznjene baseline, napade kodiranja in senzorje ter objavi pozitivne in negativne izide.
Identifiers checked 18 August 2026. This list positions the proposed experiment; it does not claim exhaustive prior-art coverage or priority.