Lição 4 · Medição comparávelÍndiceEN
Benchmark CLIProxyAPI · Medição comparável

Entregue o contexto que você declara

O alvo nominal muda quando cap, envelope e reserva de saída entram na mesma janela.

Fontes locais primárias: BENCHMARK-MEASUREMENT-PLAN.md, model-context-matrix.csv e planned-run-manifest.json.
BENCHMARK-MEASUREMENT-PLAN.md · model-context-matrix.csv · planned-run-manifest.json

A ideia em linguagem simples

A matriz usa cinco cenários: 256, 128k, 256k, 500k e ~1M. ✓ cabe no limite conhecido; △ exige prova; — excede; N/A é não textual. O harness não pode dizer que testou 500k se compactou ou truncou antes de transmitir.

Exemplo recorrente: envie o mesmo pacote lacrado — nonce, checksum e três needles — pelas seis lanes. Se o embrulho muda no harness, você mede a lane também. A analogia quebra porque contexto, tools e thinking têm semântica, não apenas tamanho.

O alvo real é min(cenário nominal, cap efetivo − envelope observado − reserva de saída). Há 53 células estritas e 9 condicionais por lane completa. Se todas as seis lanes qualificassem, o teto geométrico seria 1.278 requests e 238.024.602 tokens de entrada conhecidos — projeção, não autorização.

Trecho verificável

actual_target = min(nominal, effective_cap - envelope - output_reserve)\nper_lane = 53 strict + 9 conditional\nall_six_lanes_upper_bound = 1278 requests

outputs/BENCHMARK-MEASUREMENT-PLAN.md · outputs/model-context-matrix.csv · outputs/planned-run-manifest.json

O caminho em uma imagem

UI / CLIobserved outputharnessWarp · Codex · Claudecompatibilitysidecar / envelopeCLIProxyAPI127.0.0.1:8317providerdirect Chat · Responses · MessagesPRIMARY BOUNDARY
Exemplo recorrente: o mesmo nonce + checksum percorre cada lane; a falha pertence ao menor boundary onde reaparece.

Teste de recuperação

Uma compactação oculta permite comparar com o grid direto?