🧭 Índice · v2.2 · corte 27 ago 2026

Oráculos metamórficos para teste E2E de navegador

Como um teste ponta-a-ponta decide que passou quando não existe valor esperado — e o que existe, em teoria e em ferramenta, para fazer isso por relação entre execuções. Quatro camadas, de introdução a especificação implementável.

24MRs catalogadas
16ADRs
32asserções falsificáveis
0produtos comerciais de MT E2E
🪨 C1 · Introdução

O problema do oráculo

Todo teste tem duas metades; em E2E o oráculo é o gargalo inteiro. Seis famílias ancoradas em Barr et al., vocabulário de MT, como ler o resto.

📐 C2 · Teoria

Oráculo metamórfico em E2E

Três teses e nenhuma ferramenta; catálogo de 24 MRs em três grupos com moldes e pré-condições; cinco hostilidades do navegador; onde está a brecha; a regra 'o veredito é código'.

🔩 C3 · Mercado

Ferramentas e sinais

Nenhum produto comercial faz MT E2E — com protocolo de busca. Camadas, matriz N4 de 27/08, transporte dos Test Agents, Bombadil, observabilidade, risco de fornecedor.

🏗️ C4 · Stack

Especificação de inception

Dezesseis ADRs fechadas, arquitetura AWS com custo por par, formato de MR, regras de R(·), app de referência (Vendure), três pilotos (70–100 h) e o que só se resolve medindo.

O que mudou da v1 para a v2

v1 (26/08) v2 → v2.2 (27–28/08)
Estrutura Parte I (C1+C2), Parte II (C3+C4) Um documento por camada, C1–C4
Catálogo 12 MRs 24 MRs: A7 e A8 novas, B6 corrigida, grupo C derivado das 76 do MST-wi
Artefatos de MT E2E 1 (Morfify) → 2 3 (Morfify, Zahid/Åbo 2025, metamorph)
Violação→bug em E2E 0/26 com MR gerada por LLM e não validada (metamorph, produção); 10/10 com MR humana e faltas manuais escolhidas por MR (Zahid, tese lida em 28/08) — nenhum ponto com mutantes semeados antes das MRs
A brecha "ninguém instancia MRP via LLM" não há pipeline automatizado em que um LLM instancia, o navegador executa e a MR só é promovida após baseline e mutante — a contribuição é a automação do filtro
A regra "o agente nunca julga" "o veredito é código" é consenso (Octomind, WebTestPilot homônimo); o diferencial de D é a origem do predicado
Ancoragem o oráculo que não pode falhar é o que ajusta a relação depois do diff; resposta = mutação (falsifiedBy executado). A tese de Zahid descreve o ajuste como método — fonte primária
C4 levantamento, agnóstico de infra spec de inception em AWS, 16 ADRs, custo por par, app de referência, três pilotos
E11 (AWS) lacuna crítica respondido; 18 experimentos de medição listados, dois já fechados
Asserções 22 32, com protocolo de busca para as de ausência
Evidência empírica nenhuma ferramenta executada a app de referência (Vendure) subiu em 8 min; MR-A1 e MR-B1 escritas e executadas com mutantes: MR ≈ 2× asserção por cenário, 4/4 falsos positivos sem assentamento
Fechamento (28/08, v2.1–v2.2) tese de Zahid lida; merge de carrinho lido (MR-B5 volta com pré-condição); Hegel e adoção do Bombadil medidos; revisão de legibilidade (R7) e auditoria de consistência (R8) aplicadas: classes de custo K0/K1/K2, histórico fora do texto, enunciados e divergências no C1 § 5, ADR-11..14 escritas

Por onde começar