| Estrutura |
Parte I (C1+C2), Parte II (C3+C4) |
Um documento por camada, C1–C4 |
| Catálogo |
12 MRs |
24 MRs: A7 e A8 novas, B6 corrigida, grupo C derivado das 76 do MST-wi |
| Artefatos de MT E2E |
1 (Morfify) → 2 |
3 (Morfify, Zahid/Åbo 2025, metamorph) |
| Violação→bug em E2E |
— |
0/26 com MR gerada por LLM e não validada (metamorph, produção); 10/10 com MR humana e faltas manuais escolhidas por MR (Zahid, tese lida em 28/08) — nenhum ponto com mutantes semeados antes das MRs |
| A brecha |
"ninguém instancia MRP via LLM" |
não há pipeline automatizado em que um LLM instancia, o navegador executa e a MR só é promovida após baseline e mutante — a contribuição é a automação do filtro |
| A regra |
"o agente nunca julga" |
"o veredito é código" é consenso (Octomind, WebTestPilot homônimo); o diferencial de D é a origem do predicado |
| Ancoragem |
— |
o oráculo que não pode falhar é o que ajusta a relação depois do diff; resposta = mutação (falsifiedBy executado). A tese de Zahid descreve o ajuste como método — fonte primária |
| C4 |
levantamento, agnóstico de infra |
spec de inception em AWS, 16 ADRs, custo por par, app de referência, três pilotos |
| E11 (AWS) |
lacuna crítica |
respondido; 18 experimentos de medição listados, dois já fechados |
| Asserções |
22 |
32, com protocolo de busca para as de ausência |
| Evidência empírica |
nenhuma ferramenta executada |
a app de referência (Vendure) subiu em 8 min; MR-A1 e MR-B1 escritas e executadas com mutantes: MR ≈ 2× asserção por cenário, 4/4 falsos positivos sem assentamento |
| Fechamento (28/08, v2.1–v2.2) |
— |
tese de Zahid lida; merge de carrinho lido (MR-B5 volta com pré-condição); Hegel e adoção do Bombadil medidos; revisão de legibilidade (R7) e auditoria de consistência (R8) aplicadas: classes de custo K0/K1/K2, histórico fora do texto, enunciados e divergências no C1 § 5, ADR-11..14 escritas |