Evidências experimentais¶
Corridas MCP (evidence/run-.../)¶
Cada corrida deve ser registrada em diretório próprio:
evidence/run-YYYYMMDD-HHMM-<id-curto>/
Conteúdo mínimo esperado:
session.jsonlmetrics.jsoncontext.jsonsummary.md
Schema v1: Schema context.json v1. Exemplos em Exemplo context baseline v1.
Não sobrescreva corridas anteriores. Qualquer ajuste gera novo runId.
Artefatos de decisão humana (T11 / T08)¶
Estes arquivos são preenchidos pelo autor, não inferidos por agentes de IA. Ver
ai-interaction/correcao-metodologia.md (documentação acadêmica offline; seção «Decisões e execução
exclusivas do autor»).
| Arquivo | Uso |
|---|---|
| Bateria de 30 perguntas | 30 perguntas; 6 cenários; SIMPLES / MÉDIA / COMPLEXA — revisão humana aprovada (9985067) |
| Gabarito da bateria | Gabarito \(G_i\) por question_id; inclui auditoria de executabilidade e resultado baseline v1 |
| Matriz de cobertura da bateria | Cobertura cenário × dificuldade × tabelas |
| Métricas baseline v1 | Métricas da campanha baseline-static v1 (Gemini-only, 30 corridas; gabarito_match por pergunta) |
Esquema estático do comparativo simples: Schema massa de teste.
Inventário e catálogo de tools MCP (T06)¶
Artefatos derivados do Swagger do Apache Atlas que sustentam o catálogo fechado de quinze tools MCP.
| Arquivo | Uso |
|---|---|
| Inventário Atlas API | Triagem das operações de leitura da API REST v2 do Atlas |
| Matriz de 15 tools MCP | Decisão final: 3 basais + 12 complementares, com mapeamento Atlas |
Valores agregados (\(A_{\mathrm{gab}}\)) derivam do CSV baseline preenchido, conforme
Métricas e fórmulas. A campanha v1 usa apenas
gemini-3.5-flash (\(N_{\mathrm{base}} = 30\)); extensão a segundo provedor é opcional e não mistura com esta v1.