Com o uso do MCP, a alucinação com a BNCC some das IAs
Medimos os modelos do leaderboard com os mesmos 300 itens, sem fonte e consultando o servidor MCP da bncc.dev, além de uma condição de controle descrita em "Como medimos". As regras, as hipóteses e a análise foram registradas por escrito antes da primeira chamada, e cada resposta está publicada, julgamento por julgamento, no GitHub.
Contamos como alucinação qualquer código ou texto da BNCC que não confere com o documento oficial. Respostas com falha técnica ficam de fora.
A queda da alucinação, modelo a modelo
Fizemos a mesma pergunta para os modelos de IA, com e sem o uso do MCP. A taxa de alucinação cai nos 6 modelos quando o MCP entra. Foram 1.421 comparações, pergunta a pergunta. Usar o MCP não piorou as respostas em nenhum modelo.
As barras usam a mesma escala: a largura inteira equivale a 50%. Os dois modelos da Maritaca foram medidos no mesmo estudo. Os números deles estão no relatório completo.
Ver a tabela com os intervalos de confiança
| Modelo | Sem fonte | Controle (na pergunta) | MCP | Δ MCP, pontos |
|---|---|---|---|---|
| Gemini 3.7 Flashvia OpenRouter | 13,1% | 0,0% | 0,0% | -13,1IC95 [-17,6; -9,3] · 237 pares |
| GPT-5.6 SolAPI direta, sem raciocínio nesta rota | 21,4% | 0,3% | 0,0% | -21,4IC95 [-26,3; -17,0] · 238 pares |
| Grok 4.6API direta | 27,2% | 0,0% | 0,0% | -27,2IC95 [-33,6; -21,8] · 238 pares |
| Claude Sonnet 4.6Amazon Bedrock | 31,1% | 0,0% | 0,0% | -30,0IC95 [-36,8; -24,1] · 232 pares |
| DeepSeek V4 FlashAPI direta | 37,4% | 0,0% | 0,0% | -37,4IC95 [-45,1; -30,9] · 238 pares |
| Kimi K3API direta | 39,8% | 0,0% | 0,0% | -39,8IC95 [-48,2; -32,8] · 238 pares |
Δ é a queda em pontos percentuais entre a condição sem fonte e a condição MCP, comparando as mesmas perguntas. O intervalo (IC 95%) vem de reamostragem por item, com semente registrada. Perguntas sobre códigos reais da tarefa de existência e itens especiais não contam como alucinação, então ficam fora dessa conta.
O que muda com o uso do MCP
Quando a empresa de IA conecta ao MCP por conta própria
Também testamos a conexão feita pela própria empresa de IA. Nesse caminho, a API da empresa conecta ao mcp.bncc.dev e faz as consultas sozinha. Três das quatro que oferecem isso completaram a medição.
| Modelo | Mecanismo | Alucinação | Sem consultar |
|---|---|---|---|
| GPT-5.6 Sol | Responses API, com raciocínio | 0,0% | 0/300 |
| Grok 4.6 | Responses API | 0,0% | 0/300 |
| Claude Sonnet 5 | Messages API, connector MCP | 0,0% | 0/300 |
| Gemini 3.7 Flash (Interactions API): medição incompleta, 91 de 300 respostas, por indisponibilidade do serviço do Google nos dias do estudo. Entra numa atualização desta série. | |||
Como medimos
- A fonte consultada e o gabarito que julga as respostas são o mesmo dataset, mantido por nós. Por isso o estudo tem uma condição de controle: a listagem oficial vai colada na própria pergunta, sem servidor no meio. Nela, a alucinação foi de 0,0%. O mérito é do dado; o MCP é a forma de entregá-lo.
- As mesmas 300 perguntas do leaderboard, nas quatro tarefas. Os 60 códigos falsos foram verificados um a um.
- 8 modelos, escolhidos por critério fixado antes da medição: dos primeiros e dos últimos do leaderboard, com e sem raciocínio, por rotas diferentes, incluindo os dois brasileiros.
- Cada condição usa as mesmas perguntas, com a mesma redação. O julgamento é o mesmo do leaderboard.
Ressalvas por modelo
- GPT-5.6 Sol: na rota direta, a API exige desligar o raciocínio para usar ferramentas em Chat Completions; a condição connector mede o modelo com raciocínio.
- Gemini 3.7 Flash: medido via OpenRouter pela indisponibilidade da rota direta do Google nos dias do estudo.
- Kimi K3: a API só aceita temperatura 1; o protocolo pede 0.
- Claude Sonnet 4.6: condição sem fonte reaproveitada da rodada oficial de 15 a 18/ago, mesma rota e configuração.
- Sabiá-4 e Sabiazinho-4: medidos no estudo; os resultados deles estão no relatório da Release, fora desta página.
- Qwen (Alibaba): fora do estudo, sem rota de API disponível na data.
Conferir e reproduzir
As respostas brutas, os julgamentos e o resumo estatístico estão no repositório. A Release traz o relatório completo, com os 8 modelos. O CI reconfere as contas a cada mudança.
Release estudo-fonte-v0.1.0 ↗ · pré-registro ↗ · DECISOES.md D14 ↗ · conectar sua IA à fonte →