O benchmark de alucinação, explicado
Um modelo de IA pode citar um código real da BNCC com um texto inventado, ou afirmar que um código inexistente é oficial. O benchmark mede esses erros. Como testamos, como ler a nota e por que publicamos tudo.
Um modelo de IA pode citar um código real da BNCC e atribuir a ele um texto inventado. Também pode afirmar que um código inexistente é oficial. Na área, esse tipo de invenção se chama alucinação. Nosso benchmark mede quanto ela acontece quando o modelo responde sobre a BNCC sem consultar nenhuma fonte.
Como testamos
Usamos um banco de 300 itens, distribuídos entre quatro tipos de tarefa.
- Transcrição. Dado um código real, apresentar o texto da habilidade.
- Existência. Reconhecer códigos reais e rejeitar os inventados.
- Citação. Listar habilidades de um tema. Conferimos cada código e cada texto citado.
- Localização. Dado o texto de uma habilidade, encontrar seu código.
Cada item é apresentado em três formulações, o que dá 900 respostas por modelo. A variação mostra quanto a redação da pergunta muda o resultado.
Os modelos respondem sem busca na web e sem ferramentas. Comparamos cada resposta com a base verificada da bncc.dev, rastreável aos documentos oficiais. Paráfrase fiel conta como acerto. Quando a resposta é ambígua, um juiz automático decide, e cada decisão fica registrada item a item. As demais respostas caem em três casos. O modelo inventou um texto, respondeu com o texto de outra habilidade ou declarou que não sabe. Ao final, cada modelo recebe uma nota de 0 a 100.
As duas primeiras rodadas
| Julho de 2026 | Agosto de 2026 | |
|---|---|---|
| Modelos testados | 17 | 19 |
| Respostas avaliadas | 15.300 | 17.100 |
| Transcrições com alucinação (média) | 58,8% | 54,0% |
| Códigos reais negados (média) | 34,4% | 27,3% |
| Modelos com nota abaixo de 50 | 12 | 10 |
Os modelos erram mais nos trechos da BNCC que circulam menos na web. O Ensino Médio é a etapa com mais texto inventado, e no complemento de Computação, oficial desde 2022, a alucinação passa de 90% na média dos modelos.
A terceira rodada, de setembro de 2026, mudou a forma de medir e começou uma série nova. Ela separa quem inventa um texto de quem nega que o código exista ou admite que não sabe, por isso os números dela não se comparam com os desta tabela. Contamos essa rodada em uma nota à parte, e os resultados estão na página do benchmark.
Como interpretar
A nota resume o desempenho nas tarefas avaliadas. Para escolher um modelo, olhe também o tipo de erro, porque reproduzir bem os textos e rejeitar códigos falsos são capacidades diferentes.
Cada resultado vale para a versão do modelo e para as condições registradas naquela rodada. Os números não medem qualidade pedagógica. Também não representam toda aplicação de IA, porque uma aplicação pode dar ao modelo uma fonte para consultar. Em um segundo estudo, os mesmos modelos puderam consultar os dados verificados da bncc.dev antes de responder, e deixaram de inventar códigos.
Por que publicamos
Quem desenvolve ferramentas educacionais com IA precisa saber onde os modelos erram. Quem recebe uma resposta com um código da BNCC precisa ter onde conferir.
Publicamos a metodologia, os itens e as respostas avaliadas no repositório do benchmark. No leaderboard, você encontra os resultados por modelo e exemplos para examinar além da nota.