A terceira rodada do benchmark
Medimos 19 modelos em 17.100 respostas sobre a BNCC, sem acesso a nenhuma fonte. A fidelidade ao texto oficial vai de 88% a 3%, e a régua de avaliação mudou para separar quem inventa de quem recusa responder.
A terceira rodada do benchmark de alucinação mediu 19 modelos em 17.100 respostas sobre a BNCC. Cada modelo respondeu aos mesmos 300 itens em três formulações, sem busca na web e sem nenhuma ferramenta de consulta. O que o benchmark mede, e como, está explicado em outra nota.
Quando a pergunta é o texto exato de uma habilidade, a fração de respostas fiéis ao documento oficial vai de 88% a 3%, conforme o modelo.
Os resultados
| # | Modelo | Nota (0 a 100) | Texto fiel | Aceitou código falso |
|---|---|---|---|---|
| 1 | GPT-6 Astra · OpenAI | 94,7 | 88% | 3% |
| 2 | Claude Fable 5.1 · Anthropic | 81,8 | 80% | 0% |
| 3 | Muse Spark 1.3 · Meta | 79,4 | 73% | 10% |
| 4 | Gemini 3.1 Pro · Google | 78,0 | 67% | 3% |
| 5 | Claude Opus 5 · Anthropic | 76,8 | 71% | 4% |
Transcrever o texto oficial e recusar um código inventado são capacidades distintas. O GPT-5.6 Luna, sexto colocado e primeiro fora da tabela, tem 76% de fidelidade, quase o mesmo do Fable 5.1, e confirma 42% dos códigos falsos que recebeu. O Fable não confirmou nenhum. Por isso vale ler as duas colunas antes de escolher um modelo.
Os 19 modelos, todas as métricas e os exemplos de cada erro estão no leaderboard.
Recusar deixou de contar como invenção
Até a rodada de agosto, um modelo que não apresentava texto nenhum, mas acrescentava contexto (a área, o ano, onde consultar), era julgado por uma régua que só oferecia sim, parcial e não. O veredito saía como invenção.
Esta rodada separa três comportamentos. No primeiro, o modelo atribui um texto e o conteúdo é julgado. No segundo, ele nega que o código exista. No terceiro, declara que não sabe. Nas 5.016 respostas da tarefa de transcrição, 476 são abstenções e 207 são negações que a régua antiga contaria como alucinação.
O efeito aparece em quem recusa muito. A taxa de alucinação do Claude Sonnet 5 vai de 86% para 42%, a do Haiku 4.5 de 76% para 36%, a do GPT-6 Astra de 11% para 0%. A nota composta quase não se mexe, porque só a fidelidade entra nela, e o ranking continua o mesmo.
Com a separação, dá para ver que modelos de nota parecida erram de jeitos diferentes. Sonnet 5 e Haiku 4.5 têm nota baixa e recusam 36% e 37% das perguntas em vez de inventar. O Qwen 3.8 Flash, na mesma faixa de nota, inventa em 86%.
As rodadas de julho e agosto foram julgadas pela régua antiga e têm a taxa de alucinação inflada pelo mesmo motivo. Rodadas publicadas não são reescritas, então os números delas ficam como saíram. A ressalva está registrada no RELEASES.md.
Computação segue fora da memória dos modelos
Das 207 negações, 195 são de Computação. Vários modelos afirmam que CO, a sigla de Computação nos códigos, não é componente da BNCC, porque não conhecem o complemento homologado em 2022. Nesses casos o modelo não inventa texto, e mesmo assim erra o fato, porque o complemento existe. A fronteira entre negar e contextualizar é decisão do juiz, e cerca de 36 dessas negações reconhecem o complemento.
As 141 aprendizagens do complemento estão em /computacao/, com a página do documento oficial em cada uma.
Como a rodada foi feita
Três coisas mudaram ao mesmo tempo. Doze dos 19 modelos passaram a ser chamados pela API direta da empresa, em vez de um agregador. Sete rodaram em lote, modalidade em que a resposta demora mais e custa a metade. E sete modelos são novos no elenco.
Por isso as notas não se comparam com a rodada de agosto, e a série recomeça aqui. A bateria custou US$ 175,18 de execução.
Cada resultado vale para a versão do modelo e para as condições registradas na rodada. Os números não medem qualidade pedagógica. Também não representam toda aplicação de IA, já que uma ferramenta pode dar ao modelo acesso à fonte. Foi o que medimos em um segundo estudo, com modelos do benchmark consultando os dados verificados da bncc.dev.
A metodologia, os 300 itens e cada uma das 17.100 respostas cruas estão no repositório do benchmark.