bncc.dev
  1. Novidades
  2. Benchmark

A terceira rodada do benchmark

Medimos 19 modelos em 17.100 respostas sobre a BNCC, sem acesso a nenhuma fonte. A fidelidade ao texto oficial vai de 88% a 3%, e a régua de avaliação mudou para separar quem inventa de quem recusa responder.

Publicado
Faixas largas em coral, verde e ameixa atravessando o quadro em curvas sobre papel creme.

A terceira rodada do benchmark de alucinação mediu 19 modelos em 17.100 respostas sobre a BNCC. Cada modelo respondeu aos mesmos 300 itens em três formulações, sem busca na web e sem nenhuma ferramenta de consulta. O que o benchmark mede, e como, está explicado em outra nota.

Quando a pergunta é o texto exato de uma habilidade, a fração de respostas fiéis ao documento oficial vai de 88% a 3%, conforme o modelo.

Os resultados

#ModeloNota (0 a 100)Texto fielAceitou código falso
1GPT-6 Astra · OpenAI94,788%3%
2Claude Fable 5.1 · Anthropic81,880%0%
3Muse Spark 1.3 · Meta79,473%10%
4Gemini 3.1 Pro · Google78,067%3%
5Claude Opus 5 · Anthropic76,871%4%

Transcrever o texto oficial e recusar um código inventado são capacidades distintas. O GPT-5.6 Luna, sexto colocado e primeiro fora da tabela, tem 76% de fidelidade, quase o mesmo do Fable 5.1, e confirma 42% dos códigos falsos que recebeu. O Fable não confirmou nenhum. Por isso vale ler as duas colunas antes de escolher um modelo.

Os 19 modelos, todas as métricas e os exemplos de cada erro estão no leaderboard.

Recusar deixou de contar como invenção

Até a rodada de agosto, um modelo que não apresentava texto nenhum, mas acrescentava contexto (a área, o ano, onde consultar), era julgado por uma régua que só oferecia sim, parcial e não. O veredito saía como invenção.

Esta rodada separa três comportamentos. No primeiro, o modelo atribui um texto e o conteúdo é julgado. No segundo, ele nega que o código exista. No terceiro, declara que não sabe. Nas 5.016 respostas da tarefa de transcrição, 476 são abstenções e 207 são negações que a régua antiga contaria como alucinação.

O efeito aparece em quem recusa muito. A taxa de alucinação do Claude Sonnet 5 vai de 86% para 42%, a do Haiku 4.5 de 76% para 36%, a do GPT-6 Astra de 11% para 0%. A nota composta quase não se mexe, porque só a fidelidade entra nela, e o ranking continua o mesmo.

Com a separação, dá para ver que modelos de nota parecida erram de jeitos diferentes. Sonnet 5 e Haiku 4.5 têm nota baixa e recusam 36% e 37% das perguntas em vez de inventar. O Qwen 3.8 Flash, na mesma faixa de nota, inventa em 86%.

As rodadas de julho e agosto foram julgadas pela régua antiga e têm a taxa de alucinação inflada pelo mesmo motivo. Rodadas publicadas não são reescritas, então os números delas ficam como saíram. A ressalva está registrada no RELEASES.md.

Computação segue fora da memória dos modelos

Das 207 negações, 195 são de Computação. Vários modelos afirmam que CO, a sigla de Computação nos códigos, não é componente da BNCC, porque não conhecem o complemento homologado em 2022. Nesses casos o modelo não inventa texto, e mesmo assim erra o fato, porque o complemento existe. A fronteira entre negar e contextualizar é decisão do juiz, e cerca de 36 dessas negações reconhecem o complemento.

As 141 aprendizagens do complemento estão em /computacao/, com a página do documento oficial em cada uma.

Como a rodada foi feita

Três coisas mudaram ao mesmo tempo. Doze dos 19 modelos passaram a ser chamados pela API direta da empresa, em vez de um agregador. Sete rodaram em lote, modalidade em que a resposta demora mais e custa a metade. E sete modelos são novos no elenco.

Por isso as notas não se comparam com a rodada de agosto, e a série recomeça aqui. A bateria custou US$ 175,18 de execução.

Cada resultado vale para a versão do modelo e para as condições registradas na rodada. Os números não medem qualidade pedagógica. Também não representam toda aplicação de IA, já que uma ferramenta pode dar ao modelo acesso à fonte. Foi o que medimos em um segundo estudo, com modelos do benchmark consultando os dados verificados da bncc.dev.

A metodologia, os 300 itens e cada uma das 17.100 respostas cruas estão no repositório do benchmark.

Receba cada nota por e-mail

Uma mensagem por lançamento, com o mesmo texto desta página. Nada além disso.