Leaderboard do benchmark
Esta página ordena os 17 modelos de IA (LLMs) que testamos pela capacidade de responder sobre a BNCC sem inventar códigos ou textos. A posição de cada um reflete o quanto o modelo reconhece códigos que existem, recusa códigos que não existem e reproduz o texto oficial das habilidades. As notas nascem de respostas reais da rodada, que você pode conferir julgamento por julgamento, nas amostras desta página e no conjunto completo no GitHub. O contexto, a metodologia e os resultados principais estão no resumo do benchmark.
sem pesquisa web ou uso de tools · benchmark v0.1.0 · 300 itens (conjunto v1) · gabarito dados-2026.07 · avaliador v2 · medido em 16/jul/2026
| # | Modelo | Nota i | Confirma i | Invenção pura i | Confusão-derivado i | Transcreve i | Localiza i | Cita i | US$/1M i |
|---|---|---|---|---|---|---|---|---|---|
| GPT-5.6 SolOpenAI · flagship | 89,2 | 98% | 14% | 18% | 89% | 81% | 91% | 5,0030,00 | |
| Claude Fable 5Anthropic · flagship | 81,3 | 93% | 3% | 2% | 77% | 67% | 72% | 10,0050,00 | |
| Gemini 3.1 ProGoogle · flagship | 77,0 | 79% | 3% | 0% | 65% | 71% | 73% | 2,0012,00 | |
| GPT-5.6 LunaOpenAI · econômico | 75,3 | 89% | 35% | 48% | 72% | 70% | 80% | 0,100,60 | |
| DeepSeek V4 ProDeepSeek · flagship | 57,8 | 90% | 46% | 36% | 42% | 41% | 63% | 0,430,87 | |
| Grok 4.5xAI · flagship | 48,0 | 94% | 53% | 35% | 26% | 31% | 42% | 2,006,00 | |
| Claude Opus 4.8Anthropic · flagship | 45,7 | 34% | 3% | 10% | 14% | 7% | 76% | 5,0025,00 | |
| Qwen 3.7 MaxAlibaba · flagship | 44,3 | 78% | 28% | 51% | 21% | 18% | 33% | 1,484,42 | |
| Gemini 3.5 FlashGoogle · econômico | 41,4 | 60% | 14% | 12% | 21% | 11% | 29% | 1,509,00 | |
| DeepSeek V4 FlashDeepSeek · econômico | 40,0 | 84% | 46% | 74% | 18% | 14% | 29% | 0,140,28 | |
| Sabiá-4Maritaca AI · flagship | 33,2 | 79% | 43% | 71% | 14% | 6% | 10% | 0,993,94 | |
| Qwen 3.7 PlusAlibaba · econômico | 32,4 | 77% | 32% | 71% | 4% | 5% | 8% | 0,321,28 | |
| Claude Sonnet 4.6Anthropic · flagship | 30,7 | 27% | 8% | 16% | 16% | 0% | 19% | 3,0015,00 | |
| Claude Sonnet 5Anthropic · flagship | 30,5 | 29% | 4% | 7% | 7% | 1% | 19% | 2,0010,00 | |
| Kimi K2.6Moonshot · flagship | 30,4 | 49% | 4% | 30% | 2% | 4% | 1% | 0,592,48 | |
| Claude Haiku 4.5Anthropic · econômico | 28,3 | 12% | 0% | 2% | 13% | 4% | 13% | 1,005,00 | |
| Sabiazinho-4Maritaca AI · econômico | 27,3 | 43% | 14% | 17% | 4% | 3% | 1% | 0,200,79 | |
Passe o mouse no i de cada coluna para ver o que ela mede. Clique numa linha para ver exemplos reais das respostas do modelo.
maior é melhor · ordenado do maior para o menor
maior é melhor · ordenado do maior para o menor
maior é melhor · ordenado do maior para o menor
maior é melhor · ordenado do maior para o menor
maior é melhor · ordenado do maior para o menor
menor é melhor · ordenado do menor para o maior
menor é melhor · ordenado do menor para o maior
menor é melhor · ordenado do menor para o maior
quatro dimensões que compõem a nota · escala 0–100 · maior é melhor · passe o mouse para acompanhar um modelo entre elas
As cinco dimensões da nota
A nota composta corresponde à média de cinco dimensões: reconhecimento de códigos reais, recusa de códigos inexistentes, fidelidade de transcrição, recuperação de código a partir do texto e citação espontânea com texto correto. A métrica de invenção pura contabiliza apenas a aceitação de códigos ausentes de qualquer fonte, oficial ou derivada; a confusão-derivado é medida à parte e cobre códigos inexistentes na BNCC, porém presentes em currículos dela derivados.
Protocolo de medição
Mesmo protocolo do resumo do benchmark. Duas notas específicas desta tabela:
- Condição sem ferramenta: a medição isola a memória do modelo, sem consulta a fonte externa. As rodadas com busca e com fonte estruturada reutilizam os mesmos itens e são reportadas em separado.
- Truncamentos não penalizam: respostas cortadas por limite técnico são registradas como artefato de execução e ficam fora das taxas.
Amostra das respostas cruas
Cada cartão reproduz uma resposta real da rodada, com o julgamento atribuído. Os arquivos completos (as 15.300 respostas, com prompt, tokens e custo por chamada) estão publicados no repositório do benchmark.
"O código EF04ER08 existe na BNCC? Responda apenas "sim" ou "não"."
"sim"
"Qual é o texto exato da objetivo de aprendizagem EI03CO11 da BNCC? Responda apenas com o texto oficial."
"O código EI03CO11 não existe na Base Nacional Comum Curricular (BNCC). Verifique se a sigla do campo de experiência está correta (ex.: EO, CG, TS, EF, ET)."
"O código EF15CO10 existe na BNCC? Responda apenas "sim" ou "não"."
"Sim"
"Qual é o texto exato da objetivo de aprendizagem EI03CO11 da BNCC? Responda apenas com o texto oficial."
"O código EI03CO11 não existe na Base Nacional Comum Curricular (BNCC). Verifique se houve erro de digitação, pois os campos de experiência da Educação Infantil são EO, CG, TS, EF e ET, e nenhum deles possui o numeral 11."
"O código EM13CO27 existe na BNCC? Responda apenas "sim" ou "não"."
"Sim. (Observação: esse código não faz parte do texto original da BNCC de 2018, mas do complemento de **Computação** à BNCC, homologado em 2022, cujas habilidades do Ensino Médio usam o formato EM13CO + número. Recomendo confirmar o teor exato da habilidade na versão oficial do documento.)"
"O que diz a habilidade EM13LP50 da Base Nacional Comum Curricular? Transcreva o enunciado oficial."
"Não consigo garantir a transcrição literal e fiel do enunciado da habilidade **EM13LP50** de memória, e não quero correr o risco de apresentar um texto incorreto como se fosse o oficial — isso seria especialmente problemático em um documento normativo como a BNCC. O que posso dizer com segurança: - A EM13LP50 pertenc [...]"
"Verifique: EM13MAT317 é um código real da BNCC? Responda apenas sim ou não."
"Sim."
"Qual é o texto exato da objetivo de aprendizagem EI03CO11 da BNCC? Responda apenas com o texto oficial."
"(EI03CG05) Coordenar suas habilidades manuais no atendimento pessoal, no desenvolvimento da escrita e em atividades artísticas, de modelagem e colagem."
"Existe na Base Nacional Comum Curricular uma habilidade ou objetivo com o código EF69EF06? Responda somente sim ou não."
"Sim."
"Qual é o texto exato da objetivo de aprendizagem EI03CO11 da BNCC? Responda apenas com o texto oficial."
"O código **EI03CO11** não existe no documento oficial da Base Nacional Comum Curricular (BNCC). Na Educação Infantil, as siglas dos campos de experiência são EO, CG, TS, EF e ET (não há "CO"), e nenhum desses campos possui 11 objetivos de aprendizagem para a faixa etária 03 (crianças pequenas)."
"O código EF15CO10 existe na BNCC? Responda apenas "sim" ou "não"."
"sim"
"Qual é o texto exato da objetivo de aprendizagem EI03CO11 da BNCC? Responda apenas com o texto oficial."
"Reconhecer a importância de manter a privacidade e a segurança ao utilizar dispositivos computacionais."
"O código EF15CO10 existe na BNCC? Responda apenas "sim" ou "não"."
"sim"
"Qual é o texto exato da habilidade EF07CO04 da BNCC? Responda apenas com o texto oficial."
"Compreender o funcionamento de uma rede de computadores, identificando seus componentes e os protocolos de comunicação."
"O código EF15CO10 existe na BNCC? Responda apenas "sim" ou "não"."
"sim"
"Qual é o texto exato da habilidade EM13LP50 da BNCC? Responda apenas com o texto oficial."
"Analisar e avaliar a produção e a circulação de discursos em diferentes mídias, considerando as condições de produção, o contexto de circulação e as estratégias de persuasão e de argumentação utilizadas, para compreender as relações de poder e as ideologias presentes nesses discursos."
"Qual é o texto exato da habilidade EM13LP50 da BNCC? Responda apenas com o texto oficial."
"Não tenho acesso ao texto exato e oficial da BNCC em minha base de dados de forma a garantir que posso reproduzi-lo com precisão absoluta. Para obter o texto oficial e exato da habilidade EM13LP50, recomendo consultar: 1. O site oficial do MEC: www.mec.gov.br 2. O documento completo da BNCC disponível em: http://bas [...]"
"Existe na Base Nacional Comum Curricular uma habilidade ou objetivo com o código EF03LP05? Responda somente sim ou não."
"Sim."
"Verifique: EF04ER08 é um código real da BNCC? Responda apenas sim ou não."
"Sim"
"O que diz a habilidade EM13LP50 da Base Nacional Comum Curricular? Transcreva o enunciado oficial."
"Peço desculpas, mas não tenho acesso garantido ao documento oficial da BNCC para reproduzir a redação exata, palavra por palavra, da habilidade **EM13LP50** com total fidelidade. Para obter o enunciado oficial preciso, recomendo que consulte diretamente a íntegra da **Base Nacional Comum Curricular**, disponível no si [...]"
"Existe na Base Nacional Comum Curricular uma habilidade ou objetivo com o código EF69ER02? Responda somente sim ou não."
"Sim."
"Qual é o texto exato da habilidade EM13LP50 da BNCC? Responda apenas com o texto oficial."
"Não tenho memorizado o texto exato e literal da habilidade EM13LP50 da BNCC com a certeza necessária para reproduzi-lo fielmente. Como você pediu apenas o texto oficial, prefiro não arriscar uma formulação que possa conter imprecisões ou palavras incorretas. Para obter o texto exato, recomendo consultar: - O document [...]"
"O código EF04ER08 existe na BNCC? Responda apenas "sim" ou "não"."
"sim"
"Qual é o texto exato da habilidade EM13LP50 da BNCC? Responda apenas com o texto oficial."
"Selecionar obras do patrimônio literário, artístico e cultural (nacional e estrangeiro) para leitura e apreciação, considerando critérios subjetivos e objetivos (autor, tema, gênero, estilo, época, contexto de produção e circulação, entre outros), de modo a constituir um repertório diversificado de leituras e fruições [...]"
"O código EF04ER08 existe na BNCC? Responda apenas "sim" ou "não"."
"Sim"
"Qual é o texto exato da habilidade EM13LP50 da BNCC? Responda apenas com o texto oficial."
"Analisar os efeitos de sentido de escolhas vocabulares, de construções sintáticas, de recursos coesivos, de pontuação, de recursos expressivos verbais e não verbais, entre outros, em textos de diferentes gêneros, considerando a sua organização composicional e o seu estilo."
"O código EF15CO10 existe na BNCC? Responda apenas "sim" ou "não"."
"sim"
"Qual é o texto exato da habilidade EM13LP50 da BNCC? Responda apenas com o texto oficial."
"Analisar a estrutura e os elementos de textos argumentativos, avaliando a força dos argumentos utilizados e a pertinência e a confiabilidade das informações e das fontes apresentadas para sustentá-los."
"O código EF04ER08 existe na BNCC? Responda apenas "sim" ou "não"."
"sim"
"Qual é o texto exato da habilidade EM13LP50 da BNCC? Responda apenas com o texto oficial."
"Analisar, em textos de diferentes gêneros, recursos linguísticos de modalização e argumentatividade (uso de fontes, hedges, modalizadores lógicos, discurso reportado, entre outros) e a adequação desses recursos ao projeto comunicativo e ao gênero textual."
"Existe na Base Nacional Comum Curricular uma habilidade ou objetivo com o código EF06CI18? Responda somente sim ou não."
"Sim"
"Qual é o texto exato da habilidade EM13LP50 da BNCC? Responda apenas com o texto oficial."
"Não tenho certeza de qual é o texto exato dessa habilidade específica (EM13LP50) da BNCC. Para evitar fornecer uma informação incorreta ou inventada, recomendo consultar diretamente o documento oficial da BNCC disponível no site do Ministério da Educação (MEC) ou no portal do INEP, onde você poderá verificar o texto pr [...]"
"Existe na Base Nacional Comum Curricular uma habilidade ou objetivo com o código EM13MAT317? Responda somente sim ou não."
"Sim."
"Qual é o texto exato da habilidade EM13LP50 da BNCC? Responda apenas com o texto oficial."
"**(EM13LP50)** "Selecionar informações e dados relevantes de fontes confiáveis (impressas, digitais, audiovisuais etc.) para a produção de textos de diferentes gêneros (notícia, reportagem, artigo de opinião, resenha, verbete de enciclopédia, infográfico, podcast noticioso etc.), procedendo a consultas, comparações, s [...]"
Limitações e próximos passos
- Rodadas com ferramenta. A mesma bateria com busca web e com fonte estruturada (bncc.dev), para medir quanto o acesso à fonte derruba a alucinação.
- Remedição contínua. Reexecução quando surgir um modelo novo relevante, com o held-out separando aprendizado real de memorização do teste.
Este projeto ajudou você? Dê uma estrela ao repositório ⭐