bncc.dev

Novidades

Rodadas do benchmark de alucinação e estudos sobre IA e BNCC.

  1. A terceira rodada do benchmark

    Medimos 19 modelos em 17.100 respostas sobre a BNCC, sem acesso a nenhuma fonte. A fidelidade ao texto oficial vai de 88% a 3%, e a régua de avaliação mudou para separar quem inventa de quem recusa responder.

    Benchmark
  2. O benchmark de alucinação, explicado

    Um modelo de IA pode citar um código real da BNCC com um texto inventado, ou afirmar que um código inexistente é oficial. O benchmark mede esses erros. Como testamos, como ler a nota e por que publicamos tudo.

    Benchmark

Receba cada nota por e-mail

Uma mensagem por lançamento, com o mesmo texto desta página. Nada além disso.