BL-EDU: conteúdo escolar brasileiro.
Régua própria da LUA sobre conteúdo escolar brasileiro: questões objetivas do ENEM 2024 e 2025, com gabarito oficial do INEP. Só o modelo LUA Genesys PI House foi medido, sem concorrente nesta rodada.
Resultado.
| Recorte | n | Acerto (%) | IC 95% | Erro quando tentou |
|---|---|---|---|---|
| Geral, 2024+2025 | 354 | 99,7 | 98,4–100,0 | 0,3 |
Por área.
| Área | n | Acerto (%) | IC 95% |
|---|---|---|---|
| Linguagens | 90 | 98,9 | 94,0–99,8 |
| Ciências Humanas | 90 | 100,0 | 95,9–100,0 |
| Ciências da Natureza | 86 | 100,0 | 95,7–100,0 |
| Matemática | 88 | 100,0 | 95,8–100,0 |
Por edição.
| Edição | n | Acerto (%) | IC 95% |
|---|---|---|---|
| 2024 | 179 | 100,0 | 97,9–100,0 |
| 2025 | 175 | 99,4 | 96,8–99,9 |
Cobertura de imagem: 125 de 125 questões com imagem, gráfico ou quadro foram rodadas, todas via transcrição oficial em áudio-descrição do INEP, com 100,0% de acerto.
O único erro da rodada: uma questão de Linguagens de 2025 em que a resposta veio com confiança declarada de 97, contra o gabarito oficial.
IC95 por Wilson. Nota com penalidade t=0,5: 99.6.
Metodologia.
| Modelo | LUA Genesys PI House, API pública api.lua.vision, esforço medium. |
|---|---|
| Dados | Cadernos oficiais do ENEM 2024 e 2025 (versão com transcrição de imagem em texto) e gabarito impresso definitivo do INEP. |
| Pontuação | Letra extraída por expressão regular, sem juiz automático. |
| Execuções | Uma por item, pass@1. |
Contaminação.
Não há data de corte de treino declarada para o modelo avaliado, então a página não estima uma. As duas edições usadas (2024 e 2025) já circulam publicamente há mais de dez meses, tempo de sobra para entrar em qualquer corpus coletado da web — as duas são candidatas a contaminação, não só a mais antiga. O acerto por edição não caiu na prova mais recente (2024: 100%; 2025: 99,4%, intervalos sobrepostos), o que não aponta memorização concentrada numa das duas, mas também não separa "modelo muito bom" de "as duas foram vistas em treino". Nenhuma sonda de memorização foi rodada nesta entrega. O acerto de 99,7% é alto mesmo para um exame amplamente comentado publicamente, e deve ser lido como o resultado desta rodada, não como capacidade confirmadamente livre de contaminação.
O que não rodou.
- Redação: não executada. A matriz oficial das cinco competências está num PDF com fonte sem tabela de caracteres legível; dois extratores diferentes devolveram texto inconsistente, e usar uma matriz reconstituída de memória seria inventar o critério de correção. Revisão humana de 100% por dois professores também não estava disponível nesta rodada.
- Tutor: não executado. Mediria se a LUA aponta o erro de um aluno sem entregar a resposta pronta, mas exigiria um caso real de erro de aluno; inventar um caso fictício fabricaria o dado de origem, o que a régua existe para evitar.
Limitações.
- Mede se a LUA acerta questão de vestibular, não se ela ensina. Nota alta aqui não autoriza dizer que o produto ensina bem.
- N por área fica entre 86 e 90, então o intervalo de confiança por área é largo, entre 4 e 6 pontos; só o agregado das duas edições tem o intervalo mais estreito.
- A proficiência estimada pela TRI usa os parâmetros publicados pelo INEP fora da aplicação real; não é comparável à nota de um candidato do ENEM, e no extremo de Matemática (acerto de 100%) a estimativa extrapola a região onde a calibração tem mais candidatos de referência.
- Cobertura de idioma: só a opção inglês das questões de língua estrangeira.
Pacote e arquivos.
245ee3af59e2b1c4a06ab37ce27dd0ace58045d5351cb4473a7bfc56fcc9d0cc| Arquivo | Tamanho | Baixar |
|---|---|---|
bl-edu-2026-09.tar.gz | 31 KB | Baixar |
| Resultado por item | SHA-256 | Baixar |
|---|---|---|
resultados/e1_objetivas.house.jsonl | 2d842b0ad37aa5eeaba1ab35c9a682f6a8f64789c2bec7b15fc651a9a851c57a | Baixar |