LUA VISION

BL-EDU: conteúdo escolar brasileiro.

Régua própria da LUA sobre conteúdo escolar brasileiro: questões objetivas do ENEM 2024 e 2025, com gabarito oficial do INEP. Só o modelo LUA Genesys PI House foi medido, sem concorrente nesta rodada.

RodadoRegistro LUA · rodado pela LUA Vision · não é avaliação independente

Resultado.

RecortenAcerto (%)IC 95%Erro quando tentou
Geral, 2024+202535499,798,4–100,00,3

Por área.

ÁreanAcerto (%)IC 95%
Linguagens9098,994,0–99,8
Ciências Humanas90100,095,9–100,0
Ciências da Natureza86100,095,7–100,0
Matemática88100,095,8–100,0

Por edição.

EdiçãonAcerto (%)IC 95%
2024179100,097,9–100,0
202517599,496,8–99,9

Cobertura de imagem: 125 de 125 questões com imagem, gráfico ou quadro foram rodadas, todas via transcrição oficial em áudio-descrição do INEP, com 100,0% de acerto.

O único erro da rodada: uma questão de Linguagens de 2025 em que a resposta veio com confiança declarada de 97, contra o gabarito oficial.

IC95 por Wilson. Nota com penalidade t=0,5: 99.6.

Metodologia.

ModeloLUA Genesys PI House, API pública api.lua.vision, esforço medium.
DadosCadernos oficiais do ENEM 2024 e 2025 (versão com transcrição de imagem em texto) e gabarito impresso definitivo do INEP.
PontuaçãoLetra extraída por expressão regular, sem juiz automático.
ExecuçõesUma por item, pass@1.

Contaminação.

Não há data de corte de treino declarada para o modelo avaliado, então a página não estima uma. As duas edições usadas (2024 e 2025) já circulam publicamente há mais de dez meses, tempo de sobra para entrar em qualquer corpus coletado da web — as duas são candidatas a contaminação, não só a mais antiga. O acerto por edição não caiu na prova mais recente (2024: 100%; 2025: 99,4%, intervalos sobrepostos), o que não aponta memorização concentrada numa das duas, mas também não separa "modelo muito bom" de "as duas foram vistas em treino". Nenhuma sonda de memorização foi rodada nesta entrega. O acerto de 99,7% é alto mesmo para um exame amplamente comentado publicamente, e deve ser lido como o resultado desta rodada, não como capacidade confirmadamente livre de contaminação.

O que não rodou.

  • Redação: não executada. A matriz oficial das cinco competências está num PDF com fonte sem tabela de caracteres legível; dois extratores diferentes devolveram texto inconsistente, e usar uma matriz reconstituída de memória seria inventar o critério de correção. Revisão humana de 100% por dois professores também não estava disponível nesta rodada.
  • Tutor: não executado. Mediria se a LUA aponta o erro de um aluno sem entregar a resposta pronta, mas exigiria um caso real de erro de aluno; inventar um caso fictício fabricaria o dado de origem, o que a régua existe para evitar.

Limitações.

  • Mede se a LUA acerta questão de vestibular, não se ela ensina. Nota alta aqui não autoriza dizer que o produto ensina bem.
  • N por área fica entre 86 e 90, então o intervalo de confiança por área é largo, entre 4 e 6 pontos; só o agregado das duas edições tem o intervalo mais estreito.
  • A proficiência estimada pela TRI usa os parâmetros publicados pelo INEP fora da aplicação real; não é comparável à nota de um candidato do ENEM, e no extremo de Matemática (acerto de 100%) a estimativa extrapola a região onde a calibração tem mais candidatos de referência.
  • Cobertura de idioma: só a opção inglês das questões de língua estrangeira.

Pacote e arquivos.

bl-edu-2026-09.tar.gz245ee3af59e2b1c4a06ab37ce27dd0ace58045d5351cb4473a7bfc56fcc9d0cc
ArquivoTamanhoBaixar
bl-edu-2026-09.tar.gz31 KBBaixar
Resultado por itemSHA-256Baixar
resultados/e1_objetivas.house.jsonl2d842b0ad37aa5eeaba1ab35c9a682f6a8f64789c2bec7b15fc651a9a851c57aBaixar