LUA VISION

ENAMED: prova de medicina de 2025.

Questões de múltipla escolha do Exame Nacional de Avaliação da Formação Médica de 2025, aplicado a quem conclui medicina no Brasil. Mede conhecimento clínico em português, na forma como o país cobra.

Registro LUA · rodado pela LUA Vision · não é avaliação independente

Resultados.

Em cada linha, o melhor valor fica destacado. Atenção ao sentido: em algumas métricas, quanto menor, melhor (alucinação, recusa indevida, erro de calibração).

ModeloAcerto (%)
↑ maior é melhor
IC 95%RespondidasRecusadas ou barradasSem resposta
LUA Genesys PI House96,6melhor92,0–100,08520
GPT-5.596,692,0–100,08520
GPT-5.494,388,5–98,98520
Grok 4.695,490,8–98,98700
DeepSeek-V4-Pro94,388,5–98,98700
Kimi K2.693,187,4–97,78610
Sabiá 4 Thinking†94,4————

Acerto (%) · maior é melhor

LUA Genesys PI House
melhor resultado96,6IC 92,0–100,0
GPT-5.5
96,6IC 92,0–100,0
Grok 4.6
95,4IC 90,8–98,9
Sabiá 4 Thinking †
94,4sem IC publicado
GPT-5.4
94,3IC 88,5–98,9
DeepSeek-V4-Pro
94,3IC 88,5–98,9
Kimi K2.6
93,1IC 87,4–97,7

Eixo de 85 a 100. Barra preta: intervalo de confiança de 95%.

Como foi rodado.

Data24/09/2026
Datasetrecogna-nlp/enamed-2025, commit 0f821fc60a2d, arquivo dataset.json
Itens87 de 90. Saem 3: questões com imagem associada ou sem gabarito de A a E, para todos os modelos.
PontuaçãoLetra exata, extraída por expressão regular da linha final "Resposta: X". Sem juiz.
ExecuçõesUma por item, pass@1.
FalhasPergunta sem resposta conta zero e fica no denominador. Isso inclui recusa do filtro de conteúdo do provedor e recusa da própria coluna.
IntervaloIntervalo de 95% por bootstrap percentil, 4.000 reamostragens sobre os itens, semente fixa.
SHA-256 dos dadosdados/enamed.jsonl
2fe5851a37f11f891c1ac4d524d2eb3ce61ee1369310cc244bcd2569f2e386ea

Configuração por modelo.

Todos os modelos receberam as mesmas mensagens, pela API comercial de cada fornecedor ou da nuvem onde o modelo está publicado, na mesma data. Nenhum prompt de sistema extra, nenhuma temperatura, nenhuma ferramenta além das que o benchmark define.

ModeloAcessoEsforço de raciocínio
LUA Genesys PI HouseAPI pública api.lua.visionmedium
GPT-5.5API comercialmedium
GPT-5.4API comercialmedium
Grok 4.6API comercialpadrão do modelo
DeepSeek-V4-ProAPI comercialpadrão do modelo
Kimi K2.6API comercialpadrão do modelo
Sabiá 4 Thinking †valor publicado pelo fornecedor—

Decisões de protocolo.

  • Um prompt de múltipla escolha só, zero-shot, igual para todos os modelos: o modelo raciocina e fecha com "Resposta: X". O prompt está no pacote.
  • Questões com imagem saem para todos os modelos, porque nem todo modelo comparado lê imagem.

Defeitos achados nos dados.

  • ENAMED_64 e ENAMED_67 tratam de ideação suicida e de ferimento por arma de fogo. A coluna da LUA recusou as duas, e o filtro de conteúdo da nuvem barrou as duas no GPT-5.4 antes de o modelo responder. São questões legítimas de prova de medicina e contam zero.

Contaminação.

Os itens estão em datasets públicos. Qualquer coluna, a da LUA inclusive, pode ter visto essas questões em treino. Esta rodada não mediu contaminação, e o número deve ser lido como teto do que o modelo sabe sobre o assunto, não como prova de raciocínio sobre item inédito.

Limitações.

  • Uma execução por item. A variação entre execuções do mesmo modelo não foi medida.
  • Um prompt de múltipla escolha só, zero-shot. Outro prompt pode mudar a ordem das colunas.
  • O número vale para o modelo servido pela API em 24/09/2026. Versão nova pede rodada nova.
  • Questões com imagem ficaram fora para todas as colunas. O resultado não diz nada sobre leitura de figura.

Reproduzir.

O pacote traz o código que chama os modelos, o que monta cada prova, o que pontua e o que gera a tabela, mais a tabela agregada desta rodada. Os dados são baixados por preparar_dados.py nas versões exatas e conferidos por SHA-256. Se um byte mudar, o script para.

Com Python 3 e Node 20 ou mais novo:

tar -xzf bancada-brasil-2026-09.tar.gz && cd bancada-brasil-2026-09
shasum -a 256 -c <(sed -n '/^Arquivos deste pacote/,/^$/p' VERIFICAR.txt | grep -E '^[0-9a-f]{64}')
pip install huggingface_hub pyarrow
python3 preparar_dados.py          # baixa, normaliza e confere SHA-256
export LUA_API_KEY=...             # chave de avaliação da API LUA
node run.mjs --bench enamed --modelo house
node tabela.mjs
bancada-brasil-2026-09.tar.gz1144df20af11b5c0141614c256fa1733c698bf829be3303842839ec149a1f81111 KB · As respostas cruas por item não estão neste pacote.
ArquivoTamanhoBaixar
bancada-brasil-2026-09.tar.gz11 KBBaixar
resultados-agregados.json7 KBBaixar
VERIFICAR.txt1 KBBaixar

Histórico.

24/09/2026 · primeira rodada, publicada nesta página.