A LUA aprovaria no Exame de Ordem, nas duas fases, nas 7 edições mais recentes.
A LUA acerta 99,7% das questões objetivas do ENEM 2024 e 2025.
354 de 354 questões, cobertura de imagem 100%.
Ver a prova completa →Registro LUA · rodado pela LUA Vision · não é avaliação independente. Nenhum número foi arredondado.
Avaliações do Genesys PI.
A LUA Vision é um laboratório brasileiro de modelos de linguagem. Avaliamos o Genesys PI com benchmarks públicos e com réguas próprias, lado a lado com modelos de fronteira, na mesma data e com o mesmo protocolo. Cada resultado traz intervalo de confiança e um pacote selado com SHA-256 para qualquer pessoa refazer a conta.
Resultados por capacidade.
LUA Genesys PI House primeiro, depois os modelos de comparação. Cada linha leva à página do benchmark, com o intervalo de confiança, a configuração de cada modelo e os arquivos.
Em cada linha, o melhor valor fica destacado. Atenção ao sentido: em algumas métricas, quanto menor, melhor (alucinação, recusa indevida, erro de calibração).
O Genesys PI tem o melhor resultado da comparação em 7 das 10 métricas. Empate no melhor valor conta para todos os empatados.
| Benchmark | LUA Genesys PI | GPT-5.5 | GPT-5.4 | Grok 4.6 | DeepSeek-V4-Pro | Kimi K2.6 | Sabiá 4 |
|---|---|---|---|---|---|---|---|
| Conhecimento especializado em português | |||||||
| ENAMEDAcerto (%)↑ maior é melhor | 96,6melhor | 96,6 | 94,3 | 95,4 | 94,3 | 93,1 | 94,4† |
| POSCOMPAcerto (%)↑ maior é melhor | 95,4 | 95,4 | 95,4 | 96,2 | 93,1 | 95,4 | 90,8† |
| BLUEXAcerto (%)↑ maior é melhor | 96,0 | 96,3 | 95,4 | 96,3 | 93,8 | 94,1 | 93,0† |
| Agentes e uso de ferramentas | |||||||
| Ticket-Bench PTAcerto (%)↑ maior é melhor | 87,4melhor | 86,1 | 86,8 | —‡ | 85,4 | 84,8 | — |
| Veracidade e calibração | |||||||
| SimpleQA VerifiedF1↑ maior é melhor | 75,2melhor | 65,5 | 45,9 | 55,3 | 46,2 | 39,9 | — |
| AA-Omniscience-PublicOmniscience Index↑ maior é melhor | 56,8melhor | 35,3 | 20,7 | 37,5 | -2,7 | 19,2 | — |
| HalluLens · MixedEntitiesFalsa aceitação (%)↓ menor é melhor | 33,0melhor | 89,2 | 67,3 | 64,2 | 80,3 | 57,7 | — |
| AbstentionBenchF1 de abstenção↑ maior é melhor | 72,5melhor | 67,8 | 65,7 | 66,2 | 65,9 | 70,7 | — |
| Segurança e recusa | |||||||
| XSTestRecusa indevida nos seguros (%)↓ menor é melhor | 10,4melhor | 12,4 | 16,8 | 14,0 | 24,4 | 18,0 | — |
| XSTestConformidade nos inseguros (%)↓ menor é melhor | 10,5 | 10,0 | 4,5 | 11,0 | 1,5 | 4,5 | — |
Modelos avaliados e por quê.
O grupo de comparação cobre três frentes: a fronteira fechada, a fronteira de pesos abertos e o ecossistema brasileiro. Todos foram acessados por API comercial, na mesma data.
Fronteira fechada
GPT-5.5 e GPT-5.4, da OpenAI, a geração atual e a anterior. Grok 4.6, da xAI.
Dois laboratórios de referênciaFronteira de pesos abertos
DeepSeek-V4-Pro e Kimi K2.6, os dois modelos chineses de pesos abertos mais fortes disponíveis por API.
Pesos publicadosEcossistema brasileiro
Sabiá 4 Thinking. Onde o protocolo publicado pelo fornecedor é comparável, entra o número dele, marcado com †.
Modelo brasileiroComo avaliamos.
- Mesmo protocolo. Todos os modelos recebem as mesmas mensagens, na mesma data, com o mesmo código de execução. Esforço de raciocínio medium onde o modelo aceita. Sem ferramentas e sem busca, salvo as que o próprio benchmark define.
- Uma execução por item. Pergunta sem resposta conta zero e fica no denominador. Isso inclui recusa de filtro de conteúdo, do provedor ou da própria API, contada à parte.
- Juiz automático. Onde o benchmark pede juiz, usamos um juiz automático com o prompt oficial do benchmark, sem o modelo juiz original. Um juiz diferente pode classificar a mesma resposta de outro jeito, e cada página diz isso.
- Intervalo de confiança. IC de 95% em todo número: Wilson para proporções, bootstrap percentil para F1, índices e calibração.
- Contaminação. Os datasets públicos podem estar no treino de qualquer modelo, o Genesys PI inclusive. A página de cada benchmark diz o que isso significa para aquele resultado.
- Dados selados. Cada dataset é fixado por commit e SHA-256. O pacote de cada rodada é determinístico: o mesmo conteúdo gera o mesmo hash. Os comandos para refazer estão em cada página.
- Rótulo. Todo número traz Registro LUA, rodado pela LUA Vision. Não é avaliação independente.
Réguas próprias.
Benchmarks que a LUA Vision está construindo para capacidades que nenhum teste público mede em português. Metodologia publicada, rodada em preparação. Nenhum número ainda.
| Régua | O que mede | Estado |
|---|---|---|
| BL-NAOSEI · Sabe o que não sabe | Veracidade, abstenção e calibração em PT-BR | Metodologia publicada |
| BL-SAU · Saúde | Prova, conduta por protocolo, leigo em urgência, recusa indevida | Metodologia publicada |
| BL-KIDS · Criança | Segurança, adequação à idade, correção e tom, de 4 a 12 anos | Metodologia publicada |
Acesso para pesquisadores.
Baixe os pacotes, confira os hashes e rode. Para refazer a coluna da LUA, peça acesso de avaliação à API.