LUA VISION
Exame de Ordem

A LUA aprovaria no Exame de Ordem, nas duas fases, nas 7 edições mais recentes.

1ª fase, objetiva99,3%IC 95% 98,2–99,7Aprovaria: sim, nas 7 edições
2ª fase, discursiva9,41 /10IC 95% 9,19–9,59Aprovaria: sim, nas 21 provas
Ver a prova completa →
ENEM

A LUA acerta 99,7% das questões objetivas do ENEM 2024 e 2025.

Objetivas99,7%IC 95% 98,4–100,0

354 de 354 questões, cobertura de imagem 100%.

Ver a prova completa →

Registro LUA · rodado pela LUA Vision · não é avaliação independente. Nenhum número foi arredondado.

Avaliações do Genesys PI.

A LUA Vision é um laboratório brasileiro de modelos de linguagem. Avaliamos o Genesys PI com benchmarks públicos e com réguas próprias, lado a lado com modelos de fronteira, na mesma data e com o mesmo protocolo. Cada resultado traz intervalo de confiança e um pacote selado com SHA-256 para qualquer pessoa refazer a conta.

Resultados por capacidade.

LUA Genesys PI House primeiro, depois os modelos de comparação. Cada linha leva à página do benchmark, com o intervalo de confiança, a configuração de cada modelo e os arquivos.

Em cada linha, o melhor valor fica destacado. Atenção ao sentido: em algumas métricas, quanto menor, melhor (alucinação, recusa indevida, erro de calibração).

O Genesys PI tem o melhor resultado da comparação em 7 das 10 métricas. Empate no melhor valor conta para todos os empatados.

BenchmarkLUA Genesys PIGPT-5.5GPT-5.4Grok 4.6DeepSeek-V4-ProKimi K2.6Sabiá 4
Conhecimento especializado em português
ENAMEDAcerto (%)↑ maior é melhor96,6melhor96,694,395,494,393,194,4†
POSCOMPAcerto (%)↑ maior é melhor95,495,495,496,293,195,490,8†
BLUEXAcerto (%)↑ maior é melhor96,096,395,496,393,894,193,0†
Agentes e uso de ferramentas
Ticket-Bench PTAcerto (%)↑ maior é melhor87,4melhor86,186,8—‡85,484,8—
Veracidade e calibração
SimpleQA VerifiedF1↑ maior é melhor75,2melhor65,545,955,346,239,9—
AA-Omniscience-PublicOmniscience Index↑ maior é melhor56,8melhor35,320,737,5-2,719,2—
HalluLens · MixedEntitiesFalsa aceitação (%)↓ menor é melhor33,0melhor89,267,364,280,357,7—
AbstentionBenchF1 de abstenção↑ maior é melhor72,5melhor67,865,766,265,970,7—
Segurança e recusa
XSTestRecusa indevida nos seguros (%)↓ menor é melhor10,4melhor12,416,814,024,418,0—
XSTestConformidade nos inseguros (%)↓ menor é melhor10,510,04,511,01,54,5—
Veracidade e segurança: juiz automático único por benchmark, o mesmo para os seis modelos, fora das famílias avaliadas.† Valor publicado pelo fornecedor em 23/06/2026, com o protocolo do fornecedor. Não foi rodado pela LUA Vision e não tem intervalo de confiança publicado.‡ Erro do ambiente com page_number: toda chamada falhou. Ver defeitos.Bancada Brasil rodada em 24/09/2026; veracidade e segurança de 25/09/2026 a 27/09/2026. LUA Genesys PI House, esforço medium, API pública. Registro LUA · rodado pela LUA Vision · não é avaliação independente.

Modelos avaliados e por quê.

O grupo de comparação cobre três frentes: a fronteira fechada, a fronteira de pesos abertos e o ecossistema brasileiro. Todos foram acessados por API comercial, na mesma data.

Fronteira fechada

GPT-5.5 e GPT-5.4, da OpenAI, a geração atual e a anterior. Grok 4.6, da xAI.

Dois laboratórios de referência

Fronteira de pesos abertos

DeepSeek-V4-Pro e Kimi K2.6, os dois modelos chineses de pesos abertos mais fortes disponíveis por API.

Pesos publicados

Ecossistema brasileiro

Sabiá 4 Thinking. Onde o protocolo publicado pelo fornecedor é comparável, entra o número dele, marcado com †.

Modelo brasileiro

Como avaliamos.

  1. Mesmo protocolo. Todos os modelos recebem as mesmas mensagens, na mesma data, com o mesmo código de execução. Esforço de raciocínio medium onde o modelo aceita. Sem ferramentas e sem busca, salvo as que o próprio benchmark define.
  2. Uma execução por item. Pergunta sem resposta conta zero e fica no denominador. Isso inclui recusa de filtro de conteúdo, do provedor ou da própria API, contada à parte.
  3. Juiz automático. Onde o benchmark pede juiz, usamos um juiz automático com o prompt oficial do benchmark, sem o modelo juiz original. Um juiz diferente pode classificar a mesma resposta de outro jeito, e cada página diz isso.
  4. Intervalo de confiança. IC de 95% em todo número: Wilson para proporções, bootstrap percentil para F1, índices e calibração.
  5. Contaminação. Os datasets públicos podem estar no treino de qualquer modelo, o Genesys PI inclusive. A página de cada benchmark diz o que isso significa para aquele resultado.
  6. Dados selados. Cada dataset é fixado por commit e SHA-256. O pacote de cada rodada é determinístico: o mesmo conteúdo gera o mesmo hash. Os comandos para refazer estão em cada página.
  7. Rótulo. Todo número traz Registro LUA, rodado pela LUA Vision. Não é avaliação independente.

Método das réguas LUA →

Réguas próprias.

Benchmarks que a LUA Vision está construindo para capacidades que nenhum teste público mede em português. Metodologia publicada, rodada em preparação. Nenhum número ainda.

RéguaO que medeEstado
BL-NAOSEI · Sabe o que não sabeVeracidade, abstenção e calibração em PT-BRMetodologia publicada
BL-SAU · SaúdeProva, conduta por protocolo, leigo em urgência, recusa indevidaMetodologia publicada
BL-KIDS · CriançaSegurança, adequação à idade, correção e tom, de 4 a 12 anosMetodologia publicada

Acesso para pesquisadores.

Baixe os pacotes, confira os hashes e rode. Para refazer a coluna da LUA, peça acesso de avaliação à API.