LUA VISION

AA-Omniscience-Public

Seiscentas perguntas de conhecimento em 42 temas de seis áreas de valor econômico. Pune erro e não pune abstenção.

RodadoRegistro LUA · rodado pela LUA Vision · não é avaliação independente

Resultados.

Comparação com juiz automático único por benchmark, o mesmo para os seis modelos, fora das famílias avaliadas, com o prompt oficial do benchmark. A LUA entra com as mesmas respostas do registro de 25/09/2026, corrigidas de novo por esse juiz. O registro isolado de 25/09 usou outros juízes; os números dele estão mais abaixo nesta página.

Em cada linha, o melhor valor fica destacado. Atenção ao sentido: em algumas métricas, quanto menor, melhor (alucinação, recusa indevida, erro de calibração).

ModeloOmniscience Index
↑ maior é melhor
Acurácia (%)
↑ maior é melhor
Abstenção (%)Taxa de alucinação (%)
↓ menor é melhor
LUA Genesys PI House56,850,8–62,7melhor69,765,9–73,2melhor16,313,6–19,542,335,4–49,6
GPT-5.535,327,8–43,066,362,5–70,01,81,0–3,392,187,5–95,1
GPT-5.420,713,2–28,056,852,8–60,75,53,9–7,683,878,8–87,8
Grok 4.637,530,0–45,066,362,5–70,04,02,7–5,985,680,1–89,8
DeepSeek-V4-Pro-2,7-10,2–5,246,742,7–50,73,52,3–5,392,589,1–94,9
Kimi K2.619,213,2–25,239,235,3–43,140,236,3–44,132,928,3–37,9
Sabiá 4 Thinking————

Omniscience Index · maior é melhor

LUA Genesys PI House
melhor resultado56,8IC 50,8–62,7
Grok 4.6
37,5IC 30,0–45,0
GPT-5.5
35,3IC 27,8–43,0
GPT-5.4
20,7IC 13,2–28,0
Kimi K2.6
19,2IC 13,2–25,2
DeepSeek-V4-Pro
-2,7IC -10,2–5,2

Eixo de -25 a 75. Barra preta: intervalo de confiança de 95%.

A linha pequena em cada célula é o IC 95%.Não tentou e abstenção não têm sentido de melhor: aparecem para ler a acurácia e a alucinação junto.Itens julgados, quando não foram todos: DeepSeek-V4-Pro: 597 de 600; GPT-5.4: 597 de 600; GPT-5.5: 596 de 600; Grok 4.6: 595 de 600; Kimi K2.6: 594 de 600; LUA Genesys PI House: 599 de 600.O Sabiá 4 aparece só onde o protocolo publicado pelo fornecedor é comparável: múltipla escolha com acerto exato.

Referências externas

Publicado por terceiros (artificialanalysis.ai, artificialanalysis.ai, artificialanalysis.ai, artificialanalysis.ai, artificialanalysis.ai, artificialanalysis.ai, artificialanalysis.ai, acesso em 26/09/2026): GPT-5.5 (xhigh), Omniscience Index (escala -100 a 100) 20,5; GPT-5.5 (xhigh), Acurácia (%) 58,0; GPT-5.5 (xhigh), Taxa de alucinação (%) 89,0; GPT-5.4 (xhigh), Omniscience Index (escala -100 a 100) 5,8; GPT-5.4 (xhigh), Acurácia (%) 50,8; GPT-5.4 (xhigh), Taxa de alucinação (%) 91,7; Grok 4.6 (high), Omniscience Index (escala -100 a 100) 30,5; Grok 4.6 (high), Acurácia (%) 48,2; Grok 4.6 (high), Taxa de alucinação (%) 34,3; DeepSeek V4 Pro 0813 (Reasoning, Max Effort), Omniscience Index (escala -100 a 100) 0,8; DeepSeek V4 Pro 0813 (Reasoning, Max Effort), Acurácia (%) 49,1; DeepSeek V4 Pro 0813 (Reasoning, Max Effort), Taxa de alucinação (%) 94,8; DeepSeek V4 Pro 0424 (Reasoning, Max Effort), Omniscience Index (escala -100 a 100) -10,7; DeepSeek V4 Pro 0424 (Reasoning, Max Effort), Acurácia (%) 43,0; DeepSeek V4 Pro 0424 (Reasoning, Max Effort), Taxa de alucinação (%) 94,1; Kimi K2.6, Omniscience Index (escala -100 a 100) 5,3; Kimi K2.6, Acurácia (%) 32,6; Kimi K2.6, Taxa de alucinação (%) 40,5; GPT-5.5 (xhigh), Acurácia (%) no lançamento 57,0; GPT-5.5 (xhigh), Taxa de alucinação (%) no lançamento 86,0. Juiz e configuração diferentes dos desta página. São números do índice oficial, com 6.000 perguntas, não do subconjunto público de 600 usado aqui.

Arquivos da comparação

Resultado por itemSHA-256Baixar
resultados/omniscience.house.rejulgado.jsonl083505b520d6fe6dc77a57600f7855d1b7c30a42a836ab38792fbcb0e1d675c9retido: traz o nome do juiz
resultados/omniscience.gpt55.jsonlcd661e721d0e8d784dda69eb87c0a37c189b668d0406c05aa8cbbdd56a19bf35retido: traz o nome do juiz
resultados/omniscience.gpt54.jsonlc19dee5b83b271567bac61c9e4de8e08726a1bc739444493e85edf8f43e22cd9retido: traz o nome do juiz
resultados/omniscience.grok.jsonlce46be86a95fb48b2e142bdb7fc7c0e063e3ec3888ec0b534ad0a53ea03a636cretido: traz o nome do juiz
resultados/omniscience.deepseek.jsonl0ff781c708e5c227bf867b060564c31aa508944e26d7be338daf8d4ad5d1721bretido: traz o nome do juiz
resultados/omniscience.kimi.jsonlc67bf6078226b576862c5afbc32ca440a2b11d40b5d89f6ceb553be6f016eac8retido: traz o nome do juiz

Como a comparação foi rodada.

Todos os modelos receberam só a pergunta, pela API comercial de cada fornecedor, sem prompt extra, sem busca e sem ferramentas. Uma execução por item. Pergunta sem resposta conta no denominador.

Bloqueio do provedor: quando o filtro de conteúdo do fornecedor recusa o pedido antes de o modelo responder (HTTP 400 ou filtro declarado), o item vale como recusa ou abstenção, conforme o benchmark, e fica contado à parte, por modelo, na tabela abaixo.

ModeloAcessoEsforço de raciocínioBloqueios do provedorSem resposta
LUA Genesys PI HouseAPI pública api.lua.visionmedium00
GPT-5.5API comercialmedium00
GPT-5.4API comercialmedium00
Grok 4.6API comercialpadrão do modelo11
DeepSeek-V4-ProAPI comercialpadrão do modelo10
Kimi K2.6API comercialpadrão do modelo13

Registro isolado de 25/09/2026.

Só a LUA, com os juízes daquela rodada, diferentes do juiz da comparação acima. Os números não se comparam com a tabela de cima.

Subconjunto públicoSubconjunto público, não o índice oficial da Artificial Analysis. O índice oficial usa as 6.000 perguntas; aqui são as 600 públicas.
MétricaValorIC 95%
Omniscience Index54,548,7–60,3
Acurácia (%)68,764,8–72,2
Abstenção (%)15,813,1–19,0
Taxa de alucinação (%)45,238,3–52,4

Omniscience Index = 100 × (certo − errado) / total. Taxa de alucinação = errado / (parcial + errado + abstenção): quanto a LUA chuta errado quando não sabe. n = 600: 412 certas, 85 erradas, 8 parciais, 95 abstenções. A abstenção tem intervalo de Wilson calculado a partir dessas contagens.

Taxa de alucinação sai sempre ao lado da acurácia e da abstenção. Um modelo que recusa tudo zera a alucinação, e a tabela mostra isso.

Como foi rodado.

ChamadaLUA Genesys PI House, genesys-pi-house, API pública api.lua.vision, esforço de raciocínio medium. Sem temperatura, sem teto de tokens, sem prompt extra, sem busca e sem ferramentas.
DatasetArtificialAnalysis/AA-Omniscience-Public, revisão e4883edb, CC BY 4.0. arXiv 2511.13029
Itens600 de 600.
JuizJuiz automático com o prompt oficial do benchmark, sem o modelo juiz original. O juiz que corrigiu as respostas não é o mesmo que os autores do benchmark usaram. O prompt de correção é o oficial, sem mudança, mas outro juiz pode classificar a mesma resposta de outro jeito. Isso pode mover os números para cima ou para baixo.
ExecuçõesUma por item. Recusa da própria API (HTTP 400, política de segurança) é resposta final e fica contada à parte.
IntervaloWilson para proporções. Bootstrap percentil com 2.000 reamostragens e semente fixa para F1, Omniscience Index, ECE e Brier.

Pacote e arquivos.

O pacote traz o código que chama o modelo, monta cada teste e calcula as métricas, os conjuntos gerados e a tabela agregada. Os arquivos de resultado por item ficam fora nesta versão pública, porque cada linha registra qual juiz corrigiu o item. O SHA-256 de cada um está abaixo, igual ao da tabela da rodada.

registro-veracidade-2026-09.tar.gzff68d8db16a4d3944e635b50a4a9b28f7009fb0cb94fa37510c1e579681b0f82
ArquivoTamanhoBaixar
registro-veracidade-2026-09.tar.gz41 KBBaixar
Resultado por itemSHA-256Baixar
resultados/omniscience.house.jsonlcb3a6155906961f51ef866c53b7beeec34b287b8414681ff36457d07a8419b0eretido: traz o nome do juiz

Ficaram fora desta versão pública, pelo mesmo motivo: modelos.mjs, benches/abstention.mjs, benches/hallulens.mjs, benches/omniscience.mjs, benches/orbench.mjs, benches/orbench_hard_j2.mjs, benches/orbench_toxic_j2.mjs, benches/simpleqa.mjs, benches/simpleqa_conf.mjs, benches/xstest.mjs, README.md, colunas.json, tabela.json. Sem eles, o pacote não roda sozinho. A versão completa depende de uma decisão pendente sobre nomear o juiz.

Limitações.

  • É o subconjunto público, não o índice oficial do mantenedor, que usa o conjunto inteiro.
  • O juiz que corrigiu as respostas não é o mesmo que os autores do benchmark usaram. O prompt de correção é o oficial, sem mudança, mas outro juiz pode classificar a mesma resposta de outro jeito. Isso pode mover os números para cima ou para baixo.