AA-Omniscience-Public
Seiscentas perguntas de conhecimento em 42 temas de seis áreas de valor econômico. Pune erro e não pune abstenção.
Resultados.
Comparação com juiz automático único por benchmark, o mesmo para os seis modelos, fora das famílias avaliadas, com o prompt oficial do benchmark. A LUA entra com as mesmas respostas do registro de 25/09/2026, corrigidas de novo por esse juiz. O registro isolado de 25/09 usou outros juízes; os números dele estão mais abaixo nesta página.
Em cada linha, o melhor valor fica destacado. Atenção ao sentido: em algumas métricas, quanto menor, melhor (alucinação, recusa indevida, erro de calibração).
| Modelo | Omniscience Index ↑ maior é melhor | Acurácia (%) ↑ maior é melhor | Abstenção (%) | Taxa de alucinação (%) ↓ menor é melhor |
|---|---|---|---|---|
| LUA Genesys PI House | 56,850,8–62,7melhor | 69,765,9–73,2melhor | 16,313,6–19,5 | 42,335,4–49,6 |
| GPT-5.5 | 35,327,8–43,0 | 66,362,5–70,0 | 1,81,0–3,3 | 92,187,5–95,1 |
| GPT-5.4 | 20,713,2–28,0 | 56,852,8–60,7 | 5,53,9–7,6 | 83,878,8–87,8 |
| Grok 4.6 | 37,530,0–45,0 | 66,362,5–70,0 | 4,02,7–5,9 | 85,680,1–89,8 |
| DeepSeek-V4-Pro | -2,7-10,2–5,2 | 46,742,7–50,7 | 3,52,3–5,3 | 92,589,1–94,9 |
| Kimi K2.6 | 19,213,2–25,2 | 39,235,3–43,1 | 40,236,3–44,1 | 32,928,3–37,9 |
| Sabiá 4 Thinking | — | — | — | — |
Omniscience Index · maior é melhor
Eixo de -25 a 75. Barra preta: intervalo de confiança de 95%.
Referências externas
Publicado por terceiros (artificialanalysis.ai, artificialanalysis.ai, artificialanalysis.ai, artificialanalysis.ai, artificialanalysis.ai, artificialanalysis.ai, artificialanalysis.ai, acesso em 26/09/2026): GPT-5.5 (xhigh), Omniscience Index (escala -100 a 100) 20,5; GPT-5.5 (xhigh), Acurácia (%) 58,0; GPT-5.5 (xhigh), Taxa de alucinação (%) 89,0; GPT-5.4 (xhigh), Omniscience Index (escala -100 a 100) 5,8; GPT-5.4 (xhigh), Acurácia (%) 50,8; GPT-5.4 (xhigh), Taxa de alucinação (%) 91,7; Grok 4.6 (high), Omniscience Index (escala -100 a 100) 30,5; Grok 4.6 (high), Acurácia (%) 48,2; Grok 4.6 (high), Taxa de alucinação (%) 34,3; DeepSeek V4 Pro 0813 (Reasoning, Max Effort), Omniscience Index (escala -100 a 100) 0,8; DeepSeek V4 Pro 0813 (Reasoning, Max Effort), Acurácia (%) 49,1; DeepSeek V4 Pro 0813 (Reasoning, Max Effort), Taxa de alucinação (%) 94,8; DeepSeek V4 Pro 0424 (Reasoning, Max Effort), Omniscience Index (escala -100 a 100) -10,7; DeepSeek V4 Pro 0424 (Reasoning, Max Effort), Acurácia (%) 43,0; DeepSeek V4 Pro 0424 (Reasoning, Max Effort), Taxa de alucinação (%) 94,1; Kimi K2.6, Omniscience Index (escala -100 a 100) 5,3; Kimi K2.6, Acurácia (%) 32,6; Kimi K2.6, Taxa de alucinação (%) 40,5; GPT-5.5 (xhigh), Acurácia (%) no lançamento 57,0; GPT-5.5 (xhigh), Taxa de alucinação (%) no lançamento 86,0. Juiz e configuração diferentes dos desta página. São números do índice oficial, com 6.000 perguntas, não do subconjunto público de 600 usado aqui.
Arquivos da comparação
| Resultado por item | SHA-256 | Baixar |
|---|---|---|
resultados/omniscience.house.rejulgado.jsonl | 083505b520d6fe6dc77a57600f7855d1b7c30a42a836ab38792fbcb0e1d675c9 | retido: traz o nome do juiz |
resultados/omniscience.gpt55.jsonl | cd661e721d0e8d784dda69eb87c0a37c189b668d0406c05aa8cbbdd56a19bf35 | retido: traz o nome do juiz |
resultados/omniscience.gpt54.jsonl | c19dee5b83b271567bac61c9e4de8e08726a1bc739444493e85edf8f43e22cd9 | retido: traz o nome do juiz |
resultados/omniscience.grok.jsonl | ce46be86a95fb48b2e142bdb7fc7c0e063e3ec3888ec0b534ad0a53ea03a636c | retido: traz o nome do juiz |
resultados/omniscience.deepseek.jsonl | 0ff781c708e5c227bf867b060564c31aa508944e26d7be338daf8d4ad5d1721b | retido: traz o nome do juiz |
resultados/omniscience.kimi.jsonl | c67bf6078226b576862c5afbc32ca440a2b11d40b5d89f6ceb553be6f016eac8 | retido: traz o nome do juiz |
Como a comparação foi rodada.
Todos os modelos receberam só a pergunta, pela API comercial de cada fornecedor, sem prompt extra, sem busca e sem ferramentas. Uma execução por item. Pergunta sem resposta conta no denominador.
Bloqueio do provedor: quando o filtro de conteúdo do fornecedor recusa o pedido antes de o modelo responder (HTTP 400 ou filtro declarado), o item vale como recusa ou abstenção, conforme o benchmark, e fica contado à parte, por modelo, na tabela abaixo.
| Modelo | Acesso | Esforço de raciocínio | Bloqueios do provedor | Sem resposta |
|---|---|---|---|---|
| LUA Genesys PI House | API pública api.lua.vision | medium | 0 | 0 |
| GPT-5.5 | API comercial | medium | 0 | 0 |
| GPT-5.4 | API comercial | medium | 0 | 0 |
| Grok 4.6 | API comercial | padrão do modelo | 1 | 1 |
| DeepSeek-V4-Pro | API comercial | padrão do modelo | 1 | 0 |
| Kimi K2.6 | API comercial | padrão do modelo | 1 | 3 |
Registro isolado de 25/09/2026.
Só a LUA, com os juízes daquela rodada, diferentes do juiz da comparação acima. Os números não se comparam com a tabela de cima.
| Métrica | Valor | IC 95% |
|---|---|---|
| Omniscience Index | 54,5 | 48,7–60,3 |
| Acurácia (%) | 68,7 | 64,8–72,2 |
| Abstenção (%) | 15,8 | 13,1–19,0 |
| Taxa de alucinação (%) | 45,2 | 38,3–52,4 |
Omniscience Index = 100 × (certo − errado) / total. Taxa de alucinação = errado / (parcial + errado + abstenção): quanto a LUA chuta errado quando não sabe. n = 600: 412 certas, 85 erradas, 8 parciais, 95 abstenções. A abstenção tem intervalo de Wilson calculado a partir dessas contagens.
Taxa de alucinação sai sempre ao lado da acurácia e da abstenção. Um modelo que recusa tudo zera a alucinação, e a tabela mostra isso.
Como foi rodado.
| Chamada | LUA Genesys PI House, genesys-pi-house, API pública api.lua.vision, esforço de raciocínio medium. Sem temperatura, sem teto de tokens, sem prompt extra, sem busca e sem ferramentas. |
|---|---|
| Dataset | ArtificialAnalysis/AA-Omniscience-Public, revisão e4883edb, CC BY 4.0. arXiv 2511.13029 |
| Itens | 600 de 600. |
| Juiz | Juiz automático com o prompt oficial do benchmark, sem o modelo juiz original. O juiz que corrigiu as respostas não é o mesmo que os autores do benchmark usaram. O prompt de correção é o oficial, sem mudança, mas outro juiz pode classificar a mesma resposta de outro jeito. Isso pode mover os números para cima ou para baixo. |
| Execuções | Uma por item. Recusa da própria API (HTTP 400, política de segurança) é resposta final e fica contada à parte. |
| Intervalo | Wilson para proporções. Bootstrap percentil com 2.000 reamostragens e semente fixa para F1, Omniscience Index, ECE e Brier. |
Pacote e arquivos.
O pacote traz o código que chama o modelo, monta cada teste e calcula as métricas, os conjuntos gerados e a tabela agregada. Os arquivos de resultado por item ficam fora nesta versão pública, porque cada linha registra qual juiz corrigiu o item. O SHA-256 de cada um está abaixo, igual ao da tabela da rodada.
ff68d8db16a4d3944e635b50a4a9b28f7009fb0cb94fa37510c1e579681b0f82| Arquivo | Tamanho | Baixar |
|---|---|---|
registro-veracidade-2026-09.tar.gz | 41 KB | Baixar |
| Resultado por item | SHA-256 | Baixar |
|---|---|---|
resultados/omniscience.house.jsonl | cb3a6155906961f51ef866c53b7beeec34b287b8414681ff36457d07a8419b0e | retido: traz o nome do juiz |
Ficaram fora desta versão pública, pelo mesmo motivo: modelos.mjs, benches/abstention.mjs, benches/hallulens.mjs, benches/omniscience.mjs, benches/orbench.mjs, benches/orbench_hard_j2.mjs, benches/orbench_toxic_j2.mjs, benches/simpleqa.mjs, benches/simpleqa_conf.mjs, benches/xstest.mjs, README.md, colunas.json, tabela.json. Sem eles, o pacote não roda sozinho. A versão completa depende de uma decisão pendente sobre nomear o juiz.
Limitações.
- É o subconjunto público, não o índice oficial do mantenedor, que usa o conjunto inteiro.
- O juiz que corrigiu as respostas não é o mesmo que os autores do benchmark usaram. O prompt de correção é o oficial, sem mudança, mas outro juiz pode classificar a mesma resposta de outro jeito. Isso pode mover os números para cima ou para baixo.