LUA VISION

HalluLens MixedEntities

Perguntas sobre animais, plantas e bactérias que não existem, tarefa NonExistentRefusal. Mede quanto o modelo aceita e descreve o que foi inventado.

RodadoRegistro LUA · rodado pela LUA Vision · não é avaliação independente

Resultados.

Comparação com juiz automático único por benchmark, o mesmo para os seis modelos, fora das famílias avaliadas, com o prompt oficial do benchmark. A LUA entra com as mesmas respostas do registro de 25/09/2026, corrigidas de novo por esse juiz. O registro isolado de 25/09 usou outros juízes; os números dele estão mais abaixo nesta página.

Em cada linha, o melhor valor fica destacado. Atenção ao sentido: em algumas métricas, quanto menor, melhor (alucinação, recusa indevida, erro de calibração).

ModeloFalsa aceitação de entidade inventada (%)
↓ menor é melhor
LUA Genesys PI House33,029,4–36,9melhor
GPT-5.589,286,4–91,4
GPT-5.467,363,5–71,0
Grok 4.664,260,3–67,9
DeepSeek-V4-Pro80,376,9–83,3
Kimi K2.657,753,7–61,6
Sabiá 4 Thinking—

Falsa aceitação de entidade inventada (%) · menor é melhor

LUA Genesys PI House
melhor resultado33,0IC 29,4–36,9
Kimi K2.6
57,7IC 53,7–61,6
Grok 4.6
64,2IC 60,3–67,9
GPT-5.4
67,3IC 63,5–71,0
DeepSeek-V4-Pro
80,3IC 76,9–83,3
GPT-5.5
89,2IC 86,4–91,4

Eixo de 20 a 100. Barra preta: intervalo de confiança de 95%.

A linha pequena em cada célula é o IC 95%.O Sabiá 4 aparece só onde o protocolo publicado pelo fornecedor é comparável: múltipla escolha com acerto exato.

Arquivos da comparação

Resultado por itemSHA-256Baixar
resultados/hallulens.house.rejulgado.jsonl6f7890d3939ad22423bd51f9e89ff54e02d4f641e3bf8da691c0ea01ff08b2abretido: traz o nome do juiz
resultados/hallulens.gpt55.jsonl31174c8f7c0343ab16cf55ed2a42450dc0fe5210826ddad6cd345dd1e3b597c3retido: traz o nome do juiz
resultados/hallulens.gpt54.jsonl3cd3c0ec7de9881a56f473957b5425198cfffda237f26957e84fe8e9ffa9d2d8retido: traz o nome do juiz
resultados/hallulens.grok.jsonl3d92d38fbe2f7f08c056edc1833cc32d67cb8daf4c582e1b1357036cb05df8fdretido: traz o nome do juiz
resultados/hallulens.deepseek.jsonlcd209cb0cc726b12dececfb8049992e18ee5a447f30f0b5f5d6001114f8fac06retido: traz o nome do juiz
resultados/hallulens.kimi.jsonl34b386c4e130b7888718eab9e1cd9189a94bb66c3b55aaf5b806219aa5b6f479retido: traz o nome do juiz

Como a comparação foi rodada.

Todos os modelos receberam só a pergunta, pela API comercial de cada fornecedor, sem prompt extra, sem busca e sem ferramentas. Uma execução por item. Pergunta sem resposta conta no denominador.

Bloqueio do provedor: quando o filtro de conteúdo do fornecedor recusa o pedido antes de o modelo responder (HTTP 400 ou filtro declarado), o item vale como recusa ou abstenção, conforme o benchmark, e fica contado à parte, por modelo, na tabela abaixo.

ModeloAcessoEsforço de raciocínioBloqueios do provedorSem resposta
LUA Genesys PI HouseAPI pública api.lua.visionmedium00
GPT-5.5API comercialmedium00
GPT-5.4API comercialmedium00
Grok 4.6API comercialpadrão do modelo00
DeepSeek-V4-ProAPI comercialpadrão do modelo10
Kimi K2.6API comercialpadrão do modelo00

Registro isolado de 25/09/2026.

Só a LUA, com os juízes daquela rodada, diferentes do juiz da comparação acima. Os números não se comparam com a tabela de cima.

DomínionAceitouFalsa aceitação (%)IC 95%
Todos os domínios60019532,528,9–36,3
Animal20010854,047,1–60,8
Planta2005527,521,8–34,1
Bactéria2003216,011,6–21,7

Falsa aceitação: a LUA descreveu como real um animal, uma planta ou uma bactéria que não existe. Menor é melhor. O erro se concentra em animais.

Como foi rodado.

ChamadaLUA Genesys PI House, genesys-pi-house, API pública api.lua.vision, esforço de raciocínio medium. Sem temperatura, sem teto de tokens, sem prompt extra, sem busca e sem ferramentas.
DatasetHalluLens, tarefa NonExistentRefusal, MixedEntities, commit 80307ac6, gerador oficial com semente 0 e 200 nomes por domínio. arXiv 2504.17550
Itens600. O script oficial usa 10 nomes por domínio; aqui são 200, para o intervalo ficar útil. A resposta não é cortada em 256 tokens como na inferência oficial. O domínio de medicamentos ficou fora: a fonte exige conta no Kaggle. GeneratedEntities ficou fora: exige API de busca paga.
JuizJuiz automático com o prompt oficial do benchmark, sem o modelo juiz original. O juiz que corrigiu as respostas não é o mesmo que os autores do benchmark usaram. O prompt de correção é o oficial, sem mudança, mas outro juiz pode classificar a mesma resposta de outro jeito. Isso pode mover os números para cima ou para baixo.
ExecuçõesUma por item. Recusa da própria API (HTTP 400, política de segurança) é resposta final e fica contada à parte.
IntervaloWilson para proporções. Bootstrap percentil com 2.000 reamostragens e semente fixa para F1, Omniscience Index, ECE e Brier.

Pacote e arquivos.

O pacote traz o código que chama o modelo, monta cada teste e calcula as métricas, os conjuntos gerados e a tabela agregada. Os arquivos de resultado por item ficam fora nesta versão pública, porque cada linha registra qual juiz corrigiu o item. O SHA-256 de cada um está abaixo, igual ao da tabela da rodada.

registro-veracidade-2026-09.tar.gzff68d8db16a4d3944e635b50a4a9b28f7009fb0cb94fa37510c1e579681b0f82
ArquivoTamanhoBaixar
registro-veracidade-2026-09.tar.gz41 KBBaixar
hallulens_mixed_semente0_n200.jsonl · SHA-256 c2c11d849a74f550eaa14b3f06de0b6f855cc796fb566b4263c178544a34a5d590 KBBaixar
hallulens_fonte.json · SHA-256 2091130d9bd8e4b2e69ac9e1e5d0305fe11d7c2215ce2e3cf10805689314d2951 KBBaixar
Resultado por itemSHA-256Baixar
resultados/hallulens.house.jsonl0ace3bda4aef2f948b5bebb878d5452913dd68055aa5cd7fece45f23869325caretido: traz o nome do juiz

Ficaram fora desta versão pública, pelo mesmo motivo: modelos.mjs, benches/abstention.mjs, benches/hallulens.mjs, benches/omniscience.mjs, benches/orbench.mjs, benches/orbench_hard_j2.mjs, benches/orbench_toxic_j2.mjs, benches/simpleqa.mjs, benches/simpleqa_conf.mjs, benches/xstest.mjs, README.md, colunas.json, tabela.json. Sem eles, o pacote não roda sozinho. A versão completa depende de uma decisão pendente sobre nomear o juiz.

Limitações.

  • Conjunto dinâmico: duas rodadas não usam as mesmas perguntas. A comparação vale dentro da mesma semente.
  • O juiz que corrigiu as respostas não é o mesmo que os autores do benchmark usaram. O prompt de correção é o oficial, sem mudança, mas outro juiz pode classificar a mesma resposta de outro jeito. Isso pode mover os números para cima ou para baixo.