HalluLens MixedEntities
Perguntas sobre animais, plantas e bactérias que não existem, tarefa NonExistentRefusal. Mede quanto o modelo aceita e descreve o que foi inventado.
Resultados.
Comparação com juiz automático único por benchmark, o mesmo para os seis modelos, fora das famílias avaliadas, com o prompt oficial do benchmark. A LUA entra com as mesmas respostas do registro de 25/09/2026, corrigidas de novo por esse juiz. O registro isolado de 25/09 usou outros juízes; os números dele estão mais abaixo nesta página.
Em cada linha, o melhor valor fica destacado. Atenção ao sentido: em algumas métricas, quanto menor, melhor (alucinação, recusa indevida, erro de calibração).
| Modelo | Falsa aceitação de entidade inventada (%) ↓ menor é melhor |
|---|---|
| LUA Genesys PI House | 33,029,4–36,9melhor |
| GPT-5.5 | 89,286,4–91,4 |
| GPT-5.4 | 67,363,5–71,0 |
| Grok 4.6 | 64,260,3–67,9 |
| DeepSeek-V4-Pro | 80,376,9–83,3 |
| Kimi K2.6 | 57,753,7–61,6 |
| Sabiá 4 Thinking | — |
Falsa aceitação de entidade inventada (%) · menor é melhor
Eixo de 20 a 100. Barra preta: intervalo de confiança de 95%.
Arquivos da comparação
| Resultado por item | SHA-256 | Baixar |
|---|---|---|
resultados/hallulens.house.rejulgado.jsonl | 6f7890d3939ad22423bd51f9e89ff54e02d4f641e3bf8da691c0ea01ff08b2ab | retido: traz o nome do juiz |
resultados/hallulens.gpt55.jsonl | 31174c8f7c0343ab16cf55ed2a42450dc0fe5210826ddad6cd345dd1e3b597c3 | retido: traz o nome do juiz |
resultados/hallulens.gpt54.jsonl | 3cd3c0ec7de9881a56f473957b5425198cfffda237f26957e84fe8e9ffa9d2d8 | retido: traz o nome do juiz |
resultados/hallulens.grok.jsonl | 3d92d38fbe2f7f08c056edc1833cc32d67cb8daf4c582e1b1357036cb05df8fd | retido: traz o nome do juiz |
resultados/hallulens.deepseek.jsonl | cd209cb0cc726b12dececfb8049992e18ee5a447f30f0b5f5d6001114f8fac06 | retido: traz o nome do juiz |
resultados/hallulens.kimi.jsonl | 34b386c4e130b7888718eab9e1cd9189a94bb66c3b55aaf5b806219aa5b6f479 | retido: traz o nome do juiz |
Como a comparação foi rodada.
Todos os modelos receberam só a pergunta, pela API comercial de cada fornecedor, sem prompt extra, sem busca e sem ferramentas. Uma execução por item. Pergunta sem resposta conta no denominador.
Bloqueio do provedor: quando o filtro de conteúdo do fornecedor recusa o pedido antes de o modelo responder (HTTP 400 ou filtro declarado), o item vale como recusa ou abstenção, conforme o benchmark, e fica contado à parte, por modelo, na tabela abaixo.
| Modelo | Acesso | Esforço de raciocínio | Bloqueios do provedor | Sem resposta |
|---|---|---|---|---|
| LUA Genesys PI House | API pública api.lua.vision | medium | 0 | 0 |
| GPT-5.5 | API comercial | medium | 0 | 0 |
| GPT-5.4 | API comercial | medium | 0 | 0 |
| Grok 4.6 | API comercial | padrão do modelo | 0 | 0 |
| DeepSeek-V4-Pro | API comercial | padrão do modelo | 1 | 0 |
| Kimi K2.6 | API comercial | padrão do modelo | 0 | 0 |
Registro isolado de 25/09/2026.
Só a LUA, com os juízes daquela rodada, diferentes do juiz da comparação acima. Os números não se comparam com a tabela de cima.
| Domínio | n | Aceitou | Falsa aceitação (%) | IC 95% |
|---|---|---|---|---|
| Todos os domínios | 600 | 195 | 32,5 | 28,9–36,3 |
| Animal | 200 | 108 | 54,0 | 47,1–60,8 |
| Planta | 200 | 55 | 27,5 | 21,8–34,1 |
| Bactéria | 200 | 32 | 16,0 | 11,6–21,7 |
Falsa aceitação: a LUA descreveu como real um animal, uma planta ou uma bactéria que não existe. Menor é melhor. O erro se concentra em animais.
Como foi rodado.
| Chamada | LUA Genesys PI House, genesys-pi-house, API pública api.lua.vision, esforço de raciocínio medium. Sem temperatura, sem teto de tokens, sem prompt extra, sem busca e sem ferramentas. |
|---|---|
| Dataset | HalluLens, tarefa NonExistentRefusal, MixedEntities, commit 80307ac6, gerador oficial com semente 0 e 200 nomes por domínio. arXiv 2504.17550 |
| Itens | 600. O script oficial usa 10 nomes por domínio; aqui são 200, para o intervalo ficar útil. A resposta não é cortada em 256 tokens como na inferência oficial. O domínio de medicamentos ficou fora: a fonte exige conta no Kaggle. GeneratedEntities ficou fora: exige API de busca paga. |
| Juiz | Juiz automático com o prompt oficial do benchmark, sem o modelo juiz original. O juiz que corrigiu as respostas não é o mesmo que os autores do benchmark usaram. O prompt de correção é o oficial, sem mudança, mas outro juiz pode classificar a mesma resposta de outro jeito. Isso pode mover os números para cima ou para baixo. |
| Execuções | Uma por item. Recusa da própria API (HTTP 400, política de segurança) é resposta final e fica contada à parte. |
| Intervalo | Wilson para proporções. Bootstrap percentil com 2.000 reamostragens e semente fixa para F1, Omniscience Index, ECE e Brier. |
Pacote e arquivos.
O pacote traz o código que chama o modelo, monta cada teste e calcula as métricas, os conjuntos gerados e a tabela agregada. Os arquivos de resultado por item ficam fora nesta versão pública, porque cada linha registra qual juiz corrigiu o item. O SHA-256 de cada um está abaixo, igual ao da tabela da rodada.
ff68d8db16a4d3944e635b50a4a9b28f7009fb0cb94fa37510c1e579681b0f82| Arquivo | Tamanho | Baixar |
|---|---|---|
registro-veracidade-2026-09.tar.gz | 41 KB | Baixar |
hallulens_mixed_semente0_n200.jsonl · SHA-256 c2c11d849a74f550eaa14b3f06de0b6f855cc796fb566b4263c178544a34a5d5 | 90 KB | Baixar |
hallulens_fonte.json · SHA-256 2091130d9bd8e4b2e69ac9e1e5d0305fe11d7c2215ce2e3cf10805689314d295 | 1 KB | Baixar |
| Resultado por item | SHA-256 | Baixar |
|---|---|---|
resultados/hallulens.house.jsonl | 0ace3bda4aef2f948b5bebb878d5452913dd68055aa5cd7fece45f23869325ca | retido: traz o nome do juiz |
Ficaram fora desta versão pública, pelo mesmo motivo: modelos.mjs, benches/abstention.mjs, benches/hallulens.mjs, benches/omniscience.mjs, benches/orbench.mjs, benches/orbench_hard_j2.mjs, benches/orbench_toxic_j2.mjs, benches/simpleqa.mjs, benches/simpleqa_conf.mjs, benches/xstest.mjs, README.md, colunas.json, tabela.json. Sem eles, o pacote não roda sozinho. A versão completa depende de uma decisão pendente sobre nomear o juiz.
Limitações.
- Conjunto dinâmico: duas rodadas não usam as mesmas perguntas. A comparação vale dentro da mesma semente.
- O juiz que corrigiu as respostas não é o mesmo que os autores do benchmark usaram. O prompt de correção é o oficial, sem mudança, mas outro juiz pode classificar a mesma resposta de outro jeito. Isso pode mover os números para cima ou para baixo.