LUA VISION

AbstentionBench

Se o modelo se abstém quando deve: pergunta sem resposta conhecida, subespecificada, com premissa falsa, subjetiva ou desatualizada.

RodadoRegistro LUA · rodado pela LUA Vision · não é avaliação independente

Resultados.

Comparação com juiz automático único por benchmark, o mesmo para os seis modelos, fora das famílias avaliadas, com o prompt oficial do benchmark. A LUA entra com as mesmas respostas do registro de 25/09/2026, corrigidas de novo por esse juiz. O registro isolado de 25/09 usou outros juízes; os números dele estão mais abaixo nesta página.

Em cada linha, o melhor valor fica destacado. Atenção ao sentido: em algumas métricas, quanto menor, melhor (alucinação, recusa indevida, erro de calibração).

ModeloF1 de abstenção
↑ maior é melhor
Recall
↑ maior é melhor
Precisão
↑ maior é melhor
LUA Genesys PI House72,569,8–75,0melhor64,961,7–68,0melhor82,179,0–84,8
GPT-5.567,864,8–70,654,651,3–57,989,386,4–91,7
GPT-5.465,762,7–68,653,550,1–56,885,382,0–88,0
Grok 4.666,263,4–69,152,248,9–55,690,487,5–92,7
DeepSeek-V4-Pro65,963,1–68,754,451,1–57,883,380,0–86,2
Kimi K2.670,768,1–73,360,457,1–63,685,182,1–87,8
Sabiá 4 Thinking———

F1 de abstenção · maior é melhor

LUA Genesys PI House
melhor resultado72,5IC 69,8–75,0
Kimi K2.6
70,7IC 68,1–73,3
GPT-5.5
67,8IC 64,8–70,6
Grok 4.6
66,2IC 63,4–69,1
DeepSeek-V4-Pro
65,9IC 63,1–68,7
GPT-5.4
65,7IC 62,7–68,6

Eixo de 60 a 80. Barra preta: intervalo de confiança de 95%.

A linha pequena em cada célula é o IC 95%.Itens julgados, quando não foram todos: DeepSeek-V4-Pro: 1999 de 2000; Grok 4.6: 1997 de 2000; Kimi K2.6: 1999 de 2000.O Sabiá 4 aparece só onde o protocolo publicado pelo fornecedor é comparável: múltipla escolha com acerto exato.

Arquivos da comparação

Resultado por itemSHA-256Baixar
resultados/abstention.house.rejulgado.jsonl0230d79a74260a4aced7d29571850a79970fe73bd2326485f6497231a099bbc2retido: traz o nome do juiz
resultados/abstention.gpt55.jsonl7c88a9f9e4875bc3cff1d4ecb15d49f481dfc2894746d54da47e70e08eef16d7retido: traz o nome do juiz
resultados/abstention.gpt54.jsonl8de18028f01b92631ee3488f0728fb18f8d87ec5c27e714563b0353d0d0cc6ffretido: traz o nome do juiz
resultados/abstention.grok.jsonl6bb01490b6656a6ff07a98d0a5d81df4f19c3ea744cc82c107fa6f622fa781d5retido: traz o nome do juiz
resultados/abstention.deepseek.jsonldceef4950539caa8a63705511bb0fd4547f27006409994fb18200ff058ffb0bbretido: traz o nome do juiz
resultados/abstention.kimi.jsonl38b2993bdd4919d40e310ccd8797669fad3a5f4d3e0e6bf595ba7aafca8b4afcretido: traz o nome do juiz

Como a comparação foi rodada.

Todos os modelos receberam só a pergunta, pela API comercial de cada fornecedor, sem prompt extra, sem busca e sem ferramentas. Uma execução por item. Pergunta sem resposta conta no denominador.

Bloqueio do provedor: quando o filtro de conteúdo do fornecedor recusa o pedido antes de o modelo responder (HTTP 400 ou filtro declarado), o item vale como recusa ou abstenção, conforme o benchmark, e fica contado à parte, por modelo, na tabela abaixo.

ModeloAcessoEsforço de raciocínioBloqueios do provedorSem resposta
LUA Genesys PI HouseAPI pública api.lua.visionmedium140
GPT-5.5API comercialmedium120
GPT-5.4API comercialmedium130
Grok 4.6API comercialpadrão do modelo142
DeepSeek-V4-ProAPI comercialpadrão do modelo221
Kimi K2.6API comercialpadrão do modelo241

Registro isolado de 25/09/2026.

Só a LUA, com os juízes daquela rodada, diferentes do juiz da comparação acima. Os números não se comparam com a tabela de cima.

MétricaValorIC 95%
Recall66,563,3–69,6
Precisão75,772,5–78,6
F170,868,3–73,4

n = 2.000. 855 itens pedem abstenção; a LUA se absteve em 752, e 569 dessas abstenções estavam certas. Recall e precisão saem juntos: abster em tudo dá recall alto e precisão baixa. 14 itens foram recusados pela própria API e contam como abstenção.

Por tipo de pergunta

TiponPedem abstençãoRecall (%)Precisão (%)
contexto subespecificado1.20751462,6 IC 58,4–66,784,7 IC 80,8–88,0
premissa falsa22112190,1 IC 83,5–94,282,6 IC 75,2–88,1
resposta desconhecida1516168,9 IC 56,4–79,167,7 IC 55,4–78,0
subjetiva1276826,5 IC 17,4–38,090,0 IC 69,9–97,2
intenção subespecificada1202295,5 IC 78,2–99,236,2 IC 25,1–49,1
desatualizada1042572,0 IC 52,4–85,731,0 IC 20,6–43,8
segurança504090,0 IC 76,9–96,097,3 IC 86,2–99,5
sem tipo definido no paper20475,0 IC 30,1–95,460,0 IC 23,1–88,2

Tipo com poucos itens que pedem abstenção tem intervalo largo. Leia o intervalo antes do número.

Como foi rodado.

ChamadaLUA Genesys PI House, genesys-pi-house, API pública api.lua.vision, esforço de raciocínio medium. Sem temperatura, sem teto de tokens, sem prompt extra, sem busca e sem ferramentas.
DatasetAbstentionBench, subconjunto rápido, commit e2918417: 20 datasets × 100 itens. arXiv 2506.09038
Itens2.000. O índice rápido lista 21 datasets. O Averitec ficou de fora porque não tem carregador no repositório do benchmark.
JuizJuiz automático com o prompt oficial do benchmark, sem o modelo juiz original. O juiz que corrigiu as respostas não é o mesmo que os autores do benchmark usaram. O prompt de correção é o oficial, sem mudança, mas outro juiz pode classificar a mesma resposta de outro jeito. Isso pode mover os números para cima ou para baixo.
ExecuçõesUma por item. Recusa da própria API (HTTP 400, política de segurança) é resposta final e fica contada à parte.
IntervaloWilson para proporções. Bootstrap percentil com 2.000 reamostragens e semente fixa para F1, Omniscience Index, ECE e Brier.

Pacote e arquivos.

O pacote traz o código que chama o modelo, monta cada teste e calcula as métricas, os conjuntos gerados e a tabela agregada. Os arquivos de resultado por item ficam fora nesta versão pública, porque cada linha registra qual juiz corrigiu o item. O SHA-256 de cada um está abaixo, igual ao da tabela da rodada.

registro-veracidade-2026-09.tar.gzff68d8db16a4d3944e635b50a4a9b28f7009fb0cb94fa37510c1e579681b0f82
ArquivoTamanhoBaixar
registro-veracidade-2026-09.tar.gz41 KBBaixar
Resultado por itemSHA-256Baixar
resultados/abstention.house.jsonld6ea6160050360e74d906e6163e71c9b4aa2b658383cd931b15d7b37d4f78ba5fora desta versão

Ficaram fora desta versão pública, pelo mesmo motivo: modelos.mjs, benches/abstention.mjs, benches/hallulens.mjs, benches/omniscience.mjs, benches/orbench.mjs, benches/orbench_hard_j2.mjs, benches/orbench_toxic_j2.mjs, benches/simpleqa.mjs, benches/simpleqa_conf.mjs, benches/xstest.mjs, README.md, colunas.json, tabela.json. Sem eles, o pacote não roda sozinho. A versão completa depende de uma decisão pendente sobre nomear o juiz.

Limitações.

  • Recall e precisão saem juntos: abster em tudo dá recall alto e precisão baixa.
  • O juiz que corrigiu as respostas não é o mesmo que os autores do benchmark usaram. O prompt de correção é o oficial, sem mudança, mas outro juiz pode classificar a mesma resposta de outro jeito. Isso pode mover os números para cima ou para baixo.