AbstentionBench
Se o modelo se abstém quando deve: pergunta sem resposta conhecida, subespecificada, com premissa falsa, subjetiva ou desatualizada.
Resultados.
Comparação com juiz automático único por benchmark, o mesmo para os seis modelos, fora das famílias avaliadas, com o prompt oficial do benchmark. A LUA entra com as mesmas respostas do registro de 25/09/2026, corrigidas de novo por esse juiz. O registro isolado de 25/09 usou outros juízes; os números dele estão mais abaixo nesta página.
Em cada linha, o melhor valor fica destacado. Atenção ao sentido: em algumas métricas, quanto menor, melhor (alucinação, recusa indevida, erro de calibração).
| Modelo | F1 de abstenção ↑ maior é melhor | Recall ↑ maior é melhor | Precisão ↑ maior é melhor |
|---|---|---|---|
| LUA Genesys PI House | 72,569,8–75,0melhor | 64,961,7–68,0melhor | 82,179,0–84,8 |
| GPT-5.5 | 67,864,8–70,6 | 54,651,3–57,9 | 89,386,4–91,7 |
| GPT-5.4 | 65,762,7–68,6 | 53,550,1–56,8 | 85,382,0–88,0 |
| Grok 4.6 | 66,263,4–69,1 | 52,248,9–55,6 | 90,487,5–92,7 |
| DeepSeek-V4-Pro | 65,963,1–68,7 | 54,451,1–57,8 | 83,380,0–86,2 |
| Kimi K2.6 | 70,768,1–73,3 | 60,457,1–63,6 | 85,182,1–87,8 |
| Sabiá 4 Thinking | — | — | — |
F1 de abstenção · maior é melhor
Eixo de 60 a 80. Barra preta: intervalo de confiança de 95%.
Arquivos da comparação
| Resultado por item | SHA-256 | Baixar |
|---|---|---|
resultados/abstention.house.rejulgado.jsonl | 0230d79a74260a4aced7d29571850a79970fe73bd2326485f6497231a099bbc2 | retido: traz o nome do juiz |
resultados/abstention.gpt55.jsonl | 7c88a9f9e4875bc3cff1d4ecb15d49f481dfc2894746d54da47e70e08eef16d7 | retido: traz o nome do juiz |
resultados/abstention.gpt54.jsonl | 8de18028f01b92631ee3488f0728fb18f8d87ec5c27e714563b0353d0d0cc6ff | retido: traz o nome do juiz |
resultados/abstention.grok.jsonl | 6bb01490b6656a6ff07a98d0a5d81df4f19c3ea744cc82c107fa6f622fa781d5 | retido: traz o nome do juiz |
resultados/abstention.deepseek.jsonl | dceef4950539caa8a63705511bb0fd4547f27006409994fb18200ff058ffb0bb | retido: traz o nome do juiz |
resultados/abstention.kimi.jsonl | 38b2993bdd4919d40e310ccd8797669fad3a5f4d3e0e6bf595ba7aafca8b4afc | retido: traz o nome do juiz |
Como a comparação foi rodada.
Todos os modelos receberam só a pergunta, pela API comercial de cada fornecedor, sem prompt extra, sem busca e sem ferramentas. Uma execução por item. Pergunta sem resposta conta no denominador.
Bloqueio do provedor: quando o filtro de conteúdo do fornecedor recusa o pedido antes de o modelo responder (HTTP 400 ou filtro declarado), o item vale como recusa ou abstenção, conforme o benchmark, e fica contado à parte, por modelo, na tabela abaixo.
| Modelo | Acesso | Esforço de raciocínio | Bloqueios do provedor | Sem resposta |
|---|---|---|---|---|
| LUA Genesys PI House | API pública api.lua.vision | medium | 14 | 0 |
| GPT-5.5 | API comercial | medium | 12 | 0 |
| GPT-5.4 | API comercial | medium | 13 | 0 |
| Grok 4.6 | API comercial | padrão do modelo | 14 | 2 |
| DeepSeek-V4-Pro | API comercial | padrão do modelo | 22 | 1 |
| Kimi K2.6 | API comercial | padrão do modelo | 24 | 1 |
Registro isolado de 25/09/2026.
Só a LUA, com os juízes daquela rodada, diferentes do juiz da comparação acima. Os números não se comparam com a tabela de cima.
| Métrica | Valor | IC 95% |
|---|---|---|
| Recall | 66,5 | 63,3–69,6 |
| Precisão | 75,7 | 72,5–78,6 |
| F1 | 70,8 | 68,3–73,4 |
n = 2.000. 855 itens pedem abstenção; a LUA se absteve em 752, e 569 dessas abstenções estavam certas. Recall e precisão saem juntos: abster em tudo dá recall alto e precisão baixa. 14 itens foram recusados pela própria API e contam como abstenção.
Por tipo de pergunta
| Tipo | n | Pedem abstenção | Recall (%) | Precisão (%) |
|---|---|---|---|---|
| contexto subespecificado | 1.207 | 514 | 62,6 IC 58,4–66,7 | 84,7 IC 80,8–88,0 |
| premissa falsa | 221 | 121 | 90,1 IC 83,5–94,2 | 82,6 IC 75,2–88,1 |
| resposta desconhecida | 151 | 61 | 68,9 IC 56,4–79,1 | 67,7 IC 55,4–78,0 |
| subjetiva | 127 | 68 | 26,5 IC 17,4–38,0 | 90,0 IC 69,9–97,2 |
| intenção subespecificada | 120 | 22 | 95,5 IC 78,2–99,2 | 36,2 IC 25,1–49,1 |
| desatualizada | 104 | 25 | 72,0 IC 52,4–85,7 | 31,0 IC 20,6–43,8 |
| segurança | 50 | 40 | 90,0 IC 76,9–96,0 | 97,3 IC 86,2–99,5 |
| sem tipo definido no paper | 20 | 4 | 75,0 IC 30,1–95,4 | 60,0 IC 23,1–88,2 |
Tipo com poucos itens que pedem abstenção tem intervalo largo. Leia o intervalo antes do número.
Como foi rodado.
| Chamada | LUA Genesys PI House, genesys-pi-house, API pública api.lua.vision, esforço de raciocínio medium. Sem temperatura, sem teto de tokens, sem prompt extra, sem busca e sem ferramentas. |
|---|---|
| Dataset | AbstentionBench, subconjunto rápido, commit e2918417: 20 datasets × 100 itens. arXiv 2506.09038 |
| Itens | 2.000. O índice rápido lista 21 datasets. O Averitec ficou de fora porque não tem carregador no repositório do benchmark. |
| Juiz | Juiz automático com o prompt oficial do benchmark, sem o modelo juiz original. O juiz que corrigiu as respostas não é o mesmo que os autores do benchmark usaram. O prompt de correção é o oficial, sem mudança, mas outro juiz pode classificar a mesma resposta de outro jeito. Isso pode mover os números para cima ou para baixo. |
| Execuções | Uma por item. Recusa da própria API (HTTP 400, política de segurança) é resposta final e fica contada à parte. |
| Intervalo | Wilson para proporções. Bootstrap percentil com 2.000 reamostragens e semente fixa para F1, Omniscience Index, ECE e Brier. |
Pacote e arquivos.
O pacote traz o código que chama o modelo, monta cada teste e calcula as métricas, os conjuntos gerados e a tabela agregada. Os arquivos de resultado por item ficam fora nesta versão pública, porque cada linha registra qual juiz corrigiu o item. O SHA-256 de cada um está abaixo, igual ao da tabela da rodada.
ff68d8db16a4d3944e635b50a4a9b28f7009fb0cb94fa37510c1e579681b0f82| Arquivo | Tamanho | Baixar |
|---|---|---|
registro-veracidade-2026-09.tar.gz | 41 KB | Baixar |
| Resultado por item | SHA-256 | Baixar |
|---|---|---|
resultados/abstention.house.jsonl | d6ea6160050360e74d906e6163e71c9b4aa2b658383cd931b15d7b37d4f78ba5 | fora desta versão |
Ficaram fora desta versão pública, pelo mesmo motivo: modelos.mjs, benches/abstention.mjs, benches/hallulens.mjs, benches/omniscience.mjs, benches/orbench.mjs, benches/orbench_hard_j2.mjs, benches/orbench_toxic_j2.mjs, benches/simpleqa.mjs, benches/simpleqa_conf.mjs, benches/xstest.mjs, README.md, colunas.json, tabela.json. Sem eles, o pacote não roda sozinho. A versão completa depende de uma decisão pendente sobre nomear o juiz.
Limitações.
- Recall e precisão saem juntos: abster em tudo dá recall alto e precisão baixa.
- O juiz que corrigiu as respostas não é o mesmo que os autores do benchmark usaram. O prompt de correção é o oficial, sem mudança, mas outro juiz pode classificar a mesma resposta de outro jeito. Isso pode mover os números para cima ou para baixo.