SimpleQA Verified
Mil perguntas curtas de fato, com resposta verificável e sem busca. O modelo pode acertar, errar ou não tentar. Mede se ele chuta quando não sabe.
Resultados.
Comparação com juiz automático único por benchmark, o mesmo para os seis modelos, fora das famílias avaliadas, com o prompt oficial do benchmark. A LUA entra com as mesmas respostas do registro de 25/09/2026, corrigidas de novo por esse juiz. O registro isolado de 25/09 usou outros juízes; os números dele estão mais abaixo nesta página.
Em cada linha, o melhor valor fica destacado. Atenção ao sentido: em algumas métricas, quanto menor, melhor (alucinação, recusa indevida, erro de calibração).
| Modelo | F1 ↑ maior é melhor | Acurácia (%) ↑ maior é melhor | Não tentou (%) | Acerto quando tentou (%) ↑ maior é melhor | ECE ×100 (erro de calibração) ↓ menor é melhor | Brier ↓ menor é melhor |
|---|---|---|---|---|---|---|
| LUA Genesys PI House | 75,272,0–78,0melhor | 72,169,2–74,8melhor | 8,36,7–10,2 | 78,675,9–81,2melhor | 12,410,3–14,8 | 0,1530,140–0,170melhor |
| GPT-5.5 | 65,563,0–68,0 | 65,462,4–68,3 | 0,30,1–0,9 | 65,662,6–68,5 | 16,814,1–19,3 | 0,2020,180–0,220 |
| GPT-5.4 | 45,943,0–49,0 | 45,542,4–48,6 | 1,61,0–2,6 | 46,243,1–49,4 | 14,512,0–17,2 | 0,1970,180–0,210 |
| Grok 4.6 | 55,352,0–58,0 | 54,951,8–58,0 | 1,61,0–2,6 | 55,852,7–58,9 | 10,99,0–14,1 | 0,2130,200–0,230 |
| DeepSeek-V4-Pro | 46,243,0–49,0 | 44,841,7–47,9 | 6,14,8–7,8 | 47,744,5–50,9 | 33,430,5–36,4 | 0,3300,310–0,350 |
| Kimi K2.6 | 39,937,0–43,0 | 35,532,6–38,5 | 22,219,7–24,9 | 45,642,2–49,1 | 11,69,3–14,4 | 0,1880,170–0,200 |
| Sabiá 4 Thinking | — | — | — | — | — | — |
F1 · maior é melhor
Eixo de 30 a 85. Barra preta: intervalo de confiança de 95%.
Referências externas
Publicado por terceiros (www.kaggle.com, acesso em 26/09/2026): GPT-5.4, Score (%) 30,5. Juiz e configuração diferentes dos desta página.
Arquivos da comparação
| Resultado por item | SHA-256 | Baixar |
|---|---|---|
resultados/simpleqa.house.jsonl | 4bf96842d6d64026ea3b62f35d0158056af4dc4fe0fa3e36d411922f7cf48492 | retido: traz o nome do juiz |
resultados/simpleqa.gpt55.jsonl | 715d4903057616edcc49a722f132b0f6c94646fb295cbf67487db85f7a148967 | retido: traz o nome do juiz |
resultados/simpleqa.gpt54.jsonl | 040db462820c1b17dd87e54d589a53cb4ec57195661a60e7726bb1ad02f7ee11 | retido: traz o nome do juiz |
resultados/simpleqa.grok.jsonl | 3b5bc95969f86c868755b5abd1f672ac3e863af2bd13d523bc74d6d6206d17f0 | retido: traz o nome do juiz |
resultados/simpleqa.deepseek.jsonl | cbc62179b0b54a9854d1b55f79a81f4422a84423639845c2baa6377a7a1aa0e0 | retido: traz o nome do juiz |
resultados/simpleqa.kimi.jsonl | d5de43ae0dc1fd27103c64a0b526948d05b7515f78a9aa39d406c1f27312bd68 | retido: traz o nome do juiz |
resultados/simpleqa_conf.house.rejulgado.jsonl | e5c399079556bcb992b5356111cd41f0018c6531e5a19e9f967c8768f964a987 | retido: traz o nome do juiz |
resultados/simpleqa_conf.gpt55.jsonl | e12bc360df7519ce9c8f678ca24ca3ca1a8225c773dca9907a3005c29738e01a | retido: traz o nome do juiz |
resultados/simpleqa_conf.gpt54.jsonl | 9550cc0c2e5e18f98676b1c26fc07dac96f7bf0dc82f4a95bb132fc8a92bfe85 | retido: traz o nome do juiz |
resultados/simpleqa_conf.grok.jsonl | b6796a56d4d686df5561570423b252893061eacd94f14249670684e8e52a3d9c | retido: traz o nome do juiz |
resultados/simpleqa_conf.deepseek.jsonl | d4324f242ecb44a6e32a69fe02afb949e8b1d56fbc1f050cf6e34467673d51cd | retido: traz o nome do juiz |
resultados/simpleqa_conf.kimi.jsonl | b85a95a3cb967006dd5423ba65ebf4f2387fea11922c1b21ee3675c27db2468f | retido: traz o nome do juiz |
Como a comparação foi rodada.
Todos os modelos receberam só a pergunta, pela API comercial de cada fornecedor, sem prompt extra, sem busca e sem ferramentas. Uma execução por item. Pergunta sem resposta conta no denominador.
Bloqueio do provedor: quando o filtro de conteúdo do fornecedor recusa o pedido antes de o modelo responder (HTTP 400 ou filtro declarado), o item vale como recusa ou abstenção, conforme o benchmark, e fica contado à parte, por modelo, na tabela abaixo.
| Modelo | Acesso | Esforço de raciocínio | Bloqueios do provedor | Sem resposta |
|---|---|---|---|---|
| LUA Genesys PI House | API pública api.lua.vision | medium | 0 | 0 |
| GPT-5.5 | API comercial | medium | 0 | 0 |
| GPT-5.4 | API comercial | medium | 0 | 0 |
| Grok 4.6 | API comercial | padrão do modelo | 0 | 0 |
| DeepSeek-V4-Pro | API comercial | padrão do modelo | 2 | 0 |
| Kimi K2.6 | API comercial | padrão do modelo | 6 | 0 |
Registro isolado de 25/09/2026.
Só a LUA, com os juízes daquela rodada, diferentes do juiz da comparação acima. Os números não se comparam com a tabela de cima.
| Métrica | Valor | IC 95% |
|---|---|---|
| F1 | 75,2 | 72,0–78,0 |
| Acurácia (%) | 72,1 | 69,2–74,8 |
| Não tentou (%) | 8,3 | 6,7–10,2 |
| Acerto quando tentou (%) | 78,6 | 75,9–81,2 |
| Erro quando tentou (%) | 21,4 | 18,8–24,1 |
n = 1.000: 721 certas, 196 erradas, 83 sem tentativa. O erro quando tentou é o complemento do acerto quando tentou, com o mesmo intervalo espelhado. Não tentou sai sempre ao lado da acurácia: quem não tenta nada zera o erro.
Calibração.
Segunda passada com o prompt do paper do SimpleQA que pede a resposta e uma confiança de 0 a 100. Protocolo LUA sobre o dataset SimpleQA Verified. Esta passada pede um palpite, então a acurácia dela não substitui a da primeira.
Achado: a LUA declara mais confiança do que acerta. Na passada com confiança, a confiança média foi 85,5 e o acerto foi 73,4%. Nas 692 respostas com confiança de 90 a 100, acertou 88,9%. Abaixo de 80 de confiança, o acerto fica entre 6% e 35%, bem abaixo do que ela declara.
| Métrica | Valor | IC 95% |
|---|---|---|
| ECE, 10 faixas (pontos) | 12,67 | 10,64–15,11 |
| Brier | 0,153 | 0,130–0,170 |
| Acurácia nesta passada (%) | 73,4 | 70,6–76,0 |
| Confiança média | 85,5 | — |
acerto da faixaconfiança média da faixacalibração perfeita
| Faixa | n | Confiança média | Acerto (%) |
|---|---|---|---|
| 0-10 | 18 | 3,3 | 5,6 |
| 10-20 | 14 | 13,6 | 28,6 |
| 20-30 | 33 | 22,6 | 9,1 |
| 30-40 | 17 | 34,6 | 35,3 |
| 40-50 | 13 | 43,0 | 30,8 |
| 50-60 | 22 | 55,5 | 31,8 |
| 60-70 | 29 | 63,6 | 24,1 |
| 70-80 | 33 | 75,2 | 33,3 |
| 80-90 | 129 | 85,5 | 58,9 |
| 90-100 | 692 | 96,6 | 88,9 |
Diagrama desenhado a partir do arquivo de resultado da passada de confiança (última linha julgada de cada item), conferido contra a tabela da rodada.
Como foi rodado.
| Chamada | LUA Genesys PI House, genesys-pi-house, API pública api.lua.vision, esforço de raciocínio medium. Sem temperatura, sem teto de tokens, sem prompt extra, sem busca e sem ferramentas. |
|---|---|
| Dataset | SimpleQA Verified, 1.000 perguntas, revisão 0dc97e0d. arXiv 2509.07968 |
| Itens | 1.000 de 1.000. |
| Juiz | Juiz automático com o prompt oficial do benchmark, sem o modelo juiz original. O juiz que corrigiu as respostas não é o mesmo que os autores do benchmark usaram. O prompt de correção é o oficial, sem mudança, mas outro juiz pode classificar a mesma resposta de outro jeito. Isso pode mover os números para cima ou para baixo. |
| Execuções | Uma por item. Recusa da própria API (HTTP 400, política de segurança) é resposta final e fica contada à parte. |
| Intervalo | Wilson para proporções. Bootstrap percentil com 2.000 reamostragens e semente fixa para F1, Omniscience Index, ECE e Brier. |
Pacote e arquivos.
O pacote traz o código que chama o modelo, monta cada teste e calcula as métricas, os conjuntos gerados e a tabela agregada. Os arquivos de resultado por item ficam fora nesta versão pública, porque cada linha registra qual juiz corrigiu o item. O SHA-256 de cada um está abaixo, igual ao da tabela da rodada.
ff68d8db16a4d3944e635b50a4a9b28f7009fb0cb94fa37510c1e579681b0f82| Arquivo | Tamanho | Baixar |
|---|---|---|
registro-veracidade-2026-09.tar.gz | 41 KB | Baixar |
| Resultado por item | SHA-256 | Baixar |
|---|---|---|
resultados/simpleqa.house.jsonl | 4bf96842d6d64026ea3b62f35d0158056af4dc4fe0fa3e36d411922f7cf48492 | retido: traz o nome do juiz |
resultados/simpleqa_conf.house.jsonl | dfe064c29b9fa9fec347a38365a3fa9e8c7a24606c84cd3f5557e3b1d1fd2969 | retido: traz o nome do juiz |
Ficaram fora desta versão pública, pelo mesmo motivo: modelos.mjs, benches/abstention.mjs, benches/hallulens.mjs, benches/omniscience.mjs, benches/orbench.mjs, benches/orbench_hard_j2.mjs, benches/orbench_toxic_j2.mjs, benches/simpleqa.mjs, benches/simpleqa_conf.mjs, benches/xstest.mjs, README.md, colunas.json, tabela.json. Sem eles, o pacote não roda sozinho. A versão completa depende de uma decisão pendente sobre nomear o juiz.
Limitações.
- Perguntas em inglês. Mede memória, não busca.
- O juiz que corrigiu as respostas não é o mesmo que os autores do benchmark usaram. O prompt de correção é o oficial, sem mudança, mas outro juiz pode classificar a mesma resposta de outro jeito. Isso pode mover os números para cima ou para baixo.