LUA VISION

SimpleQA Verified

Mil perguntas curtas de fato, com resposta verificável e sem busca. O modelo pode acertar, errar ou não tentar. Mede se ele chuta quando não sabe.

RodadoRegistro LUA · rodado pela LUA Vision · não é avaliação independente

Resultados.

Comparação com juiz automático único por benchmark, o mesmo para os seis modelos, fora das famílias avaliadas, com o prompt oficial do benchmark. A LUA entra com as mesmas respostas do registro de 25/09/2026, corrigidas de novo por esse juiz. O registro isolado de 25/09 usou outros juízes; os números dele estão mais abaixo nesta página.

Em cada linha, o melhor valor fica destacado. Atenção ao sentido: em algumas métricas, quanto menor, melhor (alucinação, recusa indevida, erro de calibração).

ModeloF1
↑ maior é melhor
Acurácia (%)
↑ maior é melhor
Não tentou (%)Acerto quando tentou (%)
↑ maior é melhor
ECE ×100 (erro de calibração)
↓ menor é melhor
Brier
↓ menor é melhor
LUA Genesys PI House75,272,0–78,0melhor72,169,2–74,8melhor8,36,7–10,278,675,9–81,2melhor12,410,3–14,80,1530,140–0,170melhor
GPT-5.565,563,0–68,065,462,4–68,30,30,1–0,965,662,6–68,516,814,1–19,30,2020,180–0,220
GPT-5.445,943,0–49,045,542,4–48,61,61,0–2,646,243,1–49,414,512,0–17,20,1970,180–0,210
Grok 4.655,352,0–58,054,951,8–58,01,61,0–2,655,852,7–58,910,99,0–14,10,2130,200–0,230
DeepSeek-V4-Pro46,243,0–49,044,841,7–47,96,14,8–7,847,744,5–50,933,430,5–36,40,3300,310–0,350
Kimi K2.639,937,0–43,035,532,6–38,522,219,7–24,945,642,2–49,111,69,3–14,40,1880,170–0,200
Sabiá 4 Thinking——————

F1 · maior é melhor

LUA Genesys PI House
melhor resultado75,2IC 72,0–78,0
GPT-5.5
65,5IC 63,0–68,0
Grok 4.6
55,3IC 52,0–58,0
DeepSeek-V4-Pro
46,2IC 43,0–49,0
GPT-5.4
45,9IC 43,0–49,0
Kimi K2.6
39,9IC 37,0–43,0

Eixo de 30 a 85. Barra preta: intervalo de confiança de 95%.

A linha pequena em cada célula é o IC 95%.Não tentou e abstenção não têm sentido de melhor: aparecem para ler a acurácia e a alucinação junto.O Sabiá 4 aparece só onde o protocolo publicado pelo fornecedor é comparável: múltipla escolha com acerto exato.

Referências externas

Publicado por terceiros (www.kaggle.com, acesso em 26/09/2026): GPT-5.4, Score (%) 30,5. Juiz e configuração diferentes dos desta página.

Arquivos da comparação

Resultado por itemSHA-256Baixar
resultados/simpleqa.house.jsonl4bf96842d6d64026ea3b62f35d0158056af4dc4fe0fa3e36d411922f7cf48492retido: traz o nome do juiz
resultados/simpleqa.gpt55.jsonl715d4903057616edcc49a722f132b0f6c94646fb295cbf67487db85f7a148967retido: traz o nome do juiz
resultados/simpleqa.gpt54.jsonl040db462820c1b17dd87e54d589a53cb4ec57195661a60e7726bb1ad02f7ee11retido: traz o nome do juiz
resultados/simpleqa.grok.jsonl3b5bc95969f86c868755b5abd1f672ac3e863af2bd13d523bc74d6d6206d17f0retido: traz o nome do juiz
resultados/simpleqa.deepseek.jsonlcbc62179b0b54a9854d1b55f79a81f4422a84423639845c2baa6377a7a1aa0e0retido: traz o nome do juiz
resultados/simpleqa.kimi.jsonld5de43ae0dc1fd27103c64a0b526948d05b7515f78a9aa39d406c1f27312bd68retido: traz o nome do juiz
resultados/simpleqa_conf.house.rejulgado.jsonle5c399079556bcb992b5356111cd41f0018c6531e5a19e9f967c8768f964a987retido: traz o nome do juiz
resultados/simpleqa_conf.gpt55.jsonle12bc360df7519ce9c8f678ca24ca3ca1a8225c773dca9907a3005c29738e01aretido: traz o nome do juiz
resultados/simpleqa_conf.gpt54.jsonl9550cc0c2e5e18f98676b1c26fc07dac96f7bf0dc82f4a95bb132fc8a92bfe85retido: traz o nome do juiz
resultados/simpleqa_conf.grok.jsonlb6796a56d4d686df5561570423b252893061eacd94f14249670684e8e52a3d9cretido: traz o nome do juiz
resultados/simpleqa_conf.deepseek.jsonld4324f242ecb44a6e32a69fe02afb949e8b1d56fbc1f050cf6e34467673d51cdretido: traz o nome do juiz
resultados/simpleqa_conf.kimi.jsonlb85a95a3cb967006dd5423ba65ebf4f2387fea11922c1b21ee3675c27db2468fretido: traz o nome do juiz

Como a comparação foi rodada.

Todos os modelos receberam só a pergunta, pela API comercial de cada fornecedor, sem prompt extra, sem busca e sem ferramentas. Uma execução por item. Pergunta sem resposta conta no denominador.

Bloqueio do provedor: quando o filtro de conteúdo do fornecedor recusa o pedido antes de o modelo responder (HTTP 400 ou filtro declarado), o item vale como recusa ou abstenção, conforme o benchmark, e fica contado à parte, por modelo, na tabela abaixo.

ModeloAcessoEsforço de raciocínioBloqueios do provedorSem resposta
LUA Genesys PI HouseAPI pública api.lua.visionmedium00
GPT-5.5API comercialmedium00
GPT-5.4API comercialmedium00
Grok 4.6API comercialpadrão do modelo00
DeepSeek-V4-ProAPI comercialpadrão do modelo20
Kimi K2.6API comercialpadrão do modelo60

Registro isolado de 25/09/2026.

Só a LUA, com os juízes daquela rodada, diferentes do juiz da comparação acima. Os números não se comparam com a tabela de cima.

MétricaValorIC 95%
F175,272,0–78,0
Acurácia (%)72,169,2–74,8
Não tentou (%)8,36,7–10,2
Acerto quando tentou (%)78,675,9–81,2
Erro quando tentou (%)21,418,8–24,1

n = 1.000: 721 certas, 196 erradas, 83 sem tentativa. O erro quando tentou é o complemento do acerto quando tentou, com o mesmo intervalo espelhado. Não tentou sai sempre ao lado da acurácia: quem não tenta nada zera o erro.

Calibração.

Segunda passada com o prompt do paper do SimpleQA que pede a resposta e uma confiança de 0 a 100. Protocolo LUA sobre o dataset SimpleQA Verified. Esta passada pede um palpite, então a acurácia dela não substitui a da primeira.

Achado: a LUA declara mais confiança do que acerta. Na passada com confiança, a confiança média foi 85,5 e o acerto foi 73,4%. Nas 692 respostas com confiança de 90 a 100, acertou 88,9%. Abaixo de 80 de confiança, o acerto fica entre 6% e 35%, bem abaixo do que ela declara.

MétricaValorIC 95%
ECE, 10 faixas (pontos)12,6710,64–15,11
Brier0,1530,130–0,170
Acurácia nesta passada (%)73,470,6–76,0
Confiança média85,5—
Diagrama de confiabilidadeAcerto por faixa de confiança declarada, com a diagonal da calibração perfeita. Os valores estão na tabela abaixo.002020404060608080100100n=18n=14n=33n=17n=13n=22n=29n=33n=129n=692Confiança declarada (%)Acerto (%)

acerto da faixaconfiança média da faixacalibração perfeita

FaixanConfiança médiaAcerto (%)
0-10183,35,6
10-201413,628,6
20-303322,69,1
30-401734,635,3
40-501343,030,8
50-602255,531,8
60-702963,624,1
70-803375,233,3
80-9012985,558,9
90-10069296,688,9

Diagrama desenhado a partir do arquivo de resultado da passada de confiança (última linha julgada de cada item), conferido contra a tabela da rodada.

Como foi rodado.

ChamadaLUA Genesys PI House, genesys-pi-house, API pública api.lua.vision, esforço de raciocínio medium. Sem temperatura, sem teto de tokens, sem prompt extra, sem busca e sem ferramentas.
DatasetSimpleQA Verified, 1.000 perguntas, revisão 0dc97e0d. arXiv 2509.07968
Itens1.000 de 1.000.
JuizJuiz automático com o prompt oficial do benchmark, sem o modelo juiz original. O juiz que corrigiu as respostas não é o mesmo que os autores do benchmark usaram. O prompt de correção é o oficial, sem mudança, mas outro juiz pode classificar a mesma resposta de outro jeito. Isso pode mover os números para cima ou para baixo.
ExecuçõesUma por item. Recusa da própria API (HTTP 400, política de segurança) é resposta final e fica contada à parte.
IntervaloWilson para proporções. Bootstrap percentil com 2.000 reamostragens e semente fixa para F1, Omniscience Index, ECE e Brier.

Pacote e arquivos.

O pacote traz o código que chama o modelo, monta cada teste e calcula as métricas, os conjuntos gerados e a tabela agregada. Os arquivos de resultado por item ficam fora nesta versão pública, porque cada linha registra qual juiz corrigiu o item. O SHA-256 de cada um está abaixo, igual ao da tabela da rodada.

registro-veracidade-2026-09.tar.gzff68d8db16a4d3944e635b50a4a9b28f7009fb0cb94fa37510c1e579681b0f82
ArquivoTamanhoBaixar
registro-veracidade-2026-09.tar.gz41 KBBaixar
Resultado por itemSHA-256Baixar
resultados/simpleqa.house.jsonl4bf96842d6d64026ea3b62f35d0158056af4dc4fe0fa3e36d411922f7cf48492retido: traz o nome do juiz
resultados/simpleqa_conf.house.jsonldfe064c29b9fa9fec347a38365a3fa9e8c7a24606c84cd3f5557e3b1d1fd2969retido: traz o nome do juiz

Ficaram fora desta versão pública, pelo mesmo motivo: modelos.mjs, benches/abstention.mjs, benches/hallulens.mjs, benches/omniscience.mjs, benches/orbench.mjs, benches/orbench_hard_j2.mjs, benches/orbench_toxic_j2.mjs, benches/simpleqa.mjs, benches/simpleqa_conf.mjs, benches/xstest.mjs, README.md, colunas.json, tabela.json. Sem eles, o pacote não roda sozinho. A versão completa depende de uma decisão pendente sobre nomear o juiz.

Limitações.

  • Perguntas em inglês. Mede memória, não busca.
  • O juiz que corrigiu as respostas não é o mesmo que os autores do benchmark usaram. O prompt de correção é o oficial, sem mudança, mas outro juiz pode classificar a mesma resposta de outro jeito. Isso pode mover os números para cima ou para baixo.