LUA VISION

Ticket-Bench em português: o agente compra o ingresso.

Um agente recebe o pedido de um torcedor, consulta partidas e preços por ferramentas num ambiente simulado e compra o ingresso. Conta acerto quando a compra final é igual à esperada, numa tentativa (pass@1).

Registro LUA · rodado pela LUA Vision · não é avaliação independente

Resultados.

Em cada linha, o melhor valor fica destacado. Atenção ao sentido: em algumas métricas, quanto menor, melhor (alucinação, recusa indevida, erro de calibração).

ModeloAcerto (%)
↑ maior é melhor
IC 95%RespondidasRecusadas ou barradasSem resposta
LUA Genesys PI House87,4melhor76,0–96,815100
GPT-5.586,173,9–96,515100
GPT-5.486,874,8–96,615100
Grok 4.6‡——390112
DeepSeek-V4-Pro85,474,5–95,115100
Kimi K2.684,873,0–95,315100

Acerto (%) · maior é melhor

LUA Genesys PI House
melhor resultado87,4IC 76,0–96,8
GPT-5.4
86,8IC 74,8–96,6
GPT-5.5
86,1IC 73,9–96,5
DeepSeek-V4-Pro
85,4IC 74,5–95,1
Kimi K2.6
84,8IC 73,0–95,3
Grok 4.6 ‡
—

Eixo de 65 a 100. Barra preta: intervalo de confiança de 95%.

‡ Erro do ambiente com page_number: toda chamada falhou. Ver defeitos.n = 151. Intervalo de 95% por bootstrap percentil, 4.000 reamostragens, semente fixa. As variações de um mesmo modelo de pergunta são reamostradas juntas, porque não são independentes.O Sabiá 4 aparece só onde o protocolo publicado pelo fornecedor é comparável: múltipla escolha com acerto exato.

Os erros do dataset público em português, descritos abaixo, pesam sobre todos os modelos da mesma forma. O paper do Ticket-Bench publica GPT-5 com 0,87 em português, o mesmo nível desta rodada. Compare os modelos desta tabela entre si.

Como foi rodado.

Data24/09/2026
DatasetTropicAI-Research/Ticket-Bench, commit 7318bc718a07
Itens151. Nenhum excluído.
PontuaçãoCompra final igual à esperada (pass@1). Sem juiz.
ExecuçõesUma por item, pass@1.
FalhasPergunta sem resposta conta zero e fica no denominador. Isso inclui recusa do filtro de conteúdo do provedor e recusa da própria coluna.
IntervaloIntervalo de 95% por bootstrap percentil, 4.000 reamostragens, semente fixa. As variações de um mesmo modelo de pergunta são reamostradas juntas, porque não são independentes.

Configuração por modelo.

Todos os modelos receberam as mesmas mensagens, pela API comercial de cada fornecedor ou da nuvem onde o modelo está publicado, na mesma data. Nenhum prompt de sistema extra, nenhuma temperatura, nenhuma ferramenta além das que o benchmark define.

ModeloAcessoEsforço de raciocínio
LUA Genesys PI HouseAPI pública api.lua.visionmedium
GPT-5.5API comercialmedium
GPT-5.4API comercialmedium
Grok 4.6API comercialpadrão do modelo
DeepSeek-V4-ProAPI comercialpadrão do modelo
Kimi K2.6API comercialpadrão do modelo

Decisões de protocolo.

  • O código original manda temperatura 0,7. Modelos de raciocínio recusam esse parâmetro, então nenhuma coluna recebe temperatura.
  • Estado, ferramentas, prompt de sistema, limite de 20 iterações e a rotina de avaliação são os do repositório dos autores, importados direto do clone.

Defeitos achados nos dados.

  • Dados em português: o modelo de pergunta 12 foi traduzido como "próximo jogo" quando o original pede o "mais barato", e os gabaritos das perguntas 6, 11 e 17 não seguem a pergunta nem a tabela de classificação em português do próprio repositório.
  • Ambiente: a ferramenta listar_partidas declara page_number como number, mas o código dos autores usa o valor para fatiar a lista e exige inteiro. Modelo que manda 1.0, válido pelo esquema, recebe erro em toda chamada e esgota as 20 iterações. Aconteceu só com o Grok 4.6, que sai deste placar como não comparável. As outras colunas mandam inteiro e nunca chegaram ao limite.

Contaminação.

Os itens estão em datasets públicos. Qualquer coluna, a da LUA inclusive, pode ter visto essas questões em treino. Esta rodada não mediu contaminação, e o número deve ser lido como teto do que o modelo sabe sobre o assunto, não como prova de raciocínio sobre item inédito.

Limitações.

  • Uma execução por item. A variação entre execuções do mesmo modelo não foi medida.
  • Um prompt de múltipla escolha só, zero-shot. Outro prompt pode mudar a ordem das colunas.
  • O número vale para o modelo servido pela API em 24/09/2026. Versão nova pede rodada nova.
  • Questões com imagem ficaram fora para todas as colunas. O resultado não diz nada sobre leitura de figura.

Reproduzir.

O pacote traz o código que chama os modelos, o que monta cada prova, o que pontua e o que gera a tabela, mais a tabela agregada desta rodada. Os dados são baixados por preparar_dados.py nas versões exatas e conferidos por SHA-256. Se um byte mudar, o script para.

Com Python 3 e Node 20 ou mais novo:

tar -xzf bancada-brasil-2026-09.tar.gz && cd bancada-brasil-2026-09
shasum -a 256 -c <(sed -n '/^Arquivos deste pacote/,/^$/p' VERIFICAR.txt | grep -E '^[0-9a-f]{64}')
pip install huggingface_hub pyarrow
python3 preparar_dados.py          # baixa, normaliza e confere SHA-256
export LUA_API_KEY=...             # chave de avaliação da API LUA
python3 ticket_run.py --modelo house
node tabela.mjs
bancada-brasil-2026-09.tar.gz1144df20af11b5c0141614c256fa1733c698bf829be3303842839ec149a1f81111 KB · As respostas cruas por item não estão neste pacote.
ArquivoTamanhoBaixar
bancada-brasil-2026-09.tar.gz11 KBBaixar
resultados-agregados.json7 KBBaixar
VERIFICAR.txt1 KBBaixar

Histórico.

24/09/2026 · primeira rodada, publicada nesta página.