Ticket-Bench em português: o agente compra o ingresso.
Um agente recebe o pedido de um torcedor, consulta partidas e preços por ferramentas num ambiente simulado e compra o ingresso. Conta acerto quando a compra final é igual à esperada, numa tentativa (pass@1).
Resultados.
Em cada linha, o melhor valor fica destacado. Atenção ao sentido: em algumas métricas, quanto menor, melhor (alucinação, recusa indevida, erro de calibração).
| Modelo | Acerto (%) ↑ maior é melhor | IC 95% | Respondidas | Recusadas ou barradas | Sem resposta |
|---|---|---|---|---|---|
| LUA Genesys PI House | 87,4melhor | 76,0–96,8 | 151 | 0 | 0 |
| GPT-5.5 | 86,1 | 73,9–96,5 | 151 | 0 | 0 |
| GPT-5.4 | 86,8 | 74,8–96,6 | 151 | 0 | 0 |
| Grok 4.6‡ | — | — | 39 | 0 | 112 |
| DeepSeek-V4-Pro | 85,4 | 74,5–95,1 | 151 | 0 | 0 |
| Kimi K2.6 | 84,8 | 73,0–95,3 | 151 | 0 | 0 |
Acerto (%) · maior é melhor
Eixo de 65 a 100. Barra preta: intervalo de confiança de 95%.
Os erros do dataset público em português, descritos abaixo, pesam sobre todos os modelos da mesma forma. O paper do Ticket-Bench publica GPT-5 com 0,87 em português, o mesmo nível desta rodada. Compare os modelos desta tabela entre si.
Como foi rodado.
| Data | 24/09/2026 |
|---|---|
| Dataset | TropicAI-Research/Ticket-Bench, commit 7318bc718a07 |
| Itens | 151. Nenhum excluído. |
| Pontuação | Compra final igual à esperada (pass@1). Sem juiz. |
| Execuções | Uma por item, pass@1. |
| Falhas | Pergunta sem resposta conta zero e fica no denominador. Isso inclui recusa do filtro de conteúdo do provedor e recusa da própria coluna. |
| Intervalo | Intervalo de 95% por bootstrap percentil, 4.000 reamostragens, semente fixa. As variações de um mesmo modelo de pergunta são reamostradas juntas, porque não são independentes. |
Configuração por modelo.
Todos os modelos receberam as mesmas mensagens, pela API comercial de cada fornecedor ou da nuvem onde o modelo está publicado, na mesma data. Nenhum prompt de sistema extra, nenhuma temperatura, nenhuma ferramenta além das que o benchmark define.
| Modelo | Acesso | Esforço de raciocínio |
|---|---|---|
| LUA Genesys PI House | API pública api.lua.vision | medium |
| GPT-5.5 | API comercial | medium |
| GPT-5.4 | API comercial | medium |
| Grok 4.6 | API comercial | padrão do modelo |
| DeepSeek-V4-Pro | API comercial | padrão do modelo |
| Kimi K2.6 | API comercial | padrão do modelo |
Decisões de protocolo.
- O código original manda temperatura 0,7. Modelos de raciocínio recusam esse parâmetro, então nenhuma coluna recebe temperatura.
- Estado, ferramentas, prompt de sistema, limite de 20 iterações e a rotina de avaliação são os do repositório dos autores, importados direto do clone.
Defeitos achados nos dados.
- Dados em português: o modelo de pergunta 12 foi traduzido como "próximo jogo" quando o original pede o "mais barato", e os gabaritos das perguntas 6, 11 e 17 não seguem a pergunta nem a tabela de classificação em português do próprio repositório.
- Ambiente: a ferramenta listar_partidas declara page_number como number, mas o código dos autores usa o valor para fatiar a lista e exige inteiro. Modelo que manda 1.0, válido pelo esquema, recebe erro em toda chamada e esgota as 20 iterações. Aconteceu só com o Grok 4.6, que sai deste placar como não comparável. As outras colunas mandam inteiro e nunca chegaram ao limite.
Contaminação.
Os itens estão em datasets públicos. Qualquer coluna, a da LUA inclusive, pode ter visto essas questões em treino. Esta rodada não mediu contaminação, e o número deve ser lido como teto do que o modelo sabe sobre o assunto, não como prova de raciocínio sobre item inédito.
Limitações.
- Uma execução por item. A variação entre execuções do mesmo modelo não foi medida.
- Um prompt de múltipla escolha só, zero-shot. Outro prompt pode mudar a ordem das colunas.
- O número vale para o modelo servido pela API em 24/09/2026. Versão nova pede rodada nova.
- Questões com imagem ficaram fora para todas as colunas. O resultado não diz nada sobre leitura de figura.
Reproduzir.
O pacote traz o código que chama os modelos, o que monta cada prova, o que pontua e o que gera a tabela, mais a tabela agregada desta rodada. Os dados são baixados por preparar_dados.py nas versões exatas e conferidos por SHA-256. Se um byte mudar, o script para.
Com Python 3 e Node 20 ou mais novo:
tar -xzf bancada-brasil-2026-09.tar.gz && cd bancada-brasil-2026-09
shasum -a 256 -c <(sed -n '/^Arquivos deste pacote/,/^$/p' VERIFICAR.txt | grep -E '^[0-9a-f]{64}')
pip install huggingface_hub pyarrow
python3 preparar_dados.py # baixa, normaliza e confere SHA-256
export LUA_API_KEY=... # chave de avaliação da API LUA
python3 ticket_run.py --modelo house
node tabela.mjs1144df20af11b5c0141614c256fa1733c698bf829be3303842839ec149a1f81111 KB · As respostas cruas por item não estão neste pacote.Histórico.
24/09/2026 · primeira rodada, publicada nesta página.