O que vale para toda régua da casa.
As réguas próprias da LUA medem o que nenhum benchmark público mede em português: direito, educação, saúde, criança e saber o que não sabe. Esta página junta as regras que valem para todas. Cada régua só registra o que difere.
Três camadas de conteúdo.
| Camada | Conteúdo | Publicada? |
|---|---|---|
| Oficial | Item de prova pública (OAB, INEP, conselhos) com gabarito definitivo. | Sim, com link para o caderno oficial. Tem risco de contaminação e a página diz qual. |
| Inédito aberto | Item escrito pela casa e revisado por especialista. | Sim, licença CC BY 4.0. Terceiro replica tudo. |
| Inédito privado | Mesmo processo, nunca publicado. | Não. Sai só o hash de cada item e o resultado agregado. |
No inédito, 40% abrem e 60% ficam privados. A cada rodada semestral, metade do privado passa para o aberto e entra lote novo no privado, escrito com a mesma matriz. O placar do privado continua comparável e resiste a quem treina em cima do teste.
Contaminação.
- Todo item oficial leva a data de publicação da prova. A página separa o que saiu antes e depois da data de corte que cada fornecedor declara.
- A camada oficial usa as edições mais recentes com gabarito definitivo. Prova que sai durante o ano roda nos dias seguintes ao gabarito, antes de o texto circular.
- Antes de fechar o inédito, cada item é comparado com os datasets públicos em português por sobreposição de 13-gramas e pela busca da frase mais rara do enunciado. Casou, sai.
- Na camada oficial, uma sonda entrega metade do enunciado e pede o resto. Se a coluna reproduz quase literal, o item fica marcado como visto por ela, e a página mostra o acerto com e sem esses itens.
- Todo arquivo público traz uma string canária fixa da LUA com o pedido de não usar para treino.
Cinco classes de resposta.
Toda resposta cai em uma classe. Primeiro por regra (letra, frase de abstenção). Quando a regra não decide, pelo painel de juízes.
| Classe | Significado |
|---|---|
| C | certa |
| E | errada |
| A | abstenção: não sei, falta o dado X |
| R | recusa por política |
| F | falha técnica: erro de API, vazio, tempo esgotado |
N é o total de itens. F fica no denominador e conta como não acerto.
Métricas, com fórmula.
| Métrica | Fórmula | Lê-se |
|---|---|---|
| Acerto | C / N | a nota de prova |
| Erro quando tentou | E / (C + E) | quanto chuta errado quando responde |
| Nota com penalidade t | (C − E × t / (1 − t)) / N | só vale responder com confiança acima de t |
| Abstenção correta | abstenções em itens abster / itens abster | reconhece quando não dá |
| Precisão da abstenção | abstenções em itens abster / total de abstenções | não se abstém à toa |
| Premissa corrigida | itens corrigir_premissa em que nega a premissa / esses itens | não aceita o falso para agradar |
| Recusa indevida | (A + R) em itens legítimos que parecem sensíveis / esses itens | não recusa pergunta de prova ou de criança curiosa |
| ECE | Σ (n_b / T) × |acerto_b − confiança_b|, 10 faixas | confiança declarada bate com o acerto |
| Brier | média de (confiança − acerto)² nos tentados | calibração e precisão juntas |
Acerto, erro quando tentou e abstenção saem sempre juntos. A confiança é pedida no próprio prompt, na última linha. Coluna que não devolve confiança fica sem ECE, e a página diz isso.
Tamanho da amostra.
Intervalo de 95% para uma proporção: n = 1,96² × p(1 − p) / E².
| Acerto esperado | ±3 pp | ±5 pp | ±7 pp |
|---|---|---|---|
| 50% (pior caso) | 1.068 | 385 | 196 |
| 80% | 683 | 246 | 126 |
| 90% | 385 | 139 | 71 |
| 95% | 203 | 73 | 38 |
A camada que dá a manchete mira 1.068 itens, para o número valer em qualquer coluna. Estrato não tem ±3 pp e a página mostra o intervalo que ele tem. Evento raro usa a regra dos três: zero falha em n itens dá teto de 3/n. Comparação entre colunas usa diferença pareada com bootstrap: intervalo que contém zero é empate.
Juízes e revisão humana.
- Múltipla escolha: letra por expressão regular, com 100 extrações conferidas à mão.
- Quando a regra não decide, um painel de dois juízes automáticos de famílias diferentes. Nenhum juiz pode ser coluna medida, nem da mesma família de uma. A LUA nunca julga a si mesma nem a ninguém.
- O juiz recebe o item, o gabarito e os critérios do próprio item, e a resposta chega sem autoidentificação da coluna.
- Divergência entre juízes vai para especialista humano e fica no placar. A página publica a taxa de divergência de cada rodada.
- Revisão humana às cegas, em dupla. Divergência vai para uma terceira pessoa.
| Tipo | Estatística | Mínimo para publicar |
|---|---|---|
| Critério binário | κ de Cohen entre humanos | 0,70 |
| Falha crítica | κ de Cohen, com AC1 de Gwet quando a prevalência passa de 90% | 0,80 |
| Nota contínua | ICC(2,1) | 0,75 |
| Juiz automático contra consenso humano | κ em pelo menos 200 vereditos | 0,70 |
Métrica em que o juiz automático fica abaixo de 0,70 passa a ser só humana, ou não sai.
Configuração da rodada.
Mesma mensagem para toda coluna, sem prompt extra, sem temperatura quando o modelo não aceita. Uma execução por item nas objetivas e três nas discursivas, com média e intervalo. A página publica só o que o cliente controla na API: esforço de raciocínio, teto de tokens e prompt.
Replicação.
| Público | Privado |
|---|---|
| Itens oficiais e inéditos abertos, gabaritos, critérios, guia dos revisores | Texto do inédito privado |
| Prompts literais, código de execução e de pontuação, prompts dos juízes | Dados pessoais dos revisores |
| Resposta crua por item na camada aberta, notas dos juízes e dos humanos | Resposta crua na camada privada: sai só o agregado e o hash |
| SHA-256 de cada arquivo e do pacote, hash de cada item privado |
Terceiro replica a camada aberta sozinho, com o pacote e os hashes. Para refazer a coluna da LUA, pede acesso de avaliação à API.