A auditoria do nosso próprio banco

Todo simulado diz que é bom. Este publica a medição, o método e o script — inclusive o defeito que ficou aberto aqui até ser consertado.

Por que esta página existe

Um simulado só serve para uma coisa: dizer se você está pronto. Se ele mede errado, ele é pior que não fazer nada — porque te dá confiança falsa e você marca a prova.

O problema é que ninguém consegue verificar isso de fora. Você faz o simulado, tira 85%, e não tem como saber se tirou 85% porque sabe o assunto ou porque o gabarito estava sempre na letra A.

Então aqui está tudo o que você precisa para verificar por conta própria: o que medimos, como medimos, o script e os dados.

O que os três testes procuram

1. Posição do gabaritoSe a resposta certa se concentra numa letra, dá para passar marcando sempre aquela letra. Foi o primeiro defeito que encontramos no nosso banco: 95% das respostas estavam na A.
2. Pista de comprimentoAutor de questão tende a detalhar a alternativa certa e abreviar as erradas. Quem não sabe nada marca a maior e passa. Medimos em dois níveis: a pista que dá para ver de olho, e a inclinação que só um script que conta caracteres percebe.
3. Simulação de chuteDuas mil provas resolvidas no aleatório. A nota tem que bater com o acaso matemático. Se der acima, alguma pista escapou dos dois primeiros testes.
4. Termos absolutosHeurística de cursinho: alternativa com 'sempre', 'nunca' ou 'apenas' costuma ser a errada, porque o autor usa o exagero para fabricar o distrator. Medimos quanto tira quem elimina essas e chuta no resto.

Por que revisão questão a questão não pega isso

Olhando uma questão isolada, ela é impecável. O gabarito na letra A só é um problema quando você olha as 600 de uma vez. É um defeito de lote, e revisão é feita item a item — por isso quase ninguém encontra. Nós só encontramos porque paramos de revisar e começamos a medir.

O resultado, rodado agora

Saída do script, sem edição · 13/09/2026

====================================================================
  AUDITORIA — metrica_pt.json
  600 questoes
====================================================================

[1] POSICAO DO GABARITO
    Pergunta: da para passar marcando sempre a mesma letra?

      A   150   24.5%  #######.....................
      B   164   26.8%  #######.....................
      C   151   24.6%  #######.....................
      D   148   24.1%  #######.....................

      esperado por letra ................ 25.0%
      maior desvio ...................... 1.8 pp
      nota de quem marca so B ........... 27.3%
      PASSOU  (criterio: desvio <= 5 pp)

[2] PISTA DE COMPRIMENTO
    (a) VISIVEL — da para explorar de olho, fazendo a prova?

      a CERTA se destaca em ............. 2 de 600   <- e o que da para explorar
      um DISTRATOR se destaca em ........ 7 de 600   <- desequilibrio, nao vazamento
      PASSOU  (criterio: certa em destaque no maximo 1% dos itens)

    (b) INCLINACAO — da para explorar contando caracteres?

      certa e a mais longa .............. 25.0%
      esperado pelo acaso ............... 25.0%
      razao certa/erradas ............... 1.06x  (1.00 = neutro)
      diferenca media ................... +3.2 caracteres
      PASSOU  (criterio: desvio <= 8 pp)

[3] SIMULACAO DE CHUTE
    Pergunta: quanto tira quem nao sabe nada? (2000 simulacoes)

      nota media do chute ............... 25.5%  (dp 1.7)
      acaso matematico .................. 25.0%
      PASSOU  (criterio: diferenca <= 2 pp)

[4] TERMOS ABSOLUTOS
    Pergunta: da para passar fugindo de 'sempre', 'nunca', 'apenas'?

      absolutos nas alternativas certas . 0.0%
      absolutos nas erradas ............. 0.0%
      nota de quem elimina e chuta ...... 25.5%  (acaso 25.0%)
      PASSOU  (criterio: diferenca <= 4 pp)

====================================================================
  RESULTADO: SEM PISTA EXPLORAVEL POR QUEM FAZ A PROVA
====================================================================

O número que estava aberto, e o que foi feito

Quando esta página foi publicada, um script que conta caracteres acertava 61,8% das questões marcando sempre a alternativa mais longa, contra 25,0% do acaso. Nós publicamos o defeito antes de saber como consertá-lo.

Hoje esse script acerta 26,1% — a certa é a mais longa em 25,0%, contra 25,0% do acaso. A correção não foi encurtar a resposta certa, que degradaria a resposta: foram 221 distratores reescritos, um a um, para ficarem tão completos quanto ela. Distrator que parava um passo antes agora vai até o fim, pelo caminho errado — a questão ficou mais difícil pelo motivo certo. 2 questões ficaram fora do alcance do método (MOD-068, GOV-003): a resposta certa é o nome de uma função ou de um recurso, curta demais para um distrator mais longo caber sem virar absurdo.

Ainda há 9 questões em 600 com alguma alternativa que se destaca de verdade (2 delas a certa, 7 um distrator), e quem usa a heurística lendo tira 25,5% — o mesmo que chutar. Não acreditar em nós é o comportamento correto: baixe o script e os dados e rode você mesmo.

Verifique você mesmo

Baixe os dois arquivos e rode. Não tem dependência: Python 3.8 e a biblioteca padrão.

python3 auditar.py metrica_pt.json

O arquivo de métrica tem, para cada questão, apenas o comprimento de cada alternativa e qual delas é a certa. Nenhum enunciado, nenhum texto de alternativa. Os três testes só olham comprimento e posição, então o resultado é idêntico ao que sai rodando no banco fechado — dá para auditar sem que o banco vire domínio público.

Se você achar um viés que os nossos testes não pegam, escreva. O script é domínio público: rode no banco de questões que você usa hoje. É bem provável que você não goste do resultado.

Baixar o script (auditar.py) Dados PT (metrica_pt.json) Dados EN (metrica_en.json)
Fazer o diagnóstico gratuito