Todo simulado diz que é bom. Este publica a medição, o método e o script — inclusive o defeito que ficou aberto aqui até ser consertado.
Um simulado só serve para uma coisa: dizer se você está pronto. Se ele mede errado, ele é pior que não fazer nada — porque te dá confiança falsa e você marca a prova.
O problema é que ninguém consegue verificar isso de fora. Você faz o simulado, tira 85%, e não tem como saber se tirou 85% porque sabe o assunto ou porque o gabarito estava sempre na letra A.
Então aqui está tudo o que você precisa para verificar por conta própria: o que medimos, como medimos, o script e os dados.
Olhando uma questão isolada, ela é impecável. O gabarito na letra A só é um problema quando você olha as 600 de uma vez. É um defeito de lote, e revisão é feita item a item — por isso quase ninguém encontra. Nós só encontramos porque paramos de revisar e começamos a medir.
Saída do script, sem edição · 13/09/2026
====================================================================
AUDITORIA — metrica_pt.json
600 questoes
====================================================================
[1] POSICAO DO GABARITO
Pergunta: da para passar marcando sempre a mesma letra?
A 150 24.5% #######.....................
B 164 26.8% #######.....................
C 151 24.6% #######.....................
D 148 24.1% #######.....................
esperado por letra ................ 25.0%
maior desvio ...................... 1.8 pp
nota de quem marca so B ........... 27.3%
PASSOU (criterio: desvio <= 5 pp)
[2] PISTA DE COMPRIMENTO
(a) VISIVEL — da para explorar de olho, fazendo a prova?
a CERTA se destaca em ............. 2 de 600 <- e o que da para explorar
um DISTRATOR se destaca em ........ 7 de 600 <- desequilibrio, nao vazamento
PASSOU (criterio: certa em destaque no maximo 1% dos itens)
(b) INCLINACAO — da para explorar contando caracteres?
certa e a mais longa .............. 25.0%
esperado pelo acaso ............... 25.0%
razao certa/erradas ............... 1.06x (1.00 = neutro)
diferenca media ................... +3.2 caracteres
PASSOU (criterio: desvio <= 8 pp)
[3] SIMULACAO DE CHUTE
Pergunta: quanto tira quem nao sabe nada? (2000 simulacoes)
nota media do chute ............... 25.5% (dp 1.7)
acaso matematico .................. 25.0%
PASSOU (criterio: diferenca <= 2 pp)
[4] TERMOS ABSOLUTOS
Pergunta: da para passar fugindo de 'sempre', 'nunca', 'apenas'?
absolutos nas alternativas certas . 0.0%
absolutos nas erradas ............. 0.0%
nota de quem elimina e chuta ...... 25.5% (acaso 25.0%)
PASSOU (criterio: diferenca <= 4 pp)
====================================================================
RESULTADO: SEM PISTA EXPLORAVEL POR QUEM FAZ A PROVA
====================================================================
Quando esta página foi publicada, um script que conta caracteres acertava
61,8% das questões marcando sempre a alternativa mais longa, contra 25,0% do acaso. Nós
publicamos o defeito antes de saber como consertá-lo.
Hoje esse script acerta 26,1% — a certa é a mais longa em 25,0%, contra
25,0% do acaso. A correção não foi encurtar a resposta certa, que degradaria a
resposta: foram 221 distratores reescritos, um a um, para ficarem tão completos quanto
ela. Distrator que parava um passo antes agora vai até o fim, pelo caminho errado — a questão
ficou mais difícil pelo motivo certo. 2 questões ficaram fora do alcance do método (MOD-068, GOV-003): a resposta certa é o nome de uma função ou de um recurso, curta demais para um distrator mais longo caber sem virar absurdo.
Ainda há 9 questões em 600 com alguma alternativa que se destaca de verdade
(2 delas a certa, 7 um distrator), e quem usa a heurística lendo tira
25,5% — o mesmo que chutar. Não acreditar em nós é o comportamento correto: baixe o script e
os dados e rode você mesmo.
Baixe os dois arquivos e rode. Não tem dependência: Python 3.8 e a biblioteca padrão.
python3 auditar.py metrica_pt.json
O arquivo de métrica tem, para cada questão, apenas o comprimento de cada alternativa e qual delas é a certa. Nenhum enunciado, nenhum texto de alternativa. Os três testes só olham comprimento e posição, então o resultado é idêntico ao que sai rodando no banco fechado — dá para auditar sem que o banco vire domínio público.
Se você achar um viés que os nossos testes não pegam, escreva. O script é domínio público: rode no banco de questões que você usa hoje. É bem provável que você não goste do resultado.
Fazer o diagnóstico gratuito