Os valores P quantificam a força da evidência contra uma hipótese nula – especificamente, a probabilidade de observar uma estatística de teste tão extrema quanto a sua (ou mais) se a hipótese nula fosse verdadeira. Apesar de ser um dos conceitos estatísticos mais utilizados na investigação científica, os valores-p são também um dos números mais incompreendidos e mal utilizados em todas as estatísticas, contribuindo para a "crise de replicação" na psicologia, medicina e ciências sociais. As seções abaixo cobrem o que um valor p realmente mede (e o que não mede), como a dependência excessiva dos limites do valor p levou ao hacking p e a práticas de pesquisa questionáveis, e por que relatar o tamanho do efeito juntamente com os valores p é essencial para uma interpretação honesta dos resultados estatísticos.
O que é um valor P (e não é)
Um valor p é a probabilidade de ver dados tão extremos quanto os seus (ou mais extremos) se a hipótese nula fosse verdadeira. Enfaticamente NÃO é a probabilidade de que a hipótese nula seja verdadeira, e esta distinção é um dos pontos conceituais mais importantes na estatística aplicada. Um valor p de 0,03 significa: se H₀ fosse verdadeiro, há apenas 3% de chance de ver um resultado tão extremo ou mais extremo. Não diz nada diretamente sobre se H₀ é realmente correto ou falso - isso exigiria uma análise bayesiana incorporando probabilidades anteriores. Interpretações errôneas comuns a serem evitadas: "p = 0,03 significa que há 3% de chance de H₀ ser verdadeiro" (errado, esta é a probabilidade inversa P(H₀|dados) que requer o teorema de Bayes). "p = 0,03 significa que há 97% de chance de H₁ ser verdadeiro" (também errado). "p> 0,05 significa que H₀ é provavelmente verdadeiro" (errado - ausência de evidência não é evidência de ausência, especialmente com amostras pequenas). A interpretação correta é restrita: o valor p é uma afirmação sobre quão incomuns seriam seus dados se H₀ fosse verdadeiro. Use valores-p para quantificar a surpresa em um modelo nulo, e não para fazer declarações de probabilidade sobre as próprias hipóteses.
A crise da replicação e o P-Hacking
A dependência excessiva do limiar p < 0,05 contribuiu significativamente para a irreprodutibilidade da investigação em psicologia, medicina e ciências sociais — um problema amplamente documentado desde a crise de replicação de 2010. "P-hacking" é a prática de executar múltiplas análises, testar vários subgrupos, tentar diferentes medidas de resultados ou excluir certos pontos de dados até que algo ultrapasse o limite de 0,05. Isso aumenta as taxas de falsos positivos bem acima dos 5% nominais, o que significa que muitas descobertas "significativas" publicadas são ruído estatístico que não será replicado em estudos de acompanhamento.
As melhores práticas modernas incluem o pré-registro de hipóteses e planos de análise antes da coleta de dados (forçando os pesquisadores a se comprometerem com testes específicos em vez de pescar depois), relatando tamanhos de efeito junto com valores p para que os leitores possam julgar a significância prática e não apenas a significância estatística, usando intervalos de confiança para comunicar a magnitude da incerteza, adotando métodos bayesianos quando apropriado para incorporação prévia explícita e tratando p = 0,05 como uma diretriz aproximada em vez de um limite binário rígido. Alguns periódicos e áreas passaram para limites mais rígidos (p < 0,005) ou exigem pré-registro para publicação. As ferramentas do Open Science Framework apoiam o pré-registro e relatórios registrados que melhoraram substancialmente as taxas de reprodutibilidade nos campos participantes.
O tamanho do efeito é tão importante quanto o valor P
Com amostras grandes o suficiente, quase qualquer diferença de zero torna-se estatisticamente significativa porque os valores p diminuem à medida que o tamanho da amostra aumenta, mesmo quando o efeito subjacente é pequeno. Um valor p de 0,0001 para um d de Cohen de 0,05 significa que você tem um efeito real, mas trivialmente pequeno - não vale a pena agir, apesar de ser "altamente significativo". Estudos de big data em milhões de observações produzem rotineiramente p < 0,001 para tamanhos de efeito que são reais, mas clinicamente ou praticamente sem sentido. Significância estatística não é o mesmo que significância prática.
Sempre compare valores de p com estimativas de tamanho de efeito (d de Cohen para diferenças médias, r² para força de correlação, η² ou η² parcial para tamanhos de efeito ANOVA) e intervalos de confiança para obter um quadro estatístico completo. Interpretação d de Cohen: 0,2 = efeito pequeno, 0,5 = médio, 0,8 = grande. Uma regra prática razoável: se d de Cohen <0,2, o efeito é pequeno demais para ter importância na maioria das decisões do mundo real, independentemente do valor p. Este "é praticamente significativo?" filtro aplicado ao lado de "é estatisticamente significativo?" produz decisões científicas e de negócios muito melhores do que apenas os limites do valor p. As diretrizes modernas da APA, AMA e outros órgãos profissionais exigem explicitamente relatórios de tamanho de efeito, além de valores p em pesquisas publicadas.