Um valor p informa se a diferença entre dois grupos provavelmente será real, em vez de ruído aleatório. Não diz nada sobre quão grande é essa diferença. O tamanho do efeito – mais comumente o d de Cohen – preenche essa lacuna colocando o tamanho de uma diferença em uma escala padronizada e comparável. Este guia explica como o d de Cohen é calculado, por que o desvio padrão é agrupado e quando recorrer ao g de Hedges. Os intervalos de confiança são aproximados. Os rótulos do estilo Cohen são convenções de referência aproximadas, e não padrões universais de importância prática. Os resultados pressupõem observações independentes, desvios padrão amostrais, escalas comparáveis e resultados aproximadamente contínuos; dados emparelhados, variações fortemente desiguais, resultados distorcidos ou dados ordinais exigem um método adequado a esse projeto. O método segue Cohen (1988) e Hedges e Olkin (1985).
D de Cohen vs. valor p
Um valor p responde "essa diferença poderia ter acontecido por acaso?" — é uma afirmação sobre significância estatística e depende muito do tamanho da amostra. Com uma amostra suficientemente grande, mesmo uma diferença trivialmente pequena e praticamente sem sentido pode produzir um pequeno valor p. O d de Cohen responde a uma pergunta diferente: “quão grande é essa diferença, de uma forma que não depende de quantas pessoas estavam no estudo?” Um d de 0,1 permanece um d de 0,1 quer o estudo tenha 20 participantes ou 20.000. Relatar ambos juntos — significância estatística e tamanho do efeito — fornece uma imagem completa: o efeito é real e isso importa?
Por que agrupar o desvio padrão
O d de Cohen padroniza a diferença média bruta dividindo-a por um desvio padrão, de modo que o resultado é expresso em "quantos desvios padrão estão separados" em vez de nas unidades originais (pontos, dólares, milissegundos). Como dois grupos independentes podem ter desvios padrão diferentes, o d de Cohen usa um desvio padrão agrupado - uma média ponderada do spread de ambos os grupos, onde a contribuição de cada grupo é ponderada pelo tamanho da sua amostra (especificamente, n − 1, seus graus de liberdade). Isto pressupõe que a variabilidade subjacente dos dois grupos é razoavelmente semelhante; se o spread de um grupo for dramaticamente maior que o do outro, alguns pesquisadores preferem o delta de Glass, que divide apenas pelo desvio padrão do grupo de controle, em vez de um valor agregado.
Quando usar o g de Hedges em vez de d
O d de Cohen tem um viés conhecido para amostras pequenas – ele tende a superestimar ligeiramente o verdadeiro tamanho do efeito populacional quando as amostras são pequenas. O g de hedge aplica um fator de correção, sempre um pouco menor que 1, que encolhe d em direção a zero para compensar. A correção é maior para amostras pequenas e diminui para zero à medida que o tamanho da amostra combinada passa de aproximadamente 50, ponto em que d e g são quase idênticos. Como regra geral: relate o g de Hedges em vez ou ao lado do d de Cohen sempre que um dos grupos tiver menos de 20 observações, o que é comum em estudos piloto e pequenos ensaios clínicos.