Un p-value indica si una diferencia entre dos grupos probablemente sea real y no ruido aleatorio. No dice nada sobre qué tan grande es esa diferencia. El tamaño del efecto — más comúnmente la d de Cohen — llena ese vacío al poner el tamaño de una diferencia en una escala estandarizada y comparable. Esta guía explica cómo se calcula la d de Cohen, por qué se combina la desviación estándar, y cuándo recurrir a la g de Hedges en su lugar.
d de Cohen vs. el p-value
Un p-value responde "¿podría haber ocurrido esta diferencia por azar?" — es una afirmación sobre significancia estadística, y depende fuertemente del tamaño de la muestra. Con una muestra suficientemente grande, incluso una diferencia trivialmente pequeña y prácticamente insignificante puede producir un p-value diminuto. La d de Cohen responde una pregunta diferente: "¿qué tan grande es esta diferencia, de una manera que no dependa de cuántas personas participaron en el estudio?" Una d de 0.1 sigue siendo una d de 0.1 ya sea que el estudio tuviera 20 participantes o 20,000. Reportar ambos juntos — significancia estadística y tamaño del efecto — da una imagen completa: ¿es real el efecto, y importa?
Por qué se combina la desviación estándar
La d de Cohen estandariza la diferencia de medias cruda dividiéndola entre una desviación estándar, así que el resultado se expresa en "cuántas desviaciones estándar de separación" en lugar de en las unidades originales (puntos, dólares, milisegundos). Como dos grupos independientes pueden tener desviaciones estándar diferentes, la d de Cohen usa una desviación estándar combinada — un promedio ponderado de la dispersión de ambos grupos, donde la contribución de cada grupo se pondera por su tamaño de muestra (específicamente, n − 1, sus grados de libertad). Esto asume que la variabilidad subyacente de los dos grupos es razonablemente similar; si la dispersión de un grupo es dramáticamente mayor que la del otro, algunos investigadores prefieren la delta de Glass, que divide solo entre la desviación estándar del grupo de control en lugar de una cifra combinada.
Cuándo usar la g de Hedges en lugar de d
La d de Cohen tiene un sesgo conocido para muestras pequeñas — tiende a sobreestimar ligeramente el verdadero tamaño del efecto poblacional cuando las muestras son pequeñas. La g de Hedges aplica un factor de corrección, siempre un poco menor que 1, que reduce d hacia cero para compensar. La corrección es máxima para muestras pequeñas y se reduce hacia cero a medida que el tamaño de muestra combinado crece más allá de aproximadamente 50, punto en el cual d y g son casi idénticas. Como regla general: reporta la g de Hedges en lugar de, o junto con, la d de Cohen siempre que cualquiera de los grupos tenga menos de unas 20 observaciones, algo común en estudios piloto y ensayos clínicos pequeños.