El valor p es el concepto más utilizado (y más incomprendido) en estadística. Aparece prácticamente en todos los artículos científicos, informes de pruebas A/B y ensayos clínicos. Sin embargo, las encuestas muestran consistentemente que incluso los investigadores frecuentemente malinterpretan lo que significa. Hacer esto bien es esencial para cualquiera que tome decisiones basadas en datos.

Lo que realmente mide un valor P

Definición
P-value = Probability of observing results at least as extreme as the data, assuming the null hypothesis is true.

NO te dice la probabilidad de que tu hipótesis sea cierta. Le indica lo sorprendentes que serían sus datos si en realidad no sucediera nada interesante.

Ejemplo: Se prueba si un nuevo medicamento reduce la presión arterial. La hipótesis nula es que el fármaco no tiene ningún efecto. Realiza una prueba y descubre que los pacientes que tomaban el medicamento tenían una presión arterial 8 mmHg más baja que el grupo de control, con p = 0,02. Esto significa: Si el fármaco realmente no tuvo ningún efecto, solo hay un 2% de posibilidades de observar una diferencia de 8 mmHg (o más) solo por casualidad.

El umbral de 0,05

Por convención, p < 0,05 se considera "estadísticamente significativo". Este umbral, elegido por Ronald Fisher en la década de 1920, significa que usted está dispuesto a aceptar una probabilidad del 5% de equivocarse cuando rechaza la hipótesis nula (un error de tipo I). No es una ley de la naturaleza: es una convención que equilibra el rigor con la practicidad.

Valor pInterpretaciónAcción
p < 0,001Pruebas muy contundentes contra la nulidad.Rechazar nulo con alta confianza
p<0,01Evidencia contundenteRechazar nulo
p<0,05Evidencia moderada (umbral convencional)Rechazar nulo
p = 0,05–0,10Evidencia débil ("marginalmente significativa")Poco concluyente; se necesitan más datos
p > 0,10Evidencia insuficienteNo se pudo rechazar nulo

Interpretaciones erróneas comunes

  • Equivocado: "P = 0,03 significa que hay un 3% de posibilidades de que la hipótesis nula sea cierta". Bien: Significa que hay un 3% de posibilidades de ver estos datos (o más extremos) si la hipótesis nula fuera cierta. La distinción es sutil pero crítica.
  • Equivocado: "P = 0,03 significa que hay un 97% de posibilidades de que el fármaco funcione". Bien: El valor p no dice nada sobre la probabilidad de que su hipótesis sea cierta. Eso requiere análisis bayesiano y probabilidades previas.
  • Equivocado: "P = 0,06 significa que el resultado no es significativo, por lo que no hay ningún efecto". Bien: P = 0,06 significa que la evidencia no es lo suficientemente sólida como para rechazar la nula en el nivel 0,05. La ausencia de evidencia no es evidencia de ausencia. Más datos podrían producir un resultado definitivo.

Calcule los valores p para sus propios datos con el Calculadora de valor P.

Conclusiones clave

  • Las medidas del valor P sorprenden - qué tan improbables son sus datos bajo la hipótesis nula.
  • P <0,05 es el umbral de significancia convencional, pero es una pauta, no una regla.
  • Significancia estadística ≠ significancia práctica. Una muestra enorme puede producir p < 0,001 para un efecto trivialmente pequeño.
  • Informe siempre el tamaño del efecto junto con los valores p para transmitir si el resultado importa en la práctica.
  • "No se pudo rechazar el nulo" no es lo mismo que demostrar que la nula es verdadera.

Preguntas frecuentes

¿Qué significa p < 0,05 en términos simples?

Significa que si realmente no hubo ningún efecto o diferencia, hay menos de un 5% de posibilidades de obtener resultados tan extremos como los que observó. Dado que el 5% se considera bastante improbable, usted concluye que la hipótesis nula (sin efecto) probablemente sea incorrecta y la rechaza. Piénselo así: sus datos serían sorprendentemente raros si no sucediera nada interesante.

¿Puede un resultado ser estadísticamente significativo pero no importante en la práctica?

Sí, esto sucede frecuentemente con muestras de gran tamaño. Un estudio de 100.000 personas podría encontrar que un suplemento aumenta el coeficiente intelectual en 0,3 puntos con p <0,001. El resultado es muy significativo desde el punto de vista estadístico, pero carece completamente de significado en la práctica. Mire siempre el tamaño del efecto (qué tan grande es la diferencia) junto con el valor p.

¿Cuál es la diferencia entre los valores p de una cola y de dos colas?

Una prueba de dos colas verifica cualquier diferencia (mayor o menor), mientras que una prueba de una cola solo verifica en una dirección. Las pruebas de dos colas son más conservadoras y son las predeterminadas en la mayoría de las investigaciones. Las pruebas de una cola son apropiadas sólo cuando se tiene una razón teórica sólida para predecir la dirección del efecto antes de recopilar datos.

¿Buscas más? Explora todos los recursos gratuitos incluyendo guías, comparaciones y términos del glosario.