Una prueba t responde una pregunta: ¿es la diferencia que observaste — entre una muestra y un objetivo, entre dos grupos, o entre mediciones pareadas de antes/después — mayor de lo que produciría el ruido aleatorio del muestreo? Esta calculadora ejecuta las tres variantes comunes a partir de estadísticas de resumen que ya tienes (medias, desviaciones estándar, tamaños de muestra), así que no necesitas datos en bruto ni software estadístico.
¿Qué prueba t necesito?
Usa la prueba de una muestra cuando estás comparando el promedio de un solo grupo contra un valor conocido o hipotetizado (una especificación, un promedio histórico, una media poblacional declarada). Usa la prueba de dos muestras cuando tienes dos grupos separados e independientes y quieres saber si sus medias difieren — esta calculadora usa la versión de Welch, que no asume que los dos grupos tienen varianza igual y es la opción predeterminada más segura en la práctica. Usa la prueba pareada cuando los mismos sujetos fueron medidos dos veces (antes/después, izquierda/derecha, pre/post) — el emparejamiento elimina la variabilidad entre sujetos, así que la prueba es más sensible a un efecto real.
Leyendo el estadístico t, los grados de libertad y el valor p
El estadístico t mide cuántos errores estándar separan la diferencia observada de cero (o de µ₀ para la prueba de una muestra) — cuanto mayor es su valor absoluto, menos compatibles son los datos con la hipótesis nula de que no hay diferencia. Los grados de libertad (df) reflejan cuánta información independiente se usó para estimar la variabilidad; para las pruebas de una muestra y pareada df = n − 1, mientras que la prueba de dos muestras de Welch usa la fórmula de Welch-Satterthwaite, que generalmente da un df no entero entre los dos tamaños de grupo. El valor p convierte (t, df) en una probabilidad: es la probabilidad de ver un estadístico t tan extremo (o más) si la hipótesis nula fuera realmente cierta. Compáralo con tu umbral de significancia α (convencionalmente 0.05): p < α significa rechazar la hipótesis nula, p ≥ α significa que no tienes evidencia suficiente para hacerlo.
Una cola vs. dos colas, y qué significan los supuestos
Dos colas es la opción estándar y conservadora por defecto — verifica si la diferencia es significativamente distinta de cero en cualquier dirección. Una prueba de una cola solo tiene sentido si te comprometiste, antes de recolectar los datos, con una dirección predicha específica; reduce el valor p a la mitad para el mismo estadístico t, lo que facilita encontrar significancia y facilita también su mal uso después del hecho. Todas las variantes aquí asumen que los datos subyacentes se distribuyen aproximadamente de forma normal (o que la muestra es lo suficientemente grande para que aplique el Teorema del Límite Central) y que las observaciones dentro de cada grupo son independientes. Con muestras pequeñas y muy sesgadas, trata con precaución un valor p límite y considera una alternativa no paramétrica.