Un valor crítico es el número con el que una prueba de hipótesis compara su estadístico — la línea que separa 'no hay suficiente evidencia' de 'rechazar la hipótesis nula'. Antes de que las hojas de cálculo y el software estadístico hicieran que los valores p fueran instantáneos de calcular, los estudiantes e investigadores buscaban estos números en tablas impresas al final de un libro de texto; esta calculadora reemplaza esa búsqueda en tablas con un cálculo exacto de CDF inversa para cualquier alfa y cualquier grado de libertad, en las cuatro distribuciones de las que dependen la mayoría de las pruebas de hipótesis.
Qué representa realmente un valor crítico
Toda prueba de hipótesis reduce tus datos a un solo estadístico de prueba, y luego pregunta: ¿qué tan extremo tendría que ser este estadístico antes de ser implausible bajo la hipótesis nula? El valor crítico es ese umbral, establecido de modo que la probabilidad de cruzarlo puramente por azar sea igual a tu nivel de significancia elegido (α). Es matemáticamente la misma información que un valor p, solo calculada en la dirección opuesta — un valor p pregunta "qué tan extremo es mi estadístico", mientras que un valor crítico pregunta "qué tan extremo tendría que ser un estadístico". Muchos libros de texto y cursos de laboratorio todavía enseñan primero el enfoque de valor crítico porque hace visible la regla de decisión antes de ver datos reales.
Elegir una cola vs. dos colas
Dos colas es el estándar conservador por defecto: prueba una diferencia en cualquier dirección sin asumir de antemano hacia dónde irá el efecto, así que la región de rechazo — y el valor crítico — se sitúa en α/2 en cada cola. Una prueba de una cola solo es válida si te comprometiste con una dirección específica (por ejemplo, "el nuevo proceso reduce los defectos") antes de recolectar datos; cambiar a una cola después de ver hacia dónde se inclinaron los datos es un error común y grave, ya que efectivamente duplica tu verdadera tasa de error de Tipo I. En caso de duda, usa dos colas.
Por qué cuatro distribuciones diferentes
Z asume que conoces exactamente la desviación estándar poblacional (o tu muestra es lo suficientemente grande como para que la distinción apenas importe). t relaja eso — es lo que usas cuando la desviación estándar se estima a partir de la muestra misma, y tiene colas más pesadas para compensar esa incertidumbre adicional, convergiendo hacia la distribución Z a medida que crecen los grados de libertad. Chi-cuadrado aplica a conteos y varianzas en lugar de medias, y como está acotada por debajo por cero y sesgada a la derecha, su valor crítico se reporta convencionalmente solo para la cola superior. F es la razón de dos varianzas (o dos cuadrados medios en ANOVA) y necesita dos valores de grados de libertad — no es simétrica, así que una prueba F de dos colas realmente necesita dos valores críticos distintos en lugar de un solo par ±.