Um valor crítico é o número com o qual um teste de hipótese compara sua estatística - a linha que separa 'evidência insuficiente' de 'rejeitar a hipótese nula'. Antes que as planilhas e os softwares estatísticos tornassem os valores p instantâneos para serem computados, estudantes e pesquisadores pesquisavam esses números em tabelas impressas no final de um livro didático; esta calculadora substitui a consulta de tabela por um cálculo CDF inverso exato para qualquer alfa e qualquer grau de liberdade, nas quatro distribuições nas quais a maioria dos testes de hipóteses se baseia.
O que um valor crítico realmente representa
Cada teste de hipótese reduz seus dados a uma única estatística de teste e então pergunta: quão extrema essa estatística precisa ser antes de ser implausível sob a hipótese nula? O valor crítico é aquele limite, definido de forma que a probabilidade de cruzá-lo puramente por acaso seja igual ao nível de significância escolhido (α). É matematicamente a mesma informação que um valor p, apenas calculado na direção oposta – um valor p pergunta “quão extrema é minha estatística”, enquanto um valor crítico pergunta “quão extrema uma estatística precisaria ser”. Muitos livros didáticos e cursos de laboratório ainda ensinam primeiro a abordagem do valor crítico, porque ela torna a regra de decisão visível antes mesmo de você ver os dados reais.
Escolhendo unicaudal vs. bicaudal
Bicaudal é o padrão conservador e padrão: ele testa uma diferença em qualquer direção sem assumir antecipadamente qual direção o efeito irá, de modo que a região de rejeição - e o valor crítico - fica em α/2 em cada cauda. Um teste unilateral só é válido se você se comprometeu com uma direção específica (por exemplo, “o novo processo reduz defeitos”) antes de coletar dados; mudar para unilateral depois de ver para que lado os dados foram inclinados é um erro comum e grave, pois efetivamente dobra sua taxa real de erro Tipo I. Em caso de dúvida, use bicaudal.
Por que quatro distribuições diferentes
Z pressupõe que você conhece exatamente o desvio padrão da população (ou que sua amostra é grande o suficiente para que a distinção pouco importe). t relaxa isso - é o que você usa quando o desvio padrão é estimado a partir da própria amostra, e tem caudas mais pesadas para compensar essa incerteza extra, convergindo para a distribuição Z à medida que os graus de liberdade aumentam. O qui-quadrado se aplica a contagens e variações, e não a médias, e como é limitado abaixo por zero e inclinado para a direita, seu valor crítico é convencionalmente relatado apenas para a cauda superior. F é a razão de duas variâncias (ou dois quadrados médios na ANOVA) e precisa de dois valores de graus de liberdade - não é simétrico, portanto, um teste F bicaudal realmente precisa de dois valores críticos distintos em vez de um único ± par.