O teste de hipóteses é o procedimento formal que os cientistas usam para decidir se os efeitos observados nos dados de amostra são reais ou apenas ruído de amostragem. Os cinco testes que esta calculadora suporta — t de uma amostra, t de duas amostras (Welch), t pareado, qualidade de ajuste do qui-quadrado e independência do qui-quadrado — cobrem a grande maioria dos casos de uso de estatística introdutória e aplicada. Compreender quando usar qual teste, o que o valor p realmente significa e por que o tamanho do efeito é importante junto com a significância separa a prática estatística competente do ritual de culto à carga.
Escolhendo o teste certo
Três perguntas selecionam o teste para você. Primeiro, você está comparando médias (dados numéricos contínuos) ou contagens (dados categóricos)? Médias → família do teste t; contagens → família qui-quadrado. Em segundo lugar, quantos grupos? Uma amostra comparada com uma referência conhecida → t de uma amostra. Dois grupos independentes → Welch t de duas amostras. Duas medições relacionadas nos mesmos sujeitos (antes/depois, pares de gêmeos) → t pareado. Terceiro, qual é a estrutura dos dados categóricos? Uma variável com k categorias → qualidade de ajuste do qui-quadrado. Duas variáveis em uma tabela de contingência 2×2 → independência do qui-quadrado. O fluxograma é mecânico quando você internaliza as questões. Erros comuns dos alunos incluem o uso de um teste t em porcentagens (que são proporções, não médias – geralmente queremos um teste de qui-quadrado ou de proporção) e o uso de um teste t pareado em amostras independentes (que perde poder estatístico sem nenhum benefício).
Valores p não significam o que as pessoas pensam
O erro interpretativo mais comum em estatística é tratar o valor p como 'a probabilidade de que H₀ seja verdadeiro' ou 'a probabilidade de que o resultado seja devido ao acaso'. Nenhum dos dois está correto. O valor p é a probabilidade de observar dados pelo menos tão extremos quanto os seus, assumindo que H₀ seja verdadeiro. É condicional ao nulo ser verdadeiro, não informativo sobre se o nulo é verdadeiro. Valores p pequenos constituem evidência contra H₀ - forte evidência de que os dados são improváveis sob o valor nulo - mas não quantificam a probabilidade de H₀. Um p de 0,04 não é 'uma chance de 4% de que o nulo esteja certo'; há 'uma chance de 4% de ver dados tão extremos se o nulo estiver correto'. É por isso que as estatísticas modernas enfatizam os tamanhos dos efeitos juntamente com os valores p: uma diferença pequena, mas estatisticamente significativa (p = 0,001, d = 0,05) é real, mas trivialmente pequena; uma diferença grande, mas não significativa (p = 0,12, d = 0,6) é sugestiva, mas insuficiente. Informe os dois números.
Por que o teste de Welch supera o teste de Student
A maioria dos livros introdutórios ainda apresenta o 'teste t agrupado de Student' como a comparação padrão de duas amostras, com o ajuste de Welch mostrado como um caso de exceção para 'variâncias desiguais'. As estatísticas modernas reverteram este conselho: o teste t de Welch deve ser o padrão porque a suposição de variâncias iguais (a suposição de homocedasticidade na qual o teste agrupado de Student se baseia) raramente é atendida na prática, e o teste agrupado fornece taxas inflacionadas de falsos positivos quando é violado. O ajuste de Welch usa a aproximação de Welch-Satterthwaite para df e calcula o erro padrão sem agrupamento, produzindo taxas de erro Tipo I quase corretas, independentemente de as variâncias serem iguais. A linguagem R mudou para Welch como padrão em t.test() por esse motivo; O SciPy e as ferramentas mais modernas agora fazem o mesmo. A menos que você tenha uma razão teórica específica para agrupar as variações, use a de Welch: basicamente não há custo quando as variações são iguais, e um benefício real quando não são.
Advertências Qui-Quadrado
A aproximação do qui-quadrado depende de que as contagens de células esperadas sejam grandes o suficiente para que a distribuição amostral discreta das contagens seja bem aproximada pela distribuição qui-quadrado contínua. A regra padrão: cada contagem de células esperada deve ser de pelo menos 5; algumas referências relaxam para 'pelo menos 80% das células ≥ 5 e nenhuma abaixo de 1'. Tabelas de contingência esparsas (contagens ≤ 5 em múltiplas células) precisam do Teste Exato de Fisher (para 2×2) ou de um teste de permutação de Monte Carlo (para tabelas maiores) — a aplicação do qui-quadrado de qualquer maneira fornece valores de p não confiáveis. A calculadora sinaliza violações da regra de contagem esperada com um aviso; trate o valor p resultante como aproximado quando ele aparecer. Especificamente para tabelas 2×2, a correção de continuidade de Yates às vezes é aplicada para melhorar ligeiramente a aproximação, embora a prática moderna geralmente prefira o Exato de Fisher para qualquer caso 2×2 onde o custo computacional permitir.