Um teste t responde a uma pergunta: a diferença que você observou – entre uma amostra e um alvo, entre dois grupos ou entre medições emparelhadas antes/depois – é maior do que o ruído de amostragem aleatória produziria? Esta calculadora executa todas as três variantes comuns de estatísticas resumidas que você já possui (médias, desvios padrão, tamanhos de amostra), portanto, você não precisa de dados brutos ou software estatístico.

Qual teste t eu preciso?

Use o teste de uma amostra ao comparar a média de um único grupo com um valor conhecido ou hipotético (uma especificação, uma média histórica, uma média populacional declarada). Use o teste de duas amostras quando você tiver dois grupos separados e independentes e quiser saber se suas médias diferem — esta calculadora usa a versão de Welch, que não pressupõe que os dois grupos tenham variância igual e é o padrão mais seguro na prática. Use o teste emparelhado quando os mesmos indivíduos forem medidos duas vezes (antes/depois, esquerda/direita, pré/pós) — o emparelhamento remove a variabilidade entre indivíduos, tornando o teste mais sensível a um efeito real.

Lendo a estatística t, graus de liberdade e valor p

A estatística t mede quantos erros padrão separam a diferença observada de zero (ou de µ₀ para o teste de uma amostra) — quanto maior for o seu valor absoluto, menos compatíveis serão os dados com a hipótese nula de nenhuma diferença. Os graus de liberdade (gl) refletem a quantidade de informação independente utilizada para estimar a variabilidade; para os testes de uma amostra e pareados df = n − 1, enquanto o teste de duas amostras de Welch usa a fórmula de Welch – Satterthwaite, que geralmente fornece um df não inteiro entre os dois tamanhos de grupo. O valor p converte (t, df) em uma probabilidade: é a chance de ver uma estatística t tão extrema (ou mais) se a hipótese nula fosse realmente verdadeira. Compare-o com seu limite de significância α (convencionalmente 0,05) — p < α significa rejeitar a hipótese nula, p ≥ α significa que você não tem evidências suficientes para fazê-lo.

Unicaudal vs. bicaudal e o que as suposições significam

Bilateral é o padrão conservador e padrão — ele testa se a diferença é significativamente diferente de zero em qualquer direção. Um teste unilateral só faz sentido se você se comprometer, antes de coletar os dados, com uma direção prevista específica; ele reduz pela metade o valor p para a mesma estatística t, o que torna mais fácil encontrar significância e mais fácil de usar indevidamente após o fato. Todas as variantes aqui assumem que os dados subjacentes são distribuídos aproximadamente normalmente (ou a amostra é grande o suficiente para que o Teorema do Limite Central seja aplicado) e que as observações dentro de cada grupo são independentes. Com amostras pequenas e muito distorcidas, trate um valor p limítrofe com cautela e considere uma alternativa não paramétrica.