O teste A/B levanta uma questão – essa mudança move a métrica? - em um teste de hipótese. Esta calculadora executa um teste z de duas proporções em suas taxas de conversão de controle e variante e, em seguida, ajuda a planejar testes futuros calculando os tamanhos de amostra necessários e as durações dos testes. Ele é destinado a profissionais de marketing, engenheiros de crescimento e gerentes de produto que comparam taxas de conversão em páginas de destino, formulários de inscrição, CTAs de e-mail, fluxos de checkout e testes de divisão semelhantes.

Como funciona o teste de significância

Começamos assumindo que ambas as variantes compartilham a mesma taxa de conversão verdadeira (a hipótese nula) e perguntamos quão improvável seria a diferença observada sob essa suposição. O pontuação z agrupado mede quantos erros padrão separam as duas taxas observadas; o valor p converte z em uma probabilidade por meio do CDF normal padrão.

Um valor p pequeno (por exemplo, abaixo de 0,05) significa: se ambas as variantes realmente fossem convertidas na mesma taxa, você veria uma diferença tão grande ou maior por acaso em menos de 5% das vezes. Esse é o limite que chamamos de 95% de significância estatística. O gráfico na guia da calculadora sombreia a região de rejeição da confiança escolhida e marca onde cai o z observado.

Entradas que movem o resultado

Tamanho da amostra é a maior alavanca. Duplicar os visitantes reduz aproximadamente pela metade o erro padrão, aumenta o intervalo de confiança e torna detectáveis ​​​​pequenos aumentos. O tamanho do efeito também é importante: um aumento relativo de 50% precisa de muito menos tráfego do que um aumento de 5%. O nível de confiança compensa o erro Tipo I (falsos positivos): 95% é o padrão de marketing, 99% é apropriado quando o custo de envio de uma variante ruim é alto. A escolha da cauda raramente altera as decisões de negócios – mantenha a bicaudal, a menos que você tenha uma hipótese direcional pré-registrada.

Armadilhas e limites

O maior erro nos testes A/B é espiar – verificar o valor p diariamente e parar assim que ele ultrapassar 0,05. Isso inflaciona dramaticamente a taxa de falsos positivos. Execute o teste durante o retorno do Planejador de tamanho de amostra e verifique uma vez. Múltiplas variantes (testes A/B/C/n) precisam de uma correção de múltiplas comparações (Bonferroni, Holm) ou você verá falsos vencedores. Os efeitos de novidade e primazia podem alterar as métricas na primeira semana, mas desaparecer na terceira semana; ciclos semanais de trânsito significam que os testes com duração inferior a uma semana inteira muitas vezes perdem padrões reais. Por fim, esta calculadora usa uma aproximação normal — para amostras muito pequenas (n < 30 conversões por variante) ou taxas extremas (< 1% ou > 99%), prefira um teste exato como o de Fisher.