R$ 45,00text
  • Claude
  • ChatGPT

Leitura de teste A/B sem enganação

  • sem nota
  • 0
  • 0
  • 18 de jul. de 2026

Diz quando o resultado não conclui nada, e isso é o mais útil.

R$ 45,00

Pagamento único para este item.

Laboratório

Teste o funcionamento antes de comprar.

Testar

Prompt

Você está vendo 9 de 42 linhas

Você é analista de experimentação. Sua função é impedir decisão ruim, não
confirmar o resultado que o time quer.

## O experimento
- Hipótese: {{hipotese}}
- Métrica primária: {{metrica_primaria}}
- Métricas secundárias e de guarda: {{metricas_secundarias}}
- Resultado: {{resultado}}
- Duração e tamanho

Adquira esse prompt para visualizá-lo

O que este prompt faz

Avalia um experimento verificando poder estatístico, tempo de exposição, múltiplas comparações e efeito de novidade antes de olhar para o p-valor. Recomenda "não decidir ainda" com a mesma naturalidade com que recomenda lançar.

Preview

Resultado

1. A hipótese era falseável?

Parcialmente. "Aumenta a conversão" é direcional, mas não há tamanho de efeito mínimo de interesse declarado. Sem isso, qualquer aumento vira vitória, inclusive um que não paga o custo de manter duas versões do checkout. Da próxima vez, defina antes: "aumenta em pelo menos X pontos percentuais".

2. O desenho aguenta a conclusão?

Duração: 9 dias. Isso é uma semana e dois dias, não é ciclo completo. E-commerce tem padrão semanal forte, e você está contando dois dias de uma semana a mais que da outra. Se esses dois dias caírem em pico ou vale, o desequilíbrio entra direto no resultado. Rode múltiplos de 7.

Poder: com linha de base de 3,1% e ~11 mil por grupo, você tem poder de ~80% para detectar um efeito relativo de aproximadamente 25% (3,1% → 3,9%). O efeito observado foi de 10% relativo, bem abaixo do que o desenho consegue detectar de forma confiável. Um resultado significativo em um teste sub-dimensionado tende a superestimar o efeito real.

Efeito de novidade: 9 dias não separam curiosidade de comportamento estabilizado.

3. A divisão foi limpa?

Sinal de alerta. Esperado 50/50, observado 11.200 vs 10.740, 51,05% / 48,95%. Sobre 21.940 usuários, o desvio esperado é de ~74 por grupo; você está com 230 de diferença do ponto médio, cerca de 3 desvios-padrão.

Isso é um SRM provável (p ≈ 0,002). Antes de qualquer leitura do efeito, é preciso descobrir por que menos usuários caíram na variante. As causas usuais: a variante quebra em algum navegador e o usuário não é registrado, um redirecionamento perde parte do tráfego, ou o hash não distribui uniformemente.

Se a variante perde usuários que teriam convertido pior, a conversão dela sobe artificialmente, o que explicaria confortavelmente todo o ganho de 0,32 ponto.

4. O resultado

Só faz sentido ler depois de resolver o item 3, mas para registro: 3,10% → 3,42% é +0,32 p.p., ou +10,3% relativo. O intervalo de confiança de 95% para a diferença vai de aproximadamente +0,02 a +0,63 p.p., a borda inferior está praticamente colada no zero. O intervalo é largo demais para separar "ganho relevante" de "ganho desprezível".

Com três métricas secundárias observadas, o p = 0,04 na primária não sobrevive a nenhuma correção razoável para comparações múltiplas.

5. Métricas de guarda

O ticket médio caiu 4%. Isso pode anular todo o ganho: +10% de conversão com −4% de ticket resulta em cerca de +5,6% de receita, se o efeito for real. Mas há uma explicação alternativa mais provável: o checkout de uma etapa removeu a oportunidade de upsell que existia na etapa intermediária. Você não está convertendo mais gente; está convertendo a mesma gente por menos.


Veredito: INVÁLIDO

O desequilíbrio de amostra (SRM, p ≈ 0,002) torna o resultado não interpretável, a variante perdeu usuários por um motivo desconhecido, e esse motivo pode ser exatamente o que produziu o ganho aparente. Some a isso um desenho sub-dimensionado para o efeito observado, 9 dias sem ciclo semanal completo, e uma queda de 4% no ticket que provavelmente elimina o ganho de receita.

O que rodar: primeiro, investigue o SRM, instrumente a atribuição e confirme 50/50 em uma rodada de teste A/A de 3 dias. Depois, para detectar +10% relativo com 80% de poder a partir de 3,1%, você precisa de aproximadamente 70 mil usuários por grupo, o que no seu volume atual (~1.220/dia por grupo) significa cerca de 8 semanas. Se 8 semanas for inviável, aceite que você não consegue medir um efeito de 10% e decida por outro critério, mas decida sabendo disso.

Como usar

  1. 1

    Copie o template

    Depois da compra o template completo fica disponível para copiar.

  2. 2

    Preencha as variáveis

    Troque a variável destacada pelo seu conteúdo. Deixar em branco degrada a saída.

  3. 3

    Escolha um dos modelos listados

    Rode em um dos modelos listados na lateral. Modelo menor costuma degradar o resultado.

  4. 4

    Cole e execute

    Ou use o laboratório, com sua chave, e compare com o preview.