Prompt
Você é analista de experimentação. Sua função é impedir decisão ruim, não
confirmar o resultado que o time quer.
## O experimento
- Hipótese: {{hipotese}}
- Métrica primária: {{metrica_primaria}}
- Métricas secundárias e de guarda: {{metricas_secundarias}}
- Resultado: {{resultado}}
- Duração e tamanhoAdquira esse prompt para visualizá-lo
O que este prompt faz
Avalia um experimento verificando poder estatístico, tempo de exposição, múltiplas comparações e efeito de novidade antes de olhar para o p-valor. Recomenda "não decidir ainda" com a mesma naturalidade com que recomenda lançar.
Preview
1. A hipótese era falseável?
Parcialmente. "Aumenta a conversão" é direcional, mas não há tamanho de efeito mínimo de interesse declarado. Sem isso, qualquer aumento vira vitória, inclusive um que não paga o custo de manter duas versões do checkout. Da próxima vez, defina antes: "aumenta em pelo menos X pontos percentuais".
2. O desenho aguenta a conclusão?
Duração: 9 dias. Isso é uma semana e dois dias, não é ciclo completo. E-commerce tem padrão semanal forte, e você está contando dois dias de uma semana a mais que da outra. Se esses dois dias caírem em pico ou vale, o desequilíbrio entra direto no resultado. Rode múltiplos de 7.
Poder: com linha de base de 3,1% e ~11 mil por grupo, você tem poder de ~80% para detectar um efeito relativo de aproximadamente 25% (3,1% → 3,9%). O efeito observado foi de 10% relativo, bem abaixo do que o desenho consegue detectar de forma confiável. Um resultado significativo em um teste sub-dimensionado tende a superestimar o efeito real.
Efeito de novidade: 9 dias não separam curiosidade de comportamento estabilizado.
3. A divisão foi limpa?
Sinal de alerta. Esperado 50/50, observado 11.200 vs 10.740, 51,05% / 48,95%. Sobre 21.940 usuários, o desvio esperado é de ~74 por grupo; você está com 230 de diferença do ponto médio, cerca de 3 desvios-padrão.
Isso é um SRM provável (p ≈ 0,002). Antes de qualquer leitura do efeito, é preciso descobrir por que menos usuários caíram na variante. As causas usuais: a variante quebra em algum navegador e o usuário não é registrado, um redirecionamento perde parte do tráfego, ou o hash não distribui uniformemente.
Se a variante perde usuários que teriam convertido pior, a conversão dela sobe artificialmente, o que explicaria confortavelmente todo o ganho de 0,32 ponto.
4. O resultado
Só faz sentido ler depois de resolver o item 3, mas para registro: 3,10% → 3,42% é +0,32 p.p., ou +10,3% relativo. O intervalo de confiança de 95% para a diferença vai de aproximadamente +0,02 a +0,63 p.p., a borda inferior está praticamente colada no zero. O intervalo é largo demais para separar "ganho relevante" de "ganho desprezível".
Com três métricas secundárias observadas, o p = 0,04 na primária não sobrevive a nenhuma correção razoável para comparações múltiplas.
5. Métricas de guarda
O ticket médio caiu 4%. Isso pode anular todo o ganho: +10% de conversão com −4% de ticket resulta em cerca de +5,6% de receita, se o efeito for real. Mas há uma explicação alternativa mais provável: o checkout de uma etapa removeu a oportunidade de upsell que existia na etapa intermediária. Você não está convertendo mais gente; está convertendo a mesma gente por menos.
Veredito: INVÁLIDO
O desequilíbrio de amostra (SRM, p ≈ 0,002) torna o resultado não interpretável, a variante perdeu usuários por um motivo desconhecido, e esse motivo pode ser exatamente o que produziu o ganho aparente. Some a isso um desenho sub-dimensionado para o efeito observado, 9 dias sem ciclo semanal completo, e uma queda de 4% no ticket que provavelmente elimina o ganho de receita.
O que rodar: primeiro, investigue o SRM, instrumente a atribuição e confirme 50/50 em uma rodada de teste A/A de 3 dias. Depois, para detectar +10% relativo com 80% de poder a partir de 3,1%, você precisa de aproximadamente 70 mil usuários por grupo, o que no seu volume atual (~1.220/dia por grupo) significa cerca de 8 semanas. Se 8 semanas for inviável, aceite que você não consegue medir um efeito de 10% e decida por outro critério, mas decida sabendo disso.
Como usar
- 1
Copie o template
Depois da compra o template completo fica disponível para copiar.
- 2
Preencha as variáveis
Troque a variável destacada pelo seu conteúdo. Deixar em branco degrada a saída.
- 3
Escolha um dos modelos listados
Rode em um dos modelos listados na lateral. Modelo menor costuma degradar o resultado.
- 4
Cole e execute
Ou use o laboratório, com sua chave, e compare com o preview.