R$45.00text
  • Claude
  • ChatGPT

Leitura de teste A/B sem enganação

  • no rating
  • 0
  • 0
  • Jul 18, 2026

Diz quando o resultado não conclui nada, e isso é o mais útil.

R$45.00

One-time payment for this item.

Lab

Test how it works before buying.

Try it

Prompt

You are seeing 9 of 42 lines

Você é analista de experimentação. Sua função é impedir decisão ruim, não
confirmar o resultado que o time quer.

## O experimento
- Hipótese: {{hipotese}}
- Métrica primária: {{metrica_primaria}}
- Métricas secundárias e de guarda: {{metricas_secundarias}}
- Resultado: {{resultado}}
- Duração e tamanho

Get this prompt to see it

What this prompt does

Avalia um experimento verificando poder estatístico, tempo de exposição, múltiplas comparações e efeito de novidade antes de olhar para o p-valor. Recomenda "não decidir ainda" com a mesma naturalidade com que recomenda lançar.

Preview

Result

1. A hipótese era falseável?

Parcialmente. "Aumenta a conversão" é direcional, mas não há tamanho de efeito mínimo de interesse declarado. Sem isso, qualquer aumento vira vitória, inclusive um que não paga o custo de manter duas versões do checkout. Da próxima vez, defina antes: "aumenta em pelo menos X pontos percentuais".

2. O desenho aguenta a conclusão?

Duração: 9 dias. Isso é uma semana e dois dias, não é ciclo completo. E-commerce tem padrão semanal forte, e você está contando dois dias de uma semana a mais que da outra. Se esses dois dias caírem em pico ou vale, o desequilíbrio entra direto no resultado. Rode múltiplos de 7.

Poder: com linha de base de 3,1% e ~11 mil por grupo, você tem poder de ~80% para detectar um efeito relativo de aproximadamente 25% (3,1% → 3,9%). O efeito observado foi de 10% relativo, bem abaixo do que o desenho consegue detectar de forma confiável. Um resultado significativo em um teste sub-dimensionado tende a superestimar o efeito real.

Efeito de novidade: 9 dias não separam curiosidade de comportamento estabilizado.

3. A divisão foi limpa?

Sinal de alerta. Esperado 50/50, observado 11.200 vs 10.740, 51,05% / 48,95%. Sobre 21.940 usuários, o desvio esperado é de ~74 por grupo; você está com 230 de diferença do ponto médio, cerca de 3 desvios-padrão.

Isso é um SRM provável (p ≈ 0,002). Antes de qualquer leitura do efeito, é preciso descobrir por que menos usuários caíram na variante. As causas usuais: a variante quebra em algum navegador e o usuário não é registrado, um redirecionamento perde parte do tráfego, ou o hash não distribui uniformemente.

Se a variante perde usuários que teriam convertido pior, a conversão dela sobe artificialmente, o que explicaria confortavelmente todo o ganho de 0,32 ponto.

4. O resultado

Só faz sentido ler depois de resolver o item 3, mas para registro: 3,10% → 3,42% é +0,32 p.p., ou +10,3% relativo. O intervalo de confiança de 95% para a diferença vai de aproximadamente +0,02 a +0,63 p.p., a borda inferior está praticamente colada no zero. O intervalo é largo demais para separar "ganho relevante" de "ganho desprezível".

Com três métricas secundárias observadas, o p = 0,04 na primária não sobrevive a nenhuma correção razoável para comparações múltiplas.

5. Métricas de guarda

O ticket médio caiu 4%. Isso pode anular todo o ganho: +10% de conversão com −4% de ticket resulta em cerca de +5,6% de receita, se o efeito for real. Mas há uma explicação alternativa mais provável: o checkout de uma etapa removeu a oportunidade de upsell que existia na etapa intermediária. Você não está convertendo mais gente; está convertendo a mesma gente por menos.


Veredito: INVÁLIDO

O desequilíbrio de amostra (SRM, p ≈ 0,002) torna o resultado não interpretável, a variante perdeu usuários por um motivo desconhecido, e esse motivo pode ser exatamente o que produziu o ganho aparente. Some a isso um desenho sub-dimensionado para o efeito observado, 9 dias sem ciclo semanal completo, e uma queda de 4% no ticket que provavelmente elimina o ganho de receita.

O que rodar: primeiro, investigue o SRM, instrumente a atribuição e confirme 50/50 em uma rodada de teste A/A de 3 dias. Depois, para detectar +10% relativo com 80% de poder a partir de 3,1%, você precisa de aproximadamente 70 mil usuários por grupo, o que no seu volume atual (~1.220/dia por grupo) significa cerca de 8 semanas. Se 8 semanas for inviável, aceite que você não consegue medir um efeito de 10% e decida por outro critério, mas decida sabendo disso.

How to use

  1. 1

    Copy the template

    After the purchase the full template becomes available to copy.

  2. 2

    Fill in the variables

    Swap the highlighted variable for your own content. Leaving them blank degrades the output.

  3. 3

    Pick one of the listed models

    Run it on one of the models listed on the side. A smaller model usually degrades the result.

  4. 4

    Paste and run

    Or use the lab, with your own key, and compare it against the preview.