Calculadora de Significancia en Tests A/B
Ese "lift del 10%" en tu experimento — ¿es real o ruido aleatorio?
¿Por qué "10% más conversiones" suele ser ruido?
El error más común en pruebas A/B: declarar un ganador demasiado pronto. Con tamaños de muestra pequeños, un levantamiento del 10% puede ser fácilmente variación aleatoria. Necesitas significancia estadística (típicamente p < 0.05, o confianza del 95%) antes de confiar en un resultado.
Para una tasa de conversión base del 5% y un levantamiento relativo del 10% (a 5.5%), necesitas aproximadamente 28,000 visitantes por grupo. La mayoría de los equipos detienen sus pruebas demasiado pronto.
Requisitos de tamaño de muestra
Mínimo de visitantes por grupo necesarios para detectar un levantamiento con confianza del 95% / potencia del 80%:
| Tasa base | Levantamiento 5% | Levantamiento 10% | Levantamiento 20% |
|---|---|---|---|
| 1% | 635K | 159K | 40K |
| 2% | 312K | 78K | 20K |
| 5% | 118K | 30K | 7.5K |
| 10% | 54K | 14K | 3.5K |
| 20% | 24K | 6.1K | 1.6K |
Por eso los sitios con poco tráfico luchan con pruebas A/B — detectar levantamientos pequeños requiere muestras enormes.
Errores comunes en pruebas A/B
Mirar prematuramente: Revisar resultados diariamente y detener cuando se ven bien infla las tasas de falsos positivos a 25%+ (del objetivo del 5%).
Variantes múltiples: Probar 5 variantes sin corrección significa una probabilidad del 23% de un ganador falso.
Efectos estacionales: Una prueba que se ejecuta de lunes a viernes pierde el comportamiento del fin de semana. Siempre ejecuta múltiplos de semana completa.