Come faccio a sapere se il mio A/B test è statisticamente significativo?
Inserisci i visitatori e le conversioni di ogni variante, scegli un livello di confidenza (il 95% è lo standard) e leggi il verdetto. Il test è significativo quando il p-value è sotto 1 meno la confidenza, quindi sotto 0.05 al 95%. Questa pagina ti dice anche l'intervallo del lift reale e se il test poteva rilevare l'effetto che stai guardando, cosa che un p-value da solo non può fare.
Cosa significa un p-value di 0.08 per il mio test?
Che se A e B convertissero davvero allo stesso tasso, un distacco almeno così grande comparirebbe per caso circa l'8% delle volte. Non è la probabilità che il risultato sia sbagliato, e non è "92% di confidenza che B sia migliore". Con confidenza al 95% significa che il test non ha superato l'asticella; guarda il riquadro del lift minimo rilevabile per capire se avrebbe mai potuto farlo.
Una confidenza del 90% basta?
Può bastare, se hai scelto il 90% prima di iniziare il test e accetti un tasso di falsi positivi di uno su dieci. Quello che non basta mai è lavorare al 95%, vedere 91% e decidere che la vera soglia era il 90% da sempre. Il livello di confidenza è una promessa su quanto spesso accetti di farti ingannare; cambiarlo dopo aver guardato rompe la promessa.
Quante conversioni mi servono per variante?
Non esiste un numero magico, ma sotto le 25 conversioni circa per braccio il test z è un abbozzo, e la maggior parte dei test reali ne richiede centinaia. Il numero che conta è il lift che vuoi rilevare: con un tasso base del 5%, vedere un lift relativo del 10% con confidenza al 95% e potenza all'80% richiede circa 31,000 visitatori per variante, circa 1,550 conversioni ciascuna. La scheda sample size lo calcola con i tuoi tassi.
Qual è la differenza tra il p-value frequentista e la probabilità bayesiana che B sia migliore?
Il p-value chiede "quanto è sorprendente questo distacco se non è cambiato nulla?" e dà un sì o un no rispetto a una soglia. Il numero bayesiano chiede "dato quello che ho visto, quanto è probabile che il tasso reale di B sia sopra quello di A?" e dà una probabilità. Sugli stessi dati di solito concordano sulla direzione: un p di 0.05 corrisponde più o meno a una probabilità del 97% che B sia migliore in un test bilaterale. Questa pagina li mostra entrambi perché la frase bayesiana è quella che le persone intendono quando dicono "confidenza", e il p-value è quello che stampa il loro strumento.
Perché il calcolatore si rifiuta di dare un verdetto quando lo split è sbagliato?
Perché un sample ratio mismatch significa che i due gruppi non sono stati assegnati a caso, e la randomizzazione è l'unico motivo per cui un A/B test funziona. Se avevi pianificato 50/50 e lo split osservato ha meno di una probabilità su mille di nascere per caso, c'è un meccanismo che decide chi finisce in quale braccio, e potrebbe essere correlato con la conversione. Il lift che vedi potrebbe essere quel meccanismo, non la tua modifica.
Posso usare questo calcolatore per il ricavo per visitatore o il valore medio dell'ordine?
No. Questa pagina testa una proporzione: ogni visitatore ha convertito oppure no. Il ricavo per visitatore è una metrica continua e molto asimmetrica, e richiede un test t o un bootstrap sugli importi per utente, che a loro volta richiedono i dati grezzi invece di quattro totali. Il calcolatore del test t tra i calcolatori matematici di Coddy gestisce il confronto tra medie una volta che hai i valori per utente.
Da dove viene il lift minimo rilevabile?
Dalla stessa formula del calcolatore di sample size, applicata al contrario. Date le dimensioni dei bracci e il tasso di A, trova il lift relativo che l'80% dei test di questa dimensione coglierebbe al tuo livello di confidenza. Se il lift osservato è sotto questa soglia, il test non aveva abbastanza potenza per quell'effetto, e "non significativo" non dice quasi nulla sul fatto che la modifica abbia funzionato.