Menu

Calcolatore A/B Test

Inserisci i visitatori e le conversioni di ogni variante. Ottieni il verdetto in una frase, il p-value con tutti i passaggi, l'intervallo, la probabilità bayesiana che B sia migliore, un controllo che lo split del traffico non sia rotto e il lift minimo che questo test avrebbe mai potuto vedere.

Di Nethanel Bar, Co-founder & CEO

Ultimo aggiornamento

Vuoi imparare a programmare sul serio?

Coddy ti insegna facendoti scrivere codice vero nel browser: lezioni interattive, feedback immediato e aiuto dall'AI quando ti blocchi.

Cosa ti dice questo calcolatore che gli altri non dicono

Ogni calcolatore di A/B test stampa un p-value. La maggior parte si ferma lì, ed è così che i founder finiscono a fissare un 87% di confidenza chiedendosi cosa significhi. Questo risponde alle domande che decidono davvero cosa fai dopo. La differenza è più grande di quella che produrrebbe il caso? Quanto potrebbe essere grande il lift reale, nel caso peggiore e nel migliore? Se il test è uscito "non significativo", avrebbe mai potuto trovare qualcosa con questo campione? E lo split del traffico è sano, o stai confrontando due gruppi che non sono mai stati uguali?

Usa il classico test z per due proporzioni, lo stesso del motore classico di Optimizely, della modalità frequentista di VWO e di ogni manuale di statistica, e mostra ogni riga del calcolo: il tasso aggregato, l'errore standard, lo z-score e l'area della coda. Accanto trovi la risposta bayesiana, la probabilità che il tasso reale di B sia superiore a quello di A, perché "c'è il 91% di probabilità che B sia migliore" è la frase che la maggior parte delle persone sperava di ottenere dal p-value, ed è un numero diverso.

L'abbiamo costruito dopo aver guardato la nostra dashboard. Coddy ha fatto girare una ventina di esperimenti, dieci dei quali test di prezzo per paese su piccole fette di traffico, e il nostro strumento interno mostrava una barra di confidenza con la scritta "Continua" sotto il 95%. È l'optional stopping con una faccia simpatica. Le tre schede accanto a questa, sample size, verifica di realtà e simulatore di peeking, esistono perché un calcolatore che riporta solo la significatività è un calcolatore che ti aiuta a ingannarti più in fretta.

Cosa sapere prima di fidarti del numero

  • "Non significativo" non vuol dire "nessuna differenza". Vuol dire che i dati non sanno dirlo. Il riquadro con il lift minimo che questo test poteva vedere è la lettura onesta: se il lift osservato è sotto quella soglia, il test non avrebbe mai potuto rispondere.
  • Il p-value non è la probabilità di sbagliare. È la probabilità di vedere un distacco così grande se le due varianti fossero identiche. Quanto è probabile che il vincitore sia reale dipende anche da quanto spesso le tue idee funzionano, e la scheda della verifica di realtà lo trasforma in un numero.
  • Fermarsi il primo giorno in cui la barra diventa verde è l'abitudine più costosa dell'A/B testing. Controllare ogni giorno e fermarsi presto trasforma un tasso di falsi positivi del 5% in un 20% o più. Il simulatore di peeking te lo mostra sul tuo traffico.
  • Uno split rotto avvelena tutto. Se avevi pianificato 50/50 e hai ottenuto 46/54, qualcosa sta smistando gli utenti prima che arrivino al test: uno strato di cache, un filtro anti bot, un redirect. Il calcolatore fa questo controllo per primo e si rifiuta di dare un verdetto finché non passa.
  • Sotto le 25 conversioni circa per braccio, l'approssimazione normale alla base del test z è un abbozzo, non una misura. Il calcolatore lo dice invece di stampare tre decimali di falsa precisione.

Come usare il calcolatore A/B test

  1. Inserisci visitatori e conversioni per A e B

    I visitatori sono le persone assegnate a quella variante, non le visualizzazioni di pagina. Le conversioni sono quelle che hanno fatto l'azione che stai misurando: registrazione, pagamento, clic. Vanno contati allo stesso modo in entrambi i bracci.

  2. Scegli la confidenza e l'ipotesi

    95% bilaterale è il valore predefinito ed è la scelta onesta quando B potrebbe essere migliore o peggiore. Il test unilaterale serve solo quando un B peggiore verrebbe ignorato esattamente come un nessun cambiamento, cosa più rara di quanto si pensi.

  3. Leggi il verdetto, poi l'intervallo

    Il banner dice cosa supportano i numeri. Il riquadro del lift relativo mostra l'intervallo: l'effetto reale probabilmente sta in un punto qualsiasi al suo interno, e l'estremo basso è il numero su cui pianificare, non la stima puntuale.

  4. Controlla i due avvisi

    Se lo split è segnalato, sistema il test prima di leggere qualsiasi altra cosa. Se il lift minimo rilevabile è più grande del lift osservato, il test non aveva abbastanza potenza: vai alla scheda sample size e guarda quanti visitatori servirebbero.

  5. Copia il risultato o il link

    Copia risultato ti dà il riepilogo da incollare in un messaggio o in un documento. Copia link mette i quattro numeri nell'URL, così chi lo apre vede lo stesso calcolo.

Come leggere i risultati

Cosa significa ogni riquadro, in una riga.

RiquadroCos'èCome leggerlo
Lift relativo(tasso B meno tasso A) diviso tasso AIl dato principale. L'intervallo accanto è l'intervallo in cui probabilmente si trova il lift reale.
p-valueProbabilità di un distacco così grande se A e B fossero identiciSotto 0.05 con confidenza al 95% significa significativo. Non è la probabilità che il risultato sia sbagliato.
Confidenza1 meno p, in percentualeIl numero che stampa la maggior parte degli strumenti. 87% non è quasi 95%; è una moneta dal lato sbagliato della linea.
Probabilità che B sia miglioreProbabilità bayesiana che il tasso reale di B sia sopra quello di ALa frase che le persone vogliono. 91% significa che B è probabilmente migliore, non che è migliore del 91%.
Lift minimo che questo test poteva vedereIl lift relativo rilevabile con potenza all'80% con queste dimensioni dei bracciSe il lift osservato è sotto questa soglia, "non significativo" vuol dire "non si può dire".
Split del trafficoQuota osservata di visitatori in ogni braccio rispetto al pianoSegnalato quando lo split si discosta più di quanto il caso consenta. Sistema il test prima di leggere i risultati.

Tre test, tre lezioni diverse

Il classico quasi ci siamo

A: 10,000 visitatori, 500 conversioni (5.00%). B: 10,000 visitatori, 560 conversioni (5.60%). Lift relativo +12%, p = 0.058.

Non significativo al 95%, e l'intervallo va da circa meno 0.4% a più 24%. La lettura onesta è "probabilmente un piccolo effetto positivo, forse niente". Il lift minimo che questo test poteva rilevare è circa il 17%, quindi un effetto del 12% sarebbe sempre finito nella zona grigia. Serve circa il doppio del traffico, non un'altra settimana di speranze.

Lo split rotto

A: 5,000 visitatori, 100 conversioni. B: 4,300 visitatori, 120 conversioni. Split pianificato 50/50.

B sembra un vincitore netto con +40%. Il calcolatore si rifiuta di dirlo: uno split 5,000 contro 4,300 ha meno di una probabilità su un milione di capitare per caso con 50/50. Qualcosa sta togliendo utenti da B prima che vengano contati, spesso un redirect che fallisce su un browser o un filtro anti bot che tratta la variante in modo diverso. Qualunque cosa sia, i due gruppi non sono confrontabili e il lift non significa nulla.

Il sito piccolo

A: 400 visitatori, 12 conversioni (3.0%). B: 400 visitatori, 19 conversioni (4.75%). Lift relativo +58%, p = 0.20.

Un lift del 58% sembra enorme, e il p-value è circa 0.19. Con 12 e 19 conversioni il calcolatore segnala pochi dati: a queste dimensioni i numeri oscillano così tanto che una sola registrazione in più sposta il tasso di un quarto di punto. Con questo traffico il lift minimo che il test potrebbe confermare in un mese supera il 100%. Non è un motivo per farlo durare di più; è un motivo per leggere la scheda della verifica di realtà.

Errori che questo calcolatore è fatto per scovare

  • Leggere il 90% di confidenza come "probabilmente va bene". Al 95% la soglia è il 95%. Il numero sotto significa che i dati non hanno superato l'asticella che hai fissato, e l'errore è spostare l'asticella dopo aver guardato, non il numero.
  • Chiamare pareggio un test non significativo. Un pareggio è un intervallo minuscolo intorno allo zero. Un test non significativo con un intervallo ampio è una domanda senza risposta, e la scheda sample size ti dice quanto costerebbe rispondere.
  • Dichiarare un vincitore la prima mattina in cui la barra diventa verde. Il simulatore di peeking fa girare duemila test in cui non è cambiato nulla e mostra quanti ne avrebbe rilasciati chi controlla ogni giorno.
  • Testare cinque varianti e riportare la migliore al 95%. Cinque confronti al 5% ciascuno danno il 23% di probabilità di un vincitore spurio. La scheda sample size divide l'alpha per te quando aggiungi varianti.
  • Confrontare visualizzazioni di pagina con utenti unici, o contare le conversioni su una finestra diversa da quella dei visitatori. Il test z assume che ogni visitatore sia una prova indipendente; qualsiasi altra cosa gonfia la confidenza.
  • Ignorare lo split. Uno split 48/52 su 100,000 visitatori non è il caso; è un bug, e ogni risultato a valle non è affidabile.

FAQ sul calcolatore A/B test

Come faccio a sapere se il mio A/B test è statisticamente significativo?
Inserisci i visitatori e le conversioni di ogni variante, scegli un livello di confidenza (il 95% è lo standard) e leggi il verdetto. Il test è significativo quando il p-value è sotto 1 meno la confidenza, quindi sotto 0.05 al 95%. Questa pagina ti dice anche l'intervallo del lift reale e se il test poteva rilevare l'effetto che stai guardando, cosa che un p-value da solo non può fare.
Cosa significa un p-value di 0.08 per il mio test?
Che se A e B convertissero davvero allo stesso tasso, un distacco almeno così grande comparirebbe per caso circa l'8% delle volte. Non è la probabilità che il risultato sia sbagliato, e non è "92% di confidenza che B sia migliore". Con confidenza al 95% significa che il test non ha superato l'asticella; guarda il riquadro del lift minimo rilevabile per capire se avrebbe mai potuto farlo.
Una confidenza del 90% basta?
Può bastare, se hai scelto il 90% prima di iniziare il test e accetti un tasso di falsi positivi di uno su dieci. Quello che non basta mai è lavorare al 95%, vedere 91% e decidere che la vera soglia era il 90% da sempre. Il livello di confidenza è una promessa su quanto spesso accetti di farti ingannare; cambiarlo dopo aver guardato rompe la promessa.
Quante conversioni mi servono per variante?
Non esiste un numero magico, ma sotto le 25 conversioni circa per braccio il test z è un abbozzo, e la maggior parte dei test reali ne richiede centinaia. Il numero che conta è il lift che vuoi rilevare: con un tasso base del 5%, vedere un lift relativo del 10% con confidenza al 95% e potenza all'80% richiede circa 31,000 visitatori per variante, circa 1,550 conversioni ciascuna. La scheda sample size lo calcola con i tuoi tassi.
Qual è la differenza tra il p-value frequentista e la probabilità bayesiana che B sia migliore?
Il p-value chiede "quanto è sorprendente questo distacco se non è cambiato nulla?" e dà un sì o un no rispetto a una soglia. Il numero bayesiano chiede "dato quello che ho visto, quanto è probabile che il tasso reale di B sia sopra quello di A?" e dà una probabilità. Sugli stessi dati di solito concordano sulla direzione: un p di 0.05 corrisponde più o meno a una probabilità del 97% che B sia migliore in un test bilaterale. Questa pagina li mostra entrambi perché la frase bayesiana è quella che le persone intendono quando dicono "confidenza", e il p-value è quello che stampa il loro strumento.
Perché il calcolatore si rifiuta di dare un verdetto quando lo split è sbagliato?
Perché un sample ratio mismatch significa che i due gruppi non sono stati assegnati a caso, e la randomizzazione è l'unico motivo per cui un A/B test funziona. Se avevi pianificato 50/50 e lo split osservato ha meno di una probabilità su mille di nascere per caso, c'è un meccanismo che decide chi finisce in quale braccio, e potrebbe essere correlato con la conversione. Il lift che vedi potrebbe essere quel meccanismo, non la tua modifica.
Posso usare questo calcolatore per il ricavo per visitatore o il valore medio dell'ordine?
No. Questa pagina testa una proporzione: ogni visitatore ha convertito oppure no. Il ricavo per visitatore è una metrica continua e molto asimmetrica, e richiede un test t o un bootstrap sugli importi per utente, che a loro volta richiedono i dati grezzi invece di quattro totali. Il calcolatore del test t tra i calcolatori matematici di Coddy gestisce il confronto tra medie una volta che hai i valori per utente.
Da dove viene il lift minimo rilevabile?
Dalla stessa formula del calcolatore di sample size, applicata al contrario. Date le dimensioni dei bracci e il tasso di A, trova il lift relativo che l'80% dei test di questa dimensione coglierebbe al tuo livello di confidenza. Se il lift osservato è sotto questa soglia, il test non aveva abbastanza potenza per quell'effetto, e "non significativo" non dice quasi nulla sul fatto che la modifica abbia funzionato.

Altri strumenti per sviluppatori

Illustrazione dei linguaggi di programmazione di Coddy

Impara a programmare con Coddy

INIZIA