Menu

Calcolatore di sample size per A/B test

Quanti visitatori servono a ogni variante prima che il test possa dire qualcosa, e quanti giorni sono con il tuo traffico. Imposta il lift minimo che vale la pena rilevare, la confidenza e la potenza, e leggi il conteggio con la formula sotto.

Di Nethanel Bar, Co-founder & CEO

Ultimo aggiornamento

Vuoi imparare a programmare sul serio?

Coddy ti insegna facendoti scrivere codice vero nel browser: lezioni interattive, feedback immediato e aiuto dall'AI quando ti blocchi.

Decidi la dimensione del campione prima di guardare un solo risultato

Una dimensione del campione è una promessa che fai a te stesso prima che il test inizi: "Guarderò il risultato quando lo avranno visto queste persone, e non prima." Senza, ogni A/B test scivola nella stessa storia. La prima settimana sembra promettente, la seconda il lift si restringe, qualcuno chiede se è già significativo e il test finisce il giorno in cui la barra diventa verde. Questa pagina ti dà il numero da scrivere nel piano, così la data di fine è un fatto e non un umore.

Il calcolo è la formula standard della dimensione del campione per due proporzioni, quella dietro il calcolatore di Evan Miller e quello di Optimizely, e dipende da quattro cose: il tasso base, il lift che vuoi poter rilevare, il livello di confidenza e la potenza. La potenza è quella che molti saltano. Con potenza all'80%, un lift reale della dimensione indicata viene colto otto volte su dieci; un test con metà del campione ha molto meno della metà della potenza, ed è per questo che un test sottodimensionato non è "una risposta più grezza" ma di solito nessuna risposta.

La curva sotto il risultato è la parte da ricordare. I visitatori necessari crescono con il quadrato di uno fratto il lift: dimezza il lift che vuoi vedere e ti serve circa quattro volte il traffico. Un sito che può confermare un lift del 30% in due settimane ha bisogno di circa nove volte il tempo per confermarne uno del 10%. Se i giorni vengono espressi in mesi, il calcolatore ti sta dicendo di testare qualcosa di più grande, o di risalire il funnel verso una metrica raggiunta da più persone, prima ancora di dirti di aspettare.

Da cosa dipende la dimensione del campione

  • L'effetto minimo rilevabile è una decisione, non una misura. È il lift più piccolo per cui rilasceresti davvero la modifica. Tenerlo basso per rendere il test "più sensibile" rende il test più lungo, non migliore.
  • Lift relativi e assoluti sono cose diverse. Un lift relativo del 10% su un tasso base del 5% è mezzo punto percentuale. Questa pagina ragiona in termini relativi perché i risultati si riportano così, e mostra accanto il tasso obiettivo così vedi entrambi.
  • Le varianti in più costano più della loro quota. Testare A contro B, C e D sono tre confronti, e la confidenza va divisa tra loro. Il calcolatore applica la correzione di Bonferroni e mostra l'alpha che ogni confronto riceve davvero.
  • I giorni sono un tetto, non un pavimento. Anche quando i numeri dicono quattro giorni, fai girare il test per almeno una settimana intera, meglio due, perché i visitatori dei giorni feriali e del weekend convertono in modo diverso e un test solo di martedì misura i martedì.
  • Una potenza dell'80% significa che un vincitore reale su cinque viene perso. Se perdere un vincitore ti costa caro, usa il 90% e accetta il campione più grande.

Come dimensionare un A/B test

  1. Inserisci il tasso di conversione attuale

    Usa il tasso della pagina o del passaggio che il test cambierà, misurato sullo stesso tipo di visitatori che vedranno il test. Non usare una media di tutto il sito quando testi un solo passaggio del funnel.

  2. Scegli il lift minimo che vale la pena rilevare

    Chiediti quale lift ti farebbe rilasciare la modifica. Quello è il tuo effetto minimo rilevabile. Un 10% relativo è una scelta comune per una pagina matura; un redesign potrebbe giustificare il 20% o più.

  3. Imposta confidenza e potenza

    95% di confidenza e 80% di potenza sono le convenzioni. Alza la confidenza quando annullare un falso vincitore è costoso; alza la potenza quando lasciarsi sfuggire un vincitore è costoso.

  4. Aggiungi i visitatori giornalieri

    Tutte le varianti insieme, contando solo i visitatori che arriveranno al test. Il risultato si trasforma in giorni e settimane intere.

  5. Scrivi la data di fine

    Il calcolatore ti dà la dimensione del campione per variante. Mettila nel piano del test con la data che ne deriva, e non leggere i risultati prima. La scheda del simulatore di peeking mostra perché.

La dimensione del campione a colpo d'occhio

Visitatori per variante con confidenza al 95% e potenza all'80%, bilaterale. Moltiplica per due per un test a due bracci.

Tasso baseLift +5%Lift +10%Lift +20%Lift +50%
1%circa 637,000circa 163,000circa 42,700circa 7,800
3%circa 208,000circa 53,200circa 13,900circa 2,500
5%circa 122,000circa 31,200circa 8,200circa 1,500
10%circa 57,800circa 14,800circa 3,800circa 690
20%circa 25,600circa 6,500circa 1,700circa 290

Esempi svolti

Una pagina di registrazione al 5%, obiettivo +10%

Tasso base 5%, effetto minimo rilevabile 10% (obiettivo 5.5%), confidenza 95%, potenza 80%, bilaterale. Risultato: circa 31,000 visitatori per variante, 62,000 in totale.

Con 1,000 visitatori al giorno sono 62 giorni, quindi nove settimane intere. Molti team lo considererebbero troppo lungo e testerebbero una modifica più audace, oppure accetterebbero che questa pagina ha bisogno di un lift del 20% o più per essere testabile in due settimane.

Un passaggio del checkout al 3%, obiettivo +20%

Tasso base 3%, effetto minimo rilevabile 20% (obiettivo 3.6%). Risultato: circa 13,900 visitatori per variante.

Tassi base più bassi richiedono più visitatori per lo stesso lift relativo, perché ci sono meno conversioni da contare. Qui un lift relativo del 20% è solo 0.6 punti percentuali, e il test deve distinguere il 3.0% dal 3.6%.

Tre varianti contro un controllo

Tasso base 5%, lift 10%, quattro varianti incluso il controllo. L'alpha per confronto diventa 0.05 / 3, e il campione per variante cresce di circa un terzo; il totale è quattro volte il valore per variante.

Aggiungere varianti è il modo più rapido per trasformare un test di due settimane in uno di due mesi. Testa un'idea forte contro il controllo; fai girare l'idea successiva dopo.

Errori sulla dimensione del campione

  • Dimensionare il test dopo aver visto i primi risultati. Il lift che osservi per caso al terzo giorno non è l'effetto minimo rilevabile; è rumore con un'opinione.
  • Usare un lift assoluto quando si intendeva uno relativo. Un "lift del 10%" su un tasso base del 2% è 2.2% oppure 12%, e le dimensioni del campione differiscono di un fattore di centinaia.
  • Fermarsi alla dimensione del campione quando il risultato non è significativo e chiamarla una sconfitta. Raggiungere la dimensione del campione significa che il test può rilevare l'effetto che hai indicato. Non dice nulla sugli effetti più piccoli.
  • Contare le visualizzazioni di pagina come visitatori. La formula assume che ogni unità sia un visitatore indipendente con un solo esito; le visualizzazioni ripetute gonfiano il conteggio e la confidenza.
  • Chiudere a metà settimana. Se la dimensione del campione si raggiunge di giovedì, continua fino alla domenica successiva; il mix dei giorni della settimana cambia i tassi di conversione più della maggior parte delle modifiche testate.

FAQ sulla dimensione del campione

Quanto deve durare un A/B test?
Finché ogni variante ha raggiunto la dimensione del campione per il lift che vuoi rilevare, e per almeno una settimana intera, meglio due. Inserisci sopra i visitatori giornalieri e il calcolatore trasforma la dimensione del campione in giorni e settimane intere. Farlo durare più del necessario è un piccolo spreco; fermarsi prima perché il risultato sembra buono è il modo in cui si dichiara la maggior parte dei falsi vincitori.
Cos'è l'effetto minimo rilevabile?
Il lift più piccolo che il test è progettato per cogliere in modo affidabile, scelto prima del test. Di solito si esprime come variazione relativa, quindi un MDE del 10% su un tasso base del 4% significa che il test può distinguere il 4.0% dal 4.4%. MDE più piccoli richiedono molti più visitatori: dimezzare l'MDE all'incirca quadruplica il campione.
Cosa significa potenza all'80%?
Che se il lift reale è esattamente della dimensione indicata, un test di queste dimensioni risulterà significativo l'80% delle volte. Nel restante 20% si perde un vincitore reale. La potenza è l'immagine speculare della confidenza: la confidenza limita i falsi allarmi, la potenza limita i vincitori persi.
Perché un tasso di conversione più basso richiede più visitatori?
Perché il test conta le conversioni, non i visitatori. Con un tasso dell'1%, 10,000 visitatori ti danno 100 eventi da confrontare; al 10%, te ne danno 1,000. Lo stesso lift relativo è molto più facile da vedere nel secondo caso. È per questo che testare su una metrica più in alto nel funnel, raggiunta da più visitatori, è spesso l'unico modo in cui un sito piccolo può fare test.
Posso testare più di una variante?
Sì, e il calcolatore la dimensiona correttamente, ma ogni variante in più è un altro confronto con il controllo e la confidenza va condivisa tra loro. Quattro varianti al 95% senza correzione danno il 14% di probabilità di almeno un falso vincitore. Il calcolatore divide l'alpha tra i confronti, ed è per questo che il numero per variante cresce.
Funziona per il ricavo o il valore medio dell'ordine?
No, questa pagina dimensiona un test su un tasso di conversione. Le metriche continue come il ricavo per visitatore richiedono la varianza della metrica, che di solito è molto più grande di quella di una proporzione, e le dimensioni del campione crescono di conseguenza. Per quelle ti servono la tua varianza storica e un calcolo basato sul test t.

Altri strumenti per sviluppatori

Illustrazione dei linguaggi di programmazione di Coddy

Impara a programmare con Coddy

INIZIA