Menu

A/B 테스트 표본 크기 계산기

테스트가 무언가를 말할 수 있으려면 각 변형에 방문자가 몇 명 필요한지, 그리고 당신의 트래픽에서 그게 며칠인지 알려줍니다. 감지할 가치가 있는 최소 향상률과 신뢰수준, 검정력을 정하고 아래 공식과 함께 숫자를 확인하세요.

작성자 Nethanel Bar, Co-founder & CEO

마지막 업데이트

진짜로 코딩을 배워볼까요?

Coddy는 브라우저에서 실제 코드를 작성하며 배웁니다. 인터랙티브 레슨, 즉각적인 피드백, 막힐 때 도와주는 AI까지.

결과를 하나라도 보기 전에 표본 크기를 정하세요

표본 크기는 테스트를 시작하기 전에 자신과 맺는 약속입니다: '이만큼의 사람이 보고 나면 결과를 볼 것이고, 그 전에는 보지 않는다.' 이게 없으면 모든 A/B 테스트가 같은 이야기로 흘러갑니다. 첫 주에는 유망해 보이고, 둘째 주에 향상률이 줄고, 누군가 벌써 유의한지 묻고, 막대가 초록색이 된 날 테스트가 끝납니다. 이 페이지는 계획서에 적을 숫자를 주기 때문에, 종료일이 기분이 아니라 사실이 됩니다.

계산은 표준 두 비율 표본 크기 공식으로, Evan Miller의 계산기와 Optimizely 뒤에 있는 바로 그 공식이며 네 가지에 달려 있습니다: 기준 전환율, 감지하고 싶은 향상률, 신뢰수준, 검정력. 사람들이 건너뛰는 건 검정력입니다. 검정력 80%에서는 당신이 지정한 크기의 진짜 향상이 열 번 중 여덟 번 잡힙니다. 표본이 절반인 테스트는 검정력이 절반보다 훨씬 낮은데, 검정력이 부족한 테스트가 '조금 거친 답'이 아니라 대개 아무 답도 아닌 이유가 그것입니다.

결과 아래 곡선이 기억할 만한 부분입니다. 필요한 방문자 수는 향상률의 역수의 제곱으로 커집니다: 보고 싶은 향상률을 절반으로 줄이면 트래픽이 약 네 배 필요합니다. 30% 향상을 2주 만에 확인할 수 있는 사이트는 10% 향상을 확인하는 데 약 아홉 배의 시간이 걸립니다. 일수가 개월 단위로 나온다면, 그건 기다리라는 말이기 전에 더 큰 변경을 테스트하거나 더 많은 사람이 닿는 퍼널 위쪽 지표로 올라가라는 계산기의 신호입니다.

표본 크기는 무엇에 달려 있는가

  • 최소 감지 효과는 측정이 아니라 결정입니다. 실제로 배포할 마음이 드는 가장 작은 향상률이죠. 테스트를 '더 민감하게' 만들려고 낮게 잡으면 테스트가 길어질 뿐 좋아지지 않습니다.
  • 상대 향상률과 절대 향상률은 전혀 다른 물건입니다. 기준 5%에서 상대 10% 향상은 0.5%포인트입니다. 이 페이지는 결과가 보고되는 방식이 그러하므로 상대값으로 계산하고, 둘 다 볼 수 있도록 목표 전환율을 옆에 보여줍니다.
  • 변형을 추가하는 비용은 그 몫보다 큽니다. A를 B, C, D와 겨루는 것은 세 번의 비교이고, 신뢰수준을 그 사이에 나눠야 합니다. 계산기는 본페로니 분할을 적용하고 각 비교가 실제로 받는 알파를 보여줍니다.
  • 일수는 하한이 아니라 상한입니다. 숫자가 4일이라고 해도 최소 한 주, 가능하면 두 주를 온전히 돌리세요. 평일과 주말 방문자의 전환 양상이 다르고, 화요일만 돌린 테스트는 화요일을 측정한 것이기 때문입니다.
  • 검정력 80%는 진짜 승자 다섯 중 하나를 놓친다는 뜻입니다. 승자를 놓치는 비용이 크다면 90%를 쓰고 더 큰 표본을 받아들이세요.

A/B 테스트 크기를 정하는 법

  1. 현재 전환율을 입력하세요

    테스트가 바꿀 페이지나 단계의 전환율을, 테스트가 보게 될 것과 같은 종류의 방문자에서 측정해 쓰세요. 퍼널 한 단계를 테스트하면서 사이트 전체 평균을 쓰지 마세요.

  2. 감지할 가치가 있는 최소 향상률을 고르세요

    어느 정도 향상이면 이 변경을 배포하겠는지 자문해 보세요. 그게 최소 감지 효과입니다. 성숙한 페이지에서는 상대 10%가 흔한 선택이고, 전면 개편이라면 20% 이상도 정당화됩니다.

  3. 신뢰수준과 검정력을 정하세요

    신뢰수준 95%와 검정력 80%가 관례입니다. 가짜 승자를 되돌리는 비용이 크면 신뢰수준을 올리고, 진짜 승자를 놓치는 비용이 크면 검정력을 올리세요.

  4. 하루 방문자 수를 넣으세요

    테스트에 닿을 방문자만 세어 모든 변형을 합친 수치입니다. 결과가 일수와 온전한 주 단위로 환산됩니다.

  5. 종료일을 적어두세요

    계산기는 변형당 표본 크기를 알려줍니다. 그 숫자가 뜻하는 날짜와 함께 테스트 계획서에 적어두고, 그 전에는 결과를 읽지 마세요. 왜 그래야 하는지는 엿보기 시뮬레이터 탭이 보여줍니다.

표본 크기 한눈에 보기

신뢰수준 95%, 검정력 80%, 양측 기준 변형당 방문자 수입니다. 두 그룹 테스트라면 두 배 하세요.

기준 전환율+5% 향상+10% 향상+20% 향상+50% 향상
1%약 637,000약 163,000약 42,700약 7,800
3%약 208,000약 53,200약 13,900약 2,500
5%약 122,000약 31,200약 8,200약 1,500
10%약 57,800약 14,800약 3,800약 690
20%약 25,600약 6,500약 1,700약 290

계산 예시

전환율 5%인 가입 페이지에서 +10%를 노릴 때

기준 5%, 최소 감지 효과 10%(목표 5.5%), 신뢰수준 95%, 검정력 80%, 양측. 결과: 변형당 약 31,000명, 총 62,000명.

하루 방문자가 1,000명이면 62일, 즉 온전히 아홉 주입니다. 많은 팀이 너무 길다고 판단해 더 과감한 변경을 테스트하거나, 이 페이지는 2주 안에 테스트하려면 20% 이상의 향상이 필요하다는 사실을 받아들입니다.

전환율 3%인 결제 단계에서 +20%를 노릴 때

기준 3%, 최소 감지 효과 20%(목표 3.6%). 결과: 변형당 약 13,900명.

기준 전환율이 낮을수록 같은 상대 향상률을 보는 데 방문자가 더 많이 필요합니다. 셀 수 있는 전환 자체가 적기 때문이죠. 여기서 상대 20% 향상은 겨우 0.6%포인트이고, 테스트는 3.0%와 3.6%를 구별해야 합니다.

대조군에 맞서는 세 개의 변형

기준 5%, 향상률 10%, 대조군 포함 네 개 변형. 비교당 알파는 0.05 / 3이 되고 변형당 표본은 약 3분의 1 늘어납니다. 총합은 변형당 수치의 네 배입니다.

변형을 추가하는 것은 2주짜리 테스트를 두 달짜리로 바꾸는 가장 빠른 방법입니다. 강한 아이디어 하나를 대조군과 겨루게 하고, 다음 아이디어는 그다음에 돌리세요.

표본 크기에서 흔한 실수

  • 초기 결과를 본 뒤에 테스트 크기를 정하는 것. 3일째에 우연히 관측된 향상률은 최소 감지 효과가 아니라 의견을 가진 잡음입니다.
  • 상대 향상률을 뜻하면서 절대 향상률을 쓰는 것. 기준 2%에서 '10% 향상'은 2.2%일 수도 12%일 수도 있고, 표본 크기는 수백 배 차이가 납니다.
  • 표본 크기에 도달했는데 결과가 유의하지 않다고 패배로 부르는 것. 표본 크기에 도달했다는 것은 당신이 지정한 효과를 감지할 수 있다는 뜻입니다. 그보다 작은 효과에 대해서는 아무 말도 하지 않습니다.
  • 페이지뷰를 방문자로 세는 것. 공식은 각 단위가 하나의 결과를 가진 독립적인 방문자라고 가정하며, 반복 조회는 수치와 신뢰도를 함께 부풀립니다.
  • 주의 중간에 끝내는 것. 목요일에 표본 크기를 채웠다면 다음 일요일까지 돌리세요. 요일 구성은 대부분의 테스트 변경보다 전환율을 더 크게 흔듭니다.

표본 크기 자주 묻는 질문

A/B 테스트는 얼마나 오래 돌려야 하나요?
감지하고 싶은 향상률에 해당하는 표본 크기를 각 변형이 채울 때까지, 그리고 최소 한 주, 되도록이면 두 주를 온전히 돌리세요. 위에 하루 방문자 수를 넣으면 계산기가 표본 크기를 일수와 주 단위로 환산해 줍니다. 필요보다 길게 돌리는 건 작은 낭비지만, 결과가 좋아 보인다고 일찍 멈추는 것이야말로 대부분의 가짜 승자가 선언되는 경로입니다.
최소 감지 효과란 무엇인가요?
테스트가 안정적으로 잡아내도록 설계된 가장 작은 향상률이며, 테스트 전에 정합니다. 보통 상대 변화로 표현하므로 기준 4%에서 MDE 10%는 테스트가 4.0%와 4.4%를 구별할 수 있다는 뜻입니다. MDE가 작아지면 방문자가 극적으로 더 필요합니다: MDE를 절반으로 줄이면 표본은 대략 네 배가 됩니다.
검정력 80%는 무슨 뜻인가요?
진짜 향상률이 정확히 당신이 지정한 크기라면, 이 크기의 테스트가 80%의 경우에 유의하게 나온다는 뜻입니다. 나머지 20%에서는 진짜 승자를 놓칩니다. 검정력은 신뢰수준의 거울상입니다: 신뢰수준은 거짓 경보를 제한하고, 검정력은 놓치는 승자를 제한합니다.
전환율이 낮으면 왜 방문자가 더 많이 필요한가요?
테스트가 세는 것은 방문자가 아니라 전환이기 때문입니다. 전환율 1%에서 방문자 10,000명은 비교할 사건 100건을 주고, 10%에서는 1,000건을 줍니다. 같은 상대 향상률이라도 두 번째 경우가 훨씬 보기 쉽습니다. 작은 사이트가 테스트를 할 수 있는 유일한 길이 종종 더 많은 방문자가 닿는 퍼널 위쪽 지표로 올라가는 것인 이유입니다.
변형을 두 개 이상 돌려도 되나요?
됩니다. 계산기도 그에 맞게 크기를 잡아줍니다. 다만 변형이 하나 늘 때마다 대조군과의 비교가 하나 늘고, 신뢰수준을 그 사이에 나눠야 합니다. 보정 없이 95%로 네 개 변형을 돌리면 가짜 승자가 하나 이상 나올 확률이 14%입니다. 계산기는 비교 수만큼 알파를 나누며, 그래서 변형당 숫자가 커집니다.
매출이나 평균 주문 금액에도 쓸 수 있나요?
아니요. 이 페이지는 전환율에 대한 테스트 크기를 잡습니다. 방문자당 매출 같은 연속 지표는 해당 지표의 분산이 필요한데, 그 값은 보통 비율의 분산보다 훨씬 크고 표본 크기도 그만큼 커집니다. 그런 경우에는 자체 과거 분산과 t 검정 기반 계산이 필요합니다.

다른 개발자 도구

Coddy 프로그래밍 언어 일러스트

Coddy로 코딩 배우기

시작하기