Menu

우리 사이트도 A/B 테스트가 될까? 트래픽 현실 점검

열 번째 테스트 뒤가 아니라 첫 번째 테스트 전에 던져야 할 질문입니다. 월 방문자 수, 전환율, 그리고 실제로 실행에 옮길 향상률을 넣으면 곧바로 답이 나옵니다: 진행, 도전, 아니면 중단하고 다른 방법을 쓰기.

작성자 Nethanel Bar, Co-founder & CEO

마지막 업데이트

진짜로 코딩을 배워볼까요?

Coddy는 브라우저에서 실제 코드를 작성하며 배웁니다. 인터랙티브 레슨, 즉각적인 피드백, 막힐 때 도와주는 AI까지.

작은 사이트는 대부분 A/B 테스트를 할 수 없고, 아무도 그 얘기를 해주지 않습니다

모든 A/B 테스트 가이드는 방문자가 수백만인 회사가 씁니다. Microsoft의 실험 조직, Google, Booking.com, Airbnb는 한 해에 수천 건의 테스트를 돌리고, 그들의 조언은 그들에게는 맞습니다: 전부 테스트하고, 데이터를 믿고, 이긴 걸 배포하라. 월 방문자 8,000명인 스타트업이 같은 조언을 읽고 같은 대시보드를 만들고는, 왜 모든 테스트가 신뢰도 87%에서 끝나고 향상률이 매주 줄어드는지 이해하지 못합니다. 잘못하고 있는 게 아닙니다. 그 규모에서 작동하지 않는 일을 하고 있는 것입니다.

이 페이지는 가이드들이 건너뛰는 산술을 합니다. 월 방문자 8,000명에 전환율 3%라면, 10% 향상을 확인하는 데 약 106,000명이 필요합니다. 가진 방문자 전부로 열세 달, 그동안 내내 페이지를 얼려둬야 한다는 뜻이죠. 4주 안에 확인할 수 있는 최소 향상률은 약 40%입니다. 이건 조율로 해결되는 문제가 아닙니다. Microsoft와 Airbnb에서 실험을 이끈 Ronny Kohavi는 한 자릿수 향상을 감지하는 현실적 하한을 수십만 사용자 규모로 잡습니다. 그 아래에서는 A/B 테스트가 시기상조이고 사용자 리서치가 더 나은 지출일 수 있다고 말합니다.

경험에서 나온 얘기입니다. Coddy의 대시보드도 이름 붙인 실험을 스무 개쯤 돌렸고 그중 열 개는 단일 국가를 대상으로 한 가격 테스트였는데, 각각 작은 트래픽 조각에서 진행되었고 신뢰도가 95% 아래일 때마다 '계속 진행'을 표시했습니다. 몇 건은 성공으로 표시되어 배포되기까지 했습니다. 이 계산기로 돌아보면, 그중 일부는 자기 공으로 기록된 향상률을 애초에 감지할 수 없는 테스트였습니다. 그 대시보드의 정직한 버전이 바로 이 페이지입니다: 이 트래픽이 무엇에 답할 수 있는가, 얼마나 걸리는가, 그리고 승자가 거짓 경보일 확률은 얼마인가?

테스트가 가능한지를 결정하는 것들

  • 당신을 제약하는 숫자는 방문자가 아니라 월 전환 수입니다. 방문자 8,000명에 전환율 3%인 페이지는 두 그룹이 나눠 가질 전환이 한 달에 240건뿐입니다. z 검정이 무언가를 말하려면 그룹당 수백 건이 필요합니다.
  • 실행에 옮길 향상률이 청구서를 정합니다. 솔직하게 잡으세요: 3% 향상에도 배포할 생각이라면 3%를 볼 수 있는 테스트가 필요한데, 작은 사이트는 거의 그럴 수 없습니다.
  • 시간은 해결책이 아니라 비용입니다. 한 분기가 걸리는 테스트는 페이지를 한 분기 동안 얼려두고, 계절과 캠페인을 가로지르며, 시작할 때와 다른 회사에서 끝납니다.
  • 아이디어가 얼마나 자주 먹히는지가 승자의 의미를 바꿉니다. 열 개 중 하나만 실제로 지표를 움직인다면, 신뢰도 95%와 검정력 80%에서 '유의한' 승자의 3분의 1 이상이 거짓 경보입니다. 기저율은 사소한 기술적 사항이 아니라 답의 대부분입니다.
  • 그 선 아래에는 더 나은 방법이 있습니다. 사용자 다섯 명과 대화하고, 세션 녹화를 보고, 변경을 배포한 뒤 넓은 오차범위를 감안해 전후를 비교하고, 구매 대신 클릭처럼 더 많은 방문자가 닿는 지표로 테스트하세요.

현실 점검 하는 법

  1. 테스트를 보게 될 월 방문자 수를 입력하세요

    사이트 전체가 아닙니다. 테스트가 가격 페이지에 있다면 가격 페이지의 방문자이고, 결제 단계라면 그 단계까지 도달한 사람들입니다.

  2. 해당 단계의 현재 전환율을 입력하세요

    계산기가 그 값이 뜻하는 월 전환 수를 보여주는데, 그게 진짜 제약입니다.

  3. 실행에 옮길 향상률을 지정하세요

    그 변경을 배포하게 만들 상대 향상률입니다. 대부분 10%라고 말하고 실제로도 그렇게 생각하지만, 당신 기준이 더 작다면 솔직하게 적으세요.

  4. 결론과 사다리를 읽으세요

    진행은 한 달 미만, 도전은 한 분기 미만이며 그동안 페이지는 계속 얼어 있습니다. 중단은 당신의 트래픽으로는 이 질문에 답할 수 없다는 뜻입니다. 사다리는 더 큰 향상률이라면 대신 얼마가 드는지 보여줍니다.

  5. 기저율을 고르고 거짓양성 위험을 읽으세요

    당신의 아이디어가 실제로 얼마나 자주 먹히는지 고르세요. 타일은 그 비율에서 유의한 결과 중 몇 퍼센트가 거짓 경보인지 보여줍니다. 다음에 테스트가 초록불로 나올 때 떠올려야 할 숫자입니다.

신뢰도 95%, 검정력 80%에서 10% 향상을 확인하기까지의 개월 수

두 그룹, 모든 방문자가 테스트에 들어가는 경우입니다. 당신의 행과 열을 찾아 읽으세요.

월 방문자기준 1%기준 3%기준 5%기준 10%
3,000100개월 이상35개월21개월9.8개월
8,00041개월13개월7.8개월3.7개월
25,00013개월4.3개월2.5개월5주
100,0003.3개월5주19일9일
500,00020일6일4일2일

세 사이트, 세 가지 결론

초기 단계 SaaS

월 방문자 8,000명, 가입률 3%, 10% 향상을 보고 싶음. 결론: 중단. 약 13개월, 방문자 106,000명이 필요합니다. 4주 안에 확인 가능한 최소 향상률은 약 40%입니다.

월 240건의 가입으로는 0.3%포인트 차이를 가려낼 수 없습니다. 팀의 시간은 사용자 다섯 명 인터뷰와, 테스트 없이도 드러날 만큼 큰 변경에 쓰는 편이 낫습니다. 새 헤드라인은 그런 변경이 아니지만, 새 가격 모델은 그럴 수 있습니다.

콘텐츠 사이트

월 방문자 50,000명, 뉴스레터 가입률 2%, 10% 향상을 원함. 결론: 도전. 약 3.2개월. 4주 안에 확인 가능한 최소 향상률은 약 19%입니다.

테스트는 가능하지만 과감한 변경에 한해서입니다. 가입을 5분의 1쯤 움직일 가능성이 있다면 폼 배치를 테스트해도 좋지만, 버튼 문구는 아닙니다. 아니면 훨씬 많은 방문자가 하는 행동인 폼으로 가는 클릭을 지표로 삼으세요.

마켓플레이스

월 방문자 400,000명, 전환율 4%, 10% 향상을 원함. 결론: 진행. 필요한 방문자가 한 주도 안 돼 모이지만, 그래도 온전히 두 주를 돌리세요.

A/B 테스트 가이드들이 상정하는 규모가 바로 이 정도입니다. 남은 위험은 기저율입니다: 다섯 개 중 하나가 실제로 통한다면 유의한 승자 여섯 중 하나쯤은 여전히 거짓 경보이고, 매일 확인할 때 그게 얼마나 빨리 나빠지는지는 엿보기 시뮬레이터 탭이 보여줍니다.

트래픽이 적을 때 흔한 실수

  • 그냥 테스트를 돌리고 85%에서 읽는 것. 당신이 정한 신뢰수준은 얼마나 자주 속아도 되는지에 대한 약속입니다. 나중에 그 아래에서 읽는 것은 애초에 정하지 않은 것과 같습니다.
  • 아주 작은 변경을 테스트하는 것. 버튼 색과 단어 교체는 잘해야 몇 퍼센트의 향상을 만들고, 작은 사이트는 그걸 감지할 수 없습니다. 꼭 테스트해야 한다면 숫자를 3분의 1쯤 움직일 법한 것을 테스트하세요.
  • 퍼널 맨 아래에서 테스트하는 것. 구매는 드물고 클릭은 흔합니다. 구매로 이어지는 클릭을 대상으로 한 테스트는 사건이 열 배라서 끝까지 갈 수 있습니다.
  • 테스트를 여섯 달 돌리는 것. 계절과 캠페인과 제품 변경이 전부 새어 들어오고, 두 그룹이 결국 서로 다른 시대를 측정하게 됩니다.
  • 유의했다는 이유로 승자를 믿는 것. 아이디어 중 진짜 승자가 적다면, 유의한 결과가 p값이 시사하는 것보다 더 자주 거짓 경보입니다. 거짓양성 위험 타일이 그걸 숫자로 보여줍니다.
  • '유의하지 않음'을 '아이디어 실패'로 취급하는 것. 트래픽이 적으면 거의 아무것도 유의하지 않습니다. 아이디어는 멀쩡할 수 있고, 테스트가 그걸 볼 수 없었을 뿐입니다.

현실 점검 자주 묻는 질문

A/B 테스트를 하려면 트래픽이 얼마나 필요한가요?
전환율과 보고 싶은 향상률에 달려 있고, 그래서 이 페이지가 둘 다 묻습니다. 대략적인 기준으로, 전환율 3%에서 상대 10% 향상을 확인하려면 약 100,000명, 30% 향상이라면 약 12,000명이 필요합니다. 월 방문자 10,000명 미만인 사이트는 보통 아주 큰 효과만 감지할 수 있습니다.
작은 사이트는 A/B 테스트 대신 무엇을 해야 하나요?
사용자와 직접 또는 통화로 대화하세요. 다섯 번의 대화면 한 페이지의 문제 대부분이 드러납니다. 세션 녹화를 보세요. 과감한 변경을 만들어 배포하고, 비교가 거칠다는 것을 알면서 전후 몇 주를 비교하세요. 더 많은 방문자가 닿는 지표로 테스트하세요. 그리고 트래픽이 모이면 여기로 돌아와 제대로 테스트하세요.
거짓양성 위험은 무엇이고 p값과 어떻게 다른가요?
p값은 아무것도 바뀌지 않았다면 이 결과가 얼마나 놀라운지를 말합니다. 거짓양성 위험은 유의하게 나온 테스트 중 실체가 없었던 것이 몇 건인지를 말합니다. 이 값은 당신의 아이디어가 실제로 얼마나 자주 먹히는지에 달려 있습니다: 기저율 10%, 신뢰도 95%, 검정력 80%라면 유의한 승자의 약 36%가 거짓 경보입니다. 대규모 실험 프로그램들은 아이디어의 10~33%만이 지표를 움직인다고 보고하는데, 기저율이 그토록 중요한 이유입니다.
3.5개월짜리 테스트가 정말 불가능한가요?
불가능하지는 않고, 계산기도 한 분기까지는 '중단'이 아니라 '도전'이라고 말합니다. 하지만 한 분기 동안 얼어 있는 페이지는 아무도 개선하지 않는 페이지이고, 계절이나 캠페인을 가로지르는 테스트는 서로 다른 두 시기를 비교하는 셈입니다. 한 분기를 기다릴 만큼 큰 변경이라면, 아마 그냥 배포하고 전후를 측정해도 될 만큼 큰 변경일 것입니다.
테스트를 빨리 끝내려고 신뢰수준을 90%로 낮춰도 되나요?
테스트 전에 그렇게 정했고 기저율 효과에 더해 열 번에 한 번의 거짓 경보를 받아들인다면 됩니다. 테스트가 대략 3분의 1쯤 짧아지는데, 작은 사이트에 필요한 열 배와는 거리가 멉니다. 테스트하려는 향상률 자체를 키우는 편이 훨씬 효과적입니다.
표본 크기 계산기는 숫자를 주는데 여기서는 왜 중단하라고 하나요?
둘 다 같은 공식을 씁니다. 표본 크기 페이지는 필요한 수를 알려주고, 이 페이지는 그 수를 당신의 트래픽으로 나눠 판정합니다. 방문자 106,000명은 숫자이고, 열세 달은 결론입니다.

다른 개발자 도구

Coddy 프로그래밍 언어 일러스트

Coddy로 코딩 배우기

시작하기