매일 확인하는 사람
전환율 5%, 하루 방문자 1,000명, 28일, 매일 아침 확인. 저희 실행 결과: 엿보는 사람은 A/A 테스트 2,000건 중 약 28%에서 승자를 선언했고, 마지막에 한 번 읽으면 4.5%였습니다.
누군가 매일 지켜봐서 꼼꼼해 보였던 테스트가 거짓 경보율은 여섯 배였습니다. 그 '승자'의 절반은 B를, 절반은 A를 왕좌에 올렸습니다. 찾을 것이 애초에 없었기 때문입니다.
A와 B가 똑같은 페이지인 테스트 2천 건을 당신의 트래픽으로 돌립니다. 매일 엿보는 사람이 그중 몇 건을 승자라고 불렀을지, 그리고 종료일까지 기다린 사람은 같은 테스트에 몇 번이나 속았을지 확인해 보세요.
마지막 업데이트
Coddy는 브라우저에서 실제 코드를 작성하며 배웁니다. 인터랙티브 레슨, 즉각적인 피드백, 막힐 때 도와주는 AI까지.
이런 습관이 있습니다. 테스트를 시작하고 매일 아침 대시보드를 엽니다. 막대가 슬금슬금 오르다 내려가고 다시 오르다가, 어느 화요일에 95%를 넘습니다. 그 순간 결론을 내고 승자를 배포하고 넘어갑니다. 문제는 p값이 떠돈다는 것입니다. 두 변형이 완전히 같은 테스트에서도 p값은 어떤 날에는 우연히 0.05를 넘나듭니다. 나중에 다시 돌아올 뿐이죠. 처음 넘는 순간 멈춘다는 것은 지나가는 길목에서 붙잡는다는 뜻이고, 가졌다고 믿었던 신뢰수준은 사라집니다.
효과의 크기가 사람들을 놀라게 합니다. 신뢰도 95%에서 마지막에 한 번 읽는 테스트는 스무 번에 한 번쯤 당신을 속이는데, 그게 당신이 맺은 계약입니다. 같은 테스트를 4주 동안 매일 읽고 초록불이 처음 켜진 날 멈추면, 시뮬레이터는 보통 아무 변화도 없는 테스트의 4분의 1 이상에서 거짓 승자를 보여줍니다. Evan Miller의 원래 글은 매일 엿보는 사람의 경우를 20% 이상으로 잡았고, Optimizely는 고객들의 거짓양성률이 그 수준을 넘어가자 2015년에 통계 엔진을 다시 만들었습니다. 매일 대신 매주 확인하면 피해가 대략 절반으로 줄지만 사라지지는 않습니다.
여기 시뮬레이션은 자기가 무엇인지 솔직합니다: 각 테스트는 두 그룹 모두 진짜 전환율로 전환을 뽑고, 확인할 때마다 그때까지 모인 전체 데이터에 평범한 두 비율 z 검정을 돌리며, 엿보는 사람이 멈췄을 지점을 기록합니다. 차트의 모든 선이 하나의 테스트이고, 모든 점이 누군가 결과를 발표했을 아침입니다. 실제 향상률을 +10%로 설정하면 이야기의 나머지 절반이 보입니다. 엿보는 사람이 진짜 효과를 일찍 잡아내되 향상률을 부풀려 보고하고, 효과가 0이었어도 똑같이 신나게 '승리'를 선언했을 모습이죠.
시뮬레이션은 당신의 실제 전환율로 전환을 뽑으므로, p값이 떠도는 모습이 당신이 실제로 보게 될 잡음과 일치합니다.
매일, 3일마다, 또는 매주. 엿보는 사람의 비율과 정직한 비율의 격차가 그 습관의 대가입니다.
그러면 모든 테스트가 A/A 테스트가 되어, 어떤 승자든 구조상 거짓 경보입니다. 그다음 +10%나 +30%로 바꿔서 진짜 효과 앞의 엿보기를 확인해 보세요.
엿보는 사람의 비율은 매일 확인하는 사람이 승자를 선언한 빈도입니다. 종료일 비율은 당신이 고른 알파에 가까워야 합니다. 그렇다면 정직한 테스트는 약속대로 작동하고 있는 것입니다.
실행할 때마다 새로운 무작위 테스트를 뽑습니다. 비율은 조금씩 움직이지만 격차는 그대로입니다.
신뢰도 95%에서 마지막에 한 번 정직하게 읽으면 약 5%의 경우에 속습니다. 아래는 유의해진 첫 시점에 멈추는 사람에 대해 시뮬레이션과 문헌에서 얻은 대략적인 수치입니다.
| 확인 주기 | 4주간 확인 횟수 | 거짓 승자 |
|---|---|---|
| 마지막에 한 번 | 1 | 약 5% |
| 매주 | 4 | 약 10~13% |
| 3일마다 | 9~10 | 약 15~20% |
| 매일 | 28 | 약 25~30% |
| 12주 동안 매일 | 84 | 35% 이상 |
전환율 5%, 하루 방문자 1,000명, 28일, 매일 아침 확인. 저희 실행 결과: 엿보는 사람은 A/A 테스트 2,000건 중 약 28%에서 승자를 선언했고, 마지막에 한 번 읽으면 4.5%였습니다.
누군가 매일 지켜봐서 꼼꼼해 보였던 테스트가 거짓 경보율은 여섯 배였습니다. 그 '승자'의 절반은 B를, 절반은 A를 왕좌에 올렸습니다. 찾을 것이 애초에 없었기 때문입니다.
같은 트래픽, 같은 기간, 주 1회 확인. 저희 실행 결과: 엿보는 사람은 약 12%, 종료 시점에 읽으면 5%.
스물여덟 번 대신 네 번 보는 것은 큰 도움이 되지만, 그래도 약속된 비율의 두 배가 넘습니다. 약속을 지키는 확인 횟수는 한 번 말고는 없습니다.
같은 트래픽에서 B의 실제 향상률을 +10%로 설정해 보세요. 28일짜리 정직한 테스트는 이 트래픽에서 그렇게 작은 향상에 대해 검정력이 제한적이고, 엿보는 사람은 운 좋은 날에 더 자주 일찍 멈춥니다.
이것이 유혹적인 경우입니다: 엿보는 사람이 더 빨리 찾아내는 것처럼 보이니까요. 하지만 멈추는 날은 향상률이 가장 커 보였던 날이라서 배포된 추정치는 부풀려져 있고, 같은 습관이라면 향상률이 0이었어도 '승자'를 찾아냈을 것입니다.