"데이터 기반으로 의사결정하자"는 말은 요즘 어느 회의실에서나 나옵니다.
저도 이 말을 참 많이 하고 다녔는데, 실제로 데이터를 근거로 몇 번 잘못된 결정을 내려본 뒤로는 이 문장을 좀 더 조심스럽게 쓰게 됐습니다.
이번 글에서는 저희 팀이 데이터를 잘못 해석했던 구체적인 사례들과, 그걸 겪으면서 세운 나름의 원칙들을 정리해보려고 합니다.
함정 1 - 상관관계를 인과관계로 착각하기
가장 흔하면서도 가장 무섭게 반복되는 함정입니다.
저희는 한때 "튜토리얼 영상을 끝까지 본 사용자의 30일 리텐션이 그렇지 않은 사용자보다 40% 높다"는 데이터를 보고, "튜토리얼 영상을 강제로 다 보게 만들면 리텐션이 올라갈 것이다"라는 결론을 내렸습니다.
그래서 온보딩 과정에 튜토리얼 영상을 스킵할 수 없게 만들었어요.
결과는 정반대였습니다.
가입 완료율이 오히려 15%p 떨어졌어요.
나중에 다시 데이터를 들여다보니, 원래 튜토리얼을 끝까지 보는 사용자는 이미 이 서비스에 관심이 높고 진지하게 써볼 의지가 있던 사람들이었던 거예요.
영상이 리텐션을 만든 게 아니라, 리텐션을 만들 만한 사람들이 영상도 끝까지 봤던 거였습니다.
저희는 원인과 결과를 반대로 읽었던 거죠.
이 사건 이후로 "이 두 지표가 같이 움직인다"는 걸 발견하면, 반드시 "이게 정말 원인과 결과인지, 아니면 둘 다 제3의 요인 때문에 같이 움직이는 건지"를 한 번 더 물어보는 습관이 생겼습니다.
함정 2 - 평균에 숨어 있는 편차 무시하기
두 번째 함정은 평균값만 보고 판단하는 것이었습니다.
저희 서비스의 평균 세션 시간이 8분이라는 지표를 보고 "사용자들이 충분히 오래 머문다"고 판단했던 적이 있어요.
그런데 나중에 분포를 뜯어보니, 실제로는 사용자의 70%가 2분 안에 이탈하고, 나머지 30%가 20분 이상 머무르면서 평균을 끌어올린 형태였습니다.
평균 8분이라는 숫자는 존재하지 않는 "평균적인 사용자"를 상상하게 만들었던 거예요.
실제로는 두 개의 완전히 다른 사용자 집단이 있었는데, 저희는 그걸 하나의 숫자로 뭉쳐서 보고 있었던 거죠.
이 경험 이후로 저희는 평균값 대신 항상 분포(히스토그램)를 같이 확인하는 걸 대시보드 기본 설정으로 바꿨습니다.
함정 3 - 통계적으로 의미 없는 차이에 의미를 부여하기
세 번째 함정은 A/B 테스트에서 특히 자주 벌어졌습니다.
버튼 문구를 "지금 시작하기"에서 "무료로 시작하기"로 바꾸는 테스트를 진행했는데, 사흘 만에 전환율이 3%p 올랐다는 결과가 나왔어요.
저는 신나서 바로 전체 적용을 하자고 제안했습니다.
그런데 데이터 분석팀 동료가 "이 표본 크기로는 통계적으로 의미 있는 차이라고 보기 어렵다"고 짚어줬어요.
사흘간의 트래픽으로는 신뢰구간이 너무 넓어서, 이 3%p 차이가 진짜 효과인지 우연인지 구분할 수 없다는 거였습니다.
2주를 더 돌려본 결과, 차이는 0.4%p로 좁혀졌고 통계적으로 유의미하지 않다는 결론이 나왔습니다.
저는 그때 "숫자가 그렇게 나왔으니까"라는 이유만으로 성급하게 결정을 내릴 뻔했다는 걸 깨닫고 좀 부끄러웠어요.
이후로는 어떤 실험이든 최소 표본 크기와 최소 실행 기간을 사전에 정해두고, 그 기준을 채우기 전에는 중간 결과에 흔들리지 않기로 팀 규칙을 만들었습니다.
함정 4 - 측정하기 쉬운 것만 측정하고 있다는 착각
네 번째는 조금 더 근본적인 함정입니다.
저희는 클릭률, 전환율, 체류 시간처럼 로그로 자동 수집되는 지표에는 익숙했지만, "사용자가 이 기능을 쓰고 실제로 만족했는가" 같은 정성적인 부분은 늘 뒷전이었어요.
어느 순간 "지표가 다 좋은데 왜 NPS(고객 추천 지수)는 떨어지고 있지"라는 질문에 답을 못 하는 상황이 왔습니다.
확인해보니 저희가 추적하던 지표들은 전부 "서비스를 쓰는 동안의 편의성"에 관한 것이었고, "이 서비스가 내 삶에 진짜 도움이 되는가"라는 더 큰 질문은 어디서도 측정하고 있지 않았던 거예요.
숫자로 잘 잡히는 것만 보고 있으면, 정작 중요한데 숫자로 잡기 어려운 것을 놓치고 있다는 사실 자체를 눈치채지 못하게 됩니다.
이후로 저희는 정량 지표 옆에 반드시 정성 리서치(사용자 인터뷰, 오픈 서베이) 결과를 나란히 놓고 리뷰하는 걸 분기별 루틴으로 만들었습니다.
함정 5 - 데이터가 결정을 대신해준다는 착각
마지막으로, 가장 근본적인 함정은 "데이터가 결정을 대신해줄 것"이라는 기대 자체였습니다.
데이터는 질문에 답을 줄 뿐, 어떤 질문을 던질지, 그 답을 어떻게 해석할지, 그리고 최종적으로 무엇을 할지는 결국 사람이 판단해야 하는 부분이에요.
저희 팀에서도 "데이터가 이렇게 나왔으니 이게 맞다"는 말로 논쟁을 끝내려는 시도가 종종 있었는데, 그럴 때마다 저는 "이 데이터가 우리가 던진 질문에 대한 답이 맞는지"를 한 번 더 확인하자고 제안했습니다.
이 함정들을 하나씩 겪으면서 저희 팀이 세운 원칙은 이렇습니다.
첫째, 상관관계를 발견하면 반드시 "왜 이 둘이 같이 움직이는가"에 대한 가설을 세우고 검증한다.
둘째, 평균값 옆에는 항상 분포를 같이 본다.
셋째, 실험은 사전에 정한 표본 크기와 기간을 채우기 전까지 중간 결과로 판단하지 않는다.
넷째, 정량 지표만큼 정성적인 사용자 이해에도 시간을 투자한다.
다섯째, 데이터는 결정의 근거일 뿐, 결정 자체를 대신해주지 않는다는 걸 항상 팀 전체가 기억한다.
데이터 기반 의사결정이라는 말이 유행하면서, 오히려 데이터를 방패처럼 쓰는 경우를 여러 번 봤습니다.
"데이터가 그렇게 말하니까요"라는 말로 논의를 끝내버리면, 사실은 그 데이터를 왜, 어떻게 해석했는지에 대한 진짜 논의는 생략되어 버려요.
저는 이제 데이터를 볼 때마다 "이 숫자가 말해주지 않는 건 뭘까"를 같이 생각해보려고 합니다.
숫자 자체보다, 그 숫자 뒤에 숨어 있는 맥락을 읽어내는 게 PM의 진짜 역할이라는 걸, 이 실패들을 겪으면서 조금씩 배우고 있는 중이에요.
앞으로도 비슷한 함정에 또 빠질 것 같긴 하지만, 적어도 이번에 정리한 다섯 가지는 스스로 계속 되짚어보려고 합니다.
'Planning · PM > Business · Growth' 카테고리의 다른 글
| 모빌리티 플랫폼 (0) | 2021.03.20 |
|---|---|
| 2021년 가트너 10대 전략 기술 (0) | 2020.10.27 |
| 2020년 가트너 10대 전략 기술 (0) | 2020.01.21 |
| 차량 공유 서비스의 전망 (0) | 2019.07.10 |
| 일본의 차세대 모빌리티 서비스 (0) | 2019.05.01 |