올해 초 AI 스피커 연동 토이 프로젝트를 맡으면서, 화면 기반 서비스만 기획해오던 저에게는 완전히 새로운 감각이 필요했습니다.
화면이 없는 인터페이스를 기획한다는 게 처음엔 막막했는데, 프로젝트를 진행하면서 몇 가지 중요한 원칙들을 배우게 됐어요.
이번 글에서는 보이스 UI를 처음 기획하는 분들이 참고할 만한 고려사항들을 정리해봤습니다.
화면 UI에서는 사용자가 버튼을 보고 "이걸 누르면 되겠구나"를 스스로 판단할 수 있습니다.
보이스 UI에서는 이게 불가능해요.
사용자가 "무엇을 말해야 하는지" 스스로 알기 어렵기 때문에, 매 순간 다음에 무엇을 말할 수 있는지 안내해줘야 합니다.
저희가 초반에 만든 프로토타입은 "무엇을 도와드릴까요"라고만 물었는데, 실제 사용자 테스트에서 절반 가까운 사람들이 몇 초간 침묵하다가 "음... 뭘 물어보면 되죠"라고 되묻는 반응을 보였습니다.
그래서 이후로는 "날씨를 물어보거나, 알람을 설정해달라고 말씀해보세요"처럼 구체적인 예시를 항상 함께 제공하도록 바꿨어요.
화면에서는 한 번에 열 개, 스무 개의 정보를 나열해도 사용자가 필요한 부분만 골라 읽을 수 있습니다.
음성으로는 그게 불가능해요.
저희가 검색 결과를 다섯 개까지 음성으로 읽어주도록 설계했는데, 테스트해보니 세 번째 항목을 읽을 때쯤 사용자가 이미 앞의 내용을 잊어버렸다는 피드백이 나왔습니다.
결국 음성으로는 최대 세 개까지만 요약해서 전달하고, 더 자세한 내용은 "더 알려드릴까요"라고 물어보는 방식으로 바꿔야 했어요.
화면에서 통하던 정보량의 기준을 음성에 그대로 적용하면 안 된다는 걸 이때 확실히 배웠습니다.
음성 인식은 아무리 좋은 엔진을 써도 완벽하지 않습니다.
특히 조용한 사무실에서 테스트할 때와 실제 가정집 거실, TV 소리나 아이들 소음이 있는 환경에서 테스트할 때 인식률이 크게 달랐어요.
저희 테스트에서는 조용한 환경에서 인식률이 92%였는데, 배경 소음이 있는 환경에서는 68%까지 떨어졌습니다.
이 격차를 알고 나서, 인식이 잘못됐을 때 되돌릴 수 있는 경로를 반드시 마련해야 한다는 원칙을 세웠어요.
"알람을 오전 7시로 맞췄어요, 맞나요"처럼 중요한 명령은 반드시 확인 질문을 한 번 거치도록 설계를 바꿨고, 이후 사용자 불만이 확실히 줄었습니다.
화면에서는 실수로 버튼을 눌러도 "취소" 버튼이 바로 눈에 보입니다.
음성에서는 사용자가 "취소해줘"라고 말해야 한다는 것 자체를 떠올리지 못하면 되돌릴 방법이 없어요.
저희는 쇼핑 연동 기능을 붙이면서 이 문제를 심각하게 고민했는데, 결제처럼 되돌릴 수 없는 행동은 음성만으로 완결시키지 않고, 반드시 스마트폰 앱으로 최종 확인 알림을 보내는 이중 장치를 넣었습니다.
번거로워 보이지만, 이건 사용자 보호를 위해 타협할 수 없는 부분이라고 판단했어요.
화면 UI에서는 문구 톤이 브랜드 이미지의 일부지만, 보이스 UI에서는 목소리 자체가 브랜드입니다.
저희는 TTS 목소리를 고를 때 후보 세 가지를 두고 사용자 그룹 테스트를 진행했는데, 같은 문구인데도 목소리에 따라 "믿음직하다"와 "가볍다"는 인상이 크게 갈렸어요.
목소리 하나 고르는 데 예상보다 훨씬 오랜 논의가 필요했습니다.
말투도 마찬가지였는데, 존댓말을 쓸지, 얼마나 친근하게 반응할지 하나하나가 다 브랜드 경험에 영향을 주는 결정이라는 걸 이 과정에서 깨달았어요.
AI 스피커는 단독으로 쓰이기보다, 스마트폰 앱이나 다른 기기와 연결되어 쓰이는 경우가 많습니다.
저희 서비스도 스피커로 시작한 요청이 앱에서 이어지거나, 반대로 앱에서 설정한 내용이 스피커 응답에 반영돼야 하는 경우가 많았어요.
이 흐름을 놓치면 "아까 앱에서 설정했는데 스피커는 왜 몰라요"라는 불만이 바로 나옵니다.
저희는 결국 사용자 설정 데이터를 모든 채널이 공통으로 참조하는 구조로 다시 설계했는데, 이 작업이 프로젝트 초반 예상보다 훨씬 큰 비중을 차지했습니다.
화면 UI는 클릭률이나 스크롤 깊이 같은 지표로 문제를 비교적 명확하게 짚어낼 수 있습니다.
보이스 UI는 "어느 지점에서 사용자가 막혔는지"를 파악하기가 훨씬 어려워요.
저희는 발화 로그를 전부 텍스트로 변환해서 분석했는데, 같은 의도를 표현하는 방식이 화면 UI보다 훨씬 다양해서 실패 패턴을 찾는 데 시간이 오래 걸렸습니다.
결국 사용자 발화를 의도별로 태깅하는 작업에 예상보다 두 배 넘는 시간을 투입해야 했어요.
이번 프로젝트를 겪으면서, 보이스 UI는 화면 UI의 기술을 그대로 옮기는 게 아니라 완전히 새로운 사고 방식을 요구한다는 걸 절실히 느꼈습니다.
아직 국내에서 AI 스피커 사용이 일부 얼리어답터층에 머물러 있어서 데이터가 충분히 쌓이려면 시간이 더 필요하겠지만, 이 흐름은 앞으로 스마트홈, 차량 인포테인먼트 등으로 계속 확장될 거라고 봅니다.
저도 이번에 배운 것들을 토대로, 다음엔 화면과 음성을 동시에 쓰는 멀티모달 인터페이스 기획에도 도전해보고 싶습니다.
'Planning · PM > UX · Product' 카테고리의 다른 글
| 생성형 AI 네이티브 프로덕트 설계 원칙 (0) | 2026.04.10 |
|---|---|
| AI 서비스 사용자 신뢰 확보를 위한 UX 라이팅 (0) | 2023.09.30 |
| 디자인 시스템 도입기 - 왜 필요했나 (0) | 2020.10.17 |
| 비대면 시대 온보딩 UX 재설계 (0) | 2020.08.16 |
| 디자인 씽킹 워크숍 후기와 실무 적용기 (0) | 2019.02.09 |