사내 챗봇 프로젝트를 준비하면서, 국내외 AI 스타트업들이 내놓은 챗봇 서비스를 한 달 넘게 써보고 비교해봤습니다.
직접 계정을 만들어서 데모를 돌려보고, 가능한 경우 무료 티어로 실제 시나리오를 넣어서 테스트했어요.
이 글은 특정 서비스를 홍보하거나 비판하려는 목적이 아니라, 저희 팀이 도입 검토를 하면서 정리한 비교 기준과 각 유형별 장단점을 공유하려는 목적으로 씁니다.
챗봇 서비스를 비교할 때 그냥 "어떤 게 더 똑똑한가"로 접근하면 판단이 안 섭니다.
저희는 다섯 가지 기준을 세웠어요.
첫째, 시나리오 빌더의 학습 곡선.
둘째, 폴백 처리와 상담원 연결 흐름의 유연성.
셋째, 기존 CS 시스템(티켓팅, 지식베이스)과의 연동 난이도.
넷째, 응답 로그 분석 기능의 깊이.
다섯째, 비용 구조와 트래픽 증가에 따른 확장성.
이 다섯 가지를 기준으로 표를 만들어서 서비스마다 점수를 매기는 방식으로 진행했습니다.
시나리오 기반형 챗봇
첫 번째로 살펴본 유형은 시나리오/플로우 빌더 중심의 서비스였습니다.
드래그 앤 드롭으로 대화 흐름을 만들 수 있는 형태로, 비개발자인 저도 하루 정도 만에 기본적인 FAQ 흐름을 만들 수 있었어요.
이 유형의 장점은 확실히 진입장벽이 낮다는 점이었습니다.
기획자나 CS 담당자가 개발자 도움 없이도 답변 스크립트를 수정할 수 있어서, 저희가 예전 프로젝트에서 겪었던 "답변 문구가 코드에 하드코딩되어 있어서 매번 배포해야 하는" 문제를 근본적으로 해결해줄 수 있는 구조였습니다.
다만 단점도 명확했어요.
시나리오가 복잡해질수록 플로우 다이어그램이 기하급수적으로 커져서, 100개가 넘는 시나리오를 관리하려니 화면 스크롤만 몇 분이 걸리는 수준이 됐습니다.
또 자유 텍스트 질문에 대한 이해도가 낮아서, 정해진 버튼 흐름을 벗어나면 대부분 "이해하지 못했습니다"로 떨어지는 경우가 많았어요.
정형화된 문의(배송 조회, 영업시간 안내)가 많은 서비스라면 적합하지만, 복잡한 문의가 많은 저희 서비스에는 한계가 뚜렷했습니다.
NLU 기반형 챗봇
두 번째 유형은 자체 NLU(자연어 이해) 엔진을 앞세운 서비스였어요.
자유 텍스트로 질문을 입력했을 때 의도(intent)를 분류해서 응답하는 방식인데, 확실히 자유 텍스트 이해도는 시나리오 기반형보다 높았습니다.
저희가 넣어본 테스트 문장 50개 중에서 의도를 정확히 분류한 비율이 시나리오 기반형은 40% 수준이었는데, NLU 기반형은 68%까지 올라갔어요.
다만 학습 데이터가 부족한 초반에는 오분류가 꽤 있었고, 오분류된 케이스를 다시 학습 데이터에 반영하는 루프를 팀 안에서 계속 돌려야 했습니다.
한 스타트업의 서비스는 오분류 발생 시 자동으로 "이 질문, 이렇게 이해했는데 맞나요?"라는 확인 질문을 던지는 기능이 있었는데, 이 UX 디테일이 사용자 신뢰도에 확실히 도움이 됐어요.
반면 다른 서비스는 이 확인 절차가 없어서, 오분류된 답변이 그대로 나가는 경우가 있었고 이게 저희 테스트에서 가장 큰 감점 요인이었습니다.
LLM 기반형 챗봇
세 번째로 본 유형은 대형 언어모델을 기반으로 답변을 생성하는 신생 서비스들이었습니다.
가장 인상적이었던 건 자연스러운 대화 흐름이었어요.
사용자가 애매하게 질문해도 맥락을 이어받아서 되묻고, 대화가 자연스럽게 이어지는 느낌이 다른 유형보다 확실히 강했습니다.
문제는 두 가지였어요.
첫째는 비용이었습니다.
호출량에 비례해서 비용이 계속 늘어나는 구조라, 저희가 예상 문의량(월 5만 건)을 기준으로 견적을 받아보니 시나리오 기반형보다 3~4배 비용이 높게 나왔습니다.
둘째는 할루시네이션 리스크였어요.
저희 정책 문서에 없는 내용을 그럴듯하게 지어내서 답하는 경우가 테스트 중 몇 번 나왔는데, 환불 정책처럼 정확성이 중요한 영역에서는 이게 치명적인 리스크가 될 수 있다고 판단했습니다.
다만 답변 근거 문서를 같이 보여주는 기능을 제공하는 스타트업의 서비스는 이 리스크를 어느 정도 줄여주고 있었고, 이 부분이 앞으로 이 유형의 서비스가 개선해야 할 핵심 지점이라고 느꼈어요.
오픈소스 조합형
마지막으로, 특정 스타트업 서비스를 쓰지 않고 오픈소스 NLU 엔진과 자체 서버를 조합하는 방식도 검토해봤습니다.
이 방식은 비용 면에서는 가장 유리했고, 데이터를 외부로 내보내지 않는다는 점에서 프라이버시 측면에서도 안심이 됐어요.
다만 초기 구축 기간이 다른 상용 서비스 대비 2~3배 이상 걸렸고, 운영 인력이 상시 필요하다는 점이 저희 팀 규모에는 부담이었습니다.
결과적으로 저희는 정형화된 문의 비중이 높은 1차 응대는 시나리오 기반형으로, 복잡한 문의는 NLU 기반형으로 넘기는 하이브리드 구조를 검토하기로 했습니다.
LLM 기반형은 지금 시점에는 비용과 리스크 대비 이점이 아직 명확하지 않다고 판단해서, 사내 문서 검색처럼 리스크가 낮은 영역에 먼저 파일럿으로 적용해보고 고객 응대에는 좀 더 시간을 두고 검토하기로 했어요.
이 비교를 하면서 느낀 건, "어떤 챗봇 서비스가 제일 좋은가"라는 질문 자체가 잘못된 질문이라는 점이었습니다.
우리 서비스의 문의 유형과 리스크 허용 수준에 따라 정답이 완전히 달라지니까요.
저희처럼 도입을 검토하는 팀이 있다면, 화려한 데모보다 실제 우리 CS 로그로 직접 테스트해보는 과정을 꼭 거치라고 말해주고 싶습니다.
저희도 다음 분기에 파일럿을 돌려보고, 실제 운영 데이터가 쌓이면 이 비교 결과를 다시 업데이트해서 공유할 계획이에요.
'AI > AI Trend' 카테고리의 다른 글
| AI 에이전트 시대, PM의 역할은 어떻게 바뀌나 (0) | 2026.05.04 |
|---|---|
| 2021년 상반기 가트너 트렌드 요약과 내 생각 (0) | 2021.04.22 |
| 2020 년 100 개 이상의 AI 사용 사례 및 애플리케이션 : 심층 가이드 (0) | 2020.11.11 |
| 인공지능을 통한 캐나다의 코로나19 대응 (0) | 2020.06.27 |
| 프랑스 인공지능 스피커 동향 (0) | 2020.05.28 |