중요도와 만족도로 제품 기회 점수 매기기

소셜미디어 글에서 고객이 중요하게 여기지만 만족하지 못하는 기능을 점수 하나로 가려낼 수 있을까? 기회 점수 계산 논리와 실무 주의점을 정리한다.

제품 기획자는 리뷰 게시판과 커뮤니티에 쌓이는 고객 글을 매일 읽는다. 글이 수만 건이 되면 “어떤 기능이 자주 언급되는가”는 집계할 수 있다. 그러나 “자주 언급되면서 불만도 큰 기능이 무엇인가”를 숫자 하나로 뽑기는 어렵다. 언급량 순위와 평균 감성 점수를 따로 보면 어느 기능부터 고칠지 정하기 어렵다.

소셜미디어 글에서 고객이 중요하게 여기지만 만족하지 못하는 제품 기능을 하나의 점수로 가려낼 수 있을까?

이 질문에 답한 논문을 한 편 읽어 본다.

  • 제목: Identification of time-evolving product opportunities via social media mining
  • 학술지: Technological Forecasting and Social Change
  • 연도: 2020
  • DOI: 10.1016/j.techfore.2020.120045

논문은 두 가지를 결합한 방법을 제안한다. 첫째는 노화 이론(aging theory, 사건이 생겨나 자라고 시들어 사라진다고 보는 이론)을 바탕으로 한 사건 탐지·추적(Event Detection and Tracking, EDT) 알고리즘이다. 둘째는 감성 분석과 기회 알고리즘(opportunity algorithm)이다. 앞선 글에서는 이 논문으로 기회가 시간에 따라 어떻게 바뀌는지를 다뤘다. 이 글은 점수 계산 논리와 실무에서 주의할 점에 집중한다.

글 전체에서 쓸 용어는 다음과 같다.

  • 사건(event): 키워드가 비슷한 글을 시간 순서대로 묶은 덩어리다. 새 글이 들어오면 사건의 키워드와 가중치가 바뀐다.
  • 에너지(energy): 사건이 비슷한 글에게서 받은 지지의 누적값이다. 시간이 지나면 줄어든다.
  • 중요도(importance): 같은 시점의 에너지 값으로 정의하며, 식에 자연로그(ln)가 들어간다. 논문 원문의 식은 글자가 깨져 있어 정확한 형태를 확인하기 어렵다.
  • 만족도(satisfaction): 사건에 속한 글의 감성 점수를 시점별로 가중평균한 값이다. 0과 1 사이에 있다.
  • 기회 점수(opportunity score): 중요도와 만족도를 하나로 묶은 값이다.
  • 기회 지형 맵(opportunity landscape map): 가로축을 중요도, 세로축을 만족도로 두고 사건을 점으로 찍은 맵이다.

동기: 고객 목소리는 넘치지만 우선순위를 정할 숫자가 없다

왜 소셜미디어 고객 목소리가 중요한가

논문은 소셜미디어가 소비자 의견이 오가는 주요 경로가 되었다고 보고, 그 근거를 다음과 같이 든다.

  • 미국 성인의 86%, 유럽 성인의 79%가 소셜미디어 서비스를 쓴다는 보고가 있다.
  • 고객의 77%가 구매 전에 소셜미디어에서 다른 사람의 제품 리뷰를 읽는다.
  • 고객의 75%는 개인의 직접 추천보다 리뷰를 더 신뢰한다.
  • 기업은 “My Starbucks Idea”, “Samsung Global” 같은 소셜 채널을 열어 검열 없이 나오는 고객 목소리(Voice of Customer, VOC)를 듣는다.
  • 고객 요구를 경쟁사보다 빨리 파악한 기업은 경쟁사가 쉽게 따라 하기 어려운 고객 관계를 만든다.

기존 연구가 다루지 않은 부분

기존 제품 기획 연구는 상업 리뷰, 마이크로블로그, 온라인 토론 글을 대량으로 모은다. 연구자는 여기에 토픽 분석과 감성 분석을 적용한다. 찬스 디스커버리(chance discovery), 네트워크 분석, 형태 분석, 카노 모형 같은 이론 모형과 결합하는 연구도 있다. 이런 방식으로 제품 기능과 이슈를 찾고, 영향력 있는 사용자를 가려내고, 기능 만족도를 평가하고, 신제품 콘셉트를 만들었다.

논문이 짚은 빈틈은 세 가지다.

  • 생애주기 관점이 빠져 있다. 소셜미디어 고객 목소리는 실시간으로 생기고 바뀌므로 생성, 성장, 소멸을 추적해야 한다.
  • 개별 고객 목소리의 기회 수준을 분석하지 않았다. 대부분의 연구는 토픽별 문서 수나 평균 감성 점수로 중요도와 만족도를 따로 나타냈을 뿐이다.
  • 제품 기획에 쓸 구체적인 방향을 주지 못했다. 만족도는 정량화했지만, 그 결과가 제품 개발과 개선의 방향으로 이어지지 않았다.

논문은 기존 연구가 정적인 관점에 머물러 있다는 점도 지적한다. 새 기회를 찾으려면 토픽 모델링 같은 복잡한 실험을 매번 다시 해야 했다는 것이다.

방법: 비슷한 글을 사건으로 묶고, 사건마다 중요도·만족도·기회 점수를 시점별로 구한다

논문은 방법을 수집·전처리와 두 단계로 설명한다. 두 단계는 1) 고객이 말한 사건을 탐지·추적하는 단계와 2) 제품 기회를 식별·평가하는 단계다. 이 글에서는 수집·전처리를 1단계로 따로 둔다. 논문의 둘째 단계는 두 부분으로 나누어, 만족도·중요도 계산을 3단계, 기회 점수와 맵을 4단계로 설명한다. 그래서 글의 2단계가 논문의 첫째 단계(3.1절)이고, 글의 3·4단계가 논문의 둘째 단계(3.2.1절과 3.2.2절)다.

그림 1. 글을 걸러 단어 묶음으로 바꾸고 사건으로 묶은 뒤, 사건마다 만족도·중요도를 구해 기회 점수로 합친다.

사례와 자료

논문은 스마트 스피커를 사례로 택했다. 이유는 세 가지다.

  • 2014년 아마존 에코 출시 뒤 시장이 빠르게 커졌다. 논문은 미국의 사용자 수와 기기 수가 크다는 두 보고서의 추정을 근거로 든다.
  • 스마트폰, 태블릿, 음악 스트리밍, 스마트홈과 연결되는 기술 집약 제품이다.
  • 기술이 성숙한 제품이라 고객 쪽에서 출발하는 시장 견인(market pull) 관점의 분석이 필요하다.

자료는 레딧(Reddit)에서 모았다. 레딧은 브랜드와 제품 이름별 게시판(서브레딧)으로 정리되어 있고, 글이 트위터나 인스타그램보다 길다. 분석 기간은 2018년 4월 1일부터 5월 31일까지 두 달이다. 수집한 글은 모두 27,013건이다. 구글 홈 게시판에서 9,437건, 아마존 에코 게시판에서 17,576건을 모았다. 댓글과 게시글은 같은 수준의 문서로 다뤘다.

1단계: 수집과 전처리

  • 입력: 소셜미디어 글과 작성 시각
  • 처리: 길이와 키워드로 문서를 걸러 내고 단어 묶음으로 바꾼다
  • 산출: 작성 시각 순서로 정렬한 단어 묶음(bag-of-words)
  1. 200자 미만의 짧은 글을 뺀다. “[deleted]”, “Wow”, “Yup” 같은 글은 해석할 수 있는 사건을 만들지 못한다.
  2. 아마존, 아이튠즈, 유튜브 같은 다른 웹 주소로 가는 링크를 모두 지운다.
  3. RAKE(Rapid Automatic Keyword Extraction) 알고리즘으로 문서마다 키워드를 뽑는다.
  4. NLTK 불용어 목록으로 의미 없는 키워드를 뺀다. 단, “don”, “no”, “not”, “nor”는 남긴다. 논문은 이 네 토큰을 남긴 이유를 밝히지 않는다.
  5. 유효 키워드가 4개 미만인 문서를 뺀다.
  6. 남은 문서를 키워드와 가중치의 묶음으로 나타낸다.

논문은 휴대전화 음성 명령이 불편했다는 짧은 불만 글이 키워드마다 가중치 1.0을 가진 묶음으로 바뀌는 예를 든다. 이 전처리는 새 글이 들어올 때마다 실시간으로 이루어진다.

2단계: 사건 탐지와 추적

  • 입력: 시간 순서로 들어오는 단어 묶음
  • 처리: 세 가지 정책(에너지 감소, 사건 생성과 지지 배분, 사건 갱신)을 적용한다
  • 산출: 살아 있는 사건 목록과 시점별 에너지, 키워드
  1. 새 문서와 살아 있는 모든 사건의 유사도를 구한다.
  2. 가장 높은 유사도가 기준값보다 낮으면 새 문서가 새 사건이 된다(“탄생”).
  3. 기준값 이상이면 가장 비슷한 사건 하나에 들어가 그 사건에 지지를 준다(“성장”). 지지의 크기는 유사도 값이다.
  4. 모든 사건의 에너지는 시간 단위마다 줄어든다(“쇠퇴”). 에너지가 기준 아래로 떨어진 사건은 사라진다(“소멸”).

새 문서를 가장 비슷한 사건 하나에만 넣는 이유는 사건의 내용을 분명하게 유지하기 위해서다.

에너지는 직전 시점의 에너지에 노화 계수 α(0과 1 사이)를 곱하고, 그 시점에 받은 지지를 더해서 구한다. 원래 노화 이론은 누적 지지를 시그모이드 함수로 0~1 사이 값으로 바꾸지만, 논문은 그 함수를 쓰지 않고 누적 지지를 그대로 에너지로 쓴다. α가 작을수록 에너지가 빨리 줄어 사건이 자주 사라진다.

문서 유사도는 사전 학습된 단어 벡터로 구한다. 사례에서는 fastText를 썼다. 계산 순서는 다음과 같다.

  1. 단어 w와 문서 D의 유사도는 w와 D 안 모든 키워드의 유사도 가운데 가장 큰 값이다.
  2. 문서 D1의 키워드 가운데 D2와의 유사도가 기준을 넘는 것만 관련 단어 집합(Relevant Word Set, RWS)에 넣는다.
  3. RWS 안 키워드의 유사도를 빈도로 가중평균해 “D1에서 본 D2의 유사도”를 구한다.
  4. 반대 방향 값도 구해 두 값을 평균한다.

새 문서가 사건에 들어가면 사건의 키워드 가중치는 다음 규칙으로 바뀐다. 아래 설명은 논문 그림 2의 예를 참고해 규칙만 정리한 것이다.

  • 새 문서의 키워드 가운데 사건과의 유사도가 RWS 기준에 못 미치는 것은 반영하지 않는다.
  • 새 문서와 비슷한 기존 키워드는 가중치에 1.2를 곱하는 보상을 받는다.
  • 새 문서와 거리가 먼 기존 키워드는 가중치에 0.8을 곱하는 벌점을 받는다.
  • 양쪽에 다 있는 키워드는 1.2를 곱한 뒤 새 문서에서의 빈도를 더한다.
  • 사건에 없던 새 키워드는 새 문서에서의 빈도를 가중치로 받아 추가된다.
  • 이 갱신을 거치며 가중치가 낮아진 키워드는 사건의 키워드 집합에서 빠진다.

사례에서 α는 0.9, 문서 유사도 기준값은 0.7로 정했다.

3단계: 만족도와 중요도 계산

  • 입력: 사건별 시점별 에너지, 사건에 속한 문서
  • 처리: 문서마다 감성 점수를 구해 가중평균하고, 에너지로 중요도를 구한다
  • 산출: 사건별 시점별 만족도와 중요도
  1. 새 문서가 사건에 들어가거나 새 사건이 될 때 그 문서의 감성 극성을 측정한다.
  2. 시점마다 그 사건에 들어온 문서의 평균 감성 점수를 구한다.
  3. 시점별 평균 감성을 가중평균해 만족도를 구한다. 오래된 시점일수록 가중치를 줄인다.
  4. 같은 시점의 에너지 값을 바탕으로, 자연로그(ln)가 들어간 식으로 중요도를 구한다.

감성 분석 도구로는 NLTK, TextBlob, gensim, VADER 같은 파이썬 라이브러리를 쓸 수 있다고 논문은 적는다.

만족도 가중치를 시점별로 줄이는 이유는 최근 고객 반응에 더 무게를 두기 위해서다. 가중치는 0과 1 사이 실수 α로 정한다. 논문은 가중치가 시간에 따라 줄어든다고만 서술한다. 이 α가 에너지 계산의 α와 같은 값인지는 밝히지 않는다. 만족도가 1에 가까우면 그 사건에 대한 고객 반응이 긍정적이고, 0에 가까우면 부정적이다.

중요도는 많은 고객이 자주 언급하는 사건일수록 크다. 비슷한 문서가 많이 들어온 사건은 에너지가 높기 때문이다. 사례의 4월 1일 중요도 목록에서 가장 낮은 두 사건인 “기능 비교(Feature comparison)“와 “구글 어시스턴트(Google Assistant)“가 0.693이다. 논문 원문의 중요도 식은 글자가 깨져 있어, 이 값을 에너지로 정확히 되돌려 구할 수는 없다.

사례에서 5월 31일 만족도는 “고장(Malfunction)” 0.152, “리마인더(Reminder)” 0.136, “루틴(Routines)” 0.129였다.

4단계: 기회 점수와 기회 지형 맵

  • 입력: 사건별 시점별 중요도와 만족도
  • 처리: 기회 알고리즘으로 점수를 구하고 맵의 세 영역에 배치한다
  • 산출: 시점별 기회 점수 순위, 개선 기회와 안정화 기회 목록
  1. 기회 점수는 “중요도 + max(중요도 − 만족도, 0)“으로 구한다.
  2. 맵을 그릴 때는 시점마다 중요도를 최소-최대 정규화(min-max normalization, 가장 작은 값을 0, 가장 큰 값을 1로 맞추는 변환)한다. 시간이 갈수록 중요도의 최댓값이 커지기 때문이다.
  3. 맵을 세 영역으로 나눈다. 적정 충족(appropriately served), 과잉 충족(over-served), 과소 충족(under-served)이다.
  4. 중요도가 높고 만족도가 낮은 사건을 “개선 기회(Improvement opportunities)“로 본다. 중요도가 낮고 만족도가 높은 사건은 “안정화 기회(Stabilization opportunities)“로 본다.

이 공식은 울윅(Ulwick, 2009)이 결과 중심 혁신 이론에서 제안한 기회 알고리즘을 사건에 옮긴 것이다. 공식의 뜻은 단순하다. 중요도가 만족도보다 크면 그 차이만큼 점수를 더 얹는다. 만족도가 중요도보다 크면 둘째 항은 0이 되고 점수는 중요도와 같아진다.

계산 예로 5월 31일 “고장” 사건을 보자. 중요도는 표 4의 2.321, 만족도는 0.152다. 기회 점수는 2.321+(2.321−0.152)=2.321+2.169=4.490이다. 논문이 적은 값은 4.491로, 소수점 셋째 자리에서 조금 다르다.

같은 공식을 거꾸로 쓰면, 논문에 중요도·만족도·기회 점수가 모두 있는 사건으로 계산을 확인할 수 있다. “리마인더”는 중요도 1.998, 기회 점수 3.859다. 공식에서 만족도를 되돌려 구하면 2×1.998−3.859=0.137로, 논문의 0.136과 거의 같다. 두 사건(“고장”, “리마인더”)에서 표에 적힌 중요도 값과 공식으로 논문의 기회 점수가 재현된다. 이 중요도가 정규화 전 값인지 후 값인지는 논문이 밝히지 않아 이 계산만으로는 확인할 수 없다.

논문은 개선 기회를 경쟁 시장에서 고객을 끌어들이는 중요한 기능으로 보고, 먼저 다룰 대상으로 본다. 다만 아래 결과에서 보듯 점수 순위와 맵 영역이 다를 수 있으므로, 둘 다 확인하고 우선순위를 정하는 편이 안전하다. 논문은 안정화 기회를 적은 투자로 만족도와 충성도가 높은 고객을 지키는 데 쓸 수 있다고 본다. 안정화 기회가 파괴적 혁신의 영역을 가리킬 수 있다고도 본다.

설정에 따라 달라지는 것

결과는 분석가가 정하는 값 몇 가지에 따라 달라진다.

  • 노화 계수 α: 값을 낮추면 사건이 빨리 사라진다. 논문은 입력 자료의 발생 빈도와 분석 목적에 맞춰 정하라고 한다.
  • 유사도 기준값: 새 사건을 만들지, 기존 사건에 넣을지를 결정한다. 자료의 내용 특성에 맞춰 정한다.
  • 시간 단위: 에너지가 줄어드는 단위다. 사건의 생애 단계를 관찰하려면 알맞은 단위를 정해야 한다.
  • 정규화: 맵의 위치는 시점별 정규화 결과에 따라 정해진다.

결과: 5월 31일 기준 “고장” 사건이 기회 점수 4.491로 가장 먼저 고칠 대상이었다

사건 탐지 결과: 5,327개 가운데 355개만 하루를 넘겼다

분석 기간 전체에서 사건 5,327개가 탐지됐다. 이 가운데 93.3%는 하루 안에 사라졌다. 비슷한 문서가 뒤따르지 않아 생긴 결과이고, 작은 이슈나 인기 없는 의견으로 해석했다. 예를 들어 4월 25일 문서 두 건으로 생긴 유튜브 미디어 접근 사건은 다음 날 사라졌다.

논문은 하루를 넘긴 사건 355개를 분석했다. 이 사건은 하루 평균 약 7.11회 발생했고 평균 수명은 5.42일이었다. 분석 기간 60일 내내 살아 있던 사건에는 “블루투스 연결”(사건 4)과 “음악 재생”(사건 9) 등이 있다. “스포티파이”(사건 931)는 50일을 버텼다. 사건 이름은 주요 키워드와 대표 문서를 보고 사람이 정한다. 연구진은 데이터 분석 전문가 9명(교수 3명, 대학원생 6명)과 함께 이 해석 과정을 진행했다.

시점별 중요도 상위 사건

4월 1일에는 사건 62개가 생겼고 그 가운데 6개가 하루를 넘겼다. 중요도 1위는 “블루투스 연결”(1.594), 2위는 “음악 재생”(1.211)이었다. 5월 1일까지 하루를 넘긴 사건 186개가 생겼고 그 가운데 151개가 사라졌다. 이날 1위는 “음악 재생”(2.517), 2위는 “스포티파이”(2.244), 3위는 “블루투스 연결”(2.228)이었다.

5월 31일 상위 사건은 다음과 같다.

  • “고장”: 2.321
  • “블루투스 연결”: 2.090
  • “리마인더”: 1.998
  • “스포티파이”: 1.899

논문은 5월 1일에 “스포티파이”, “침실 조명”, “스마트 플러그”가 올라온 것을 사용 범위가 음악 스트리밍과 조명 제어로 넓어진 신호로 읽었다.

5월 31일 기회 지형 맵

과소 충족 영역에는 기회 점수가 높은 사건 6개가 있었다.

그림 2. 5월 31일 기회 점수는 과소 충족 영역의 고장 사건이 4.491로 가장 높고, 점수 순위와 맵 영역은 다를 수 있다.
  • 고장
  • 블루투스 연결
  • 리마인더
  • 피드백 제출
  • 음악 재생
  • 루틴

“고장”은 중요도가 가장 높은데 만족도가 0.152로 매우 낮아 기회 점수가 4.491로 가장 높았다. 고객은 음성 클립의 음질, 언어 지원, 메시지 전송, 명령 인식에 불만을 남겼다. “루틴”은 여러 작업을 한 명령으로 실행하는 새 기능이다. 이 사건의 기회 점수는 3.020이었다. 고객은 기대를 안고 써 봤지만 만족도는 0.129에 그쳤다. 한 고객은 기본 루틴은 작동하는데 맞춤 루틴은 작동하지 않는다고 불평했다.

적정 충족 영역에는 사건 27개, 과잉 충족 영역에는 사건 18개가 있었다. 과잉 충족 영역에는 “유튜브 뮤직”(2.533), “Bart”(1.890), “구글 플레이 뮤직”(1.649)이 있었다. 구글 플레이 뮤직과 유튜브 뮤직 사용자는 스포티파이 사용자보다 적었지만 평균 만족도는 더 높았다. 적정 충족 영역에는 “스포티파이”(3.299), “침실 조명 2”(3.200), “하모니”(2.702)가 있었다.

기회 점수 순위와 맵의 영역이 꼭 일치하지는 않는다. 적정 충족 영역의 “스포티파이”(3.299)는 과소 충족 영역의 “루틴”(3.020)보다 점수가 높다. 논문은 이렇게 어긋나는 이유를 설명하지 않는다. 필자는 맵을 정규화한 중요도로 그리기 때문일 수 있다고 추측하지만, 근거로 확인한 내용은 아니다. 순위와 영역이 다를 수 있으니 실무에서는 둘 다 확인한다.

사건 하나의 기회 점수 변화

논문은 “음악 재생”(사건 9)과 “음향기기 연결” 사건의 점수와 위치 변화를 추적했다.

“음악 재생”은 4월 1일 탄생 시점에 과잉 충족 영역에 있었고, 기회 점수 1.600은 그때 사건 평균 1.191보다 높았다. 이후 관심은 커지고 만족도는 떨어졌다. 5월 1일에는 점수가 4.447까지 오르며 과소 충족 영역으로 옮겨 갔다. 5월 31일에는 만족도가 오르고 중요도가 조금 줄어 점수가 3.305로 내려갔다.

“음향기기 연결”은 사운드바, 블루투스 스피커, TV에 스마트 스피커를 연결하는 사건이다. 5월 9일 탄생 시점에는 적정 충족 영역에 있었다. 이때 점수 1.751은 평균 1.983보다 낮았다. 5월 20일 과소 충족 영역으로 옮겨 점수가 4.517로 올랐다. 그 뒤 중요도는 0.994에서 0.266으로 떨어지고 만족도는 0.483에서 0.590으로 올라 과잉 충족 영역으로 이동했다.

의의와 한계

무엇이 달라지는가

  • 고객 목소리를 생애 단계(탄생, 성장, 쇠퇴, 소멸)로 추적한다. 정적인 분석으로는 볼 수 없던 변화가 드러난다.
  • 사건마다 중요도와 만족도를 기회 점수 하나로 묶어 우선순위를 정한다.
  • 시점마다 사건의 맵 위치가 바뀌는 모습을 숫자로 나타낸다.
  • 사건의 키워드가 시간에 따라 바뀌는 과정을 볼 수 있다. 예를 들어 “음악 재생”의 1위 키워드는 탄생일의 “country music”(11.246)에서 5월 31일 “play music”(1199)으로 바뀌었다.

실무자에게 주는 쓸모

과소 충족 영역의 사건은 불만족스러운 기능이나 설계처럼 고칠 지점을 바로 가리킨다. 과잉 충족 영역의 사건은 적은 투자로 충성 고객을 지킬 기능을 알려 준다. 도출된 기회는 자사 제품뿐 아니라 경쟁 제품, 관련 서비스, 소프트웨어, 구매 경험까지 포함한다. 논문은 이 방법을 실시간 고객 모니터링 소프트웨어로 발전시킬 수 있다고 본다.

연구자에게 주는 쓸모

방법은 특정 분야에 묶이지 않고 재현할 수 있다. 뉴스처럼 다른 주제의 텍스트에도 적용할 수 있다. 단어 벡터, 감성 분석 도구, 정규화 방식을 각각 바꿔 끼울 수 있다. 그래서 어느 요소가 점수를 얼마나 바꾸는지 비교하는 후속 연구가 가능하다.

논문이 밝힌 한계

논문은 주요 한계로 다음을 들었다.

  • 문서 유사도 계산을 개선할 수 있다. fastText 대신 BERT나 ELMo 같은 최신 모델을 쓸 수 있다.
  • 앞서 사라진 사건과 비슷한 사건이 뒤에 다시 나타나는 현상을 다루지 않았다. 새 문서를 가장 비슷한 사건 하나에만 넣은 방식도 비슷한 사건 모두에 배정하는 방식으로 바꿀 수 있다.
  • 기회 점수와 맵 위치의 과거 변화만 분석했다. 앞으로의 위치나 점수를 예측하지 못한다.

논문은 특허, 뉴스, 과학 논문, 기업 자체 VOC 자료에 적용하는 일을 후속 과제로 든다.

필자가 보는 적용 조건

아래는 논문에 적힌 내용이 아니라 필자가 실무 적용을 염두에 두고 덧붙이는 조건이다.

  • 두 지표의 범위를 확인한다. 만족도는 0과 1 사이인데, 중요도는 에너지로 구한 로그 값이라 표 4에서 가장 작은 값이 0.693, 가장 큰 값이 2.517이다. 이대로 더하고 빼면 기회 점수는 중요도의 영향을 더 크게 받는다.
  • 점수와 맵 영역을 함께 본다. 사례에서 순위와 영역이 다른 사건이 있었고, 논문은 그 이유를 설명하지 않는다.
  • 중요도는 언급량이다. 사례에서 아마존 에코 게시판 글(17,576건)이 구글 홈 게시판 글(9,437건)보다 많았다. 커뮤니티 크기가 다른 자료를 섞으면 큰 커뮤니티의 사건이 중요하게 나오기 쉽다.
  • 감성 분석 도구를 한 번 정하면 유지한다. 도구가 바뀌면 만족도 값이 바뀌어 시점 사이 비교가 깨진다.
  • 하루 만에 사라진 사건을 버리는 기준은 자료 규모에 따라 다시 정한다. 사례에서는 탐지된 사건의 93.3%가 이 기준으로 빠졌다.

바로 해 볼 일

  • 자사 제품 커뮤니티나 리뷰 글을 작성 시각과 함께 모은다. 200자 미만인 글과 유효 키워드가 4개 미만인 글을 빼고, 남은 글을 키워드 묶음으로 바꾼다. 남는 글이 얼마나 되는지부터 확인한다.
  • 이미 토픽별로 묶어 둔 자료가 있다면 논문 방법을 단순화한 시험용 절차를 돌려 본다. 아래 절차는 논문 방법 그대로가 아니다.
    • 에너지: 묶음마다 하루 단위 언급 수를 지지로 보고, 직전 에너지에 α를 곱한 뒤 더한다. α는 사례의 0.9에서 시작한다. 논문은 언급 수가 아니라 문서와 사건의 유사도를 지지로 누적하므로, 이 값은 원 방법의 에너지와 다르다.
    • 만족도: 묶음에 속한 글마다 0과 1 사이 감성 점수를 구해 날짜별로 평균한다. 오래된 날짜일수록 가중치를 줄여 가중평균한다.
    • 기회 점수: “중요도 + max(중요도 − 만족도, 0)“을 계산해 상위 다섯 개를 뽑는다. 중요도를 그대로 쓴 결과와 0~1로 정규화한 결과를 둘 다 구해 순위가 얼마나 달라지는지 비교한다.
  • 뽑힌 상위 묶음의 대표 글을 직접 읽고 이름을 붙인다. 논문에서도 사건 이름은 사람이 키워드와 대표 문서를 보고 정했다. 이 첫 단계에서 점수 순위와 실제 불만 내용이 맞는지 확인한다.

비즈니스인텔리전스랩은 고객 데이터와 기술 데이터를 함께 분석하는 방법을 계속 소개한다.

키워드

함께 읽을 글