제품 기획 담당자는 고객이 무엇을 원하는지 알아야 다음 개선 방향을 정할 수 있다. 설문조사는 결과가 나올 때까지 시간이 걸린다. 그 사이 신제품이 나오면 고객의 관심도 달라진다. 리뷰를 한 번 분석해 얻은 결과도 몇 달 뒤에는 현재 상황과 맞지 않을 수 있다.
그래서 이런 질문이 생긴다. 고객 리뷰에서 “많이 언급되지만 만족도는 낮은” 제품 속성을 찾고, 그 기회가 언제 생기고 사라지는지 매달 추적할 수 있을까?
이 질문에 답한 논문을 한 편 읽어 본다.
- 제목: Dynamic Monitoring of Product Opportunities with Online Product Review Data
- 학술지: Journal of the Korean Institute of Industrial Engineers
- 연도: 2019
- DOI: 10.7232/JKIIE.2019.45.5.387
논문은 소셜미디어 마이닝으로 동적(시간에 따라 바뀌는) 제품기회를 식별하는 방법을 제안한다. 이 방법은 온라인 리뷰에서 고객이 이야기하는 제품 주제를 뽑는다. 그다음 주제마다 매달 세 지표를 계산하고, 세 지표를 하나의 우선순위로 합친다. 분석가는 이 우선순위가 시간에 따라 어떻게 움직이는지 지켜본다.
글 전체에서 쓰는 용어는 다음과 같다.
- 제품기회(product opportunity): 고객이 만족할 새 제품을 개발하거나 기존 제품을 발전시킬 기회
- 토픽모델링(topic modeling): 문서 묶음에 숨은 주제를 확률 모형으로 찾는 텍스트 마이닝 기법. 논문은 여기서 나온 토픽 하나를 제품에 대한 고객 요구사항 하나로 본다.
- 중요성(Importance), 만족성(Satisfaction), 부상성(浮上性, Growth): 토픽의 기회 수준을 숫자로 나타내는 세 지표
- TOPSIS(Technique for Order Preference by Similarity to Ideal Solution): 여러 기준을 함께 고려해 대안의 순위를 매기는 다기준 의사결정 기법
동기: 고객 요구는 빠르게 바뀌는데 기존 분석은 한 시점에 머문다
왜 제품기회를 계속 추적해야 하는가
논문이 든 이유는 다섯 가지다.
- 경쟁이 심한 환경에서 고객 요구사항을 바탕으로 혁신적인 제품기회를 찾는 일은 제품기반 기업의 지속 성장에 중요하다.
- 설문 기반 방법으로는 요구사항을 빨리 파악하고 그 변화를 추적하기가 점점 어려워졌다. 원인은 글로벌 비즈니스 환경, 줄어든 제품수명, 복잡해진 고객 요구사항이다.
- 소셜미디어는 고객의 의견과 요구사항이 담긴 대량의 실시간 데이터를 제공한다. 고객이 제품 정보를 스스로 주고받기 때문에, 분석 결과는 R&D와 마케팅 전략에 중요한 자원이 된다.
- 제품 수명주기가 짧아지고 시장 환경이 복잡해지면서 고객 요구사항이 빠르게 변한다. 그래서 요구사항을 동적으로 분석해 비즈니스에 반영해야 한다.
- 기술이 어느 정도 성숙하면, 기술에서 새 기회를 찾기보다 고객과 시장의 요구로 개선 방향을 정하는 편이 유용하다.
기존 연구가 다루지 않은 부분
소셜미디어 데이터로 비즈니스 기회를 찾는 선행(先行) 연구는 여럿 있었다. 뉴스 데이터에서 떠오르는 토픽을 찾은 연구, 모바일 서비스 리뷰에 감성분석과 다기준 의사결정 기법을 적용해 만족도를 측정한 연구가 있다. 제품결함을 찾는 텍스트 분석 체계, 기회 발견 이론으로 제품기회를 도출한 연구, 기회분석 알고리즘을 소셜미디어 데이터에 적용한 연구도 있다.
논문이 짚은 빈틈은 세 가지다.
- 선행 연구는 기회를 계량화했지만 시간에 따라 변하는 기회는 파악하지 못했다.
- 대다수 연구는 계량화한 기회의 우선순위를 식별하지 않았다. 기업이 제품개발과 마케팅의 순서를 정하려면 기회 사이의 상대적 중요도가 필요하다.
- 일부 연구는 기술 관점으로 분석해서 고객과 시장 관점의 고려가 부족했다.
방법: 리뷰를 토픽으로 묶고, 매달 세 지표로 순위를 매긴다
논문의 방법은 네 단계다. 1단계에서 온라인 제품리뷰를 모으고 제품 관련 키워드를 뽑는다. 2단계에서 토픽모델링으로 고객 요구사항을 정의하고, 3단계에서 기회 수준을 나타내는 지표를 시간에 따라 계산한다. 4단계에서 TOPSIS로 시점별 우선순위를 산출해 바뀌는 제품기회를 모니터링한다. 이 글도 논문의 단계 구분을 그대로 따른다.
사례와 자료
사례 제품은 Apple의 태블릿 PC인 iPad다. iPad는 2010년 4월 3일 미국에서 처음 출시되었고, 수년간 태블릿 PC 시장 점유율 1위를 유지했다. 기능이 다양하고 신제품이 계속 나오며 고객 의견 교환이 활발하다. 논문은 이 점을 들어 시간에 따른 변화를 추적하는 방법에 적합한 사례로 보았다.
데이터 출처는 Reddit이다. Reddit은 120만 개가 넘는 subreddit(주제별 게시판)으로 구성된다. Twitter나 Facebook은 분석자가 미리 정한 키워드나 해시태그로만 데이터를 모을 수 있다. 반면 Reddit은 주제에 맞는 subreddit을 쓰면 검색 조건을 사전(事前)에 정의하지 않아도 관련 글을 모을 수 있다.
연구진은 iPad subreddit에서 2015년 12월부터 2018년 5월 사이에 작성된 글을 수집했다.
| 항목 | 값 |
|---|---|
| 수집 게시글 | 19,883개 |
| 수집 댓글 | 146,999개 |
| 수집 문서 합계 | 166,882개 |
| 추출 키워드 | 56,789개 |
| 최종 키워드 | 10,401개 |
| 최종 문서 | 42,269개 |
| 일 평균 글 수 | 46.25개 |
출처: 논문 4.1절
최종 분석에 쓰인 문서는 수집 문서의 약 25.3%다(42,269÷166,882=25.3%).
1단계: 리뷰 수집과 키워드 추출
- 입력: 대상 제품에 대한 온라인 리뷰
- 처리: 수집, 키워드 추출, 불용어 제거
- 산출: 문서-키워드 행렬
- 분석가는 웹 크롤링이나 소셜미디어가 제공하는 오픈 API(Application Programming Interface)로 리뷰를 모은다.
- 리뷰마다 자연어 처리 도구로 키워드를 뽑는다. 논문은 TextRazor, Alchemy API, spaCy를 예로 든다.
- 이모티콘, 의성어, 제품과 무관한 인사말 같은 불용어를 목록에서 지운다.
- 리뷰마다 키워드와 빈도를 벡터로 만들고, 모든 벡터를 문서-키워드 행렬 하나로 합친다.
불용어를 지우는 까닭은 분석에 필요하지 않은 키워드가 추출 결과에 섞이기 때문이다. 소셜미디어 데이터는 다른 공개 데이터보다 수집이 쉽고, 최신성이 높고, 비즈니스와의 연관성이 높다.
사례에서 연구진은 “[deleted]”, “[removed]” 같은 불필요한 문서를 먼저 지웠다. 이어서 spaCy로 키워드 56,789개를 뽑았다. 이 목록에는 웹 페이지 링크, 구어체, 이모티콘이 섞여 있었다. 연구진은 두 조건으로 불용어를 걸러냈다.
- 그 키워드를 포함하는 문서가 1개뿐인 키워드, 즉 문서빈도(Document Frequency)가 1인 키워드
- iPad와 직접 관련이 없는 키워드
남은 것은 키워드 10,401개와 이를 포함한 문서 42,269개다. 키워드는 원래 목록의 약 18.3%만 남았다(10,401÷56,789=18.3%).
2단계: LDA로 제품 토픽 추출
- 입력: 문서-키워드 행렬, 토픽 수
- 처리: LDA(Latent Dirichlet Allocation, 잠재 디리클레 할당) 토픽모델링과 토픽 해석
- 산출: 토픽-키워드 분포, 문서-토픽 분포, 토픽 이름
- 분석가는 토픽 수를 정한다. 논문은 토픽 사이 코사인 유사도나 Perplexity가 가장 작아지는 토픽 수를 택하는 방법을 쓴다.
- LDA를 실행해 두 분포를 얻는다.
- 토픽-키워드 분포에서 기여도가 높은 키워드를 확인한다.
- 그 토픽에 기여도가 높은 문서를 읽고 토픽 이름을 정한다.
LDA를 쓰는 까닭은 다른 토픽모델링 기법보다 성능이 좋아 널리 쓰이기 때문이다. 토픽-키워드 분포는 각 토픽이 무엇으로 구성되는지를 알려 준다. 문서-토픽 분포는 각 문서가 어떤 토픽을 이야기하는지를 알려 준다. 논문은 앞의 분포로 요구사항을 정의하고, 뒤의 분포로 요구사항을 평가한다.
토픽은 키워드 묶음일 뿐이라서 사람이 뜻을 붙여야 한다. 25번째 토픽의 주요 키워드는 ‘true tone(0.2436)’, ‘final cut(0.0346)’, ‘true tone display(0.0306)‘이었다. 기여도가 높은 문서도 True Tone 기능을 이야기했다. 그래서 연구진은 이 토픽을 ‘True tone display’로 정했다.
49번째 토픽에서는 ‘best buy’의 기여도가 0.5020이었다. 이 키워드 하나가 전체 기여도의 반 이상을 차지하므로, 연구진은 이 토픽을 전자기기 소매점 ‘Best buy’ 토픽으로 정의했다.
사례에서 연구진은 scikit-learn으로 LDA를 실행했다. 토픽 수를 1부터 늘려 가며 Perplexity를 계산했고, 토픽 수가 70개일 때 Perplexity가 3140.66으로 가장 작았다. 추출된 주요 토픽에는 다음과 같은 유형이 있다.
- 사용과 기능: ‘Data usage’, ‘Split screen’, ‘Applications’, ‘Photo editing’
- 제품 모델과 옵션: ‘32GB model’, ‘64GB model’, ‘iPad Air’, ‘iPad Mini’
- 액세서리: ‘Apple pencil’, ‘Smart keyboard’
3단계: 중요성, 만족성, 부상성 계산
- 입력: 문서-토픽 분포, 문서 작성 시점, 문서 극성
- 처리: 시점별 합산과 정규화
- 산출: 토픽마다 시점별 세 지표
- 중요성: 시점마다 문서-토픽 분포의 기여도를 더해 토픽량을 구한다. 이 값을 0과 1 사이로 정규화한다.
- 만족성: 모든 문서에 감성분석을 해서 극성(긍정·부정 정도)을 구한다. 문서 극성을 문서-토픽 분포에 곱해 감성 행렬을 만들고, 시점마다 더한 뒤 0과 1 사이로 정규화한다.
- 부상성: 방법을 설명하는 3.3절은 현재 시점과 이전 시점 토픽량의 비율로 구한다고 쓴다. 결과 자체가 비율이라서 정규화하지 않는다. 그런데 결론에서는 부상성을 문서-토픽 분포 기여도의 1개월간 증가량으로 구했다고 적는다. 논문 안에서 비율과 증가량이라는 두 서술이 서로 일치하지 않으므로, 재현하려는 독자는 이 점을 감안해야 한다.
세 지표는 각각 다른 기회를 가리킨다. 다른 토픽보다 많이 언급된 토픽은 고객이 중요하게 여기는 제품 요소다. 만족도가 낮은 토픽은 개선할 여지가 남아 있다. 언급량이 급증한 토픽에서는 이전에 없던 요구에 빨리 대응할 수 있다.
토픽 추세를 보는 방법에는 TOT(Topics over Time)와 DTM(Dynamic Topic Modeling)도 있다. 논문은 기여도를 시간에 따라 더하는 방법을 택했다. 세 지표를 같은 방식으로 산출해야 일관성이 유지되기 때문이다.
감성분석에는 파이썬 패키지 VADER를 썼다. 논문은 VADER를 딥러닝 기반 패키지로 소개한다.
계산 방식을 기호로 정리해 본다. 어떤 달에 쓰인 문서 하나가 25번째 토픽에 기여도 a, 감성 극성 p를 가진다고 하자. 이 문서는 그 달 중요성의 토픽량에 a를 더한다. 만족성 합계에는 a×p를 더한다. 기여도가 같아도 극성이 낮은 문서는 만족성에 더 작은 값을 보탠다. 논문 표 1에는 25번째 토픽 관련 문서의 기여도와 감성 가중치가 실려 있다. 실제 값은 논문 원문(DOI 링크)에서 확인할 수 있다.
부상성은 이전 시점이 없으면 계산할 수 없다. 사례의 첫 달인 2015년 12월에는 모든 토픽의 부상성이 0이다.
4단계: TOPSIS로 월별 우선순위 산출
- 입력: 토픽마다 시점별 세 지표
- 처리: TOPSIS, 이동평균
- 산출: 토픽별 우선순위 시계열
- 긍정적 이상해(PIS, positive ideal solution)를 정한다. 중요성이 가장 높고, 만족성이 가장 낮고, 부상성이 가장 높은 가상의 토픽이다.
- 부정적 이상해(NIS, negative ideal solution)를 정한다. 중요성이 가장 낮고, 만족성이 가장 높고, 부상성이 가장 낮은 가상의 토픽이다.
- 토픽마다 두 이상해까지의 유클리드 거리를 계산한다.
- 상대적 근접성을 계산한다. NIS까지의 거리를 두 거리의 합으로 나눈 값이다.
- 모든 시점에서 반복해 근접성 시계열을 얻고, 이동평균으로 변동을 줄인 뒤 순위를 매긴다.
근접성은 1이면 가장 좋은 순위, 0이면 가장 나쁜 순위다. 근접성이 높을수록 기회 수준이 높다. 다음은 논문의 정의에 필자가 값을 넣어 본 계산이다. 어떤 토픽이 PIS와 같은 위치에 있으면 PIS까지의 거리가 0이다. 이때 근접성은 NIS까지의 거리÷(0+NIS까지의 거리)=1이 된다.
TOPSIS는 지표 사이의 상쇄를 허용한다. 한 지표의 나쁜 값을 다른 지표의 좋은 값이 보완할 수 있다. 이해하기 쉽고 계산이 간단하다는 점도 논문이 든 장점이다.
사례의 이동평균 기간은 6개월이다. 논문은 수집한 30개월 동안 iPad가 5개 출시되었다는 점을 반영했다(30÷5=6). 논문은 분석 기간에 출시된 iPad를 다음과 같이 서술한다.
- 1세대 iPad Pro 9.7형
- iPad 5세대
- 2세대 iPad Pro 12.9형과 10.5형(2017년 6월 13일에 함께 출시)
- iPad 6세대
5개라는 집계는 논문의 서술을 그대로 따른 것이다. 아래 결과에서 다루는 글 수 급증 시기 5번과는 다른 숫자다.
결과: 순위는 신제품 출시에 따라 움직이고, 일부 토픽은 꾸준히 위에 남는다
리뷰 양은 발표·출시 직후에 늘었다
수집 기간 동안 글 수가 급증한 시기는 5번이다.
- 2016년 3월 22일, 176개: 1세대 iPad Pro 9.7형 발표 다음 날
- 2017년 3월 22일, 117개: 5세대 iPad 9.7형 발표 다음 날
- 2017년 6월 14일, 221개(가장 많음): 2세대 iPad Pro 12.9형·10.5형 출시 다음 날
- 2017년 9월 15일, 136개: iPad 가격인상과 사흘 전 신제품 행사의 영향으로 추정
- 2018년 3월 28일, 153개: 6세대 iPad 9.7형 출시 다음 날
연구진은 이 수치로 보아 iPad보다 iPad Pro에 대한 관심이 상대적으로 높다고 판단했다. 이 급증은 부상성에도 반영되었다. 2016년 3월과 2017년 6월에 대부분 토픽의 부상성이 급증했다.
지표마다 다른 토픽이 눈에 띄었다
중요성에서는 두 토픽의 추세가 대조적이었다.
- ‘iPad Air’: 중요성이 다른 토픽보다 높았지만 2017년 6월 이후 점차 낮아졌다. iPad Air는 2014년 10월 22일 2세대 출시 뒤 차기 제품이 없었다.
- ‘Smart keyboard’: 급증이나 급감 없이 꾸준히 올랐다. 연구진은 iPad Pro에 대한 관심이 함께 쓰는 키보드로 이어진 결과로 해석했다.
만족성에서도 두 토픽이 두드러졌다. ‘Best buy’는 2017년 1월에 급감하고 2018년 이후 떨어졌지만, 분석 기간 내내 상대적으로 매우 높았다. ‘Smart keyboard’의 만족성은 중요성과 비슷하게 증가했다. 연구진은 스마트 키보드가 점점 중요해지면서 고객을 만족시키고 있다고 해석했다.
꾸준히 상위에 남은 토픽: 배터리 수명
70개 토픽 가운데 35번째 ‘Battery life’는 전 기간 평균 8.67위였다. 2017년 11월, 12월과 2018년 1월, 2월, 4월에 1위를 차지했다. 1위를 5회 기록해 모든 토픽 중 가장 많았다.
기여도가 높은 문서를 읽어 보니 세부 주제는 다음과 같았다.
- iOS 버전 업데이트가 배터리 수명에 주는 영향: 가장 많이 언급되었고, 대부분 문서의 극성이 부정이었다.
- 애플 펜슬, 스마트 키보드 같은 액세서리 자체의 배터리와 액세서리 사용에 따른 iPad 배터리 소모
- 다른 제품과의 배터리 수명 비교
- 충전 방식이 배터리에 주는 영향
연구진은 이 토픽이 분석 기간 이후에도 기회 수준이 높을 것으로 예상했다.
출시에 따라 순위가 바뀐 토픽: 64GB와 32GB
22번째 토픽 ‘64GB model’은 2017년 6월 66위에서 6위로 올랐다. 필자가 계산하면 66−6=60계단 오른 것이다. 그 뒤 상위권을 유지했고, 가장 최근인 2018년 5월에는 1위였다. ‘32GB model’은 높은 순위를 기록하지 않았지만 ‘64GB model’과 반대 패턴을 보였다.
연구진은 이 패턴을 최저 용량 옵션으로 해석했다.
- 최저 용량이 32GB인 모델: 1세대 iPad Pro 9.7형(2016년 3월 31일), iPad 5세대(2017년 3월 24일), iPad 6세대(2018년 3월 27일)
- 최저 용량이 64GB인 모델: 2세대 iPad Pro 12.9형·10.5형(2017년 6월 13일)
두 집단은 서로의 용량 옵션이 없다. 연구진은 새 모델이 나오면 그 모델의 최저 용량에 대한 언급이 잦아져, 해당 토픽의 순위가 올라간다고 보았다. 이 해석은 출시 일정과 순위 변화가 함께 나타났다는 관찰에 바탕을 둔 추정이다. 신제품 출시가 고객 요구의 순위에 영향을 줄 수 있음을 시사하지만, 한 제품군(iPad)에서 얻은 한 사례의 해석이다.
만족도가 높고 순위가 낮은 토픽: True Tone 디스플레이
25번째 ‘True tone display’는 분석 기간 가장 높은 순위가 45위였고 전 기간 평균은 60위였다. 기여도가 높은 문서는 대부분 이 기능에 만족한 내용이었다. 대다수 문서의 극성이 0.7 이상이었다. 표본 문서 10건의 가중치 가운데 가장 높은 값은 0.9922, 가장 낮은 값은 0.7003이었다.
연구진은 높은 극성이 만족성을 높였고, 높은 만족성이 순위를 낮추는 데 큰 영향을 준 것으로 보인다고 해석했다. 다만 TOPSIS 순위에는 중요성과 부상성도 함께 작용한다. 그래서 이 사례에서 확인되는 것은 만족성이 높은 토픽이 낮은 순위와 함께 나타났다는 점까지다. 필자는 이 결과가 고객이 이미 만족하는 속성을 개선 기회로 보지 않는 방법의 의도와 맞는다고 본다.
최근 6개월 순위로 본 다음 기회
연구진은 순위 추세와 함께 최근 순위도 봐야 한다고 지적한다. 일정 기간이 지난 과거 데이터는 현재 시장과 요구를 설명하지 못하기 때문이다. 논문 표 2는 2018년 5월 순위 상위 5개 토픽의 최근 6개월 순위를 정리했다. 표에 실린 다섯 토픽은 다음과 같다.
- ‘64GB model’
- ‘Photo editing’
- ‘YouTube’
- ‘Product options’
- ‘Apple pencil’
월별 순위 수치는 논문 원문(DOI 링크)의 표 2에서 확인할 수 있다.
두 토픽의 해석이 대조적이다. ‘YouTube’는 6개월 동안 꾸준히 높은 순위였다. 연구진은 iPad로 영상을 보는 요구가 앞으로도 높을 것으로 예상했다. ‘Apple pencil’은 2018년 1월부터 순위가 꾸준히 올라 5개월 만에 47계단 상승했다. 연구진은 이 토픽을 잠재성이 있는 제품기회로 보았다.
의의와 한계
무엇이 달라지는가
- 제품기회를 한 번이 아니라 시간에 따라 계속 모니터링한다.
- 중요성, 만족성, 부상성을 TOPSIS로 합쳐 요구사항마다 우선순위를 정량화한다.
- 고객이 직접 쓴 리뷰를 써서 고객과 시장 관점의 기회를 찾는다.
- 신제품 출시가 제품 토픽 순위에 주는 영향을 확인한다.
실무자에게 주는 쓸모
연속 모니터링은 스냅숏 분석이 놓치는 정보를 준다. 순위의 변화 추세로 잠재력 있는 기회를 찾고, 새로 출시한 제품이 고객 요구에 준 영향을 확인할 수 있다. 이를 바탕으로 과거 전략이 적절했는지 판단하고 앞으로 집중할 방향을 정할 수 있다.
웹에서 모은 대량의 데이터를 쓰므로 설문보다 빨리 요구 변화를 파악하고 대응할 수 있다. 논문은 이 방법을 고객 중심 제품기획과 개발을 지원하는 모니터링 도구로 제시한다.
연구자에게 주는 쓸모
이 논문은 토픽모델링, 감성분석, TOPSIS를 하나의 절차로 연결한다. 논문은 세 지표를 같은 방식으로 산출해야 일관성이 유지된다는 이유로, 문서-토픽 분포의 기여도를 더하는 방식을 택했다. 키워드 선정 기준, 순위 예측, 지표 추가처럼 후속 연구 주제도 분명하게 남겼다.
논문이 밝힌 한계
논문이 스스로 밝힌 한계는 네 가지다.
- 제품 관련 키워드를 선정하는 과정에 분석자의 주관이 개입될 수 있다. 이 선정은 토픽 추출 결과에 영향을 준다.
- 분석 기간 이후의 기회 수준 변화는 예측하지 못했다. 딥러닝 기반 예측이나 시계열 분석이 필요하다.
- 중요성, 만족성, 부상성 외에 소셜미디어 데이터의 특성을 반영한 지표가 더 필요하다.
- 한 제품군에만 적용했다. 다른 분야나 개별 제품 모델 단위로 적용하는 연구가 가능하다.
필자가 보는 적용 조건
아래는 논문에 적힌 내용이 아니라 필자가 실무 적용을 염두에 두고 덧붙이는 조건이다.
- 매달 들어오는 글이 충분해야 한다. 부상성은 정규화하지 않아서 시점별 문서 수의 영향을 크게 받는다. 글이 적은 달에는 순위가 크게 흔들릴 수 있다.
- 자사 제품 출시일과 행사일을 함께 기록해 두어야 한다. 64GB와 32GB 사례처럼 순위 변화의 원인은 출시 일정을 알아야 설명된다.
- 토픽 이름은 사람이 붙인다. 토픽이 70개면 담당자가 키워드와 대표 문서를 읽는 시간을 따로 잡아야 한다.
- 만족성이 높은 토픽은 다른 지표가 비슷하다면 순위가 낮게 나오는 경향이 있다. TOPSIS는 지표 사이의 상쇄를 허용하므로, 중요성이나 부상성이 높으면 순위가 달라질 수 있다. 고객이 좋아하는 강점을 관리하려면 만족성 지표를 따로 봐야 한다.
- 이동평균 기간은 자사의 출시 주기에 맞춰 정한다. 논문의 6개월은 30개월 동안 5개 제품이 나온 iPad의 조건에서 나온 값이다.
바로 해 볼 일
- 자사 제품을 다루는 커뮤니티 게시판이나 리뷰 페이지에서 글을 작성일과 함께 모은다. 키워드를 뽑은 뒤 문서빈도가 1인 키워드와 제품과 무관한 키워드를 지워 문서-키워드 행렬을 만든다. 이 행렬이 첫 단계의 산출물이다.
- 토픽 수를 늘려 가며 Perplexity를 계산하고, 가장 작은 값의 토픽 수로 LDA를 실행한다. 토픽마다 기여도가 높은 키워드와 문서를 읽고 이름을 붙인다.
- 월별로 중요성, 만족성, 부상성을 계산해 TOPSIS로 순위를 매긴다. 자사 출시 주기에 맞춘 이동평균을 적용한 뒤, 최근 6개월 동안 순위가 꾸준히 오른 토픽을 찾아 다음 기획 회의의 검토 목록으로 만든다.