소셜미디어 분석 연구, 지금 어디까지 왔나

소셜미디어 속 고객 의견을 사업 의사결정에 쓰려면 어떤 플랫폼과 분석 방법이 맞을까? 논문 57편을 정리한 체계적 리뷰로 연구 흐름과 빈틈을 살펴본다.

제품 기획자나 마케팅 담당자는 리뷰와 게시글이 매일 쌓이는 것을 본다. 그런데 어느 플랫폼에서 무엇을 모아 어떤 방법으로 분석해야 의사결정에 쓸 정보가 나오는지는 분명하지 않다. 개별 응용 논문은 많지만, 연구가 어디에 몰려 있고 어디가 비어 있는지 한 번에 정리한 자료는 찾기 어렵다.

소셜미디어에 쌓인 고객 의견을 비즈니스 의사결정의 자료로 쓸 수 있을까? 쓸 수 있다면 지금까지 연구는 어떤 자료와 방법으로 무엇을 얻어 냈을까?

이 질문에 답한 논문을 한 편 읽어 본다.

  • 제목: Social media analytics and business intelligence research: A systematic review
  • 학술지: Information Processing & Management
  • 연도: 2020
  • DOI: 10.1016/j.ipm.2020.102279

논문이 하는 일은 두 가지다. 먼저 공개 데이터를 여섯 범주로 나누고, 전문가 10명의 평가로 네 차원에서 비교한다. 다음으로 Web of Science(WoS)에서 논문 633편을 모은 뒤 57편을 추리고, 세 가지 연구 질문으로 분석한다.

글 전체에서 쓰는 용어는 다음과 같다.

  • 비즈니스 인텔리전스(Business Intelligence, BI): 사업 맥락에서 정보를 얻고 해석하고 분석해 쓸모 있는 지식을 끌어내는 과정 전체를 가리키는 말이다.
  • 고객의 목소리(Voice of Customer, VoC): 고객이 제품이나 서비스에 남긴 의견이다. 이 글에서는 소셜미디어에 남긴 온라인 VoC를 다룬다.
  • 공개 데이터(open data): 기밀로 분류되지 않아 누구나 접근할 수 있는 정보원이다. 오픈소스 소프트웨어와는 다른 개념이다.
  • 체계적 문헌 리뷰(systematic review): 검색식과 제외 기준을 미리 정해 문헌을 모으고, 정해 둔 질문에 따라 분석하는 리뷰 방식이다. 논문은 Kitchenham(2004)의 지침을 따랐다.
  • 응용 프로그래밍 인터페이스(Application Programming Interface, API): 플랫폼이 외부에 데이터를 내주는 공식 접속 방식이다.
  • 감성 분석(sentiment analysis): 글에 담긴 감정의 극성(긍정인지 부정인지)을 점수로 계산하는 방법이다.

동기: 소셜미디어 기반 BI 연구를 한데 모아 정리한 리뷰가 없었다

왜 소셜미디어 속 고객 의견이 중요한가

논문은 소셜미디어가 고객이 의견을 내는 가장 손쉬운 장소가 되었다고 보고, 그 근거를 여러 개 든다.

  • 이용 규모: 미국 인구의 약 79%가 소셜미디어 계정을 가지고 있었고, 동아시아는 70%, 북유럽은 67%였다.
  • 리뷰의 영향: 고객의 약 77%가 다른 고객의 온라인 리뷰를 읽고, 75%는 개인의 직접 추천보다 리뷰를 더 믿는다. 80%가 넘는 고객은 소셜미디어 채널에서 쓸모 있는 정보를 얻는다.
  • 검열 없는 의견: 고객은 Twitter, Facebook, Amazon 같은 채널에 별다른 검열 없이 의견을 남긴다. 이런 의견이 다른 고객의 구매 결정에 영향을 준다.
  • 기업의 활용: Samsung mobile은 2010년에 “Samsung Global” Facebook 페이지를 열어 약 5천만 명의 팔로워를 모았다. Starbucks는 2008년에 “My Starbucks Idea”를 열어 고객 아이디어를 모았다.
  • 시장 주도형 혁신의 필요: 스마트폰처럼 기반 기술이 이미 성숙한 제품은 사내 연구개발만으로 혁신하기 어렵다. 그래서 고객 요구에서 개발 방향을 찾는 접근이 필요하다.

예를 들어 Jeong 등(2018)은 Reddit에서 Samsung Galaxy Note 5 리뷰를 모았다. 연구진은 토픽 모델링으로 배터리 수명, 터치 인식, 카메라에 대한 불만을 찾아냈다. 이어서 감성 분석과 기회 알고리즘으로 중요도는 높고 만족도는 낮은 기능을 짚었다.

기존 연구가 다루지 않은 부분

초기 BI 연구는 특허, 연구 논문, 상업 자료 같은 전통 데이터를 주로 썼다. Park and Yoon(2017)은 기업의 특허에서 기술 역량을 파악하고, 협업 필터링으로 기술 기회를 추천했다. Wang 등(2018)은 특허를 분류 코드로 묶고 부상 지표를 계산해 새로 떠오르는 주제를 찾았다.

이후 고객이 만든 데이터로 관심이 옮겨 갔다. Chung and Tseng(2012)은 온라인 제품 리뷰가 고객과 시장을 이해하는 주요 자료라고 강조했다. 소셜미디어 데이터가 BI에 적합하다는 데에는 합의가 있었다. 하지만 어느 공개 데이터가 BI 연구에 가장 알맞은지는 여전히 논쟁거리였다.

논문이 짚은 빈틈은 두 가지다.

  • 소셜미디어 기반 BI 연구 흐름 전체를 다룬 연구가 드물었다. 소셜미디어 관련 리뷰는 있었지만 관점이 달랐다.
  • 소셜미디어, 지식재산 같은 여러 공개 데이터를 BI 관점에서 비교한 연구가 부족했다.

이와 별도로 논문은 기여 하나를 내세운다. 새로 들어오는 연구자와 실무자를 위해 소셜미디어 데이터를 모으고 전처리하고 분석하는 절차를 정리한 안내를 제공한다는 점이다.

방법: 공개 데이터를 평가하고, 633편에서 57편을 추려 세 질문으로 분석했다

논문은 크게 두 부분으로 진행된다. 앞부분은 공개 데이터를 분류하고 평가하는 일이고, 뒷부분은 체계적 문헌 리뷰다. 이 글에서는 전체를 네 단계로 나눴다.

그림 1. 공개 데이터를 분류·평가한 뒤 문헌 633편에서 57편을 추려 세 질문으로 분석하는 네 단계 절차다.
  • 1단계: 공개 데이터를 분류한다.
  • 2단계: 전문가 평가로 데이터를 비교한다.
  • 3단계: 문헌을 검색하고 선정한다.
  • 4단계: 세 가지 연구 질문과 통합 분석 틀로 문헌을 분석한다.

논문이 개념 중심 리뷰 대신 체계적 리뷰를 택한 이유도 두 가지다. 첫째, 소셜미디어 기반 BI 연구는 이론보다 실제 사업의 의사결정 문제에서 출발했다. 둘째, 인용 관계로 이론의 발전 경로를 따라가기보다 방법, 알고리즘, 데이터의 최근 추세를 보려 했다.

자료와 전문가

분석 대상은 두 가지다. 하나는 평가에 참여한 전문가이고, 다른 하나는 WoS에서 모은 논문이다.

  • 전문가: BI 연구에 참여하는 10명이다. 교수 4명은 소셜미디어, 연구 제안서, 특허 같은 공개 데이터로 약 10년간 BI 연구를 해 왔다. 대학원생 6명은 소셜미디어 마이닝, 고객 이해, 데이터 기반 사업 기획을 약 4년간 연구했다.
  • 문헌: 2018년 7월 4일에 WoS에서 검색했다. 기간은 최근 5년, 문헌 종류는 동료 심사를 거친 학술지 논문으로 제한했다.
  • 규모: 검색 결과는 633편이었고, 최종 분석 대상은 57편이었다.

1단계: 공개 데이터를 여섯 범주로 나눈다

  • 입력: 공개 정보원에 관한 선행 문헌
  • 처리: 범주를 정의하고 예시를 붙인다
  • 산출: 공개 데이터 분류표(여섯 범주)
  1. 오픈소스 인텔리전스 분야의 정의에서 출발해 공개 데이터의 범위를 정한다.
  2. 관련 문헌을 바탕으로 범주를 나누고, 범주마다 실제 예를 붙인다.

이렇게 나누는 이유는 소셜미디어 데이터를 다른 공개 데이터와 같은 기준으로 비교하기 위해서다. 범주와 예시는 다음과 같다.

  • 대중매체: 인쇄 신문, 잡지, 라디오, 텔레비전
  • 상업 자료: 상업 이미지, 재무·산업 평가 보고서
  • 회색 문헌(상업 출판되지 않은 공개 자료): 지식재산, 뉴스레터, 기술 보고서, 서지
  • 공공 정부 데이터: 정부 보고서, 정부 공개 데이터
  • 전문·학술 출판물: 학술지, 학술대회, 심포지엄의 정보
  • 웹 기반 데이터: 소셜미디어, 온라인 토론 그룹, 온라인 출판물

특허와 상표는 회색 문헌에 들어간다. 기술과 사업 분야를 서술하는 자료여서 BI 연구에 자주 쓰인다.

2단계: 네 가지 차원으로 데이터를 평가한다

  • 입력: 여섯 범주의 공개 데이터
  • 처리: 전문가 10명이 네 차원에서 높음·중간·낮음으로 평가한다
  • 산출: 범주별 평가표
  1. 전문가가 평가 차원 네 가지를 정한다. 데이터를 모으고 분석하는 과정과 BI 시스템을 계속 운영하는 과정에 공통으로 해당하는 속성을 반영했다.
  2. 전문가가 범주마다 차원별로 높음, 중간, 낮음을 매긴다.
  3. 연구진은 전문가 의견을 모아 하나의 평가표로 정리한다.

네 차원의 뜻은 다음과 같다.

  • 데이터 내용: 다루는 내용, 전문성, 이용자의 지식 수준이 사업 의사결정에 얼마나 도움이 되는가
  • 데이터 수집: 많은 양을 모을 수 있는 공개 API가 있는가
  • 데이터 갱신: 최신 데이터가 쌓이고 데이터베이스가 계속 갱신되는가
  • 데이터 구조: 분석하기 쉬운 정형 형식으로 처리할 수 있는가

수집과 갱신 두 차원은 BI 연구의 체계화와 밀접하게 관련된다. 평가 결과는 결과 절에서 정리한다.

3단계: 문헌을 검색하고 선정한다

  • 입력: WoS 데이터베이스
  • 처리: 검색식으로 1차 목록을 얻고, 제외 기준으로 추린다
  • 산출: 1차 목록 633편(Group 1), 최종 목록 57편(Group 2)
  1. 검색식을 정한다. 연구자마다 같은 주제를 다른 낱말로 적기 때문에 핵심어를 ‘and’보다 ‘or’로 묶어 최대한 많이 찾으려 했다.
  2. 제목에 “systematic review”가 들어간 리뷰 논문은 빼고, 자주 쓰이는 방법인 “sentiment”는 검색어에 넣는다.
  3. 최근 5년, 학술지 논문으로 범위를 좁혀 검색한다.
  4. 1차 목록의 제목과 초록을 읽고 제외 기준을 적용한다.

검색식은 “TITLE: ((social and media or ((product or service) near (review))) and (mining or analy* or sentiment or business)) NOT TITLE: (systematic and review)”이다.

제외 기준은 아홉 가지다.

  • EC1: 동료 심사를 거친 학술지 논문만 포함한다.
  • EC2: 서평, 학회 초록, 편집자 글은 뺀다.
  • EC3: 제목이나 초록이 연구 내용을 충분히 설명하지 않으면 뺀다.
  • EC4: 접근할 수 없는 논문은 뺀다.
  • EC5: 영어 논문만 포함한다.
  • EC6: 내용이 중복된 논문은 뺀다.
  • EC7: 연구 논문만 포함하고 문헌 조사 논문은 뺀다.
  • EC8: 소셜미디어를 BI 목적으로 분석하지 않은 논문은 뺀다. 새 알고리즘의 성능을 보이려고 소셜미디어를 입력으로만 쓴 논문이 여기에 해당한다.
  • EC9: 사업 의사결정에 쓸 정보를 끌어내지 않은 논문은 뺀다.

선정 결과는 다음과 같다. 1차 목록 633편 가운데 10편은 중복이었고, 566편은 초록을 읽은 뒤 관련이 없다고 판단했다. 그래서 633−10−566=57편이 최종 분석 대상으로 남았다. 학술대회 논문은 뺐다. 해당 학술지 논문이 최신 결과를 대표한다고 보았기 때문이다.

4단계: 세 가지 질문과 통합 분석 틀로 문헌을 분석한다

  • 입력: 최종 논문 57편
  • 처리: 연구 질문 세 가지에 따라 데이터, 방법, 결과를 정리한다
  • 산출: 플랫폼 분포, 분석 접근 분류, 도출 정보 분류

연구 질문은 다음 세 가지다.

  1. RQ1: 이 분야에서 쓰이는 유망한 소셜미디어 플랫폼은 무엇인가?
  2. RQ2: 연구자가 소셜미디어 데이터에 적용하는 주된 방법과 알고리즘은 무엇인가?
  3. RQ3: 소셜미디어 기반 BI 연구는 어떤 정보를 끌어내는가?

연구진은 57편의 분석 절차를 정리해 네 단계짜리 통합 분석 틀을 만들었다.

  1. 데이터 수집: 공개 API나 웹 크롤링으로 글, 이미지, 영상을 모아 데이터베이스를 만든다. 보안과 개인정보를 고려하면 공개 API를 쓰는 편이 가장 낫다고 논문은 권한다.
  2. 전처리: 자연어 처리로 키워드를 뽑고 불용어를 지운다. 이모티콘(”^^”, ”:-D”), 웹 링크(“www”), 의성어(“haha”), 일반어(“product”, “device”), 관련 없는 낱말(“day”, “month”)을 뺀다. 그다음 문서-단어 행렬 같은 정형 형식으로 바꾼다.
  3. 분석: 여러 알고리즘을 적용한다.
  4. 검증과 해석: 결과를 검증하고 의미를 해석한다.

전처리에서 일부 연구자는 단어 빈도(Term Frequency, TF, 한 문서 안에서 나온 횟수)와 문서 빈도(Document Frequency, DF, 그 단어가 나온 문서 수)로 중요한 키워드를 추렸다. 짧은 글은 복잡한 전처리 없이 단어 임베딩 결과를 바로 쓰기도 했다.

분석 방법은 쓰인 깊이와 의도에 따라 다섯 가지 접근으로 분류했다. 감성 분석, 토픽 모델링, 머신러닝(Machine Learning, ML) 기반 접근, 네트워크 기반 접근, 이론 기반 접근이다.

결과: 상거래 리뷰와 SNS를 감성 분석과 머신러닝으로 분석한 연구가 중심이다

그림 2. 57편은 상거래 리뷰·SNS 데이터와 감성 분석·ML 접근에 몰려 있다.

공개 데이터 평가: 회색 문헌과 웹 기반 데이터가 높았다

평가 결과의 핵심은 다음과 같다. 범주별 전체 값은 원 논문의 표 3에서 볼 수 있다.

  • 회색 문헌: 네 차원 모두 높음이었다.
  • 웹 기반 데이터: 내용, 수집, 갱신은 높음이고 구조는 중간이었다.
  • 대중매체: 네 차원 모두 낮음이었다. 인쇄물 같은 물리적 자료라 분석 형식으로 바꾸는 데 손이 많이 가기 때문이다.
  • 공공 정부 데이터: 회색 문헌보다 낮게 평가됐고, 특히 갱신이 낮음이었다.

회색 문헌이 높게 평가된 이유는 특허처럼 공식 기관이 정기적으로 발행하고 쌓아 두기 때문이다. 그래서 데이터베이스를 체계적으로 만들 수 있다.

웹 기반 데이터의 강점은 이용자가 실시간으로 만들어 갱신이 빠르다는 점이다. 대부분 공개 API가 있고, API가 없으면 웹 크롤링으로 모을 수 있다. 구조가 중간인 이유는 오타, 이모티콘, 약어가 섞인 비정형 데이터여서 전처리가 필요하기 때문이다.

공공 정부 데이터는 낮게 평가됐다. Data.gov는 300,000개가 넘는 데이터셋을 제공하지만 사업 기회나 고객 의견과 직접 관련된 데이터셋은 적다. 게다가 발행 시기와 형식이 제각각이어서 계속 모으기 어렵다.

논문은 수집, 갱신, 구조의 높은 점수를 근거로 소셜미디어의 BI 분석 적합성이 다른 공개 데이터보다 높다고 결론지었다. 평가표 값 자체는 회색 문헌이 네 차원 모두 높음이고, 웹 기반 데이터는 구조가 중간이다. 이 차이를 어떻게 읽을지에 대한 필자의 의견은 글 뒤쪽의 적용 조건에 따로 적었다.

연구 추세: 논문 수가 해마다 늘었다

1차 목록 633편의 연도별 편수는 2014년부터 83편, 118편, 150편, 180편으로 늘었다. 2018년에는 7월까지 이미 100편 가까이 나왔다. 최종 목록 57편에서도 비슷한 증가 추세가 나타났다.

논문이 실린 학술지는 주로 정보 처리, 지능형 시스템, 전문가 의사결정 지원 분야였다. 마케팅, 서비스 경영, 전자상거래, 담배 규제, 산업 안전 분야의 학술지에도 일부 논문이 실렸다. 소셜미디어 분석이 여러 사업 환경에서 서로 다른 목적으로 쓰이고 있다는 뜻이다.

RQ1: 상거래 리뷰와 SNS가 대부분이다

연구진은 57편이 쓴 데이터를 네 유형으로 나눴다. 상거래 리뷰 29편, SNS 24편, 온라인 토론 그룹 2편, 복합 데이터 2편이다. 합계는 29+24+2+2=57편이다.

상거래 리뷰에서는 Amazon(6편), Yelp(5편), TripAdvisor(4편)가 많이 쓰였다. SNS에서는 Twitter(11편)가 가장 많았다. 온라인 토론 그룹 2편은 모두 Reddit을 썼다. 플랫폼별 전체 분포는 원 논문의 표 4에서 볼 수 있다.

개별 플랫폼으로는 Twitter, Amazon, Yelp, TripAdvisor가 자주 쓰였다. 유형마다 쓰인 이유와 어려움은 다음과 같다.

  • 상거래 리뷰: 리뷰가 제품이나 서비스 단위로 쌓여 주제가 통일되어 있다. 그래서 수집 뒤 데이터를 추리는 수고가 적다. 29편 가운데 제품 리뷰가 14편, 서비스 리뷰가 15편이다(14+15=29). 다만 약어, 이모티콘, 자동 완성 문장이 섞여 있어 정제가 필요하다.
  • SNS: 많은 이용자가 실시간으로 글을 만들고 대부분 공개 API가 있다. Twitter는 하루 평균 5억 건이 넘는 트윗이 나온다. 반면 140자 제한 때문에 약어와 이모티콘이 많아 체계적인 전처리가 필요하다. Flickr 사진을 분석한 연구는 10만 건이 넘는 데이터를 모았다.
  • 온라인 토론 그룹: Reddit에는 120만 개가 넘는 서브레딧(주제별 게시판)이 있다. 서브레딧 이용자는 그 주제에 지식이나 관심이 많아 글이 구체적이고 내용이 풍부하다.
  • 복합 데이터: 소셜미디어와 특허를 함께 분석해 기업의 기술 역량과 고객 의견을 한 번에 보려 했다. Amazon과 특허, Twitter와 특허를 결합한 연구가 1편씩이다.

복합 데이터 연구에는 보완할 점도 있었다. 한 연구는 특허 발행일과 제품 출시일의 차이를 고려하지 않았다. 실증 연구에 따르면 특허 공개와 시장 출시 사이에 3개월에서 3년의 시차가 있다. 온톨로지(개념과 관계를 정의한 지식 체계)로 특허와 리뷰를 직접 연결한 연구도 있었다. 그런데 이 방식은 온톨로지를 짤 때 전문가의 손이 많이 간다.

RQ2: 감성 분석과 머신러닝이 가장 많이 쓰였다

다섯 가지 분석 접근의 논문 수와 목적은 다음과 같다.

  • 감성 분석 27편: 특정 제품, 서비스, 브랜드에 대한 의견의 극성을 판별한다. 사전 기반, 텍스트 분류 기반, 딥러닝 기반이 있다.
  • 토픽 모델링 13편: 고객과 대중이 언급한 주제를 찾는다. 잠재 디리클레 할당(Latent Dirichlet Allocation, LDA)과 잠재 의미 분석(Latent Semantic Analysis, LSA)이 쓰였다.
  • ML 기반 접근 27편: 감성 극성을 분류하거나 주가, 제품 판매량, 감성을 예측한다. 나이브 베이즈, 랜덤 포레스트, 서포트 벡터 머신(Support Vector Machine, SVM), 은닉 마르코프 모형 등이 쓰였다.
  • 네트워크 기반 접근 7편: 고객 간 상호작용 네트워크와 영향력 있는 이용자를 찾는다.
  • 이론 기반 접근 6편: 고객 만족, 서비스 수명 주기, 서비스 품질을 수치로 나타낸다. 퍼지 이론, 게임 이론, 기회 알고리즘, 카노 모형이 쓰였다.

한 논문이 여러 접근에 동시에 속할 수 있다. 그래서 다섯 접근의 합은 27+13+27+7+6=80편으로 전체 57편보다 많다.

감성 분석이 많이 쓰인 이유는 두 가지다. 결과가 점수로 나와 고객 반응을 수치로 다룰 수 있고, 짧고 품질이 낮은 글에서도 극성을 비교적 정확히 잡아낸다. 다만 논문은 더 나은 결과를 얻으려면 ML 알고리즘, 네트워크 분석, 이론을 함께 써야 한다고 본다.

ML 분류기 가운데 SVM은 분석 기간인 2013년부터 2017년까지 가장 꾸준히 쓰였다. 고객마다 다른 낱말로 쓴 소셜미디어 글처럼 차원이 높고 희소한 데이터에서 성능이 좋기 때문이다. 합성곱 신경망(Convolutional Neural Network, CNN)과 장단기 기억(Long Short-Term Memory, LSTM) 같은 새 알고리즘도 쓰였다. 한 연구는 양방향 LSTM으로 제품 안전 문제를 찾았다.

주가나 판매량을 예측한 연구에는 공통점이 있다. 소셜미디어 글의 감성 점수를 독립 변수로 쓰는 경향이다. 대부분의 연구는 정밀도, 재현율, 정확도, F값으로 기존 모형과 예측 성능을 비교했다.

RQ3: 네 가지 대상에서 정보를 끌어냈다

연구진은 57편이 분석한 대상을 네 가지로 나눴다.

  • 고객이 만든 콘텐츠: 제품·사업 기회 발견, 시장 내 경쟁 위치 분석, 품질 감시와 안전 위험 탐지, 고객 요구와 만족도 파악, 서비스 품질과 격차 조사
  • 고객 사이의 관계: 잠재 고객 커뮤니티 탐지, 네트워크 속 영향력 있는 이용자 식별, 제품 채택자 정보 추출, 관광객 행동 분석
  • 고객 반응: 주가 움직임 예측, 고객 반응 모니터링, 이상 감정과 부작용 탐지, 온라인 판매량 예측, 신기술 발전 추세 모니터링
  • 소셜미디어 데이터의 특성: 리뷰 유용성의 이론 근거 검토, 리뷰 열람과 유용성의 예측 변수 조사

추천 시스템이나 전문가 지원 시스템처럼 체계적인 방법을 제안한 연구도 있었다. 하지만 대부분은 고객 만족, 충성도, 인식을 파악하는 일회성 분석에 그쳤다.

의의와 한계

무엇이 달라지는가

  • 공개 데이터 여섯 범주를 내용, 수집, 갱신, 구조의 네 차원에서 비교했다.
  • 소셜미디어 기반 BI 논문 57편을 데이터, 방법, 결과의 세 질문으로 분류했다.
  • 수집, 전처리, 분석, 검증과 해석의 네 단계 통합 분석 틀을 정리했다.
  • 플랫폼별 공개 API 목록을 부록으로 정리했다. Twitter, Facebook, Amazon, Reddit, Yelp, TripAdvisor 등이 들어 있다.

실무자에게 주는 쓸모

실무자는 자기 사업 환경에 맞는 플랫폼과 방법을 정할 때 이 분류를 참고할 수 있다. 예를 들어 리뷰는 주제가 통일되어 있어 제품 개선에 바로 쓰기 좋다. 영향력 있는 이용자를 찾으려면 SNS의 사용자 관계를 네트워크로 분석한 연구가 참고가 된다.

통합 분석 틀은 사내 분석 절차를 짤 때 점검 목록으로 쓸 수 있다. 특히 한 번 분석하고 끝낼 것이 아니라 시스템으로 운영하려면 공개 API처럼 체계적인 수집 방식이 필요하다는 점을 논문은 강조한다.

연구자에게 주는 쓸모

논문은 다음 연구 방향을 세 가지로 제시한다.

  • 감성 분석 너머로: 고객이 좋다고 하는지 나쁘다고 하는지에 그치지 말아야 한다. 부정 리뷰의 구체적 이유를 추적하고 새 기능을 찾는 정량 접근이 필요하다.
  • 일회성 분석에서 체계적 틀로: 다른 데이터에도 재현할 수 있는 방법론과 전문가 지원 시스템으로 발전해야 한다.
  • 이종 데이터의 결합: 소셜미디어와 특허를 함께 분석해야 한다. 상표의 제품명과 출원인 정보를 연결 고리로 쓰거나, 단어 임베딩으로 고객 용어와 특허의 기술 용어를 비교하는 방안을 논문은 제안한다.

논문이 밝힌 한계

논문이 스스로 밝힌 한계는 다섯 가지다.

  • 주요 학술 데이터베이스 하나(WoS)만 검색했다. 그래서 WoS에 없는 관련 논문은 분석에서 빠졌을 수 있다.
  • 학술대회 논문을 뺐다. 영향력이 큰 학술대회 논문도 있으므로 이후 연구에서는 포함할 수 있다.
  • 인용 관계를 분석하는 개념 중심 접근을 더 긴 기간에 적용해 볼 수 있다.
  • 더 다양한 관점에서 분석하려면 연구 질문을 더 추가해야 한다.
  • 소셜미디어의 언어와 관광, 의료, 호텔, 전자 같은 사업 분야별 차이를 다루지 않았다. 수집한 논문 대부분은 영어나 중국어 데이터를 썼다.

필자가 보는 적용 조건

아래는 논문에 적힌 내용이 아니라 필자가 실무 적용을 염두에 두고 덧붙이는 조건이다.

  • 데이터 비교 결론: 논문은 소셜미디어의 BI 적합성이 다른 공개 데이터보다 높다고 결론지었다. 그런데 평가표에서는 회색 문헌이 네 차원 모두 높음이고, 웹 기반 데이터는 구조가 중간이다. 필자는 이 결론을 수집과 갱신 관점으로 한정해 읽는 편이 맞다고 본다. 정형 자료가 중요한 과제라면 특허 같은 회색 문헌을 함께 검토하는 편이 안전하다.
  • 검색 시점: 문헌 검색은 2018년 7월 4일에 이뤄졌다. 그 뒤에 나온 방법과 플랫폼 변화는 이 리뷰에 들어 있지 않다.
  • API 현황: 부록의 공개 API 목록은 논문 작성 시점의 정보다. 플랫폼의 접근 정책은 바뀔 수 있으므로 쓰기 전에 각 플랫폼의 현재 조건을 확인해야 한다.
  • 평가 방식: 공개 데이터 평가는 전문가 10명의 정성 평가다. 자기 사업 분야에서는 같은 네 차원으로 자사 데이터를 다시 평가해 보는 편이 안전하다.
  • 언어: 리뷰 대상 논문은 영어 논문으로 제한됐고, 분석 데이터도 주로 영어와 중국어였다. 한국어 리뷰를 다룰 때는 형태소 분석과 불용어 목록을 따로 준비해야 한다.

바로 해 볼 일

  1. 자사 제품의 리뷰를 통합 분석 틀 순서대로 처리해 본다. 공개 API나 크롤링으로 리뷰를 모으고, 이모티콘과 일반어를 지운 뒤 문서-단어 행렬을 만든다. 이 행렬에 LDA를 적용해 고객이 자주 말하는 주제를 뽑는다.
  2. 주제마다 감성 점수를 붙여 본다. Jeong 등(2018)처럼 중요도는 높은데 만족도가 낮은 주제를 찾으면 개선 우선순위의 첫 후보가 된다.
  3. 리뷰에서 찾은 주제를 자사 특허와 맞추어 본다. 이때 특허 공개와 제품 출시 사이의 시차(3개월에서 3년)를 고려해 비교 기간을 잡는다.

키워드

함께 읽을 글