产品经理或营销负责人每天都能看到评论和帖子不断累积。然而,应当在哪个平台收集什么数据、用什么方法分析,才能得到可用于决策的信息,并不清楚。单个的应用论文很多,但要找到一份一次性梳理出研究集中在哪里、空白在哪里的资料却很难。
社交媒体上积累的客户意见,能否作为商业决策的依据?如果可以,迄今为止的研究用什么数据和方法得到了什么?
下面来读一篇回答这些问题的论文。
- 标题:Social media analytics and business intelligence research: A systematic review
- 期刊:Information Processing & Management
- 年份:2020
- DOI:10.1016/j.ipm.2020.102279
论文做了两件事。首先把公开数据分为六类,并通过 10 位专家的评估,在四个维度上进行比较。其次从 Web of Science(WoS)检索到 633 篇论文,筛选出 57 篇,围绕三个研究问题进行分析。
全文使用的术语如下。
- 商务智能(Business Intelligence, BI):指在商业情境中获取、解释和分析信息,进而提炼出有用知识的整个过程。
- 客户之声(Voice of Customer, VoC):客户对产品或服务留下的意见。本文讨论的是留在社交媒体上的在线 VoC。
- 公开数据(open data):未被列为机密、任何人都可以获取的信息来源。它与开源软件是不同的概念。
- 系统性文献综述(systematic review):事先确定检索式和排除标准来收集文献,并按预先设定的问题进行分析的综述方式。论文遵循了 Kitchenham(2004)的指南。
- 应用程序编程接口(Application Programming Interface, API):平台向外部提供数据的官方接入方式。
- 情感分析(sentiment analysis):将文本所含情感的极性(正面还是负面)计算为分数的方法。
动机:此前没有一篇综述把基于社交媒体的 BI 研究汇总梳理
为什么社交媒体中的客户意见很重要
论文认为社交媒体已成为客户表达意见最便捷的场所,并给出了多项依据。
- 使用规模:美国约 79% 的人口拥有社交媒体账号,东亚为 70%,北欧为 67%。
- 评论的影响:约 77% 的客户会阅读其他客户的在线评论,75% 比起个人的直接推荐更信任评论。超过 80% 的客户从社交媒体渠道获得有用信息。
- 不受审查的意见:客户在 Twitter、Facebook、Amazon 等渠道发表意见,几乎不受审查。这些意见会影响其他客户的购买决策。
- 企业的应用:Samsung mobile 于 2010 年开设了“Samsung Global”Facebook 主页,聚集了约 5 千万关注者。Starbucks 于 2008 年开设“My Starbucks Idea”,收集客户的创意。
- 市场驱动型创新的需要:像智能手机这样底层技术已经成熟的产品,仅靠企业内部研发很难实现创新。因此需要从客户需求中寻找开发方向。
例如,Jeong 等(2018)从 Reddit 收集了 Samsung Galaxy Note 5 的评论。研究团队通过主题建模找出了客户对电池续航、触控识别和相机的不满。随后借助情感分析和机会算法,指出了重要度高而满意度低的功能。
现有研究没有涉及的部分
早期的 BI 研究主要使用专利、研究论文、商业资料等传统数据。Park and Yoon(2017)从企业专利中识别技术能力,并通过协同过滤推荐技术机会。Wang 等(2018)按分类代码对专利分组并计算新兴指标,以发现新出现的主题。
此后关注点转向了客户生成的数据。Chung and Tseng(2012)强调,在线产品评论是了解客户和市场的主要资料。对于社交媒体数据适合用于 BI,已有共识。但哪种公开数据最适合 BI 研究,仍然存在争议。
论文指出的空白有两点。
- 很少有研究涵盖基于社交媒体的 BI 研究的整体脉络。虽然已有与社交媒体相关的综述,但视角不同。
- 从 BI 角度比较社交媒体、知识产权等多种公开数据的研究不足。
此外,论文还提出了一项贡献:为新进入的研究者和从业者提供一份指南,梳理社交媒体数据的收集、预处理和分析流程。
方法:评估公开数据,并从 633 篇中筛选出 57 篇,围绕三个问题进行分析
论文主要分为两部分。前半部分是对公开数据进行分类和评估,后半部分是系统性文献综述。本文将整体分为四个步骤。
- 第 1 步:对公开数据分类。
- 第 2 步:通过专家评估比较数据。
- 第 3 步:检索并筛选文献。
- 第 4 步:依据三个研究问题和综合分析框架分析文献。
论文选择系统性综述而非概念导向的综述,也有两个原因。第一,基于社交媒体的 BI 研究并非从理论出发,而是源于实际业务中的决策问题。第二,论文更想考察方法、算法和数据的近期趋势,而不是通过引用关系追踪理论的发展路径。
资料与专家
分析对象有两类:一是参与评估的专家,二是从 WoS 收集的论文。
- 专家:共 10 位参与 BI 研究的人员。4 位教授用社交媒体、研究提案、专利等公开数据从事 BI 研究约 10 年。6 位研究生用约 4 年时间研究社交媒体挖掘、客户理解和数据驱动的业务规划。
- 文献:于 2018 年 7 月 4 日在 WoS 检索。时间范围限定为最近 5 年,文献类型限定为经同行评审的期刊论文。
- 规模:检索结果为 633 篇,最终分析对象为 57 篇。
第 1 步:将公开数据分为六类
- 输入:关于公开信息来源的已有文献
- 处理:定义类别并附上示例
- 产出:公开数据分类表(六类)
- 从开源情报领域的定义出发,确定公开数据的范围。
- 依据相关文献划分类别,并为每个类别附上实际示例。
这样划分,是为了按同一标准将社交媒体数据与其他公开数据进行比较。类别与示例如下。
- 大众媒体:印刷报纸、杂志、广播、电视
- 商业资料:商业图像、财务和行业评估报告
- 灰色文献(未经商业出版的公开资料):知识产权、通讯简报、技术报告、书目
- 政府公共数据:政府报告、政府开放数据
- 专业与学术出版物:期刊、学术会议、研讨会的信息
- 基于网络的数据:社交媒体、在线讨论组、在线出版物
专利和商标属于灰色文献。它们描述技术与业务领域,因此常用于 BI 研究。
第 2 步:从四个维度评估数据
- 输入:六类公开数据
- 处理:10 位专家在四个维度上以高、中、低进行评估
- 产出:各类别评估表
- 专家确定四个评估维度。这些维度反映了数据收集与分析过程,以及 BI 系统持续运行过程中共同适用的属性。
- 专家针对每个类别,按维度给出高、中、低。
- 研究团队汇总专家意见,整理成一张评估表。
四个维度的含义如下。
- 数据内容:所涉内容、专业性和用户的知识水平对业务决策有多大帮助
- 数据收集:是否有能够大量获取数据的公开 API
- 数据更新:最新数据是否持续积累,数据库是否持续更新
- 数据结构:能否处理成易于分析的结构化格式
收集和更新两个维度与 BI 研究的体系化密切相关。评估结果在结果一节中整理。
第 3 步:检索并筛选文献
- 输入:WoS 数据库
- 处理:通过检索式获得初步清单,再按排除标准筛选
- 产出:初步清单 633 篇(Group 1),最终清单 57 篇(Group 2)
- 确定检索式。由于不同研究者用不同词汇表述同一主题,关键词用“or”而不是“and”连接,以尽量多地检索。
- 排除标题含有“systematic review”的综述论文,同时将常用方法“sentiment”纳入检索词。
- 将范围限定为最近 5 年的期刊论文进行检索。
- 阅读初步清单的标题和摘要,应用排除标准。
检索式为“TITLE: ((social and media or ((product or service) near (review))) and (mining or analy* or sentiment or business)) NOT TITLE: (systematic and review)”。
排除标准共九条。
- EC1:只纳入经同行评审的期刊论文。
- EC2:排除书评、会议摘要和编者文章。
- EC3:标题或摘要未充分说明研究内容的,排除。
- EC4:无法获取的论文,排除。
- EC5:只纳入英文论文。
- EC6:内容重复的论文,排除。
- EC7:只纳入研究论文,排除文献调查类论文。
- EC8:未以 BI 为目的分析社交媒体的论文,排除。为展示新算法的性能而仅把社交媒体用作输入的论文属于此类。
- EC9:未提炼出可用于业务决策的信息的论文,排除。
筛选结果如下。初步清单 633 篇中,10 篇为重复,566 篇在阅读摘要后被判定为不相关。因此 633−10−566=57 篇留作最终分析对象。会议论文被排除,因为认为相应的期刊论文代表最新成果。
第 4 步:依据三个问题和综合分析框架分析文献
- 输入:最终论文 57 篇
- 处理:按三个研究问题整理数据、方法和结果
- 产出:平台分布、分析方法分类、所提炼信息的分类
三个研究问题如下。
- RQ1:该领域中使用的有前景的社交媒体平台有哪些?
- RQ2:研究者对社交媒体数据应用的主要方法和算法是什么?
- RQ3:基于社交媒体的 BI 研究提炼出了哪些信息?
研究团队整理了 57 篇论文的分析流程,构建了四步综合分析框架。
- 数据收集:通过公开 API 或网络爬虫收集文本、图像、视频,建立数据库。考虑到安全和隐私,论文建议最好使用公开 API。
- 预处理:用自然语言处理提取关键词并删除停用词。去除表情符号(”^^”、”:-D”)、网页链接(“www”)、拟声词(“haha”)、通用词(“product”、“device”)和无关词(“day”、“month”)。然后转换为文档-词项矩阵等结构化格式。
- 分析:应用多种算法。
- 验证与解释:验证结果并解释其含义。
在预处理中,部分研究者利用词频(Term Frequency, TF,一个词在一篇文档中出现的次数)和文档频率(Document Frequency, DF,该词出现的文档数)筛选重要关键词。对于较短的文本,也有研究不做复杂预处理,直接使用词嵌入的结果。
分析方法按使用深度和意图分为五类:情感分析、主题建模、基于机器学习(Machine Learning, ML)的方法、基于网络的方法和基于理论的方法。
结果:以对电商评论和社交网络服务(SNS)进行情感分析和机器学习分析的研究为主
公开数据评估:灰色文献和基于网络的数据评价较高
评估结果的要点如下。各类别的完整数值可见原论文表 3。
- 灰色文献:四个维度均为高。
- 基于网络的数据:内容、收集、更新为高,结构为中。
- 大众媒体:四个维度均为低。因为印刷品等属于实体资料,转换为可分析的格式需要大量人工。
- 政府公共数据:评价低于灰色文献,尤其是更新为低。
灰色文献评价高,是因为像专利这样的资料由官方机构定期发布并存档,因此可以系统地建立数据库。
基于网络的数据的优势在于用户实时生成内容,更新很快。大多数都有公开 API,没有 API 时可以通过网络爬虫收集。结构为中,是因为其中混杂着错别字、表情符号和缩写,属于非结构化数据,需要预处理。
政府公共数据评价较低。Data.gov 提供超过 300,000 个数据集,但与商业机会或客户意见直接相关的数据集很少。此外,发布时间和格式各不相同,难以持续收集。
论文基于收集、更新和结构方面的高分,得出结论:社交媒体对 BI 分析的适用性高于其他公开数据。就评估表的数值本身而言,灰色文献四个维度均为高,基于网络的数据结构为中。对这一差异应如何解读,笔者的意见写在文末的适用条件中。
研究趋势:论文数量逐年增加
初步清单 633 篇按年份计,自 2014 年起依次为 83 篇、118 篇、150 篇、180 篇,呈增长趋势。2018 年截至 7 月已有近 100 篇。最终清单的 57 篇中也出现了类似的增长趋势。
论文发表的期刊主要集中在信息处理、智能系统和专家决策支持领域。营销、服务管理、电子商务、烟草管制和工业安全领域的期刊也刊登了一些论文。这意味着社交媒体分析正在不同的业务环境中为不同目的所使用。
RQ1:电商评论和 SNS 占绝大多数
研究团队将 57 篇论文所用的数据分为四种类型:电商评论 29 篇,SNS 24 篇,在线讨论组 2 篇,复合数据 2 篇。合计 29+24+2+2=57 篇。
在电商评论中,Amazon(6 篇)、Yelp(5 篇)、TripAdvisor(4 篇)使用较多。在 SNS 中,Twitter(11 篇)最多。2 篇在线讨论组研究全部使用了 Reddit。各平台的完整分布可见原论文表 4。
就单个平台而言,Twitter、Amazon、Yelp 和 TripAdvisor 使用频繁。各类型被使用的原因和难点如下。
- 电商评论:评论按产品或服务累积,主题统一。因此收集后筛选数据的工作量较小。29 篇中,产品评论 14 篇,服务评论 15 篇(14+15=29)。不过其中混杂着缩写、表情符号和自动补全的句子,需要清洗。
- SNS:大量用户实时生成内容,且大多有公开 API。Twitter 平均每天产生超过 5 亿条推文。另一方面,由于 140 字的限制,缩写和表情符号很多,需要系统的预处理。分析 Flickr 照片的研究收集了超过 10 万条数据。
- 在线讨论组:Reddit 有超过 120 万个 subreddit(按主题划分的板块)。subreddit 的用户对该主题知识丰富、兴趣浓厚,因此帖子具体、内容丰富。
- 复合数据:将社交媒体与专利一起分析,试图同时了解企业的技术能力和客户意见。结合 Amazon 与专利、Twitter 与专利的研究各有 1 篇。
复合数据研究也有需要改进之处。有一项研究没有考虑专利公布日与产品上市日的差异。实证研究表明,专利公开与产品上市之间存在 3 个月到 3 年的时间差。还有研究利用本体(定义概念及其关系的知识体系)将专利与评论直接关联。但这种方式在构建本体时需要大量专家投入。
RQ2:情感分析和机器学习使用最多
五类分析方法的论文数量和目的如下。
- 情感分析 27 篇:判别对特定产品、服务和品牌的意见极性。有基于词典、基于文本分类和基于深度学习的方法。
- 主题建模 13 篇:发现客户和公众提及的主题。使用了潜在狄利克雷分配(Latent Dirichlet Allocation, LDA)和潜在语义分析(Latent Semantic Analysis, LSA)。
- 基于 ML 的方法 27 篇:对情感极性进行分类,或预测股价、产品销量和情感。使用了朴素贝叶斯、随机森林、支持向量机(Support Vector Machine, SVM)、隐马尔可夫模型等。
- 基于网络的方法 7 篇:发现客户之间的互动网络和有影响力的用户。
- 基于理论的方法 6 篇:将客户满意度、服务生命周期和服务质量数值化。使用了模糊理论、博弈论、机会算法和卡诺模型。
一篇论文可以同时属于多种方法。因此五类方法的总和 27+13+27+7+6=80 篇,多于总数 57 篇。
情感分析使用较多有两个原因。结果以分数呈现,可以对客户反应进行量化处理;而且对于简短、质量较低的文本,也能相对准确地捕捉极性。不过,论文认为要获得更好的结果,需要结合 ML 算法、网络分析和理论。
在 ML 分类器中,SVM 在 2013 年至 2017 年的分析期内使用最为稳定。因为在像社交媒体文本这样维度高且稀疏的数据(不同客户用不同词汇书写)上性能较好。卷积神经网络(Convolutional Neural Network, CNN)和长短期记忆网络(Long Short-Term Memory, LSTM)等新算法也有使用。有一项研究用双向 LSTM 发现产品安全问题。
预测股价或销量的研究有一个共同点:倾向于将社交媒体帖子的情感得分作为自变量。大多数研究用精确率、召回率、准确率和 F 值,与现有模型比较预测性能。
RQ3:从四类对象中提炼信息
研究团队将 57 篇论文所分析的对象分为四类。
- 客户生成的内容:发现产品和商业机会、分析市场竞争地位、质量监控与安全风险检测、了解客户需求和满意度、调查服务质量和差距
- 客户之间的关系:发现潜在客户社区、识别网络中有影响力的用户、提取产品采用者信息、分析游客行为
- 客户反应:预测股价变动、监控客户反应、检测异常情绪和不良反应、预测在线销量、监控新技术发展趋势
- 社交媒体数据的特性:考察评论有用性的理论依据、调查评论阅读和有用性的预测变量
也有研究提出了推荐系统或专家支持系统等系统化的方法。但大多数研究只停留在了解客户满意度、忠诚度和认知的一次性分析上。
意义与局限
带来了什么变化
- 在内容、收集、更新、结构四个维度上比较了六类公开数据。
- 将 57 篇基于社交媒体的 BI 论文按数据、方法、结果三个问题进行了分类。
- 整理出收集、预处理、分析、验证与解释四步综合分析框架。
- 以附录形式整理了各平台的公开 API 清单,其中包括 Twitter、Facebook、Amazon、Reddit、Yelp、TripAdvisor 等。
对从业者的价值
从业者在为自己的业务环境选择平台和方法时,可以参考这一分类。例如,评论主题统一,便于直接用于产品改进。若要寻找有影响力的用户,可以参考将 SNS 用户关系作为网络进行分析的研究。
综合分析框架可以在设计企业内部分析流程时用作检查清单。特别是,如果不想只分析一次就结束,而要作为系统来运行,就需要像公开 API 这样系统化的收集方式,论文强调了这一点。
对研究者的价值
论文提出了三个后续研究方向。
- 超越情感分析:不应止步于客户说好还是说坏。需要追踪负面评论的具体原因并发现新功能的定量方法。
- 从一次性分析到系统化框架:应发展为可在其他数据上复现的方法论和专家支持系统。
- 异构数据的结合:应将社交媒体与专利一起分析。论文建议,可以把商标中的产品名称和申请人信息作为连接纽带,或用词嵌入比较客户用语与专利中的技术用语。
论文自述的局限
论文自己指出的局限有五点。
- 只检索了一个主要学术数据库(WoS)。因此 WoS 中没有收录的相关论文可能未被纳入分析。
- 排除了会议论文。也有影响力较大的会议论文,因此后续研究可以将其纳入。
- 可以将分析引用关系的概念导向方法应用于更长的时间跨度。
- 若要从更多角度分析,需要增加更多研究问题。
- 没有讨论社交媒体的语言,以及旅游、医疗、酒店、电子等业务领域之间的差异。收集到的论文大多使用英语或汉语数据。
笔者看到的适用条件
以下并非论文中的内容,而是笔者考虑到实务应用而补充的条件。
- 数据比较的结论:论文得出社交媒体的 BI 适用性高于其他公开数据的结论。但在评估表中,灰色文献四个维度均为高,基于网络的数据结构为中。笔者认为,应当将这一结论限定在收集和更新的角度来理解。若任务看重结构化资料,同时考虑专利等灰色文献会更稳妥。
- 检索时间点:文献检索于 2018 年 7 月 4 日进行。之后出现的方法和平台变化,不在这篇综述之内。
- API 现状:附录中的公开 API 清单是论文撰写时的信息。平台的接入政策可能变化,因此使用前需要确认各平台当前的条件。
- 评估方式:公开数据评估是 10 位专家的定性评估。在自己的业务领域,用同样的四个维度重新评估自家数据会更稳妥。
- 语言:被综述的论文限定为英文论文,分析数据也主要是英语和汉语。处理韩语评论时,需要另外准备词素分析和停用词表。
马上可以做的事
- 按综合分析框架的顺序处理自家产品的评论。通过公开 API 或爬虫收集评论,去除表情符号和通用词,然后构建文档-词项矩阵。对该矩阵应用 LDA,提取客户经常谈论的主题。
- 为每个主题加上情感得分。如 Jeong 等(2018)那样,找出重要度高而满意度低的主题,就是改进优先级的第一批候选。
- 将评论中发现的主题与自家专利进行对照。此时需考虑专利公开与产品上市之间的时间差(3 个月到 3 年)来确定比较的时间段。