新产品发布后立即捕捉客户抱怨:基于社交媒体的方法

本文以Galaxy S10的评论为例,介绍如何从产品上市初期的社交媒体帖子中提取用户不满因素,并根据紧急程度和严重程度筛选出应优先解决的不满。

本文译自韩文原文。 韩文原文

新产品发布后,使用评价会迅速积累在社区和评论板上。一条帖子里往往同时有赞扬和抱怨。负责人逐条阅读帖子,很难判断应该先处理哪些抱怨。

能否从发布初期的社交媒体帖子中自动提取抱怨要素,并用数字筛选出其中最紧迫的抱怨?

下面阅读一篇回答了这个问题的论文。

  • 标题:A Social Media Mining Approach for Monitoring Customer Complaints in the Early Stage of Product Launch
  • 期刊:Journal of the Korean Institute of Industrial Engineers
  • 年份:2021
  • DOI:10.7232/JKIIE.2021.47.3.289

论文提出了一种监测产品发布初期客户抱怨的社交媒体挖掘(social media mining)方法。社交媒体挖掘是指从社交媒体帖子中提取有用信息的分析。这一解释并非出自论文,而是笔者补充的。

该方法首先只筛选发布初期撰写的评论。接着,通过词嵌入(word embedding,将词或短语转换为数值向量的技术)和聚类(clustering,将相似对象归为一组的技术)找出抱怨要素。最后,通过句子级情感分析,用数值计算抱怨的程度。

全文使用的术语如下。

  • 潜在抱怨要素:将从评论中提取的名词短语按语义相近归并而成的一个聚类。指客户可能表达抱怨的产品要素。
  • 紧迫度(Urgency):在提及某一抱怨要素的句子中,抱怨句所占的比例。
  • 严重度(Severity):这些抱怨句情感得分绝对值的平均值。
  • 客户抱怨组合图(customer-stated complaint portfolio map):以紧迫度和严重度为两个坐标轴,将抱怨要素划分为四个区域的图。

动机:发布初期的抱怨要尽快、按句子来读

为什么发布初期的客户抱怨很重要

论文给出的理由如下。

  • 客户抱怨可能是产品的潜在风险因素。它能提示产品规划中遗漏的部分、技术缺陷和不完善的产品服务系统。
  • 在解决抱怨的过程中,可以改进产品,或为新产品规划获得新的想法。
  • 发布后初期出现的反馈可以预防后期可能发生的风险,也有助于尽早得出产品开发和改进方向等应对策略。
  • 论文在定义紧迫度指标时引用了已有研究作为依据。内容是:尽早发现产品的问题,可以降低后期成本并提高客户满意度。
  • 帖子、评论、留言等社交媒体上的客户意见数据容易获取。

企业也在关注社交媒体。根据论文引用的统计,截至2020年2月,有1亿4千万多家企业在使用Facebook、Instagram等社交媒体应用。在美国的Facebook用户中,58%的人在看到企业发布的内容后,对该企业和品牌更加关注。

已有研究没有涉及的部分

已有研究将文本挖掘应用于从社交媒体帖子中找出客户共同提及的要素,或提取潜在主题。为了量化发帖者的正面和负面情绪,也同时使用了情感分析。平台多种多样,包括Amazon、Twitter、Facebook、Reddit、Yelp等,领域也不限于某一个行业,涉及电子产品、食品、公共交通等。

论文在这一研究脉络中指出了两个空白。

  • 评论级情感分析的局限:大多数研究把一条评论的情感作为整体来分析。一条社交媒体评论中混杂着多个主题和意见,因此以句子这样更细的单位来分析,结果才更准确。
  • 采集时没有考虑发布时点:社交媒体的分析结果,其内容和重要性会随发布后的时间而不同。因此,需要把数据生成日期与产品发布日期一并考虑。

方法:把评论拆分为名词短语和句子,为每个抱怨要素计算两个指标

论文的流程分为四个步骤。

图 1. Reddit的25,886条评论经过四个步骤,整理为27个抱怨要素改进优先级的过程。
  1. 收集并预处理社交媒体数据,筛选出有效评论和名词短语。
  2. 将名词短语转换为向量并聚类,定义潜在抱怨要素。
  3. 将评论拆分为句子并识别情感,利用抱怨句为每个抱怨要素计算定量指标。
  4. 基于指标构建客户抱怨组合图,找出应优先改进的抱怨要素并提出应对策略。

本文也完全按照论文的四个步骤展开。

案例与数据

案例产品是2019年3月发布的三星智能手机Galaxy S10。与此前的Galaxy S系列相比,该产品搭载了多种新功能。

  • 无线共享电池
  • 屏下指纹识别
  • 基于人工智能的用户定制化Bixby Routines

研究团队选择Galaxy S10,理由是该产品功能多,且客户意见在社交媒体上分享活跃。

数据是Reddit的Galaxy S10板块(subreddit)中发布的帖子。研究团队收集了2018年12月1日至2019年8月31日这9个月间撰写的25,886条评论。每个阶段之后剩余的数据规模,在各阶段的说明中一并给出。

第1步:社交媒体数据收集与预处理

  • 输入:关于目标产品的全部社交媒体评论
  • 处理:按撰写日期筛选初期评论,删除过短的评论和链接,提取名词短语并去除停用词
  • 输出:有效评论集合和有效名词短语集合

处理顺序如下。

  1. 只保留产品发布日起6个月内撰写的评论。Galaxy S10的正式发布日是2019年3月8日。研究团队只保留了2019年3月至8月的评论。
  2. 剔除包含空格和特殊字符在内不足10个字符的评论。“Thanks!”、“And why?”、“[removed]“等帖子属于这种情况。
  3. 删除评论中的YouTube、Amazon、eBay等网址。
  4. 用spaCy提取名词短语。接着去除表情符号(“:D”)、拟声词(“haha”)以及与分析无关的词(“hello”、“guys”)。

短评论被认为不包含有效的含义或信息,因此予以剔除。名词短语是定义抱怨要素的材料。难以代表潜在抱怨要素的名词短语,在这一步被过滤掉。

在案例中,经过这一步得到的结果是13,976条有效评论和2,831个有效名词短语。

第2步:提取潜在抱怨要素

  • 输入:2,831个有效名词短语
  • 处理:名词短语嵌入、K-means聚类、聚类标注
  • 输出:27个已命名的潜在抱怨要素

处理顺序如下。

  1. 用预训练的Sentence-BERT将所有名词短语转换为嵌入向量。Sentence-BERT是一种句子嵌入方法,经过调整,使语义相近的句子在向量空间中距离较近。
  2. 用Gap Statistic method(用统计方法确定合适聚类数的方法)确定最优聚类数。案例中为27个。
  3. 用K-means聚类将名词短语向量划分到27个聚类中。
  4. 参考靠近各聚类中心的名词短语,为聚类命名。

转换为向量的原因,是为了对相似的名词短语进行分组。由于只对评论中与产品相关的名词短语做了聚类,因此把一个聚类定义为客户的一个潜在抱怨要素。用统计方法确定聚类数,可以减少分析人员的主观判断介入。论文将这一点作为可重复性的依据。

聚类结果示例如下。

  • Battery:“battery use”、“battery usage icon”、“battery rating”
  • Fingerprint:“fingerprint sensor”、“fingerprint recognition”、“fingerprint scanner”
  • Protection:“glass protector”、“plastic screen protectors”、“glass screen protector”

第3步:定义抱怨水平的量化指标

  • 输入:13,976条有效评论、27个抱怨要素
  • 处理:句子切分、逐句情感分析、按抱怨要素计算紧迫度和严重度
  • 输出:每个抱怨要素的紧迫度和严重度数值

处理顺序如下。

  1. 将所有有效评论拆分为句子。案例中得到54,664个句子。
  2. 用VADER(Valence Aware Dictionary and sEntiment Reasoner)为每个句子给出情感得分。
  3. 情感得分大于0判定为正面,等于0为中性,小于0为抱怨句。
  4. 将包含某抱怨要素名词短语的句子视为该要素的相关句子,按要素统计正面、中性、抱怨句的数量。
  5. 用统计出的数值计算紧迫度和严重度。

VADER是基于词典和规则的情感分析工具。它不仅考虑词的情感,还考虑特殊符号、大小写和连词,并给出-1到1之间(含端点)的情感得分。

按句子拆分的原因,可以从论文表2的示例评论中看出。这条评论由两个句子组成。第一句说的是按下拍摄按钮时设备会晃动,导致照片模糊。第二句说的是在视频模式下没有问题。VADER给第一句打了-0.1027,给第二句打了0.2716。

就整条评论而言得分为0.1761,因此被判定为正面评论。如果只按评论级别分析,就会漏掉对拍照的抱怨。为了减少这种抱怨遗漏,研究团队将所有评论拆分成了句子。

紧迫度是抱怨句数量除以包含某抱怨要素名词短语的全部句子数量所得的值。它表示客户谈到该要素时实际表达抱怨的程度。值越高,该要素越被视为紧迫。

严重度是该要素的抱怨句所获情感得分绝对值的平均值。抱怨句的情感得分为负数,因此取绝对值。值越高,表示客户的抱怨越强烈。

举一个计算例子。假设只有这条示例评论的两个句子包含某个抱怨要素的名词短语。相关句子有2个,抱怨句是第一句,共1个。紧迫度为1÷2=0.5。严重度是一个抱怨句的绝对值,所以|-0.1027|=0.1027。

第4步:构建客户抱怨组合图

  • 输入:27个抱怨要素的紧迫度和严重度
  • 处理:以两个指标为坐标轴进行布置,以平均值为基准线分为四个区域
  • 输出:各区域的抱怨要素清单和优先级

处理顺序如下。

  1. 将每个抱怨要素的紧迫度和严重度标在图上。
  2. 以所有要素的紧迫度平均值和严重度平均值为基准线,将图分为四个区域。
  3. 按区域确定改进优先级。顺序为Critical,Risky和Alert,Trivial。
  4. 阅读Critical区域要素的抱怨句,确认客户对什么提出了问题,制定应对策略。

四个区域如下。

  • Critical:紧迫度和严重度都高。是企业最应优先改进的要素。
  • Risky:紧迫度低但严重度高。虽然不常出现,但一旦出现,其严重程度就达到Critical水平。
  • Alert:紧迫度高而严重度低。由于经常出现,需要持续关注严重度的变化。
  • Trivial:两个指标都低。优先级最低。

以平均值为基准线,分析人员就不必另行设定边界值。案例中27个要素的紧迫度平均值为0.2131,严重度平均值为0.3600。

结果:三星支付、指纹识别和电池是最紧迫的抱怨

图 2. 在27个抱怨要素中,Samsung pay、Fingerprint、Battery的紧迫度和严重度都尤其高。

两个指标的靠前抱怨要素

紧迫度由高到低依次为’Samsung pay’、‘Battery’、‘Fingerprint’、‘SNS’、‘Text and call’。严重度由高到低依次为’Fingerprint’、‘Protection’、‘Samsung pay’、‘Battery’、‘Wide angle’。

有三个要素同时出现在两个榜单中,即Samsung pay、Battery和Fingerprint。相反,SNS只进入了紧迫度靠前的榜单,Protection只进入了严重度靠前的榜单。由此可见,两个指标包含的信息是不同的。

Critical区域的六个要素

Critical区域包含六个要素。

  • Samsung pay
  • Battery
  • Fingerprint
  • Text & Call
  • Camera
  • Synchronization

这些要素的两个指标都高于平均值。各要素的完整数值见论文表5。

其中,Samsung pay、Fingerprint和Battery的两个指标尤其高,因此研究团队对它们做了重点分析。Samsung pay的紧迫度为0.4069,严重度为0.4134。Fingerprint的紧迫度为0.2490,严重度为0.4211,Battery的紧迫度为0.2608,严重度为0.4045。

Samsung pay的紧迫度约为平均值的1.91倍(0.4069÷0.2131≈1.91)。紧迫度是抱怨句的比例,因此这意味着在相关句子中,抱怨句所占比例为0.4069。

Risky、Alert、Trivial区域的示例

论文没有单独列出其他区域的要素。不过,将表5的数值与平均值比较,可以确定其所属区域。下表中的区域标注是笔者通过与平均值比较后加上的。

抱怨要素紧迫度严重度区域
Protection0.16890.4186Risky
Wide angle0.18630.4024Risky
SNS0.23020.3502Alert
Smart0.14420.3245Trivial

来源:论文表5

Protection是由”plastic cover”、“glass protector”等名词短语构成的要素。笔者将其视为与保护壳、保护膜相关的要素。该要素的紧迫度(抱怨句比例)低于平均值。但严重度为0.4186,仅次于严重度为0.4211的Fingerprint。依笔者判断,它属于抱怨比例虽低、一旦出现抱怨就很强烈的Risky区域。

三星支付:应用无法打开的连接错误

Samsung pay是三星的移动支付服务,同时支持线下和线上支付。该要素的主要名词短语为’connection error’、‘background loading failure’、‘error messages’。

阅读抱怨句就能看出原因。因连接错误而无法运行三星支付的抱怨句是主要的抱怨原因。研究团队认为,三星支付是软件,可以通过更新快速应对。

指纹识别:位置与识别率

Galaxy S10把指纹传感器放进了屏幕内。采用的不是光学方式,而是超声波方式。客户抱怨传感器位置不方便,且不容易识别指纹。

上一代机型Galaxy S9的指纹传感器位于设备背面上方。单手握持时伸直手指就容易使用,识别速度也快。而把传感器放在正面下方的Galaxy S10,使用不便、识别率低的意见成了抱怨的原因。

为解决客户抱怨,2019年4月进行了与较低指纹识别率相关的更新。根据论文,之后在2019年10月,英国有报道称出现了未登记的指纹也能被识别的现象。论文引用的报道来源是英国媒体The Sun在2019年的文章。该现象依据的是论文引用的一篇新闻报道,本文没有核实报道内容的真伪。

研究团队在解读时,是带着条件把这一报道纳入的。论文作者写道,如果非用户本人的指纹也能被识别,可能造成个人信息和金融方面的损害。这种损害的可能性不是已确认的事实,而是论文作者的解读。基于这一解读,研究团队判断,Fingerprint虽然频率低于Samsung pay,但抱怨水平非常严重。

电池:5G过渡与处理器差异

Battery的主要抱怨是电池续航时间比预期短。论文对原因做了两点说明。

  • 处于5G商用化的第一阶段,连接不够顺畅。在5G和LTE之间频繁切换,消耗了大量电量。
  • 各销售地区搭载的应用处理器(Application Processor,AP)不同。北美、中国、日本的机型搭载骁龙,包括韩国在内的其他地区的机型搭载Exynos。

评论中常常同时提到电池和Exynos。部分客户称骁龙机型的电池性能更好,并为此表达抱怨。这是Reddit用户的意见,机型之间电池性能的差异并不是本文核实过的事实。研究团队解读为:电池抱怨随5G使用条件和AP而异,因此严重度相对于紧迫度较高。

作为应对方案,论文首先建议改进影响电池消耗的软件。下一代产品的电池部件研发,以及是否搭载Exynos的决定,也被列为课题。根据论文,三星在下一个系列Galaxy S20上只搭载了骁龙。

摘要报告称,与三星支付连接错误和指纹识别相关的抱怨在发布后很快得到了改善。但这一报告并不是对”改善是由于分析结果”的因果验证。指纹识别在更新之后,还有另外的问题被报道。

意义与局限

带来了什么不同

  • 同时考虑发布日期和评论撰写日期,只筛选初期的抱怨信息。
  • 将评论按句子拆分后进行情感分析。一条评论中混杂的多个主题和情感被分别处理。
  • 利用评论数据开发了两个定量测量抱怨的指标,即紧迫度和严重度。
  • 尽量减少专家介入,用统计方法确定聚类数等参数。论文因此主张,该流程在其他环境中也可以重现。

对从业者的价值

这一方法能把发布后头几个月积累的客户帖子转化为抱怨要素清单和优先级。两个指标可用于对出现的所有抱怨要素进行定量评估,并找出应优先处理的要素。

图中的区域还提示了应对方式。Critical要素是需要立即改进的对象,Alert要素是需要关注严重度变化的对象。在案例中,研究团队把Critical要素的应对建议分成两类:通过软件更新快速应对的,以及应反映到下一代产品开发中的。

对研究者的价值

处理社交媒体评论时,分析单位和采集时点会改变结果,这一点可以通过具体例子加以确认。即使一条评论被判定为正面0.1761,其中的一个句子也是抱怨-0.1027。论文认为,这种方法有助于处理产品评论的研究者更准确地理解客户。

论文自述的局限

论文自己指出的局限有两点。

  • 抱怨要素是用名词短语定义的。如果用句子本身来定义抱怨要素,就可以更直观地利用句子的情感。
  • 指标只用抱怨句数量和情感得分计算。论文预期,如果采用同时反映客户评分、表情符号等因素的指标,可以得到更准确的结果。

笔者认为的适用条件

以下并非论文中的内容,而是笔者出于实际应用的考虑补充的条件。

  • 需要有一个汇集关于某一产品帖子的渠道。像案例中的Reddit板块那样,如果有按产品划分的板块,采集和筛选会更容易。
  • 情感分析工具要与分析语言相匹配。案例对英文帖子使用了VADER。如果是韩文评论,应先考察适合韩语的工具。
  • 紧迫度和严重度本身是各要素的数值,但图中的四个区域是以27个要素的平均值为基准线划分的相对区分。如果抱怨要素数量很少,或所有要素都同样糟糕,区域划分的作用就会降低。
  • 该图只能提示优先级,不能说明原因。在案例中,原因同样是通过直接阅读抱怨句来把握的。

马上可以做的事

  • 选定一款最近发布的产品,收集其发布日起6个月内的客户帖子。删除不足10个字符的帖子和链接,确认还剩多少条。这是完全遵循论文第1步的第一步。
  • 将剩下的帖子拆分为句子,针对感兴趣的三四个产品要素计算紧迫度。用抱怨句数量除以提及该要素的句子数量即可。
  • 用同一要素抱怨句情感得分绝对值的平均值求出严重度。以两个指标的平均值为基准线,找出落入Critical区域的要素,并直接阅读这些要素的抱怨句,整理原因。

关键词

相关文章