产品规划人员只有了解客户想要什么,才能确定下一步的改进方向。问卷调查要等一段时间才有结果,期间如果有新产品上市,客户的关注点也会随之改变。即使对评论做过一次分析,几个月后得到的结果也可能与当前情况不符。
于是产生了这样一个问题:能否从客户评论中找出”被大量提及但满意度较低”的产品属性,并按月追踪这些机会何时出现、何时消失?
下面来读一篇回答这个问题的论文。
- 标题:Dynamic Monitoring of Product Opportunities with Online Product Review Data
- 期刊:Journal of the Korean Institute of Industrial Engineers
- 年份:2019
- DOI:10.7232/JKIIE.2019.45.5.387
论文提出了一种通过社交媒体挖掘来识别动态(随时间变化的)产品机会的方法。该方法先从在线评论中提取客户谈论的产品主题,然后按月为每个主题计算三个指标,再把三个指标合并为一个优先级。分析人员观察这一优先级随时间如何变化。
全文使用的术语如下。
- 产品机会(product opportunity):开发客户满意的新产品或改进现有产品的机会
- 主题建模(topic modeling):用概率模型发现文档集合中隐藏主题的文本挖掘技术。论文将由此得到的一个主题视为客户对产品的一项需求。
- 重要性(Importance)、满意度(Satisfaction)、上升性(浮上性,Growth):用数值表示主题机会水平的三个指标
- TOPSIS(Technique for Order Preference by Similarity to Ideal Solution,逼近理想解排序法):综合考虑多个准则对备选方案排序的多准则决策方法
动机:客户需求变化很快,而现有分析停留在某一时点
为什么要持续追踪产品机会
论文给出了五条理由。
- 在竞争激烈的环境中,基于客户需求发现创新性的产品机会,对以产品为基础的企业的持续增长十分重要。
- 基于问卷的方法越来越难以快速掌握需求并追踪其变化。原因是全球化的商业环境、缩短的产品寿命和日益复杂的客户需求。
- 社交媒体提供了包含客户意见和需求的大量实时数据。由于客户自行交流产品信息,分析结果会成为R&D和营销战略的重要资源。
- 随着产品生命周期缩短、市场环境复杂化,客户需求变化很快。因此需要动态分析需求并将其反映到业务中。
- 当技术发展到一定成熟度后,与其从技术中寻找新机会,不如根据客户和市场的需求来确定改进方向,这样更有用。
现有研究没有涉及的部分
以往已有多项利用社交媒体数据发现商业机会的研究。有研究从新闻数据中发现新兴主题,有研究对移动服务评论应用情感分析和多准则决策方法来衡量满意度。还有产品缺陷发现的文本分析框架、用机会发现理论推导产品机会的研究,以及将机会分析算法应用于社交媒体数据的研究。
论文指出的空白有三点。
- 以往研究虽然对机会做了量化,但没有把握随时间变化的机会。
- 多数研究没有对量化后的机会识别优先级。企业要确定产品开发和营销的先后顺序,就需要机会之间的相对重要程度。
- 部分研究从技术视角进行分析,对客户和市场视角考虑不足。
方法:将评论聚成主题,每月用三个指标排序
论文的方法分为四个步骤。第1步收集在线产品评论并提取产品相关关键词。第2步通过主题建模定义客户需求,第3步随时间计算表示机会水平的指标。第4步用TOPSIS得出各时点的优先级,以监测变化的产品机会。本文也沿用论文的步骤划分。
案例与数据
案例产品是Apple的平板电脑iPad。iPad于2010年4月3日在美国首次上市,多年来一直保持平板电脑市场占有率第一。它功能多样,新品不断推出,客户之间的意见交流活跃。论文据此认为它适合作为追踪随时间变化的方法的案例。
数据来源是Reddit。Reddit由120万个以上的subreddit(按主题划分的板块)构成。Twitter或Facebook只能用分析者预先设定的关键词或话题标签来收集数据。相比之下,Reddit只要使用与主题相符的subreddit,就无需事先定义检索条件,也能收集到相关帖子。
研究团队收集了iPad subreddit中2015年12月至2018年5月之间发布的帖子。
| 项目 | 值 |
|---|---|
| 收集的帖子 | 19,883个 |
| 收集的评论 | 146,999个 |
| 收集的文档合计 | 166,882个 |
| 提取的关键词 | 56,789个 |
| 最终关键词 | 10,401个 |
| 最终文档 | 42,269个 |
| 日均帖子数 | 46.25个 |
来源:论文第4.1节
最终用于分析的文档约占收集文档的25.3%(42,269÷166,882=25.3%)。
第1步:评论收集与关键词提取
- 输入:目标产品的在线评论
- 处理:收集、关键词提取、停用词去除
- 输出:文档-关键词矩阵
- 分析人员通过网络爬虫或社交媒体提供的开放API(Application Programming Interface,应用程序编程接口)收集评论。
- 用自然语言处理工具从每条评论中提取关键词。论文以TextRazor、Alchemy API、spaCy为例。
- 将表情符号、拟声词、与产品无关的问候语等停用词从列表中删除。
- 为每条评论将关键词及其频次构造成向量,并把所有向量合并为一个文档-关键词矩阵。
删除停用词的原因是,分析不需要的关键词会混入提取结果。社交媒体数据比其他公开数据更容易收集、时效性更高,与业务的相关性也更高。
在案例中,研究团队先删除了”[deleted]”、“[removed]“之类不必要的文档。接着用spaCy提取了56,789个关键词。这份列表中混有网页链接、口语表达和表情符号。研究团队按两个条件过滤了停用词。
- 只出现在1篇文档中的关键词,即文档频率(Document Frequency)为1的关键词
- 与iPad没有直接关系的关键词
剩下的是10,401个关键词和包含这些关键词的42,269篇文档。关键词仅保留了原列表的约18.3%(10,401÷56,789=18.3%)。
第2步:用LDA提取产品主题
- 输入:文档-关键词矩阵、主题数
- 处理:LDA(Latent Dirichlet Allocation,潜在狄利克雷分配)主题建模与主题解释
- 输出:主题-关键词分布、文档-主题分布、主题名称
- 分析人员确定主题数。论文采用的方法是选取使主题间余弦相似度或Perplexity(困惑度)最小的主题数。
- 运行LDA,得到两个分布。
- 在主题-关键词分布中查看贡献度高的关键词。
- 阅读对该主题贡献度高的文档,确定主题名称。
使用LDA的原因是它性能优于其他主题建模技术,应用广泛。主题-关键词分布说明每个主题由什么构成。文档-主题分布说明每篇文档在谈论哪些主题。论文用前一个分布定义需求,用后一个分布评估需求。
主题只是一组关键词,所以需要人来赋予含义。第25个主题的主要关键词是”true tone(0.2436)”、“final cut(0.0346)”、“true tone display(0.0306)“。贡献度高的文档也在谈论True Tone功能。因此研究团队将该主题命名为”True tone display”。
在第49个主题中,“best buy”的贡献度为0.5020。仅这一个关键词就占了总贡献度的一半以上,因此研究团队将该主题定义为电子产品零售商”Best buy”主题。
在案例中,研究团队用scikit-learn运行LDA。他们从1开始逐步增加主题数并计算Perplexity,主题数为70时Perplexity为3140.66,最小。提取出的主要主题有以下几类。
- 使用与功能:“Data usage”、“Split screen”、“Applications”、“Photo editing”
- 产品型号与选项:“32GB model”、“64GB model”、“iPad Air”、“iPad Mini”
- 配件:“Apple pencil”、“Smart keyboard”
第3步:计算重要性、满意度、上升性
- 输入:文档-主题分布、文档撰写时间、文档极性
- 处理:按时点汇总与归一化
- 输出:每个主题各时点的三个指标
- 重要性:在每个时点把文档-主题分布的贡献度相加,得到主题量。再将该值归一化到0和1之间。
- 满意度:对所有文档做情感分析,得到极性(正面、负面的程度)。将文档极性乘以文档-主题分布得到情感矩阵,在每个时点求和后归一化到0和1之间。
- 上升性:说明方法的第3.3节写道,用当前时点与上一时点的主题量之比来计算。结果本身就是比值,所以不做归一化。但结论部分写的是,上升性按文档-主题分布贡献度在1个月内的增加量来计算。论文中”比值”与”增加量”这两种表述互不一致,因此想要复现的读者需要注意这一点。
三个指标各自指向不同的机会。被提及次数多于其他主题的主题,是客户看重的产品要素。满意度低的主题仍有改进空间。提及量激增的主题,可以让人尽快回应此前不存在的需求。
观察主题趋势的方法还有TOT(Topics over Time)和DTM(Dynamic Topic Modeling,动态主题建模)。论文选择了随时间累加贡献度的方法,因为三个指标必须用同样的方式计算才能保持一致性。
情感分析使用了Python包VADER。论文将VADER介绍为基于深度学习的包。
下面用符号梳理计算方式。假设某个月撰写的一篇文档对第25个主题的贡献度为a,情感极性为p。这篇文档在该月重要性的主题量中加上a,在满意度合计中加上a×p。贡献度相同时,极性较低的文档对满意度的贡献值更小。论文表1列出了与第25个主题相关的文档的贡献度和情感权重。实际数值可在论文原文(DOI链接)中查看。
如果没有上一时点,就无法计算上升性。案例的第一个月即2015年12月,所有主题的上升性均为0。
第4步:用TOPSIS得出月度优先级
- 输入:每个主题各时点的三个指标
- 处理:TOPSIS、移动平均
- 输出:各主题的优先级时间序列
- 确定正理想解(PIS,positive ideal solution)。它是重要性最高、满意度最低、上升性最高的虚拟主题。
- 确定负理想解(NIS,negative ideal solution)。它是重要性最低、满意度最高、上升性最低的虚拟主题。
- 计算每个主题到两个理想解的欧氏距离。
- 计算相对接近度。即到NIS的距离除以两个距离之和所得的值。
- 在所有时点上重复,得到接近度时间序列,用移动平均减小波动后再排序。
接近度为1表示排名最好,为0表示排名最差。接近度越高,机会水平越高。下面是笔者在论文定义的基础上代入数值所做的计算。如果某个主题与PIS位置相同,则到PIS的距离为0。此时接近度为到NIS的距离÷(0+到NIS的距离)=1。
TOPSIS允许指标之间相互抵消。某一指标的不良取值可以由另一指标的良好取值来弥补。易于理解、计算简单也是论文列举的优点。
案例中的移动平均期为6个月。论文考虑到在收集的30个月内iPad共发布了5款(30÷5=6)。论文对分析期间发布的iPad描述如下。
- 第1代iPad Pro 9.7英寸
- iPad第5代
- 第2代iPad Pro 12.9英寸和10.5英寸(2017年6月13日同时发布)
- iPad第6代
5款这一统计沿用了论文的表述。它与下文结果中讨论的帖子数激增时期的5次是不同的数字。
结果:排名随新品发布而变动,部分主题持续居于前列
评论量在发布、上市之后增加
收集期间帖子数激增的时期有5次。
- 2016年3月22日,176个:第1代iPad Pro 9.7英寸发布次日
- 2017年3月22日,117个:第5代iPad 9.7英寸发布次日
- 2017年6月14日,221个(最多):第2代iPad Pro 12.9英寸、10.5英寸上市次日
- 2017年9月15日,136个:推测受iPad涨价和三天前新品发布会的影响
- 2018年3月28日,153个:第6代iPad 9.7英寸上市次日
研究团队根据这些数据判断,相对于iPad,人们对iPad Pro的关注度更高。这种激增也反映在了上升性上。2016年3月和2017年6月,大部分主题的上升性激增。
不同指标下引人注目的主题各不相同
在重要性方面,两个主题的趋势形成对比。
- “iPad Air”:重要性高于其他主题,但2017年6月之后逐渐下降。iPad Air在2014年10月22日第2代上市后,没有后续产品。
- “Smart keyboard”:没有激增或骤降,持续上升。研究团队解释为,对iPad Pro的关注延伸到了搭配使用的键盘。
在满意度方面,同样有两个主题突出。“Best buy”在2017年1月骤降,2018年以后下降,但在整个分析期间相对而言一直非常高。“Smart keyboard”的满意度与重要性类似地增长。研究团队解释为,随着智能键盘越来越重要,它也让客户感到满意。
持续居于前列的主题:电池续航
在70个主题中,第35个”Battery life”全时段平均排名为8.67位。它在2017年11月、12月以及2018年1月、2月、4月排名第1。第1名出现了5次,在所有主题中最多。
阅读贡献度高的文档后,发现其细分主题如下。
- iOS版本更新对电池续航的影响:被提及最多,大部分文档的极性为负面
- Apple Pencil、Smart Keyboard等配件自身的电池,以及使用配件导致的iPad电池消耗
- 与其他产品的电池续航比较
- 充电方式对电池的影响
研究团队预计,该主题在分析期间之后机会水平仍会很高。
排名随新品发布而改变的主题:64GB与32GB
第22个主题”64GB model”在2017年6月从第66位升至第6位。笔者计算得出,上升了66−6=60位。此后一直保持在前列,在最近的2018年5月排名第1。“32GB model”没有取得过很高的排名,但呈现出与”64GB model”相反的模式。
研究团队从最低容量选项的角度解释了这一模式。
- 最低容量为32GB的型号:第1代iPad Pro 9.7英寸(2016年3月31日)、iPad第5代(2017年3月24日)、iPad第6代(2018年3月27日)
- 最低容量为64GB的型号:第2代iPad Pro 12.9英寸、10.5英寸(2017年6月13日)
两组型号都没有对方的容量选项。研究团队认为,新型号推出后,对该型号最低容量的提及会变多,相应主题的排名就会上升。这一解释是基于发布时间表与排名变化同时出现这一观察所作的推测。它提示新品发布可能影响客户需求的排名,但这只是对一个产品系列(iPad)中一个案例的解释。
满意度高而排名低的主题:True Tone显示屏
第25个”True tone display”在分析期间最高排名为第45位,全时段平均为第60位。贡献度高的文档大多表达了对这一功能的满意。大多数文档的极性在0.7以上。在10篇样本文档的权重中,最高值为0.9922,最低值为0.7003。
研究团队解释说,高极性提高了满意度,而高满意度似乎对压低排名影响很大。不过,TOPSIS排名中重要性和上升性也同时起作用。因此,在这个案例中可以确认的只是满意度高的主题与较低的排名同时出现。笔者认为,这一结果符合该方法不把客户已经满意的属性视为改进机会的意图。
从最近6个月的排名看下一个机会
研究团队指出,除排名趋势外,也应关注最近的排名。因为经过一定时间的过往数据无法说明当前的市场和需求。论文表2整理了2018年5月排名前5的主题在最近6个月的排名。表中列出的五个主题如下。
- “64GB model”
- “Photo editing”
- “YouTube”
- “Product options”
- “Apple pencil”
月度排名数值可在论文原文(DOI链接)的表2中查看。
两个主题的解释形成对比。“YouTube”在6个月内持续保持较高排名。研究团队预计,用iPad观看视频的需求今后仍会很高。“Apple pencil”自2018年1月起排名持续上升,5个月内上升了47位。研究团队认为该主题是有潜力的产品机会。
意义与局限
有什么不同
- 不是一次性的,而是随时间持续监测产品机会。
- 用TOPSIS合并重要性、满意度、上升性,对每项需求的优先级进行量化。
- 利用客户亲自撰写的评论,发现客户和市场视角的机会。
- 确认新品发布对产品主题排名的影响。
对从业者的价值
持续监测能提供快照式分析所遗漏的信息。可以根据排名的变化趋势发现有潜力的机会,并确认新上市产品对客户需求的影响。在此基础上,可以判断过去的战略是否恰当,并确定今后聚焦的方向。
由于使用了从网络收集的大量数据,比问卷更快地掌握需求变化并作出反应。论文将该方法作为支持以客户为中心的产品规划与开发的监测工具提出。
对研究者的价值
这篇论文把主题建模、情感分析和TOPSIS连接成一个流程。论文认为三个指标必须用同样的方式计算才能保持一致性,因此选择了累加文档-主题分布贡献度的方式。关键词选取标准、排名预测、增加指标等后续研究课题也被明确地留了下来。
论文自述的局限
论文自己指出的局限有四点。
- 在选取产品相关关键词的过程中,可能带入分析者的主观判断。这一选取会影响主题提取结果。
- 没有预测分析期间之后机会水平的变化。需要基于深度学习的预测或时间序列分析。
- 除重要性、满意度、上升性之外,还需要更多反映社交媒体数据特性的指标。
- 只应用于一个产品系列。可以开展在其他领域或单个产品型号层面应用的研究。
笔者看到的适用条件
以下并非论文所述内容,而是笔者着眼于实际应用而补充的条件。
- 每月进入的帖子必须足够多。上升性没有归一化,因此受各时点文档数的影响很大。帖子少的月份,排名可能大幅波动。
- 需要同时记录自家产品的上市日和发布会日期。与64GB和32GB的案例一样,排名变化的原因只有了解上市时间表才能解释。
- 主题名称由人来命名。如果有70个主题,负责人需要另外留出时间阅读关键词和代表性文档。
- 在其他指标相近的情况下,满意度高的主题往往排名较低。TOPSIS允许指标之间相互抵消,因此如果重要性或上升性高,排名可能不同。要管理客户喜爱的优势,需要另外单独查看满意度指标。
- 移动平均期应根据自家的发布周期来确定。论文中的6个月是源于30个月内发布5款产品的iPad条件得出的值。
马上可以做的事
- 从讨论自家产品的社区论坛或评论页面收集帖子,并附上撰写日期。提取关键词后,删除文档频率为1的关键词和与产品无关的关键词,构建文档-关键词矩阵。这个矩阵就是第一步的输出。
- 逐步增加主题数并计算Perplexity,以最小值对应的主题数运行LDA。阅读每个主题中贡献度高的关键词和文档,并为其命名。
- 按月计算重要性、满意度、上升性,并用TOPSIS排序。应用与自家发布周期相匹配的移动平均后,找出最近6个月排名持续上升的主题,将其列为下一次规划会议的审议清单。