通过异常值检测发现新兴业务领域的方法

将商标上所载的商品和服务名称用语言模型转换为向量,再用LOF衡量其新颖性,能否提前发现正在兴起的业务领域?本文梳理2022年论文提出的四步方法、结果及局限。

本文译自韩文原文。 韩文原文

希望了解竞争对手下一步会推出哪些产品和服务的规划人员,通常依赖专家意见。随着产品、企业与客户之间的关系日趋复杂,产品生命周期不断缩短,以专家为中心的分析所需的时间和精力也越来越大。分析专利或社交媒体也是一种办法。但其结果以关键词集合的形式给出,要把这些集合解读为实际业务,又需要投入大量精力。

那么,如果用语言模型把商标上所载的商品和服务名称转换为向量,再通过异常值检测找出与其他业务相距较远的点,是否就能提前发现新的商机?

下面来读一篇回答了这个问题的论文。

  • 标题:Identification of emerging business areas for business opportunity analysis: An approach based on language model and local outlier factor
  • 期刊:Computers in Industry
  • 年份:2022
  • DOI:10.1016/j.compind.2022.103677

研究者提出了一种同时使用语言模型和局部离群因子(Local Outlier Factor, LOF)的方法。语言模型把含义相近的商品和服务归并起来,以界定业务领域。LOF 则以数值衡量每个业务领域有多新。最后一步,按新近度和可见度两项标准布置新领域,绘制商机图。

全文使用的术语如下。

  • 指定商品和服务(designated goods and services, G&S)语句:申请商标时,记载该商标所使用的商品和服务的语句。
  • 业务项(business item):把 G&S 语句按分隔符拆开后得到的单个商品或服务名称。
  • 业务领域(business area):由含义相近的业务项聚成的簇。
  • 新颖性(novelty):表示业务项在表述方式上与既有商品和服务相比有多大差异。
  • 新近度(recency)与可见度(visibility):新近度指业务领域出现得有多晚近,可见度指业务领域出现的频繁程度。
  • 探索范围(business landscape):寻找商机的目标数据的范围。

动机:以数值衡量业务领域新颖程度的研究很少

为什么要尽早发现新兴业务领域

论文给出的理由如下。

  • 随着商业环境的不确定性和波动性增大,发现商机变得更加重要。
  • 新兴业务领域是潜在商机的早期指标。它对制定新的业务战略、预判近期商业环境至关重要。
  • 仅依赖专家意见的传统分析耗时耗力。因此管理者和从业者越来越多地采用数据驱动的方法。
  • 成功的创新与高新颖性关系密切。因此,先从由新商品和服务构成的领域入手是合理的。

研究者选择商标作为数据,原因也在于此。企业申请商标,是为了标示正在开展的业务的来源。也是为了宣告并抢先占据即将开展的新业务领域。商标以标准化格式记载商品和服务,因此也便于应用计算方法。

既有研究没有涉及的部分

既有研究在寻找商机时使用的数据有四类。

  • 专利:呈现技术开发或技术商业化阶段的机会。
  • 网络新闻与社交媒体:涉及关于未来的内容,或产品上市后的客户反应。
  • 初创企业的商业计划:为早期业务构想提供线索。

大多数研究经历三个步骤:确定探索范围、划分业务领域、评估机会。论文指出了每个步骤中存在的如下空白。

  • 探索范围:由研究者挑选并收集与特定技术或产品相关的数据,因此范围的边界不清晰。即便检索式制定得很精细,在实际场景中也难以重新得到相同的结果。
  • 业务领域界定:对于领域分成几个、如何划分,没有既定标准。即使分析同一范围,领域的界定也会因研究者的方法或判断而不同。潜在狄利克雷分配(Latent Dirichlet Allocation, LDA)等主题建模给出的是关键词集合,而这些集合很难解读为实际业务。
  • 机会评估:增长、热度和可见度已有分析。相比之下,以数值表示业务领域新颖性的方法几乎没有人研究。
  • 数据的时点:既有数据更接近技术开发阶段或上市后的市场阶段。更接近业务运营阶段的商标数据则没有被使用过。

方法:把商标中的商品名转换为向量,用 LOF 找出偏离密集区的领域

该方法由四个步骤构成。第 1 步确定探索范围,收集并整理商标数据。第 2 步把 G&S 语句拆分为业务项,用语言模型生成向量后聚类,界定业务领域。第 3 步对每个业务领域用 LOF 计算新颖性,第 4 步加入新近度和可见度,绘制商机图。本文也与论文一样分四个步骤来说明。

图 1. 用商标 G&S 语句界定业务领域,再借助 LOF 和两项指标筛选商机的四个步骤。

案例与数据

数据来源是美国专利商标局(United States Patent and Trademark Office, USPTO)的数据库。USPTO 自 1870 年起管理商标。法律事件、G&S 语句、分类代码等详细信息都可以通过电子形式检索。研究者使用了三类信息。

  • 尼斯分类(Nice Classification, NCL)代码:把商品和服务分为 45 个类别,用于缩小探索范围。
  • 申请时间:用于把握业务运营的时间。
  • G&S 语句:用于提取具体的业务项,以界定业务领域。

案例选取的是涉及科学、研究用仪器和装置的 NCL 第 09 类。这一类别中技术密集型产品很多。虚拟现实设备、锂离子电池、蓝牙智能设备、人工智能应用以及加密货币相关的商标持续增加。在 2019 年商标统计报告中,NCL 09 也被列为申请量持续增长的范围。

分析对象是以 NCL 09 类申请的 134,898 件商标及其 G&S 语句。分析期间为 2017 年初至 2018 年底,这是分析时可获得的最新数据。

第 1 步:数据收集与预处理

  • 输入:USPTO 商标原始数据
  • 处理:确定探索范围,收集商标后进行解析并存储
  • 输出:同时包含结构化项和非结构化项的商标数据库
  1. 确定探索范围。可以按含特定关键词的商标来窄化范围,也可以按对应某一个 NCL 代码的全部商标来放宽范围。
  2. 按确定的标准从 USPTO 收集商标。
  3. 解析原始数据并存入数据库。NCL 代码和申请号作为结构化项存储,商标名称和 G&S 语句作为非结构化项存储。

先确定范围是有理由的。因为新颖性和新兴性是需要与其他领域比较才能确定的相对概念。案例中以整个 NCL 09 类为范围,共收集到 134,898 件。

第 2 步:业务项提取与业务领域界定

  • 输入:每件商标所载的 G&S 语句
  • 处理:语句清洗、项提取、语言模型向量化、聚类
  • 输出:由含义相近的业务项构成的业务领域

USPTO 提供载有商品和服务通用名称的商标识别手册(Trademark Identification Manual)。然而不少申请人为使自己的商品与众不同而使用新的表述。由于表述各异的业务项太多,无法由人逐一分析,因此要经过下面四个子步骤。

  1. 语句清洗:删除混入 G&S 语句中的法律程序表述。例如在 “(Based on 44(e) Priority Application) Smart phones; Television receivers; Monitors for computers; Commercial monitors” 中,删除括号内的优先权信息。
  2. 项提取:以分隔符拆分语句。上面的语句得到 smart phones、television receiver、monitors for computers、commercial monitors 四个项。
  3. 向量表示:用预训练语言模型把每个项转换为 n 维向量。含义或表述相近的项在向量空间中彼此靠近。
  4. 聚类:用 k 均值(k-means)等无监督聚类方法把相近的项聚在一起。每个簇就是一个业务领域。领域的含义,通过观察靠近簇中心点的项来解读。

不使用词袋(Bag-of-Words, BoW)方法也是有原因的。BoW 把一个词作为一个维度,因此当不同的词超过几千个时,就会遇到维度灾难(维度过多导致计算困难的问题)。它还丢弃词序和上下文,因而难以区分同样的词以不同方式排列的表述。

案例中,从 G&S 语句里提取了 254,063 个业务项。研究者按两条标准筛选这些项。

  • 删除文档频率(Document Frequency, DF)为 1 的项,即只在一件商标中出现的项。
  • 只保留商标识别手册中没有的项。因为手册中没有的项,更有可能是差异化的商品和服务。

剩下的项有 73,048 个。研究者用 RoBERTa 模型把这些项转换为 1,024 维向量,并用 k 均值聚类。领域数量参考惯性(inertia)值,由专家判断确定。因为领域数量不同,商机的具体程度也不同。

第 3 步:评估业务领域的新颖性

  • 输入:每个业务领域的中心向量
  • 处理:对中心向量计算 LOF
  • 输出:每个业务领域的新颖性值

分析单位是业务领域。输入 LOF 的是由构成各领域的项向量计算出的中心值。LOF 通过与周围邻居比较,计算对象的孤立程度。计算顺序如下。

  1. k 距离:求对象 p 到第 k 近邻居的欧氏距离。
  2. 可达距离:p 与邻居 o 之间的可达距离,是“o 的 k 距离”与“p 和 o 的实际距离”中较大的一个。
  3. 局部可达密度(local reachability density, lrd):p 到邻居的可达距离平均越短,该值越大。
  4. LOF:邻居的平均密度除以 p 的密度。

LOF 值接近 1,说明 p 的密度与邻居相近,是正常点。大于 1,说明 p 处于比邻居更稀疏的位置,很可能是异常值。论文用三种情形加以说明。

  • 当 p 位于密集区域中央时,p 与邻居的密度都大,因此 LOF 小。
  • 当 p 位于稀疏区域中央时,二者密度都小,因此 LOF 也小。
  • 当 p 处于稀疏处,而邻居形成密集的簇时,LOF 大。这种情形就是异常值。

看一个例子。论文表 2 中,“独脚架”领域的新颖性值为 1.366。论文只说明新颖性值基于 LOF。其他领域的值可在论文表 2 中查看。

不采用基于距离的聚类而关注密度,也是有理由的。商品名称在嵌入空间中即使距离很近,只要改动一个词,也可能表示重大的技术进步。因此仅凭距离很难判断新颖程度。

邻居数 k 由专家确定。案例中根据专家意见把邻居数定为 20。结果得到 103 个业务领域被判定为新领域。

第 4 步:绘制商机图

  • 输入:新业务领域,以及属于这些领域的商标的申请时间与频次
  • 处理:计算新近度和可见度,并布置到二维平面上
  • 输出:分为四个区域的商机图

即使是新领域,也要同时看它是否在快速增长,机会的可能性才会更大。因此研究者加入了新近度和可见度。

  1. 计算新近度。新近度指业务领域在商标中出现得有多晚近,以出现时点来衡量。
  2. 计算可见度。可见度指业务领域在探索范围内有多突出,以频次来衡量。
  3. 在图上布置。每个新领域是一个点。点的大小为新颖性,横坐标为新近度,纵坐标为可见度。
  4. 以归一化后的新近度和可见度的平均值为界,划分为四个区域。

四个区域的含义如下。

  • 新兴区(新近度高,可见度高):虽然出现不久,却已引领潮流的领域,是最有价值的机会。
  • 后新兴区(新近度低,可见度高):影响力大,但有可能趋于饱和。要寻找利基市场机会,需要深入调查。
  • 边缘区(新近度低,可见度低):已被长期观察,且所占比重小。若没有重大创新,可以从机会中剔除。
  • 前新兴区(新近度高,可见度低):虽然新出现,但件数还少,需要持续观察。

案例中,“智能手表(745)”领域属于新兴区。各领域的新颖性、新近度、可见度值整理在论文表 3 中,请查阅原文。论文没有给出平均边界值本身。不过由于它被归入新兴区,笔者推断其两个坐标都高于平均边界。

变体与情景

设置和分析目的不同,结果也会不同。

  • 邻居数 k:广泛探索新领域的企业把 k 取大。这样会考虑更多相邻领域,得到更宏观的结果。关注渐进式创新的企业,则把范围缩小到相邻领域。
  • 业务领域数:领域数直接影响商机呈现的具体程度。
  • 排除自有领域:已由自家企业运营的领域从图中剔除。若专家把某些领域排除出分析,则需重新计算 LOF 和指标后再布置。
  • 时点:该图是分析时点的截面。要用于实务,需要不断更新数据和结果。
  • 距离与异常值检测方法:可根据数据改用其他距离度量或异常值检测方法。

结果:103 个新领域中有 16 个是新兴领域,这些领域的申请人数量明显更多

图 2. 103个新领域中有16个是新兴领域,其平均申请人数量多于前新兴领域。但两组是按可见度划分的,因此并非独立验证。

103 个新业务领域

通过 LOF 计算得到 103 个新领域。论文举出的领域示例如下。

  • 独脚架
  • 蓝牙通信设备
  • 穿戴式机器人外骨骼服(robot exoskeleton suits)
  • 锂离子电池

仅详看其中两个领域如下。独脚架领域由智能手机和相机用自拍杆、便携式独脚架构成。锂离子电池领域由锂离子聚合物电池构成。两个领域的新颖性值见论文表 2。

所谓新领域,是指在嵌入空间中该领域与其他领域在表述上相距较远。自拍杆、蓝牙音箱这类如今看来很普通的商品也包含在内,是有原因的。新颖性是与同一探索范围内其他领域比较得出的相对值。而且分析数据是 2017 年初至 2018 年底的商标。因此应当把这一结果理解为:在那个时点的 NCL 09 类之中相对较新。

商机图的四个区域

研究者为 103 个新领域逐一查找商标,并计算了新近度和可见度。四个区域所含的领域数如下表,合计为 103 个(16+33+40+14=103)。

图中区域领域数下一步行动
新兴16调查先发企业与竞争者
前新兴33持续观察
边缘40大多从分析中剔除
后新兴14检查是否饱和

出处:论文 4.2 节正文

在新兴区中,以下领域被列为机会可能性较高的新领域。

  • 加密软件(687)
  • 智能手表(745)
  • 人工智能软件(662)

前新兴区包含以下领域。这些领域的可见度信号较弱,需要持续观察。

  • 锂离子电池(719)
  • 穿戴式机器人外骨骼服(948)
  • 语音控制智能家居设备(991)
  • 自助结账机(988)

锂离子电池虽被列为新领域,却落在前新兴区。因为在图中,新颖性不是坐标,只用作点的大小。

定量验证:比较新兴区与前新兴区的申请人数量

研究者比较了新兴区和前新兴区的申请人数量。这是遵循既有研究的观点:在某一领域中活动的主体(社区)越多,新兴性越高。把前新兴区作为对照组,是因为该区域未来最有可能成长为新兴领域,但目前尚不具备新兴性。检验采用样本量和方差互不相同的两组的双侧 t 检验。零假设是两组的平均值相同。

结果见论文表 4。16 个新兴领域的平均申请人数量,明显高于 33 个前新兴领域。即使在新兴领域内部,各领域的申请人数量差异也很大。各组的平均值和标准差请查阅原文表 4。

检验统计量为 t=5.11。t 是两个平均值之差除以标准误得到的值。论文把 p 记为 0.000。意思是它小到四舍五入后显示为 0。

要区分论文的解读和笔者的评价来阅读。研究者认为,这一结果大体支持了所提方法能够发现新兴领域的主张。但这一比较并不是独立验证。两个组从一开始就是依据可见度,即商标频次划分的。商标多的领域,申请人也容易多。因此这一比较更接近于重新确认按可见度划分的两组之间的差异,理解为出现了与方法结果相一致的趋势,才是恰当的。

定性验证:追踪后续的企业活动

研究者认为,仅靠数字比较无法证明方法的质量。因此他们追踪了位于新兴区的主要企业此后的活动。这种追踪并不是方法预测了企业活动的证据。它是事后确认,分析之后的企业活动与结果没有出入。

  • 太阳能发电面板领域在新颖性、新近度、可见度三项指标上也都属于新兴领域。前面的三个领域是论文从图的结果中挑选的代表性示例,而太阳能面板是论文在验证部分另外举出的新兴领域示例。论文叙述,与该领域关系密切的韩华 Q CELLS(한화큐셀)通过持续并购扩大了太阳能业务,并推出了效率高于既有面板的技术。
  • 在加密软件领域,HashiCorp 通过集中式密钥管理,成为保护敏感数据的加密解决方案的主要企业。论文叙述,早期参与该领域的 Tencent 和 Tessian 现在向客户提供数据安全与加密业务。
  • 论文叙述,前新兴区的锂离子电池、智能家居设备、自助结账机,此后成为众多产品和服务不可或缺的部分。据论文,锂离子电池市场因电动汽车的普及以及智能手机和可穿戴设备的需求而扩大。智能家居设备市场随物联网设备增加而快速增长。自助结账机以自助终端的形式,随非接触消费需求一同增长。

新兴性往往要事后才能判断,因此确定一个领域有多新兴既困难,又容易掺入主观因素。

意义与局限

带来了什么改变

  • 数据:这是商机发现领域中首次把文本挖掘应用于商标 G&S 语句的尝试。
  • 结果的单位:分析结果从关键词层面具体化为业务项,即商品和服务层面。
  • 指标:用 LOF 把既有研究几乎没有涉及的业务领域新颖性数值化。
  • 时点:把停留在技术开发或市场预测阶段的分析,前移到业务运营初期阶段,即靠近商标申请时点。
  • 结构:把用一次就结束的既有方法,改为由专家在每个步骤中调整和解读结果的交互式结构。
  • 模型:属于首次把最新预训练语言模型应用于商机识别的研究。

对从业者的用处

论文期望,由于能在较大范围内探索商机,可以大幅减少分析所需的时间和精力。不过,实际节省的效果并未测量。领域数和邻居数的确定、业务项的选定、领域的解读,仍然需要专家介入。

结果以商品和服务清单而不是关键词集合的形式给出,便于直接用于决策。流程系统化,因此可以做成自动化软件。这意味着缺乏数据分析技能的业务专家也可以使用。

确定探索范围之后,补充新的商标数据也很简单。只需找出新商标的 G&S 语句,重新划定探索范围即可。也可以与既有方法结合使用。例如找出新兴领域后,再通过社交媒体分析考察产品、市场和竞争者,就能使机会更加具体。不过,判断结果是否为真正的机会,仍然是专家和管理者的责任。

对研究者的用处

  • 该方法也可用于技术预测、未来信号探测和竞争分析。
  • 对专利、新闻、科学论文等其他数据源,只需更换几项技术即可应用。
  • 使用连接专利与商标的数据库,可以同时把握新兴领域的基础技术和竞争对手的技术。
  • 论文指出,应根据数据更换距离度量和异常值检测方法。

论文指出的局限

论文自己指出的局限有五点。

  • 它只是找出有可能新兴的领域,无法给出该领域是否真的兴起的确切答案。需要与显示实际新兴与否的滞后指标一起使用,价值才会提高。
  • 找出的机会需要借助市场、技术、客户数据进一步具体化并完善。
  • 数据件数或嵌入维度增加时,计算复杂度会上升。引入最新技术也有改进的余地。
  • 业务项选定和领域解读等工作仍交由专家判断,尚未完全自动化。
  • 案例研究只有一例,且找出的机会尚未得到验证,因此未能充分确认其性能和用处。

笔者认为的适用条件

以下并非论文所述内容,而是笔者着眼于实务应用而补充的条件。

  • 自家企业实际可以进入的商品范围,应与探索范围相匹配。范围过宽,结果的大部分会是与自家无关的领域。
  • 应改变几组领域数和邻居数分别运行,确认新兴领域清单的保持程度。清单若大幅变动,就难以把该结果作为决策依据。
  • 在商标申请较少的行业,每个领域的商标件数少,可见度值可能不稳定。
  • 应事先确定由谁、按什么流程用市场数据或客户数据去核实被判为新兴领域的结果。

马上可以做的事

  • 确定一个与自家行业对应的 NCL 类别。收集该类别最近的商标 G&S 语句,删除括号中的程序性表述,并以分号拆分。然后剔除文档频率为 1 的项和商标识别手册中已有的项,就能看出还剩下多少差异化的商品表述。
  • 用预训练语言模型把剩下的项转换为向量,并用 k 均值聚类。对簇中心点计算 LOF,先看明显大于 1 的领域。
  • 对每个新领域,按商标的申请时间和频次求新近度和可见度。以两个值的平均值为界分为四个区域,并与自家规划人员一起审查位于新兴区的项。

关键词

相关文章