如何衡量单件专利的知识探索距离

能否衡量一项专利在多大程度上探索了远离既有知识的领域?本文梳理了利用IPC网络嵌入和引用关系计算知识探索距离的5个步骤,以及AI专利案例的结果。

本文译自韩文原文。 韩文原文

R&D 管理者想知道,研究组织是只打磨熟悉的技术,还是从陌生技术中获取知识。迄今为止,这类判断主要基于企业或地区等较大单位的专利集合。因此,单件专利相对于既有知识探索了多远,很难用数字来确认。

本文只讨论一个问题:能否用单件专利层面的数值,来衡量单个专利探索了离既有知识多远的领域?

下面来读一篇回答了这个问题的论文。

  • 标题:Measuring knowledge exploration distance at the patent level: Application of network embedding and citation analysis
  • 期刊:Journal of Informetrics
  • 年份:2022
  • DOI:10.1016/j.joi.2022.101286

论文提出了一种计算单件专利知识探索距离(Knowledge Exploration Distance,KED)的方法。该方法由四项工作构成。

  • 根据专利分类号共同出现的关系构建网络。
  • 通过网络嵌入(network embedding,一种把网络中的每个节点转换为保留结构信息的数值向量的技术)将分类号转换为向量。
  • 用这些向量表示专利。
  • 计算施引专利与被引专利在向量空间中相距多远。

全文使用的术语如下。知识基础(knowledge base)是新发明所依托的既有知识要素的集合。论文把一件专利所引用的在先专利视为该专利的知识基础。技术要素(technical element)指专利上标注的每一个国际专利分类(International Patent Classification,IPC)号。知识探索距离表示施引专利的技术要素与被引专利的技术要素之间的关系有多新颖。

动机:知识探索此前只在组织层面衡量

为什么知识探索距离很重要

论文以”知识探索与创新绩效相关”的既有研究为基础提出问题。论文给出的理由如下。

  • 知识探索是引入其他技术或地区的外部知识、从而提升新知识质量的活动。这样形成的知识难以模仿或替代,因而是有价值的资产。
  • 探索多个领域的知识会拓宽信息搜索的范围。企业可以获得更多新信息,并借助这些信息发现和解决既有问题。
  • 既有研究报告称,知识探索距离与组织的创新活动、创新质量以及区域创新主体存在显著关系。
  • 一项企业研究发现,探索的技术多样性与创新质量呈正线性关系,地理多样性则呈曲线关系。

既有研究未涉及的部分

既有研究以企业、组织、地区的边界来确定知识基础,通过比较边界内外的专利来衡量探索程度。例如,一项研究把探索定义为引用团队成员不熟悉的技术领域的比例。另一项研究则根据企业在各分类下持有的专利数量,计算企业之间的技术距离。

论文指出的空白如下。

  • 既有方式只能用于特定主体持有的专利或在特定地区申请的专利。
  • 给定边界之外的专利,其知识基础难以衡量。这类专利在申请过程中同样探索了既有知识。
  • 基于引用的新颖性指标早已存在。但文本相似度只看技术词汇或表述有多大差异。Verhoeven 等(2016)的指标只统计新 IPC 组合的数量。
  • 这些方法能知道是否存在新的 IPC 组合,但由于缺少技术要素之间的距离信息,无法反映关联的程度。

论文认为,用引用关系定义知识基础,范围就不再受所有者或地区的限制。

方法:将 IPC 号转换为向量,并对与被引专利的距离取平均

论文把方法分为 3 个步骤。

图 1. 用全部专利学习 IPC 号向量后,对与所引在先专利的距离取平均,得到 KED。
  • 数据收集与预处理
  • 利用分类信息把专利转换为向量
  • 利用引用关系计算知识探索距离

本文把第二步中的三项工作单独拆出,分为 5 个步骤来说明。这三项工作是网络构建、网络嵌入和专利表示。本文的第 1 步对应论文的第一步,第 2~4 步对应论文的第二步,第 5 步对应论文的第三步。

案例与数据

数据是在韩国知识产权局(Korea Intellectual Property Office,KIPO)登记的专利。研究者给出的理由是,KIPO 提供高质量的引用、分类和著录信息。案例技术是人工智能(Artificial Intelligence,AI)。分析所用的专利集合有三个。

  • 全部专利:1984 年至 2019 年在 KIPO 授权的专利共 2,438,139 件。用于构建技术生态网络。
  • 基础专利:与 AI 技术相关的授权专利 28,569 件。是计算知识探索距离的对象。
  • 在先专利:基础专利所引用的专利 36,090 件。这是去重后的数量,构成基础专利的知识基础。

基础专利是用世界知识产权组织(WIPO)确定的 AI 相关分类号检索得到的。每件基础专利平均引用 1.72 件。最早的在先专利于 1984 年授权,因此网络的构建期间也从 1984 年算起。

第 1 步:数据收集与知识基础的定义

  • 输入:包含引用、分类号和著录信息的专利数据库
  • 处理:为每件待分析专利收集其引用的在先专利
  • 输出:每件专利的在先专利集合 [c0, c1, c2, …]
  1. 确定待分析专利 a。
  2. 收集 a 引用的全部专利,形成在先专利集合。
  3. 将该集合作为 a 的知识基础。

知识基础也可以用申请人已有的专利或所引用的科学文献来定义。研究者选择了引用信息。这是因为在审查过程中,技术相近或构成技术基础的在先专利很可能被引用。引用关系的先后方向明确,因此也提供了比较技术知识所需的方向信息。

在案例中,这一步得到基础专利 28,569 件和在先专利 36,090 件。

第 2 步:构建技术生态网络

  • 输入:全部 2,438,139 件专利的 IPC 号
  • 处理:把同一件专利上共同出现的 IPC 号两两连接,并记录其频次
  • 输出:以 IPC 号为节点、以共现频次为连边的网络
  1. 将 IPC 号作为节点。
  2. 把在同一件专利中共同出现的两个分类号连接起来。
  3. 将共同出现的次数作为连边的权重。

使用共现的原因在于,它体现了技术要素之间自然的关联。引用关系体现的是技术开发中的依赖关系。共现网络不仅通过直接连接,还通过间接连接揭示技术要素隐含的位置。

还需要确定分类号的层级。IPC 是从部到小组的层级结构。例如 G06F 30/27,经过 G 部(物理)、G06 大类(计算)、G06F 小类、G06F 30 大组(计算机辅助设计),最终到达使用机器学习的小组。许多研究出于计算量的考虑,在小类或大类层面进行分析。本文论文使用了完整到末位的 IPC 号。

在案例中,网络由 65,556 个节点和 2,314,188 条连边构成。

第 3 步:网络嵌入

  • 输入:第 2 步的技术生态网络
  • 处理:用名为 LINE 的嵌入方法学习每个 IPC 号
  • 输出:每个 IPC 号对应一个 128 维向量
  1. 确认网络的性质。该网络不随时间变化,节点类型单一,节点和连边都非常多。
  2. 根据这些性质,选用 Tang 等人于 2015 年提出的 LINE 方法。
  3. 同时学习一阶邻近性和二阶邻近性,为每个分类号得到向量。

节点和连边过多时计算会很困难。因此要把每个分类号的信息压缩为定长向量。嵌入的目标是让网络中相似的节点在向量空间中也彼此靠近。

两种邻近性的含义如下。

  • 一阶邻近性:两个分类号直接相连的程度。两个分类号共同出现的频次越高,学习后它们的向量就越相似。
  • 二阶邻近性:两个分类号共享公共邻居的程度。即使没有直接共同出现,只要经常与相同的分类号组合在一起,它们也会靠近。

参数设置如下:邻近性阶数为 2,负采样比例为 5,初始学习率为 0.025,嵌入维度为 128。在案例中,网络中所有 IPC 号都得到了各自唯一的 128 维向量。

第 4 步:生成专利向量

  • 输入:每件专利上的 IPC 号和第 3 步的分类号向量
  • 处理:将分类号向量乘以权重后取平均
  • 输出:每件专利一个 128 维向量
  1. 将专利的分类号按频次排序。
  2. 每个分类号向量乘以权重。
  3. 对加权后的向量取平均,作为专利向量。

由于论文使用的是完整到末位的分类号,同一件专利内没有重复的分类号。因此各分类号的权重相同,实际上就是简单平均。例如,某件专利带有三个 IPC 号,则把三个分类号向量同一位置的值相加再除以 3。

研究者给出了选择分类号而非文本的两个理由。

  • 文本受限于专利授权所在专利局的语言。
  • 难以涵盖各技术领域不同的专业术语。

IPC 这类分类号是国际通用的,并且包含了足够的技术要素信息。在案例中,全部专利都各自表示为 128 维向量。

第 5 步:计算知识探索距离

  • 输入:专利 a 的向量,以及 a 所引用的在先专利的向量
  • 处理:对每件在先专利求余弦距离并取平均
  • 输出:专利 a 的知识探索距离(KED)
  1. 求 a 与某一件在先专利 c 的余弦相似度。将两个向量同一位置的值相乘后求和,再除以两个向量长度的乘积。
  2. 用 1 减去余弦相似度,转换为距离。
  3. 对所有在先专利求出该距离,再除以在先专利数 |C|,得到平均值。

写成公式为 KED(a) = Σ(1 − 余弦相似度(a, c)) ÷ |C|。两个向量的方向越一致,余弦相似度越大。因此,KED 较大意味着被引专利的技术要素与 a 的技术要素在技术生态网络中平均而言距离较远。研究者解释为:KED 较大表示发明过程中对既有知识的探索较为活跃。这一解释是研究者的解释,并非下文结果所另行证实的内容。

在案例中,这一步得到了全部 28,569 件基础专利的 KED。

结果:距离较大的专利与既有新颖性指标大体一致,与其他专利指标存在虽小但显著的关系

单件专利的计算示例

研究者以一件关于视频摘要播放系统及配备该系统的移动通信终端的专利(KR1020050090452)展示了计算过程。该专利有三个技术要素。

图 2. 四件在先专利中最远的一件拉高了该专利的 KED 平均值。
  • G11B 27/10:索引、寻址、定时
  • G11B 20/10:数字记录与再现
  • H04B 1/40:电路

该专利引用了四件在先专利。五件专利都依据 IPC 嵌入值转换为向量,并逐件计算了与在先专利的距离。在被引的四件专利中,与 KR1020020074328 的距离最大,为 1.1764。其余三件的距离分别为 0.3168、0.3332、0.3205。各专利的完整数值可在论文表 4 中查到。

笔者亲自对四个距离取平均,得 (1.1764+0.3168+0.3332+0.3205)÷4=0.5367。该值与论文表 4 中记录的这件专利的 KED 一致。第一件在先专利的距离超过 1。由于 1−1.1764=−0.1764,说明两个向量的余弦相似度为负。这件在先专利的技术要素为 H04N 21/4402、H04N 5/915、G11B 27/28。这些分类号与施引专利的技术要素很少有共同使用的历史。其余三件的距离远小于第一件,因此是一次远距离探索把平均值拉高了。

28,569 件基础专利的分布

基础专利的 KED 平均值约为 0.3726,标准差为 0.0762。约 47% 的基础专利低于平均值。最大值为 1.2018。最小值出现在施引专利与被引专利的技术要素完全相同的情形。研究者解释说,少数 KED 较高的专利拉高了平均值。

与既有新颖性指标的比较

研究者将 KED 排名前 10 的专利与两种新颖性指标进行了比较。

  • 重组新颖性(Novelty in Recombination,NR):专利的 IPC 组合中,只要有一个在申请年份之前从未出现过,取 1,否则取 0。
  • 技术知识来源新颖性(Novelty in Technological knowledge Origins,NTO):把施引专利的 IPC 与被引专利的 IPC 配成组合,只要其中有一个新组合,取 1,否则取 0。本研究使用完整到末位的 IPC 进行测量。

前 10 件专利都只引用了一件在先专利。前 10 件的 NTO 全部为 1。NR 在 10 件中有 6 件为 1。其余 4 件(第 1、3、5、7 名)的 NR 为 0。各名次的数值可在论文表 5 中查到。

有两个代表性案例。第 1 名专利(中继线接口自动恢复装置及方法)的 KED 最大,为 1.2018。该专利的六个引用组合全部是新组合。第 2 名专利具有 A61B-005/053 与 A61N-001/05 这一组合。在其申请年份 2010 年之前,这一组合从未出现过。

总结来说,KED 排名靠前的专利与 NTO 完全一致。在 NR 上,有 6 件为 1,但包括 KED 最大的第 1 名在内的 4 件为 0。研究者表述为,排名靠前的专利大多在两项指标上都得到较高评价。研究者指出,这两项指标只能告诉我们是否存在新组合。KED 在此基础上增加了技术要素之间的距离,进而说明关系新颖到什么程度。

通过内容分析加以确认

研究者还亲自阅读了排名靠前的专利及其在先专利的内容。

  • 第 2 名专利(神经刺激器用刺激电极的阻抗测量装置)利用电极两端的电压差测量每个电极的阻抗。其在先专利是用电刺激肌肉组织的装置。区别在于,该专利分析的是接触神经或肌肉的刺激电极的电化学特性。
  • 第 1 名专利通过设置备用接口缩短了恢复时间,并提高了连接可靠性。其在先专利未能解决中继线接口的物理传输错误。

研究者也考察了 KED 较低的专利。这些专利处理的问题与被引专利相似或相同,在技术要素或内容上难以找到明显差异。

与其他专利指标的关系

研究者以 KED 为因变量进行了回归分析。共有四个模型。

  • 模型 1:加入了来自引用信息的三个变量。
  • 模型 2:再加入三个利益相关者变量。
  • 模型 3:加入所有可用变量。
  • 模型 4:通过逐步选择,剔除了不显著的从属权利要求保护范围。

方差膨胀因子(Variance Inflation Factor,VIF)均低于 5.00,因此不存在多重共线性问题。在模型 4 中,与 KED 呈负相关的变量如下。

  • 专利引用数
  • 发明人数
  • 申请人数
  • 商业范围

呈正相关的变量如下。

  • 非专利文献引用
  • 技术周期
  • 代理人数
  • 独立权利要求保护范围

这些变量在模型 4 中大多在 p<0.01 的水平上显著。非专利文献引用和申请人数仅在 p<0.05 的水平上显著。系数都很小。各变量的系数可在论文表 7 中查到。

解释如下。

  • 引用专利文献越多的专利,KED 越低。研究者认为,可用于远距离探索的在先专利本来就少,引用增多时平均距离可能会降低。
  • 非专利文献引用和技术周期与 KED 呈正相关。KED 较大的专利倾向于与科学文献有更多联系。
  • 技术周期是所引用在先专利年龄的中位数。研究者指出,技术周期会随技术生命周期从成长期走向成熟期而缩短,并据此认为,在同一阶段 KED 较大的专利可能会增多。
  • KED 较大的专利倾向于发明人和申请人较少、代理人较多。
  • 独立权利要求保护范围呈正相关。KED 较大的专利倾向于独立权利要求数较多。论文援引”权利要求多的专利保护范围广”的既有研究,将其解释为保护范围较广。效应量很小。独立权利要求保护范围的系数在模型 3 中为 0.0019,在模型 4 中为 0.0017。
  • 商业范围呈负相关。研究者解释为,KED 较大的专利倾向于只在一个专利局登记,而非在多个国家登记。

审查周期的系数接近 0。模型 4 的决定系数(R²)为 0.0124。这意味着这些指标只解释了 KED 变动中极小的一部分。应当理解为:这些关系虽然显著,但幅度很小。

意义与局限

有什么改变

  • 在单件专利而非组织或地区的层面计算知识探索距离。
  • 用引用关系定义知识基础,使其不受所有者或地区边界限制,可用于所有专利。
  • 使用完整到末位的 IPC,并通过网络嵌入把分类号之间的距离表示为数值。
  • 不止于判断有无新组合,还求出关系新颖到什么程度。
  • 确认了 KED 与保护范围、在先知识、专利价值相关指标之间存在显著关系。

对从业者的用处

研究者认为,该指标可以成为检视企业专利组合与知识探索活动的新指标。由于基于分类号,它可以不受专利局的限制而使用。流程系统化、专家介入少,因此在其他分析环境中也可以重新计算。

对 R&D 管理者来说,多了一种用数字确认探索程度的手段。顺带说明,利用型创新是改进既有方法,探索型创新是寻找新机会。汇总自家专利的 KED,可以分析组织的探索倾向。笔者在此基础上进一步建议,把 KED 特别高的专利作为候选,另行阅读其内容。论文把这一点作为学术研究中可以深入调查距离较大专利的启示提出。

对研究者的用处

  • 汇总单件专利的 KED,可以分析企业、组织、地区的探索倾向。
  • 可以把 KED 作为变量,纳入被引次数、专利寿命、技术融合的分析。
  • 可与文本相似度指标一起,作为技术关联视角的新颖性指标。

论文指出的局限

论文自己指出的局限有 4 点。

  • 并不存在为每件专利确定知识基础的绝对规则。可以借助继续申请或同族信息来扩大在先专利的范围。
  • 只用引用关系定义了知识基础。可以从申请人或科学文献的角度加以扩展。
  • KED 对专利价值或质量的影响需要事后分析。被引次数随时间累积,因此需要改进汇总方法。
  • 需要比较被驳回专利与授权专利、失效专利与长期维持的专利,从新颖性和寿命的角度进行分析。

研究者列出了三项未来课题:开发适合技术生态网络的嵌入方法,同时使用著录信息和文本信息的专利表示,以及与非专利文献的内容比较。

笔者认为的适用条件

以下并非论文所载内容,而是笔者着眼于实际应用而补充的条件。

  • 引用较少的专利,其 KED 会在很大程度上取决于一两件引用。前 10 名全部只有一件引用,因此在解释时最好同时标明引用数。
  • 回归的解释力较低,因此不要仅凭 KED 判断专利价值。应与内容审阅结合使用。
  • 嵌入的数值会随所学习的专利范围而变化。比较不同期间或不同专利局的结果时,必须使用同一套嵌入。
  • 案例是 KIPO 的 AI 专利。在其他技术领域,应重新确认平均值和分布后再确定标准。

现在就可以做的事

  • 从自家授权专利中选定一个技术领域,为每件专利整理 IPC 号和所引用的在先专利清单。这与论文第 1 步的准备工作相同。
  • 选定一件在先专利,用表格比较它与施引专利的 IPC 号重合了多少。把重合分类号少的引用组合标出来,有助于缩小需要重点查看的候选范围。这一方法不是论文的方法,而是笔者建议的粗略预筛选。嵌入也会反映公共邻居等间接关联,因此即使重合的分类号很少,KED 也可能很小。
  • 如果已经算出嵌入,就分别挑出若干件 KED 靠前和靠后的专利,与其在先专利对照阅读内容。这与论文确认结果的方式相同。

商业智能实验室(비즈니스인텔리전스랩)将继续在本博客介绍如何用专利数据解读技术与组织。

关键词

相关文章