特許1件の知識探索距離を測定する方法

特許1件が既存の知識からどれだけ遠くを探索したかを測ることはできるだろうか?IPCネットワーク埋め込みと引用関係で知識探索距離を求める5つのステップと、AI特許の事例の結果をまとめる。

韓国語の原文から翻訳しました。 韓国語の原文

R&Dマネージャーは、研究組織が慣れた技術ばかりを磨いているのか、不慣れな技術から知識を取り入れているのかを知りたいと考えています。これまでこの判断は、主に企業や地域といった大きな単位の特許群をもとに行われてきました。そのため、特許1件が既存の知識からどれだけ離れた領域を探索したのかを、数値で確認することは困難でした。

本稿が扱う問いは1つです。個々の特許が既存の知識からどれだけ遠い領域を探索したのかを、特許1件単位の数値で測定できるでしょうか。

この問いに答えた論文を1本読んでみます。

  • タイトル: Measuring knowledge exploration distance at the patent level: Application of network embedding and citation analysis
  • 学術誌: Journal of Informetrics
  • 年: 2022
  • DOI: 10.1016/j.joi.2022.101286

この論文は、特許1件の知識探索距離(Knowledge Exploration Distance, KED)を計算する方法を提案しています。この方法は4つの作業で構成されています。

  • 特許分類コード同士が一緒に使われた関係からネットワークを作ります。
  • ネットワーク埋め込み(network embedding、ネットワークの各点を構造情報を保ったまま数値ベクトルに変換する手法)によって、コードをベクトルに変換します。
  • このベクトルで特許を表現します。
  • 引用する特許と引用された特許がベクトル空間でどれだけ離れているかを計算します。

本稿全体で使う用語は次のとおりです。知識基盤(knowledge base)とは、新しい発明の土台となる既存の知識要素の集まりです。この論文では、ある特許が引用した先行特許を、その特許の知識基盤とみなします。技術要素(technical element)とは、特許に付与された国際特許分類(International Patent Classification, IPC)コード1つ1つを指します。知識探索距離は、引用する特許の技術要素と引用された特許の技術要素が結ぶ関係がどれだけ新しいかを表します。

動機: 知識探索はこれまで組織単位でしか測定されてこなかった

なぜ知識探索距離が重要なのか

論文は、知識探索がイノベーション成果と結びつくという先行研究を踏まえて問題を提起しています。論文が挙げた理由は次のとおりです。

  • 知識探索とは、他の技術や地域の外部知識を取り込んで、新しい知識の質を高める活動です。こうして作られた知識は模倣や代替が難しく、価値ある資産になります。
  • 複数の領域の知識を探索すると、情報探索の範囲が広がります。企業は新しい情報をより多く得られ、その情報で既存の問題を見つけて解決できます。
  • 先行研究は、知識探索距離が組織のイノベーション活動、イノベーションの質、地域のイノベーション主体と有意な関係にあると報告しました。
  • ある企業研究では、探索の技術的多様性がイノベーションの質と正の線形関係を示しました。地理的多様性は曲線的な関係を示しました。

既存研究が扱ってこなかった部分

既存研究は、企業、組織、地域の境界で知識基盤を定めてきました。その境界の内側の特許と外側の特許を比較して、探索の程度を測定しました。たとえばある研究は、チームメンバーにとって不慣れな技術領域を引用した割合で探索を定義しました。別の研究は、企業が分類別に保有する特許数から企業間の技術距離を計算しました。

論文が指摘した空白は次のとおりです。

  • 既存の方式は、特定の主体が保有する特許や、特定の地域で出願された特許にしか使えません。
  • 与えられた境界の外にある特許は、知識基盤を測定しにくくなります。そうした特許も、出願の過程で既存の知識を探索しています。
  • 引用に基づく新規性指標はすでにありました。ただしテキスト類似度は、技術用語や表現がどれだけ違うかを見るにとどまります。Verhoeven et al.(2016)の指標は、新しいIPCペアの数を集計するだけです。
  • 新しいIPCペアがあるかどうかはわかっても、技術要素間の距離の情報がないため、関連の程度は反映できません。

論文は、引用関係で知識基盤を定義すれば、範囲が所有者や地域に縛られないと考えています。

方法: IPCコードをベクトルに変換し、引用特許との距離を平均する

論文は方法を3段階で説明しています。

図 1. 全特許でIPCコードのベクトルを学習した後、引用した先行特許との距離を平均してKEDを求める。
  • データ収集と前処理
  • 分類情報によって特許をベクトルに変換する段階
  • 引用関係によって知識探索距離を計算する段階

本稿では、第2段階の3つの作業を切り分けて5段階で説明します。その3つの作業とは、ネットワーク構築、ネットワーク埋め込み、特許の表現です。本稿の1段階目は論文の第1段階、2〜4段階目は論文の第2段階、5段階目は論文の第3段階に当たります。

事例とデータ

データは韓国特許庁(Korea Intellectual Property Office, KIPO)に登録された特許です。研究チームは、KIPOが引用、分類、書誌情報を高い品質で提供していることを理由に挙げました。事例とする技術は人工知能(Artificial Intelligence, AI)です。分析に使った特許群は3つです。

  • 全特許: 1984年から2019年までにKIPOに登録された特許2,438,139件です。技術エコシステムネットワークの作成に使います。
  • 基礎特許: AI技術に関連する登録特許28,569件です。知識探索距離を計算する対象です。
  • 先行特許: 基礎特許が引用した特許36,090件です。重複を除いた件数で、基礎特許の知識基盤になります。

基礎特許は、世界知的所有権機関(WIPO)が定めたAI関連の分類コードで検索しました。基礎特許1件は平均1.72件を引用していました。最も古い先行特許が1984年の登録だったため、ネットワークの構築期間も1984年から設定しました。

1段階目: データ収集と知識基盤の定義

  • 入力: 引用、分類コード、書誌情報を含む特許データベース
  • 処理: 分析対象の特許ごとに、引用した先行特許を集める
  • 出力: 特許ごとの先行特許集合 [c0, c1, c2, …]
  1. 分析対象の特許aを決めます。
  2. aが引用した特許をすべて集めて、先行特許集合を作ります。
  3. この集合をaの知識基盤とします。

知識基盤は、出願人の既存特許や引用された科学文献で定義することもできます。研究チームは引用情報を選びました。審査の過程で、技術が似ている先行特許や技術的な土台となる先行特許が引用される可能性が高いためです。引用関係は前後の方向が明確なので、技術知識を比較するのに必要な方向情報も得られます。

事例では、この段階で基礎特許28,569件と先行特許36,090件が得られます。

2段階目: 技術エコシステムネットワークの構築

  • 入力: 全特許2,438,139件のIPCコード
  • 処理: 1件の特許に一緒に付与されたIPCコードのペアを結び、その頻度を記録する
  • 出力: ノードがIPCコード、リンクが共起頻度であるネットワーク
  1. IPCコードをノードとします。
  2. 1件の特許の中で一緒に現れた2つのコードを結びます。
  3. 一緒に現れた回数をリンクの重みとします。

共起を使う理由は、これが技術要素間の自然な関連を表すからです。引用関係は、技術開発に伴う依存関係を表します。共起ネットワークは、直接的な結びつきだけでなく間接的な結びつきを通じて、技術要素の潜在的な位置も明らかにします。

コードのレベルも決めなければなりません。IPCはセクションからサブグループまでの階層構造です。たとえばG06F 30/27は、セクションG(物理学)、クラスG06(計算)、サブクラスG06F、メイングループG06F 30(コンピュータ支援設計)を経て、機械学習を用いるサブグループに至ります。多くの研究は計算量の都合から、サブクラスやクラスのレベルで分析します。この論文はIPCコードを末尾の桁まですべて使いました。

事例では、ネットワークはノード65,556個とリンク2,314,188本で構成されました。

3段階目: ネットワーク埋め込み

  • 入力: 2段階目の技術エコシステムネットワーク
  • 処理: LINEという埋め込み手法で各IPCコードを学習する
  • 出力: IPCコードごとの128次元ベクトル
  1. ネットワークの性質を確認します。このネットワークは時間によって変化せず、ノードの種類が1つで、ノードとリンクが非常に多いという性質を持っています。
  2. この性質に合わせて、Tang et al.が2015年に提案したLINE手法を選びます。
  3. 1次近接性と2次近接性を併せて学習し、コードごとのベクトルを得ます。

ノードとリンクが多すぎると計算が難しくなります。そこで、各コードの情報を固定長のベクトルに圧縮します。埋め込みの目標は、ネットワーク上で似ているノードがベクトル空間でも近くに配置されるようにすることです。

2つの近接性の意味は次のとおりです。

  • 1次近接性: 2つのコードが直接結ばれている度合いです。2つのコードが一緒に現れる頻度が高いほどベクトルも似るように学習します。
  • 2次近接性: 2つのコードが共通の隣接ノードをどれだけ共有しているかです。直接一緒に現れなくても、同じコード群とよく結びつけば近くなります。

設定値は次のとおりです。近接性の次数は2、負例サンプルの比率は5、初期学習率は0.025、埋め込み次元は128です。事例では、ネットワーク内のすべてのIPCコードが128次元の固有のベクトルを得ました。

4段階目: 特許ベクトルの作成

  • 入力: 特許ごとに付与されたIPCコードと、3段階目のコードベクトル
  • 処理: コードベクトルに重みを掛けて平均する
  • 出力: 特許ごとの128次元ベクトル
  1. 特許の分類コードを頻度順に並べます。
  2. コードベクトルごとに重みを掛けます。
  3. 重みを掛けたベクトルを平均して、特許ベクトルとします。

この論文は末尾の桁まで使ったコードなので、1件の特許内に重複するコードはありませんでした。そのため、コードごとの重みは同じでした。実質的には単純平均です。たとえばある特許にIPCコードが3つ付与されていれば、3つのコードベクトルの同じ位置の値を足して3で割ります。

研究チームは、テキストではなく分類コードを選んだ理由を2つ挙げています。

  • テキストは、特許が登録された特許庁の言語に縛られます。
  • 技術分野ごとに異なる専門用語をすべて反映することが難しいです。

IPCのような分類コードは国際共通で、技術要素の情報を十分に含んでいます。事例では、全特許のそれぞれが128次元のベクトルで表現されました。

5段階目: 知識探索距離の計算

  • 入力: 特許aのベクトルと、aが引用した先行特許のベクトル
  • 処理: 先行特許ごとにコサイン距離を求めて平均する
  • 出力: 特許aの知識探索距離(KED)
  1. aと先行特許c 1件とのコサイン類似度を求めます。2つのベクトルの同じ位置の値を掛けて足し、2つのベクトルの長さの積で割ります。
  2. 1からコサイン類似度を引いて、距離に変換します。
  3. すべての先行特許についてこの距離を求め、先行特許数|C|で割って平均します。

式で書くとKED(a) = Σ(1 − コサイン類似度(a, c)) ÷ |C|です。コサイン類似度は、2つのベクトルの向きが同じであるほど大きくなります。したがって、KEDが大きいということは、引用された特許の技術要素とaの技術要素が、技術エコシステムネットワーク上で平均的に遠いことを意味します。研究チームは、KEDが大きければ発明の過程で既存知識の探索が活発だったと解釈しています。この解釈は研究チームによるものであり、以下の結果で別途立証された内容ではありません。

事例では、この段階で基礎特許28,569件すべてのKEDが得られます。

結果: 距離が大きい特許は既存の新規性指標とおおむね一致し、特許指標とは小さいながら有意な関係を示す

特許1件の計算例

研究チームは、動画要約再生システムとそれを備えた移動通信端末に関する特許(KR1020050090452)で計算過程を示しました。この特許の技術要素は3つです。

図 2. 先行特許4件のうち最も遠い1件が、この特許のKEDの平均を押し上げた。
  • G11B 27/10: インデキシング、アドレッシング、タイミング
  • G11B 20/10: デジタル記録と再生
  • H04B 1/40: 回路

この特許は先行特許4件を引用していました。5件の特許すべてがIPC埋め込み値でベクトルになり、先行特許ごとに距離を求めました。引用された4件のうち、KR1020020074328との距離が1.1764で最大でした。残り3件の距離は0.3168、0.3332、0.3205でした。特許ごとの値の全体は、論文の表4で確認できます。

筆者が4つの距離を自分で平均すると、(1.1764+0.3168+0.3332+0.3205)÷4=0.5367です。この値は、論文の表4に記載されているこの特許のKEDと一致します。最初の先行特許の距離は1を超えています。1−1.1764=−0.1764なので、2つのベクトルのコサイン類似度が負であることを意味します。この先行特許の技術要素は、H04N 21/4402、H04N 5/915、G11B 27/28でした。これらのコードは、引用特許の技術要素と一緒に使われた履歴がまれでした。残り3件の距離は最初の1件よりはるかに小さく、1件の遠い探索が平均を押し上げました。

基礎特許28,569件の分布

基礎特許のKEDの平均は約0.3726、標準偏差は0.0762でした。基礎特許の約47%が平均より低い値を示しました。最大値は1.2018でした。最小値は、引用する特許と引用された特許の技術要素がまったく同じ場合に出ます。研究チームは、KEDが高い一部の特許が平均を押し上げていると説明しています。

既存の新規性指標との比較

研究チームは、KED上位10件を2つの新規性指標と比較しました。

  • 再結合の新規性(Novelty in Recombination, NR): 特許のIPCペアのうち、出願年より前に現れたことのないペアが1つでもあれば1、なければ0です。
  • 技術知識の源泉の新規性(Novelty in Technological knowledge Origins, NTO): 引用する特許のIPCと引用された特許のIPCを組み合わせたペアのうち、新しいペアが1つでもあれば1、なければ0です。この研究ではIPCを末尾の桁まで使って測定しました。

上位10件はすべて、先行特許を1件だけ引用していました。上位10件すべてでNTOが1でした。NRは10件のうち6件が1でした。残りの4件(1位、3位、5位、7位)はNRが0でした。順位別の値は、論文の表5で確認できます。

代表的な事例は2件です。1位の特許(トランクインターフェース自動復旧装置および方法)は、KEDが1.2018で最大でした。この特許は、引用ペア6つがすべて新しい組み合わせでした。2位の特許は、A61B-005/053とA61N-001/05というペアを持っていました。出願年である2010年より前には、このペアは現れたことがありませんでした。

まとめると、KED上位の特許はNTOとはすべて一致しました。NRでは6件が1でしたが、KEDが最大の1位の特許を含む4件は0でした。研究チームは、上位特許の大半が2つの指標で高く評価されたと記述しています。研究チームは、2つの指標は新しいペアがあるかどうかしか教えてくれないと指摘しています。KEDはそれに技術要素間の距離を加えて、関係がどれだけ新しいかという程度まで教えてくれます。

内容分析による確認

研究チームは、上位特許とその先行特許の内容も直接読みました。

  • 2位の特許(神経刺激器用刺激電極のインピーダンス測定装置)は、電極両端の電圧差で電極ごとにインピーダンスを測定します。先行特許は、筋組織を電気で刺激する装置でした。この特許は、神経や筋肉に触れる刺激電極の電気化学的特性を分析する点が異なっていました。
  • 1位の特許は、予備インターフェースを設けて復旧時間を短縮し、接続の信頼性を高めました。先行特許は、トランクインターフェースの物理的な伝送エラーを解決できていませんでした。

KEDが低い特許も併せて調べました。これらの特許は、引用された特許と似た、あるいは同じ問題を扱っており、技術要素や内容に明確な違いを見つけにくいものでした。

他の特許指標との関係

研究チームは、KEDを従属変数として回帰分析を行いました。モデルは4つです。

  • モデル1: 引用情報に由来する変数を3つ投入しました。
  • モデル2: ステークホルダー変数を3つ追加しました。
  • モデル3: 可能な変数をすべて投入しました。
  • モデル4: ステップワイズ選択で、有意でない従属項の保護範囲を除きました。

分散拡大係数(Variance Inflation Factor, VIF)はすべて5.00未満で、多重共線性の問題はありませんでした。モデル4でKEDと負の関係を示した変数は次のとおりです。

  • 特許引用数
  • 発明者数
  • 出願人数
  • 商業的範囲

正の関係を示した変数は次のとおりです。

  • 非特許文献の引用
  • 技術サイクル
  • 代理人数
  • 独立項の保護範囲

これらの変数は、モデル4でほとんどがp<0.01の水準で有意でした。非特許文献の引用と出願人数は、p<0.05の水準でのみ有意でした。係数はいずれも小さいものでした。変数別の係数は、論文の表7で確認できます。

解釈は次のとおりです。

  • 特許文献を多く引用した特許ほど、KEDが低くなります。研究チームは、遠い探索に使える先行特許はもともと少なく、引用が増えるほど平均距離が下がりうると見ています。
  • 非特許文献の引用と技術サイクルは、KEDと正の関係にあります。KEDが大きい特許は、科学文献とより多く結びつく傾向があります。
  • 技術サイクルは、引用した先行特許の年齢の中央値です。研究チームは、技術サイクルが技術ライフサイクルの成長期から成熟期に進むにつれて短くなる点を挙げ、同じ段階でKEDが大きい特許が増えうると見ています。
  • KEDが大きい特許は、発明者と出願人が少なく、代理人が多い傾向があります。
  • 独立項の保護範囲は正の関係です。KEDが大きい特許は、独立項の数が多い傾向があります。論文は、請求項が多い特許は保護範囲が広いという先行研究を挙げて、これを保護範囲が広いという意味に解釈しました。効果の大きさは小さいものです。独立項の保護範囲の係数は、モデル3で0.0019、モデル4で0.0017です。
  • 商業的範囲は負の関係です。研究チームは、KEDが大きい特許は複数の国よりも1つの特許庁にだけ登録される傾向があると解釈しています。

審査期間の係数は0に近い値でした。モデル4の決定係数(R²)は0.0124でした。これらの指標がKEDの変動のごく小さな部分しか説明しないという意味です。関係は有意ですが、大きさは小さいと読む必要があります。

意義と限界

何が変わるのか

  • 知識探索距離を、組織や地域ではなく特許1件単位で計算しました。
  • 引用関係で知識基盤を定義し、所有者や地域の境界なしにすべての特許に使えるようにしました。
  • IPCを末尾の桁まで使い、ネットワーク埋め込みでコード間の距離を数値で表現しました。
  • 新しい組み合わせがあるかどうかを超えて、関係がどれだけ新しいかという程度を求めました。
  • KEDと、保護範囲、先行知識、特許価値に関連する指標との間の有意な関係を確認しました。

実務者にとっての有用性

研究チームは、この指標が企業の特許ポートフォリオと知識探索活動を点検する新しい指標になると見ています。分類コードに基づくため、特許庁にかかわらず使えます。手順が体系的で専門家の関与が少ないため、他の分析環境でも再計算できます。

R&Dマネージャーには、探索の程度を数値で確認する手段が生まれます。参考までに、活用型イノベーションは既存の方法を改善する方向であり、探索型イノベーションは新しい機会を探す方向です。自社特許のKEDを集めれば、組織の探索傾向を分析できます。筆者はこれに加えて、KEDが際立って高い特許を、内容を別途読んでみる候補とすることを提案します。論文はこれを、学術研究で距離が大きい特許を深く調査できるという示唆として示しました。

研究者にとっての有用性

  • 特許単位のKEDを集めて、企業、組織、地域の探索傾向を分析できます。
  • 被引用数、特許寿命、技術融合の分析に、KEDを変数として投入できます。
  • テキスト類似度指標と併せて、技術的関連の観点からの新規性指標として使えます。

論文が明らかにした限界

論文が自ら明らかにした限界は4つです。

  • 特許ごとに知識基盤を定める絶対的な規則はありません。継続出願やファミリー情報で、先行特許の範囲を広げることができます。
  • 引用関係だけで知識基盤を定義しました。出願人や科学文献の観点に広げることができます。
  • KEDが特許の価値や品質に与える影響には、事後分析が必要です。被引用数は時間とともに蓄積されるため、集計方法を改善する必要があります。
  • 拒絶特許と登録特許、消滅特許と長く維持された特許を比較して、新規性と寿命の観点の分析が必要です。

研究チームは、今後の課題として3つを挙げています。技術エコシステムネットワークに適した埋め込み手法の開発、書誌情報とテキスト情報を併用する特許の表現、非特許文献との内容比較です。

筆者が考える適用条件

以下は論文に書かれた内容ではなく、筆者が実務への適用を念頭に置いて付け加える条件です。

  • 引用が少ない特許は、KEDが1、2件に大きく左右されます。上位10件がすべて引用1件だったので、引用数も併記して解釈するほうが安全です。
  • 回帰の説明力が低いため、KEDだけで特許の価値を判断しません。内容の検討と併せて使います。
  • 埋め込みは、学習した特許の範囲によって値が変わります。期間や特許庁が異なる結果を比較するときは、同じ埋め込みを使います。
  • 事例はKIPOのAI特許です。他の技術分野では、平均と分布を新たに確認してから基準を定めます。

すぐに試せること

  • 自社の登録特許のうち1つの技術分野を決めて、特許ごとにIPCコードと引用した先行特許のリストを整理します。論文の1段階目と同じ準備です。
  • 先行特許を1つ決めて、引用特許とIPCコードがどれだけ重なるかを表で比較します。重なるコードが少ない引用ペアに印を付けておくと、検討する候補を絞り込む際の参考になります。この方法は論文の方法ではなく、筆者が提案する大まかな事前選別です。埋め込みは共通の隣接ノードのような間接的な関連も反映するため、重なるコードが少なくてもKEDが小さいことがあります。
  • 埋め込みまで計算したら、KED上位の特許と下位の特許を数件ずつ選んで、先行特許と内容を比較しながら読みます。論文が結果を確認した方式と同じです。

ビジネスインテリジェンスラボは、特許データで技術と組織を読み解く方法を、このブログで引き続き紹介していきます。

キーワード

関連記事