外れ値検出で台頭する事業領域を見つける方法

商標に記載された商品・サービス名を言語モデルでベクトルに変換し、LOFで新規性を測れば、浮上しつつある事業領域を事前に見つけられるだろうか。2022年の論文の4段階の手法と結果、限界を整理する。

韓国語の原文から翻訳しました。 韓国語の原文

競合他社が次にどのような商品やサービスを投入するのかを知りたい企画担当者は、たいてい専門家の意見に頼ります。製品、企業、顧客の関係が複雑になり、製品寿命が短くなるにつれて、専門家中心の分析にかかる時間と労力が大きくなりました。特許やソーシャルメディアを分析する方法もあります。ただし、結果がキーワードの集まりとして出てくるため、その集まりを実際の事業として解釈するのに、あらためて多くの労力がかかります。

そこで、商標に書かれた商品・サービス名を言語モデルでベクトルに変換し、他の事業から離れた点を外れ値検出で見つければ、新しい事業機会を事前に把握できるのでしょうか。

この問いに答えた論文を一本読んでみます。

  • タイトル: Identification of emerging business areas for business opportunity analysis: An approach based on language model and local outlier factor
  • 学術誌: Computers in Industry
  • 年: 2022
  • DOI: 10.1016/j.compind.2022.103677

研究チームは、言語モデルと局所外れ値因子(Local Outlier Factor, LOF)を組み合わせる手法を提案しました。言語モデルは、意味の近い商品・サービスをまとめて事業領域を定義します。LOFは、各事業領域がどれだけ新しいかを数値で測ります。最後の段階では、新しい領域を最新性と可視性の基準で配置した事業機会マップを作ります。

この記事全体で使う用語は次のとおりです。

  • 指定商品・役務(designated goods and services, G&S)の文: 商標を出願する際に、その商標を付ける商品とサービスを記載した文です。
  • 事業項目(business item): G&Sの文を区切り文字で分割した、商品・サービス名の一つ一つです。
  • 事業領域(business area): 意味の近い事業項目をまとめたクラスタです。
  • 新規性(novelty): 事業項目が既存の商品・サービスと表現のしかたでどれだけ異なるかを表します。
  • 最新性(recency)と可視性(visibility): 最新性は事業領域がどれだけ最近現れたか、可視性は事業領域がどれだけ頻繁に見られるかを表します。
  • 探索範囲(business landscape): 事業機会を探す対象となる資料の範囲です。

動機: 事業領域がどれだけ新しいかを数値で測った研究は少なかった

なぜ新興事業領域を早く見つける必要があるのか

論文が挙げる理由は次のとおりです。

  • 事業環境の不確実性と変動性が高まり、事業機会の発見がより重要になりました。
  • 新興事業領域は、潜在的な事業機会の初期指標です。新しい事業戦略を立て、近い将来の事業環境を見通すうえで鍵になります。
  • 専門家の意見だけに頼る従来の分析は、時間と労力が多くかかります。そのため、管理者や実務者はデータ中心のアプローチをますます多く使うようになっています。
  • 成功したイノベーションは、高い新規性と深く関係します。したがって、新しい商品・サービスからなる領域から探すのが合理的です。

研究チームが商標をデータとして選んだ理由もここにあります。企業は、進行中の事業の出所を示すために商標を出願します。まもなく始める新しい事業領域を知らせ、先んじて押さえる目的でも出願します。商標は商品とサービスを標準化された形式で記載するため、計算手法を適用するのにも適しています。

既存研究が扱っていない部分

既存研究が事業機会を探す際に使った資料は、四種類です。

  • 特許: 技術開発や技術事業化の段階の機会を示します。
  • ウェブニュースとソーシャルメディア: 将来に関する内容や、発売後の顧客の反応を扱います。
  • スタートアップの事業計画: 初期の事業アイデアの手がかりになります。

多くの研究は三つの段階を踏みます。探索範囲を定め、事業領域を分け、機会を評価します。論文は、各段階で次のような欠落を指摘しました。

  • 探索範囲: 特定の技術や製品に関する資料を研究者が選んで集めるため、範囲の境界が明確ではありません。検索式を精緻に作っても、現場で同じ結果を再び得るのは困難です。
  • 事業領域の定義: 領域をいくつに、どのように分けるかを定めた基準がありません。同じ範囲を分析しても、研究者の手法や判断によって領域の定義が異なります。潜在ディリクレ配分法(Latent Dirichlet Allocation, LDA)のようなトピックモデリングはキーワードの集まりを出力しますが、この集まりを実際の事業として解釈するのは困難です。
  • 機会の評価: 成長、人気、可視性は分析されてきました。一方、事業領域の新規性を数値で表す方法はほとんど扱われてきませんでした。
  • 資料の時点: 既存の資料は、技術開発段階か、発売後の市場段階に近いものです。事業運営段階に近い商標データは使われてきませんでした。

手法: 商標内の商品名をベクトルに変換し、密集から外れた領域をLOFで見つける

手法は四つの段階からなります。第1段階で探索範囲を定め、商標データを集めて整えます。第2段階でG&Sの文を事業項目に分け、言語モデルでベクトルを作り、クラスタにまとめて事業領域を定義します。第3段階で事業領域ごとにLOFで新規性を計算し、第4段階で最新性と可視性を加えて事業機会マップを作ります。この記事も、論文と同じ四つの段階に分けて説明します。

図 1. 商標のG&Sの文で事業領域を定義し、LOFと二つの指標で機会を選ぶ4段階である。

事例とデータ

データ源は、米国特許商標庁(United States Patent and Trademark Office, USPTO)のデータベースです。USPTOは1870年から商標を管理してきました。法的事件、G&Sの文、分類コードなどの詳細情報を、電子形式で検索できます。研究チームは三つの情報を使いました。

  • ニース分類(Nice Classification, NCL)コード: 商品とサービスを45の類に分けるもので、探索範囲を絞り込むのに使いました。
  • 出願時点: 事業運営の時期を把握するのに使いました。
  • G&Sの文: 具体的な事業項目を抽出して事業領域を定義するのに使いました。

事例は、科学・研究用の機器と装置を扱うNCL 09類です。この類には技術集約的な製品が多く含まれます。仮想現実機器、リチウムイオン電池、Bluetoothスマート機器、人工知能の応用、暗号通貨関連の商標が着実に増えています。2019年の商標統計報告書でも、NCL 09は出願が着実に増えている範囲として示されました。

分析対象は、NCL 09類で出願された商標134,898件とそのG&Sの文です。分析期間は、分析時点で利用できた最新のデータである2017年初めから2018年末までです。

第1段階: データ収集と前処理

  • 入力: USPTOの商標生データ
  • 処理: 探索範囲を定めて商標を集め、構文解析して保存
  • 出力: 構造化項目と非構造化項目の両方を含む商標データベース
  1. 探索範囲を定めます。特定のキーワードを含む商標に絞って狭く定めることも、NCLコード一つに該当する商標全体として広く定めることもできます。
  2. 定めた基準でUSPTOから商標を集めます。
  3. 生データを構文解析してデータベースに保存します。NCLコードと出願番号は構造化項目として、商標名とG&Sの文は非構造化項目として保存します。

範囲を先に定めるのには理由があります。新規性や新興性は、他の領域と比較して初めて決まる相対的な概念だからです。事例ではNCL 09類全体を範囲とし、その結果134,898件を集めました。

第2段階: 事業項目の抽出と事業領域の定義

  • 入力: 商標ごとに記載されたG&Sの文
  • 処理: 文の整形、項目抽出、言語モデルによるベクトル化、クラスタリング
  • 出力: 意味の近い事業項目からなる事業領域

USPTOは、商品・サービスの一般的な名称を収めた商標識別マニュアル(Trademark Identification Manual)を提供しています。ところが、出願人の相当数は、自社の商品を差別化するために新しい表現を使います。表現の異なる事業項目が多すぎて人が一つずつ分析することはできないため、次の四つの下位段階を踏みます。

  1. 文の整形: G&Sの文に混ざった法的手続きの表現を削除します。たとえば「(Based on 44(e) Priority Application) Smart phones; Television receivers; Monitors for computers; Commercial monitors」から、括弧内の優先権情報を削除します。
  2. 項目抽出: 区切り文字で文を分割します。上の文は、smart phones、television receiver、monitors for computers、commercial monitorsの四項目になります。
  3. ベクトル表現: 事前学習済み言語モデルで、各項目をn次元ベクトルに変換します。意味や表現が近い項目は、ベクトル空間で近くに置かれます。
  4. クラスタリング: k-means法(k-means)などの教師なしクラスタリング手法で、似た項目をまとめます。各クラスタが事業領域になります。領域の意味は、クラスタの中心点に近い項目を見て解釈します。

Bag-of-Words(BoW)方式を使わなかった理由もあります。BoWは単語一つを一次元とするため、固有の単語が数千を超えると次元の呪い(次元が多すぎて計算が難しくなる問題)に陥ります。単語の順序や文脈も捨てるため、同じ単語が異なる並びで現れる表現を区別しにくくなります。

事例では、G&Sの文から事業項目254,063個を抽出しました。研究チームは二つの基準で項目を絞り込みました。

  • 文書頻度(Document Frequency, DF)が1の項目、つまり商標1件にしか出てこない項目を削除しました。
  • 商標識別マニュアルにない項目だけを残しました。マニュアルにない項目ほど、差別化された商品・サービスである可能性が高いためです。

残った項目は73,048個です。研究チームはRoBERTaモデルでこれらの項目を1,024次元のベクトルに変換し、k-meansでまとめました。領域の数は、イナーシャ(inertia)の値を参考に、専門家が判断して決めました。領域の数によって事業機会の具体性が変わるためです。

第3段階: 事業領域の新規性評価

  • 入力: 事業領域ごとに求めた中心ベクトル
  • 処理: 中心ベクトルに対するLOFの計算
  • 出力: 事業領域ごとの新規性の値

分析単位は事業領域です。LOFには、各領域を構成する項目ベクトルから計算した中心値を入力します。LOFは、周囲の近傍と比較して、対象がどれだけ孤立しているかを計算します。計算の手順は次のとおりです。

  1. k-距離: 対象pからk番目に近い近傍までのユークリッド距離を求めます。
  2. 到達距離: pと近傍oの間の到達距離は、「oのk-距離」と「pとoの実際の距離」のうち大きいほうの値です。
  3. 局所到達密度(local reachability density, lrd): pから近傍までの到達距離が平均して短いほど大きくなります。
  4. LOF: 近傍の平均密度をpの密度で割ります。

LOFの値が1に近ければ、pの密度は近傍と同程度なので、正常な点です。1より大きければ、pは近傍より疎な場所にあるため、外れ値である可能性が高くなります。論文は三つの場合を挙げて説明しています。

  • pが密な場所の真ん中にあれば、pと近傍の密度がともに大きいので、LOFは小さくなります。
  • pが疎な場所の真ん中にあれば、両方とも密度が小さいので、LOFは小さくなります。
  • pは疎な場所にあるのに、近傍が密なクラスタをなしていれば、LOFは大きくなります。この場合が外れ値です。

例を一つ見ます。論文の表2で、「モノポッド」領域の新規性の値は1.366です。論文は、新規性の値がLOFに基づくとだけ説明しています。他の領域の値は、原論文の表2で確認できます。

距離ベースのクラスタリングではなく密度を見るのにも理由があります。商品名は、埋め込み空間で距離が近くても、単語一つが変わるだけで大きな技術的進歩を表すことがあります。そのため、距離だけでは新しさを判断しにくいのです。

近傍数kは専門家が決めます。事例では、専門家の意見に従って近傍数を20としました。その結果、事業領域103個が新規領域として得られました。

第4段階: 事業機会マップの作成

  • 入力: 新規事業領域と、その領域に属する商標の出願時点・頻度
  • 処理: 最新性と可視性を計算し、2次元平面に配置
  • 出力: 四つの領域に分かれた事業機会マップ

新しい領域であっても、急速に成長しているかを併せて見ることで、機会の可能性が高まります。そのため研究チームは、最新性と可視性を加えました。

  1. 最新性を計算します。最新性は、事業領域が商標にどれだけ最近現れたかを表し、出現時点で測ります。
  2. 可視性を計算します。可視性は、事業領域が探索範囲の中でどれだけ目立つかを表し、頻度で測ります。
  3. マップに配置します。新規領域一つが点一つです。点の大きさは新規性、横座標は最新性、縦座標は可視性です。
  4. 正規化した最新性と可視性の平均値を境界として、四つの領域に分けます。

四つの領域の意味は次のとおりです。

  • 新興領域(最新性が高く、可視性が高い): 最近現れたにもかかわらず、すでに流れを主導している領域で、最も価値のある機会です。
  • 新興後領域(最新性が低く、可視性が高い): 影響力は大きいものの、飽和している可能性があります。ニッチ市場の機会を探すには、詳しい調査が必要です。
  • 周辺領域(最新性が低く、可視性が低い): 長く観察されており、比重も小さい領域です。大きなイノベーションがなければ、機会から除外できます。
  • 新興前領域(最新性が高く、可視性が低い): 新しく現れたものの、まだ件数が少ないため、継続して観察する必要があります。

事例では、「スマートウォッチ(745)」領域が新興領域に入りました。領域ごとの新規性・最新性・可視性の値は論文の表3にまとまっているので、原論文をご覧ください。論文には平均の境界値そのものは出てきません。ただし、新興領域に分類されたことから、二つの座標がともに平均の境界より高かったと筆者は推論します。

バリエーションとシナリオ

設定や分析の目的によって、結果が変わります。

  • 近傍数k: 新しい領域を広く探索する企業は、kを大きくします。そうすると、隣接領域をより多く考慮することになり、マクロな結果が得られます。漸進的イノベーションに関心のある企業は、範囲を隣接領域に絞ります。
  • 事業領域の数: 領域の数は、事業機会がどれだけ具体的に得られるかに直接影響します。
  • 自社領域の除外: すでに自社が運営している領域は、マップから外します。専門家が特定の領域を分析から外す場合は、LOFと指標を再計算して配置し直す必要があります。
  • 時点: マップは分析時点の断面です。実務で使うには、データと結果を継続的に更新する必要があります。
  • 距離と外れ値検出の手法: データに応じて、別の距離尺度や外れ値検出手法に置き換えることができます。

結果: 新規領域103個のうち16個が新興領域であり、この領域では出願人数が際立って多かった

図 2. 新規事業領域103個のうち新興領域は16個で、その平均出願人数は新興前領域より多かった。

新規事業領域103個

LOFの計算により、新規領域103個が得られました。論文が例として挙げた領域は次のとおりです。

  • モノポッド
  • Bluetooth通信機器
  • 装着型ロボットスーツ(robot exoskeleton suits)
  • リチウムイオン電池

二つの領域だけを詳しく見ると、次のとおりです。モノポッド領域は、スマートフォンやカメラ用の自撮り棒と、携帯用モノポッドからなります。リチウムイオン電池領域は、リチウムイオンポリマー電池からなります。両領域の新規性の値は、論文の表2にあります。

新規領域とは、埋め込み空間でこの領域が他の領域と表現上離れているという意味です。自撮り棒やBluetoothスピーカーのように、今ではありふれて見える商品が含まれているのには理由があります。新規性は、同じ探索範囲内の他の領域と比較した相対値だからです。しかも、分析データは2017年初めから2018年末までの商標です。したがって、この結果は、その時点のNCL 09類の中で相対的に新しかったという意味で読む必要があります。

事業機会マップの四つの領域

研究チームは、新規領域103個ごとに商標を探し、最新性と可視性を計算しました。四つの領域に入った領域数は下のとおりで、合計は103個です(16+33+40+14=103)。

マップ領域領域数次の行動
新興16先行企業・競合の調査
新興前33継続的に観察
周辺40大部分は分析から除外
新興後14飽和の有無を点検

出典: 論文4.2節本文

新興領域では、次の領域が、機会の可能性が高い新規領域として挙げられました。

  • 暗号化ソフトウェア(687)
  • スマートウォッチ(745)
  • 人工知能ソフトウェア(662)

新興前領域には、次の領域が入りました。これらの領域は可視性のシグナルが弱く、継続して観察する必要があります。

  • リチウムイオン電池(719)
  • 装着型ロボットスーツ(948)
  • 音声制御スマートホーム機器(991)
  • セルフレジ(988)

リチウムイオン電池は、新規領域として挙げられたものの、新興前領域に置かれました。マップでは、新規性が座標ではなく点の大きさとしてのみ使われるためです。

定量的検証: 新興領域と新興前領域の出願人数の比較

研究チームは、新興領域と新興前領域の出願人数を比較しました。ある領域で活動する主体(コミュニティ)が多いほど新興性が高いとする先行研究に従ったものです。新興前領域を比較群とした理由は、この領域が今後新興領域に育つ可能性が最も高い一方で、まだ新興性を備えていないためです。検定は、標本サイズと分散が互いに異なる二群の両側t検定です。帰無仮説は、二群の平均が等しいというものです。

結果は論文の表4にあります。新興領域16個の平均出願人数は、新興前領域33個より大きく高くなりました。新興領域の中でも、領域ごとの出願人数のばらつきは大きいものでした。群ごとの平均と標準偏差は、原論文の表4をご覧ください。

検定統計量はt=5.11です。tは、二つの平均の差を標準誤差で割った値です。論文はpを0.000と記しました。四捨五入した値が0と表示されるほど小さいという意味です。

論文の解釈と筆者の評価は、区別して読む必要があります。研究チームは、この結果が、提案手法が新興領域を見つけ出すという主張をおおむね裏づけると解釈しました。ただし、この比較は独立した検証ではありません。二つの群は、最初から可視性、つまり商標の頻度を基準に分けられていました。商標が多い領域は、出願人も多くなりやすいものです。したがって、この比較は、可視性で分けた群の間の差を改めて確認したものに近く、手法の結果と整合的な傾向が現れたという程度に読むのが適切です。

定性的検証: その後の企業活動の追跡

研究チームは、数値の比較だけでは手法の品質を証明できないと考えました。そこで、新興領域にいた主要企業がその後どのように活動したかを追跡しました。この追跡は、手法が企業活動を予測したという証拠ではありません。分析後の企業活動が結果と食い違わないかを、事後的に確認したものです。

  • 太陽光発電パネル領域も、新規性、最新性、可視性の三つの指標すべてで新興領域として得られました。先の三つの領域は、論文がマップの結果から代表として挙げた例であり、太陽光パネルは、検証部分で別に挙げられた新興領域の例です。論文は、この領域と関わりの深いハンファQセルズが、M&Aを続けながら太陽光事業を拡大し、既存のパネルより効率を高めた技術を発売したと記述しています。
  • 暗号化ソフトウェア領域では、HashiCorpが、中央での鍵管理により機密データを保護する暗号化ソリューションの主要企業になりました。論文は、この領域に早くから関与していたTencentとTessianが、現在は顧客にデータセキュリティ・暗号化事業を提供していると記述しています。
  • 論文は、新興前領域のリチウムイオン電池、スマートホーム機器、セルフレジが、その後多くの製品とサービスに欠かせない部分になったと記述しています。論文によると、リチウムイオン電池市場は、電気自動車の普及とスマートフォン・ウェアラブルの需要で拡大しました。スマートホーム機器市場は、IoT機器の増加とともに急速に成長しました。セルフレジは、キオスク形態で、非対面の消費需要とともに拡大しました。

新興性はたいてい後になって判断されるため、どれだけ新興的かを決めることは難しく、主観が入りやすいものです。

意義と限界

何が変わるのか

  • データ: 事業機会発見の分野で、商標のG&Sの文にテキストマイニングを適用した初めての試みです。
  • 結果の単位: 分析結果が、キーワードレベルから事業項目、つまり商品・サービスレベルへと具体化されました。
  • 指標: 既存研究がほとんど扱ってこなかった事業領域の新規性を、LOFで数値化しました。
  • 時点: 技術開発や市場予測の段階にとどまっていた分析を、事業運営の初期段階、つまり商標出願時点に近いところへ移しました。
  • 構造: 一度使って終わりだった既存の手法を、専門家が段階ごとに結果を調整し解釈する、対話型の構造に変えました。
  • モデル: 最新の事前学習済み言語モデルを事業機会の識別に初めて適用した研究の一つです。

実務者にとっての有用性

論文は、広い範囲で事業機会を探索できるため、分析にかかる時間と労力を大きく減らせると期待しています。ただし、実際の削減効果は測定していません。領域数と近傍数の決定、事業項目の選定、領域の解釈には、依然として専門家が関与します。

結果がキーワードの集まりではなく、商品・サービスのリストとして出てくるため、意思決定にそのまま使いやすくなっています。手順が体系的なので、自動化ソフトウェアとして作ることができます。データ分析の技術が不足している現場の専門家でも使えるという意味です。

探索範囲を定めておけば、新しい商標データを追加することも簡単です。新しい商標のG&Sの文を探し、探索範囲を引き直すだけで済みます。既存の手法と併用することもできます。たとえば、新興領域を見つけたあと、ソーシャルメディア分析で製品・市場・競合を調べれば、機会をより具体化できます。ただし、結果が実際の機会であるかどうかの判断は、依然として専門家と管理者の役割です。

研究者にとっての有用性

  • 技術予測、未来シグナルの検出、競合分析にも、この手法を使えます。
  • 特許、ニュース、科学論文などの他のデータ源に、いくつかの手法を変えて適用できます。
  • 特許と商標を結びつけたデータベースを使えば、新興領域の基盤技術と競合他社の技術を併せて把握できます。
  • 論文は、データに応じて距離尺度と外れ値検出手法を切り替えて使う必要があると述べています。

論文が示す限界

論文自身が示す限界は五つあります。

  • 新興の可能性がある領域を見つけるだけで、その領域が実際に台頭したかどうかについての確定的な答えは与えられません。実際に新興かどうかを示す遅行指標と併用することで、価値が高まります。
  • 見つけた機会を、市場、技術、顧客のデータでさらに具体化し、磨き上げる必要があります。
  • データ件数や埋め込みの次元が増えると、計算複雑度が大きくなります。最新の手法を導入して改善する余地もあります。
  • 事業項目の選定や領域の解釈といった作業は、まだ専門家の判断に委ねられており、完全には自動化されていません。
  • 事例研究が一件だけで、見つけた機会がまだ立証されていないため、性能と有用性を十分に確認できていません。

筆者が考える適用条件

以下は論文に書かれた内容ではなく、筆者が実務への適用を念頭に置いて付け加える条件です。

  • 自社が実際に参入できる商品の範囲と、探索範囲が合っている必要があります。範囲が広いと、結果の大部分が自社と無関係な領域になります。
  • 事業領域の数と近傍数をいくつか変えて実行し、新興領域のリストがどれだけ維持されるかを確認する必要があります。リストが大きく変わるなら、その結果を根拠に意思決定するのは難しくなります。
  • 商標の出願が少ない業種では、領域ごとの商標件数が少なく、可視性の値が不安定になることがあります。
  • 新興領域として出た結果を、市場データや顧客データで確認する担当者と手順を、あらかじめ決めておく必要があります。

すぐに試せること

  • 自社の業種に該当するNCLの類を一つ決めます。その類の最近の商標のG&Sの文を集め、括弧内の手続き表現を削除し、セミコロンで分割します。続いて、文書頻度が1の項目と、商標識別マニュアルにある項目を除くと、差別化された商品表現がどれだけ残るかを確認できます。
  • 残った項目を事前学習済み言語モデルでベクトルに変換し、k-meansでまとめます。クラスタの中心点にLOFを計算し、1より際立って大きい領域から見ていきます。
  • 新規領域ごとに、商標の出願時点と頻度から最新性と可視性を求めます。二つの値の平均を境界として四つの領域に分け、新興領域に入った項目を、自社の企画担当者と一緒に検討します。

キーワード

関連記事