急増するAI論文を言語モデルで文献レビューする

言語モデルでAI論文をクラスタリングし、浮上しつつあるトピックを数値で捉えられるだろうか。半期ごとの言語モデル、浮上性の4指標、トピック進化マップを用いてアテンション論文を分析した研究を読む。

韓国語の原文から翻訳しました。 韓国語の原文

アテンション手法だけを見ても、関連論文の累積件数は2019年上半期の458件から2024年上半期の18,870件へと増えました。論文は、AI分野は出版量が多く、新しい概念や用語が次々に現れると指摘しています。そのため、専門家中心の文献レビューでは、研究の流れをタイムリーに、かつ漏れなく把握することは難しいとみています。

そこで次のような疑問が生まれます。言語モデルでAI論文を自動的にまとめて主題を見つけ、どの主題が浮上中なのかまで数値で示せるのでしょうか。

この問いに答えた論文を一編読んでみます。

  • タイトル: Harnessing language models for computational literature review of emerging AI topics
  • 学術誌: Information Processing & Management
  • 年: 2025
  • DOI: 10.1016/j.ipm.2025.104245

論文は計算文献レビュー(Computational Literature Review, CLR)の手法を提案しています。CLRとは、コンピュータで文献を体系的に収集・分析・統合するレビュー方式です。提案手法は、AI論文のデータベースであるPapersWithCodeから論文を集めたうえで、次の3つを行います。

  • 時点ごとにAI論文でさらに学習させた言語モデルを用いて、論文をまとめ、主題(トピック)を見つける。
  • トピックごとに、浮上の度合いを4つの指標で計算する。
  • あるトピックが前後の時点のどのトピックとつながるかを、マップで示す。

この記事全体で使う用語は次のとおりです。

  • 事前学習言語モデル(Pre-trained Language Model, PLM): 大量の文章で事前に学習し、文の意味を数値ベクトルに変換するモデルです。論文は、科学論文用のモデルであるSciBERTをAI論文でさらに学習させ、このモデルをAI-SciBERTと呼んでいます。
  • 浮上性(emergingness): あるトピックがその時点で浮上している度合いです。論文は、新規性(novelty)、成長(growth)、凝集(coherence)、不確実性(uncertainty)の4つの指標で計算します。
  • トピック進化マップ(topic evolution map): あるトピックを、前の時点の先行トピック、次の時点の後続トピックとつなげて示すマップです。

動機: AI研究の流れは人の手だけでは追いにくい

なぜAI研究の流れを読むことが重要か

論文は、AI研究の流れを読む能力が、研究者だけでなく産業の実務者や政策担当者にも必要だとみています。論文が挙げた理由は次のとおりです。

  • AIは実用の潜在力が大きいです。産業、物理科学、公共行政、教育、医療、経営で成功事例が増えています。
  • 最新のAI研究をすばやく把握し理解する能力は、競争優位の源泉であり、エビデンスに基づく戦略立案の土台とされています。
  • 分析は難しいです。出版量が多く、分野が複数の学問領域にまたがり、新しい概念や用語が次々に出てきます。

論文は、こうした困難が、専門家中心の従来の文献レビューが対応できる範囲をしばしば超えると指摘しています。そのため、大量の文章を体系的に処理して隠れたパターンを見つけるCLRが、必須のツールになりつつあるとみています。

既存研究が扱っていない部分

先行研究は、Web of ScienceやScopusなどの学術データベースからAI文献を集めました。そして、潜在ディリクレ配分(Latent Dirichlet Allocation, LDA)、非負値行列因子分解、Top2Vec、BERTopicなどのトピックモデリングで、隠れた主題を探しました。たとえばArsenyanとPiepenbrink(2024)は、オペレーションズ・リサーチ・経営・経済分野のAI応用研究7,708件をLDAで分析しました。Guler他(2024)は、AI関連研究6,974件から構造的トピックモデルでトピックを見つけ、ChatGPTの助けを借りて名前を付けました。Agbozo他(2024)は、バスケットボールを中心としたスポーツ分析にAIを適用した研究383件をBERTopicで分析しました。

論文が指摘した空白は3つあります。

  • データ源: 先行研究の多くは、AIが新たに使われる応用分野に集中していました。どのアルゴリズムやモデルを使うかは、あまり扱われていません。アテンションや活性化関数のような特定の手法を分析しようとすると、既存の検索ツールは非効率です。AIの成果は学術誌よりも学会発表論文として先に出てきますが、既存のツールは主に学術誌論文を索引しています。
  • 方法論: 確率的トピックモデルは単語が共起するパターンに依拠するため、単語一つひとつの意味や文脈を十分にとらえられません。BERTのようなPLMを用いた研究もありますが、AI分野の用語に合わせて調整せずにそのまま使うと、効率が落ちます。分析の前に一度だけ学習した固定モデルは、急速に変わるAIの知識を反映しにくいです。
  • 未来志向の分析: 先行研究の大部分は過去の変化を振り返る分析にとどまり、専門家が結果を解釈して未来を展望していました。今後分野を牽引するトピックを定量的に示す科学的な方法が必要です。

この空白から、論文の2つのリサーチクエスチョンが導かれます。第一に、どのAIトピックが浮上中で、その特徴は何か。第二に、目標トピックが一つ与えられたとき、どのような進化の経路をたどったか。

方法: 時点別の言語モデルでトピックを見つけ、浮上性を付け、経路をつなぐ

論文は方法を3段階で説明しています。第一に、AI特化のPLMと教師なしクラスタリングでAI研究の地形(AI landscape)を作ります。第二に、定量指標でトピックの浮上性を評価します。第三に、対話型のトピック進化マップを作ります。この記事では、論文の第一段階に含まれる言語モデルの学習とクラスタリングを切り分けて、4段階で説明します。この記事の1・2段階が論文の第一段階にあたり、3段階と4段階が論文の第二・第三段階にあたります。

図 1. 時点別の言語モデルでトピックを見つけ、4つの指標で浮上性を付け、進化マップでトピックをつなぐ。

事例とデータ

データ源はPapersWithCodeです。論文の説明によると、PapersWithCodeは2018年に始まり、技術運営はMeta AIが担い、内容は世界中の研究者と開発者が共同で蓄積しています。これは論文執筆時点の状況ですので、現在利用する際は提供方法を改めて確認する必要があります。

論文がこのデータ源を選んだ理由は3つです。

  • 論文をソースコードや公開の学会情報と結び付け、信頼性、透明性、再現性を与えています。
  • コミュニティが管理するタグ(データセット、手法、タスク)があり、精密に検索・比較できます。
  • 大量のデータセットやAPIの形で入手でき、継続的に更新しながら使うのに適しています。

論文一件ごとに、手法(Methods)、データセット、タスクのタグが付けられています。たとえば「Attention Is All You Need」の項目には、学会情報「NeurIPS 2017」、手法タグ「Linear Layer」と「Absolute Position Encodings」、データセットタグ「Penn Treebank」と「WMT 2014」などが付いています。

データの規模は次のとおりです。

  • タイトルや要旨がない論文と英語以外の論文を除き、AI論文506,286件を得ました。
  • このうち2017年下半期から2024年上半期までの論文409,021件をデータセットとして整理しました。
  • このデータセットを、半年単位で累積した部分集合11個に分けました。
  • 事例分析の対象は、手法タグに「Scaled Dot-Product Attention」がある論文18,870件です。

事例としてスケールド・ドット積アテンションを選んだ理由は、現代のAIモデルで基本的な役割を担い、発展が速く、多くの分野に幅広く影響するためです。

1段階: 時点別のAI特化言語モデルを作る

  • 入力: 半年単位で累積したAI論文のタイトルと要旨
  • 処理: SciBERTをAI論文で継続的に事前学習
  • 出力: 時点ごとに保存したAI-SciBERTモデル

処理の手順は次のとおりです。

  1. 論文ごとにタイトルと要旨をつなげ、一つの入力文列にします。
  2. 元のSciBERTモデル(allenai/scibert_scivocab_uncased)から出発し、AI論文で事前学習を続けます。この過程をドメイン適応といいます。
  3. マスク言語モデリング(Masked Language Modeling, MLM)で、トークンの15%を隠して当てさせます。
  4. 次文予測も併せて学習します。隣り合う文は正例のペアとして使い、ペアの50%は別の文書の文に置き換えて負例のペアとして使います。
  5. 半年ごとに累積した論文で学習したモデルを、時点別に保存します。

半年単位でモデルを別々に持つ理由は、時点ごとに変わる表現や言語の流れにモデルを合わせるためです。AIの知識は急速に変わるので、固定モデルよりも時間とともに学習し続けるモデルのほうがよいという判断です。

学習設定は次のとおりです。

  • 学習率2e-5、エポック3回、デバイスあたりバッチサイズ128
  • 重み減衰0.01、ウォームアップ500ステップ、学習率は線形に減らします。
  • チェックポイントは10,000ステップごとに保存し、最大2つだけ残します。ログは100ステップごとに記録します。

2段階: 文書をベクトルに変換しK-meansでトピックを見つける

  • 入力: アテンション論文のテキストと、該当時点のAI-SciBERT
  • 処理: 文書埋め込み、主成分分析、K-meansクラスタリング
  • 出力: 半期ごとのトピック一覧

処理の手順は次のとおりです。

  1. 該当時点のAI-SciBERTで、論文テキストを密ベクトルに変換します。最終層の[CLS]トークンのベクトルを文書埋め込みとして使います。
  2. 計算効率のため、主成分分析で全情報の80%を説明する次元まで削減します。
  3. K-meansクラスタリングで似た論文をまとめます。クラスタ数は、手法タグ数の10%~20%の範囲で試します。
  4. inertia値の曲率が最大となるエルボー点を、最適なクラスタ数とします。
  5. まとまったクラスタを、その時点のAIトピックと定義します。

論文がK-meansを選んだ理由は5つです。

  • ユークリッド距離で動作するため、長さが固定された密な埋め込みによく合います。LDAのように生成分布を仮定しません。
  • 計算が速く、大規模データに容易に拡張できます。次元削減と密度ベースの階層的クラスタリングを経るBERTopicやTop2Vecより軽量です。
  • 分析者がクラスタ数kを直接決められるので、トピックの粒度を目的に合わせられます。
  • 中心点に近い文書やキーワードを取り出して、トピックの核心的な意味を読み取りやすいです。
  • ドメイン適応を経た埋め込みは意味がより一貫しているため、トピックがよりよく分かれます。

事例では、半期ごとのトピック数は29個から111個に増えました。同じ期間の累積文書は、2019年上半期の458件から2024年上半期の18,870件へと約41.2倍(18,870÷458≈41.2)に増えました。

3段階: 4つの指標で浮上性を評価する

  • 入力: トピックごとの文書埋め込みと手法タグ、時点ごとの新規文書数
  • 処理: 新規性、成長、凝集、不確実性を計算し、トピックのタイプを分類
  • 出力: トピックごとの指標値と浮上タイプ

4つの指標は、技術予測の文献をもとに定義しました。指標ごとの前提と計算方法は次のとおりです。

  1. 新規性: 浮上トピックには、新しいパラダイムを告げる新規文書が多いはずだという前提です。文書埋め込みに局所外れ値因子(Local Outlier Factor, LOF)を適用し、トピックごとに平均をとります。
  2. 成長: 浮上トピックは、学界と産業の関心が高まって急速に大きくなるはずだという前提です。現在の時点と前の時点の新規文書数の比率に対数をとります。
  3. 凝集: 浮上トピックは、内容に一定の一貫性と独立性があるはずだという前提です。埋め込み空間における、構成文書とトピック中心との平均距離で定義します。
  4. 不確実性: 浮上トピックは、固まった概念よりも、変化の可能性が大きい革新に近いはずだという前提です。トピック内の手法タグの分布にシャノンエントロピーを適用します。

LOFは、ある点の周囲の密度を近傍の点の密度と比較する、教師なしの外れ値検出法です。LOF値が高い文書は、密度の低い位置にありながら、周囲が密なクラスタに囲まれています。そのため、外れ値、つまり新しい文書である可能性が高いです。近傍数kは、半期ごとの文書数の1%を切り捨てた値としました。文書が増えても検出基準が時点ごとにバランスよく保たれるように、kを文書数に比例して変えたものです。

成長指標は、二つの時点の新規文書数が同じなら0になり、増えれば正、減れば負になります。不確実性は、トピック内で使われる手法が多様なほど高く、手法が標準化されるほど低くなります。たとえば2024年上半期の浮上トピックのうち、ETA-LMの不確実性は3.7542、GBL-TMは3.1622です。ETA-LMの文書で使われる手法タグのほうが、より広く分布しているという意味です。

論文は、被引用数のような影響力指標を使いませんでした。こうした指標は、たいてい遅れて現れる遅行指標だからです。

指標を求めた後は、全時点のトピックを4つの指標で再びクラスタリングし、タイプを分けます。クラスタ数2~10の範囲でK-meansを実行し、エルボー点で最適なクラスタ数を決めました。タイプ別の解釈基準は次のとおりです。

  • 浮上(emerging): 新規性、成長、凝集、不確実性がすべて高いです。
  • 浮上後(post-emerging): 新規性は高いものの成長が緩やかで、凝集が強く、不確実性が低いです。
  • 浮上前(pre-emerging): 新規性は低いものの、成長や不確実性が高いクラスタは、浮上前の潜在力を示している可能性があります。
  • 周辺(marginal): どの指標でも目立ちません。

事例では、周辺317個、浮上前350個、浮上後32個、浮上93個のトピックが得られました。合計は317+350+32+93=792個です。

4段階: トピック進化マップを作る

  • 入力: 時点別のトピックと、トピック間で共有される論文数
  • 処理: 前後の時点のトピックを共有論文でつなぎ、タイプの遷移を解釈
  • 出力: 目標トピックの先行・後続の経路を示す対話型マップ

処理の手順は次のとおりです。

  1. 時点Tの目標トピックと論文を共有する、直前の時点のトピックを先行トピックとします。
  2. 時点T+1で目標トピックと論文を共有するトピックを、後続トピックとします。
  3. 可視化を簡潔にするため、共有論文が二つ以上の接続だけを表示します。
  4. つながったトピックの浮上タイプを併せて読み、技術ライフサイクルのどのあたりにあるかを解釈します。

トピックごとにタイプがあるので、タイプが変わる方向に意味が生まれます。論文が示した解釈は次のとおりです。

  • 浮上前 → 浮上: 技術が萌芽期から成長期に移った可能性があります。
  • 浮上 → 浮上後: 成長のピークを過ぎ、成熟期に入った可能性があります。
  • 周辺 → 浮上前または浮上: あまり扱われていなかった周辺領域の初期の潜在力を反映している可能性があります。
  • 浮上前 → 浮上後: ハイプサイクルを急速に通過した可能性があります。
  • 浮上 → 周辺: 技術が陳腐化していく兆候である可能性があります。

結果: グラフトランスフォーマー、特定言語のモデリング、効率的トランスフォーマーが浮上トピックとして現れた

4タイプの指標平均

第一のリサーチクエスチョンに答えるため、論文は全時点のトピックを4タイプに分け、タイプごとに指標の平均を求めました。論文の表3で目を引く値は次のとおりです。

  • 浮上後タイプは、平均新規性1.1346、平均凝集0.8260で、どちらも4タイプの中で最も大きいです。
  • 平均成長は、浮上タイプが1.3055、浮上前タイプが0.3927です。
  • 平均不確実性は、浮上後タイプが3.1928で、4タイプの中で最も低いです。

論文は、浮上後タイプを一つの統一されたパラダイムとして固まった技術と説明し、その根拠として高い凝集を挙げています。平均不確実性が最も低いという点までこの説明と結び付けて読むのは、論文ではなく筆者の解釈です。

浮上タイプの代表トピック3つ

論文は、浮上タイプが近い将来のAI地形に最も大きな影響を与える可能性があるとみて、2024年上半期の浮上トピックの中核論文を整理しました。

図 2. 2024年上半期の浮上トピック3つは、いずれも浮上前タイプ平均より速く成長した。
  • 24H1_25、トランスフォーマーベースのグラフ学習(GBL-TM): 新規性1.0345、成長1.0678、凝集0.7471、不確実性3.1622です。情報ネットワーク、グラフマイニング、分子表現などのタスクに使うグラフトランスフォーマーを扱います。分子特性の予測に線グラフトランスフォーマーを用いた研究や、推薦システムのユーザー–アイテム相互作用を異種部分グラフトランスフォーマーでモデル化した研究が含まれます。最近では、知識グラフ、時系列、マルチモーダルデータへと範囲が広がっています。
  • 24H1_2、低リソース・特定言語のモデリング(LM-LRSL): 新規性1.0647、成長1.3863、凝集0.7523、不確実性3.3756です。PLMを特定言語の自然言語処理タスクに適用します。ロシア語の有害表現の言い換え、イタリア語詩のBERTモデルの検証、ミナンカバウ語の感情分析・翻訳コーパス、エストニア語の多言語BERTの評価に関する研究が含まれます。
  • 24H1_15、言語モデリング用の効率的トランスフォーマー(ETA-LM): 新規性1.0732、成長0.9445、凝集0.6608、不確実性3.7542です。オプティマイザ、バッチ学習、アテンション演算を見直します。大規模バッチ最適化手法のLAMBは、BERTの学習時間を3日から76分に短縮しました。Primerは学習を最大4倍高速にしました。協調型マルチヘッドアテンションは、キー・クエリ投影のサイズを4分の1に減らしながら、精度と速度を維持しました。

ほかのタイプの例もあります。周辺タイプの24H1_7(画像・映像処理用の特徴表現学習)は、2024年上半期に最大のトピックでした。浮上前タイプの24H1_104は、ロボットシステムにトランスフォーマーを適用します。浮上後タイプの24H1_47は、多言語PLMの言語横断理解を扱います。新しいタスクが関心を保っている一方で、手法が標準化されて勢いが緩やかになりました。

進化経路: 知識集約型自然言語処理のトピック

第二のリサーチクエスチョンに答えるため、論文は2020年上半期の浮上トピック20H1_21(「Transformers for Knowledge-Intensive NLP」)を目標に定めました。このトピックには、GPT-3のように大規模言語モデルの発展を牽引した研究が含まれます。検索拡張生成(Retrieval-Augmented Generation, RAG)、ColBERT、DeBERTaのように、知識活用や検索ベースの手法も含まれます。

先行トピックは3つです。

  • 19H1_5(浮上前): GPT-1やBERTのようにトランスフォーマー構造でPLMを導入した論文と、Transformer-XLが属します。
  • 19H1_12(浮上): Universal Transformer、Music Transformer、常識推論データセットHellaSwagなどのトランスフォーマー応用が属します。
  • 19H2_28(浮上前): 上の二つのトピックから生まれ、事前学習研究とトランスフォーマー応用を併せて扱います。

目標トピックは、2020年下半期に5つの後続トピックへと分かれました。

  • 20H2_6(浮上前): PLMの頑健性と転移性を扱い、次の半期に21H1_46(浮上前)へとつながりました。
  • 20H2_17(周辺): エンティティマッチング、関係抽出などのタスクにPLMを使い、次の半期に3つのトピックへと分かれました。
  • 20H2_26(浮上前): 自然言語処理の応用と、実務・倫理上の考慮を扱います。次の半期のドメイン適応PLMトピックは、主にこのトピックから生まれました。
  • 20H3_36(周辺): 効率的な学習手法を扱います。次の半期に、効率的アテンションのトピック21H1_58(浮上前)などへと分かれました。
  • 20H2_39(浮上前): データ別のトランスフォーマー変種を扱います。次の半期に、アテンション計算効率のトピック21H1_8と、ドメイン応用のトピック21H1_27へと分かれました。

論文は、このマップで目標トピックの先行・後続の経路を示しました。そして、これをもとにGPT-3、RAG、ColBERT、DeBERTaなどの技術の発展を解釈しました。トランスフォーマーの事前学習から、ドメイン特化の言語モデリングとアテンションの効率化へとつながる流れです。

既存のトピックモデルとの比較

論文は、提案手法を次の3つの手法と比較しました。

  • LDA
  • BERTopic
  • 事前学習済みBERTにK-meansを組み合わせた手法

評価指標は3つの側面に分かれます。

  • トピックの一貫性: C_v、UMass、正規化点相互情報量
  • クラスタ品質: シルエットスコア、カリンスキー・ハラバス指数、デービーズ・ボルディン指数
  • 計算効率: エポックあたりの時間

どの一つのモデルも、すべての指標で上回ることはありませんでした。論文は、提案手法がトピックの一貫性、クラスタ品質、計算効率の3つの側面のすべてで2位だと記述しています。ある基準で1位ではないものの、すべての基準でバランスのとれた性能を出すというのが、論文の解釈です。ただし、この順位は論文の主張であり、論文の表6の個別指標で見ると、順位は指標ごとに異なる場合があります。たとえばトピックの一貫性指標C_vは、BERTopicが0.5560で、提案手法の0.4894より高いです。計算時間も、BERTopicのほうが提案手法より短かったです。

同じK-meansを使った一般のBERTと比べると、提案手法のC_vとカリンスキー・ハラバス指数のほうが高いです。論文は、ドメイン適応でさらに学習すると埋め込みの意味的一貫性が高まり、トピックがよりよく分かれると説明しています。表6の差は、この説明と合致します。ただし、論文が表6の差をこの原因によるものとして別途検証したわけではありません。

意義と限界

何が変わるのか

  • 学術誌中心のデータベースの代わりに、PapersWithCodeのテキスト、タグ、メタデータをCLRのデータ源として活用できる可能性を示しました。
  • 半年ごとに再学習したAI特化のPLMでトピックを見つけ、変わっていくAI用語を反映しました。
  • 過去を振り返る分析に加え、新規性、成長、凝集、不確実性の4指標で浮上性を計算する、再現可能な枠組みを示しました。
  • 共有論文でトピックをつなぎ、浮上タイプの遷移を併せて読んで、技術ライフサイクルを解釈する方法を示しました。

実務者にとっての有用性

論文は、PLMで専門文献を大量に処理できるため、AI研究の動向を、時間とコストを抑えて広く調べられるとみています。浮上トピックに関する結果は、AIの導入と活用を決める管理者や政策担当者の意思決定に使えます。ソースコードは https://github.com/jm-chung/AI-CLR で公開されています。

論文は、実務適用の指針も残しています。新しいデータ源を使うときは、信頼性、適時性、ドメイン関連性、アクセス性を評価するよう勧めています。AI専門家13名(博士5名、大学院生8名)の評価をまとめた表5で、PapersWithCodeは、信頼性が中程度、適時性がやや高い(Moderately High)、ドメイン関連性とアクセス性が高いという評価を受けました。ところが論文の本文は、専門家たちがPapersWithCodeを、高い信頼性とドメイン関連性を備えた最も包括的で優れた資料に挙げたと記述しています。信頼性についての表5の値と本文の記述が食い違っているので、この評価を引用する際は両方を併せて確認するのがよいでしょう。手法タグがないデータであれば、固有表現認識で手法名を抽出して、不確実性を同様に計算できます。

研究者にとっての有用性

論文は、急速に変わるAI地形を調べる体系的な手順を提供しています。事例はアテンションでしたが、中核論文の選定だけを変えれば、コンピュータビジョン、音声処理、ロボティクス、強化学習、生成AIにも適用できると述べています。浮上性の4指標は技術予測の文献から取り入れたものなので、他分野の新興技術の研究と指標を比較する余地もあります。

論文が示した限界

論文自身が示した限界は5つです。

  • 言語モデリングをさらに改善する必要があります。自己符号化方式以外のモデル、GPT-4やClaudeのような大規模言語モデル、知識グラフ、RAGを検討できます。
  • 浮上性指標の事後検証が必要です。トピックの影響力は、ニュース、ソーシャルメディア、引用ネットワークなどで、時間をおいて別途確認する必要があります。
  • トピックマップは、文書類似度で作ったトピックを共有文書でつないだだけです。エンティティ単位のトピックと、論文間の引用関係を反映する必要があります。
  • アテンションの事例一つだけを分析しました。外的妥当性を確保するには、他のAIの下位主題でさらに試す必要があります。
  • PapersWithCodeのデータには、学会論文中心の構成、英語以外の文献の除外といった偏りがある可能性があります。

筆者が考える適用条件

以下は論文に書かれた内容ではなく、筆者が実務適用を念頭に付け加える条件です。

  • 文書ごとに手法タグ、またはそれに準じる構造化された項目があって初めて、不確実性指標を論文の方式で求められます。タグがない場合は、抽出作業の品質が指標の品質を左右します。
  • 凝集は、中心との平均距離で定義されます。自分のデータでは、値が大きいときと小さいときをどう読むかを、あらかじめ決めておくほうが安全です。
  • 4指標とタイプ区分は、同じデータの中での相対比較です。別のデータセットや別の主題の指標値をそのまま突き合わせると、解釈がずれる可能性があります。
  • 半年ごとに言語モデルを再学習するには、GPUリソースと時間がかかります。モニタリングの周期と予算を先に決めておく必要があります。
  • データ源の提供方法は変わる可能性があります。収集のたびに基準時点を記録しておかなければ、結果を再現できません。

すぐに試せること

  • 関心のある分野で、手法タグまたはキーワードを一つ決め、該当する論文のタイトルと要旨を集めます。次に、論文のように半年単位で累積した塊に分け、半期ごとの文書数がどう増えたかをまず確認します。
  • 言語モデルを学習する前に、すでに持っている埋め込みとK-meansで、半期ごとのクラスタを作ります。クラスタごとに、成長(新規文書数の比率の対数)と不確実性(手法タグ分布のシャノンエントロピー)を求めてみます。この2つの指標だけでも、どのクラスタが大きくなっていて、手法がまだ定まっていないのかを、おおよそつかめます。
  • 隣り合う二つの半期のクラスタを共有論文数でつなぎ、共有論文が二つ以上の接続だけを残してみます。関心のあるクラスタを一つ決め、先行クラスタと後続クラスタの代表論文を読むと、その主題がどこから来て、どこへ分かれていったかを整理できます。

ビジネスインテリジェンスラボは、文献と特許データで技術の流れを読む方法を、引き続き紹介します。次回の記事でも、論文を一編取り上げ、同じ方式で読み解きます。

キーワード

関連記事