仅以注意力机制为例,相关论文的累计数量就从2019年上半年的458篇增加到2024年上半年的18,870篇。论文指出,AI领域出版量大,新概念和新术语不断出现。因此,以专家为中心的文献综述很难及时、无遗漏地把握研究动向。
于是产生了这样一个问题:能否用语言模型自动对AI论文聚类、发现主题,并且用数字指出哪些主题正在兴起?
下面来读一篇回答了这个问题的论文。
- 标题:Harnessing language models for computational literature review of emerging AI topics
- 期刊:Information Processing & Management
- 年份:2025
- DOI:10.1016/j.ipm.2025.104245
论文提出了计算文献综述(Computational Literature Review, CLR)方法。CLR是指借助计算机系统地收集、分析和综合文献的综述方式。该方法从AI论文数据库PapersWithCode收集论文,然后做以下三件事。
- 使用在各时间点上用AI论文继续训练过的语言模型,对论文聚类并发现主题(话题)。
- 用四个指标计算每个话题的兴起程度。
- 用图展示某一话题与前后时间点的哪些话题相连。
本文使用的术语如下。
- 预训练语言模型(Pre-trained Language Model, PLM):用大量文本预先训练、把句子的含义转换为数字向量的模型。论文用AI论文继续训练面向科学论文的模型SciBERT,并将这一模型称为AI-SciBERT。
- 兴起性(emergingness):某个话题在该时间点上处于兴起中的程度。论文用新颖性(novelty)、增长(growth)、凝聚(coherence)、不确定性(uncertainty)四个指标来计算。
- 话题演化图(topic evolution map):把一个话题与上一时间点的先行话题、下一时间点的后续话题相连并展示的图。
动机:AI研究动向难以只靠人工跟踪
为什么解读AI研究动向很重要
论文认为,解读AI研究动向的能力不仅研究者需要,产业从业者和政策制定者也需要。论文给出的理由如下。
- AI的实用潜力很大。在产业、物理科学、公共行政、教育、医疗、管理等领域,成功案例不断增加。
- 快速掌握和理解最新AI研究的能力,被视为竞争优势的来源和循证战略规划的基础。
- 分析很困难。出版量大,领域横跨多个学科,新概念和新术语不断出现。
论文指出,这些困难常常超出以专家为中心的传统文献综述所能承受的范围。因此论文认为,能够系统处理大量文本并发现隐藏模式的CLR正成为必不可少的工具。
既有研究没有涉及的部分
先行研究从Web of Science和Scopus等学术数据库收集AI文献,再用潜在狄利克雷分配(Latent Dirichlet Allocation, LDA)、非负矩阵分解、Top2Vec、BERTopic等主题建模方法发现隐藏主题。例如,Arsenyan和Piepenbrink(2024)用LDA分析了运筹学、管理和经济领域的7,708篇AI应用研究。Guler等(2024)在6,974篇AI相关研究中用结构主题模型发现主题,并借助ChatGPT为主题命名。Agbozo等(2024)用BERTopic分析了383篇以篮球为主、将AI应用于体育分析的研究。
论文指出的空白有三点。
- 数据来源:先行研究大多集中于AI新近应用的领域,对使用什么算法或模型则涉及较少。若想分析注意力、激活函数等特定技术,现有检索工具效率不高。AI成果往往先以学术会议论文发表,而不是期刊论文,但现有工具主要为期刊论文建立索引。
- 方法论:概率主题模型依赖词语共现模式,因此不能充分捕捉每个词的含义和语境。也有研究使用了BERT等PLM,但如果不针对AI领域术语加以调整而直接使用,效率会下降。分析前只训练一次的固定模型,难以反映快速变化的AI知识。
- 面向未来的分析:先行研究大多止步于回顾过去变化的分析,由专家解读结果并展望未来。需要一种科学方法,对今后将引领领域的话题进行定量判断。
论文的两个研究问题由这些空白而来。第一,哪些AI话题正在兴起,其特征是什么?第二,给定一个目标话题,它经历了怎样的演化路径?
方法:用分时间点的语言模型发现话题、评估兴起性并连接路径
论文把方法分为3个步骤。第一,用AI专用PLM和无监督聚类构建AI研究版图(AI landscape)。第二,用定量指标评估话题的兴起性。第三,构建交互式话题演化图。本文把论文第一步中包含的语言模型训练和聚类单独拆开,分为4个步骤来讲。本文的第1、2步对应论文的第一步,第3步和第4步对应论文的第二步和第三步。
案例与数据
数据来源是PapersWithCode。据论文介绍,PapersWithCode始于2018年,技术运营由Meta AI负责,内容由全球研究者和开发者共同积累。这是论文撰写时的情况,现在使用时需要重新确认其提供方式。
论文选择这一数据来源有三个理由。
- 它把论文与源代码、公开的学术会议信息相连,提供了可靠性、透明性和可重复性。
- 它有社区维护的标签(数据集、方法、任务),可以精确检索和比较。
- 可以以大规模数据集或API形式获取,适合持续更新使用。
每篇论文都带有方法(Methods)、数据集和任务标签。例如,「Attention Is All You Need」条目带有学术会议信息“NeurIPS 2017”、方法标签“Linear Layer”和“Absolute Position Encodings”、数据集标签“Penn Treebank”和“WMT 2014”等。
数据规模如下。
- 剔除没有标题和摘要或非英文的论文后,得到506,286篇AI论文。
- 其中,2017年下半年至2024年上半年的409,021篇论文被整理为数据集。
- 该数据集按半年为单位累计,划分为11个子集。
- 案例分析对象是方法标签中含有“Scaled Dot-Product Attention”的18,870篇论文。
选择缩放点积注意力作为案例,是因为它在现代AI模型中承担基础性作用,发展迅速,并且对多个领域影响广泛。
第1步:构建分时间点的AI专用语言模型
- 输入:按半年累计的AI论文的标题和摘要
- 处理:在AI论文上对SciBERT继续预训练
- 产出:各时间点保存的AI-SciBERT模型
处理顺序如下。
- 将每篇论文的标题和摘要连接起来,作为一个输入序列。
- 从原始SciBERT模型(allenai/scibert_scivocab_uncased)出发,用AI论文继续预训练。这一过程称为领域适应。
- 通过掩码语言建模(Masked Language Modeling, MLM),遮住15%的词元并让模型预测。
- 同时训练下一句预测。相邻的句子作为正例对,其中50%的句对把句子换成其他文档的句子,作为负例对。
- 用每半年累计的论文训练模型,并按时间点分别保存。
之所以每半年单独设置一个模型,是为了让模型适应各时间点上不同的表达和语言趋势。其判断是,AI知识变化很快,随时间持续训练的模型优于固定模型。
训练设置如下。
- 学习率2e-5,3个epoch,每设备批大小128
- 权重衰减0.01,预热500步,学习率线性下降。
- 检查点每10,000步保存一次,最多保留2个。每100步记录一次日志。
第2步:把文档转为向量,用K-均值发现话题
- 输入:注意力机制论文的文本及对应时间点的AI-SciBERT
- 处理:文档嵌入、主成分分析、K-均值聚类
- 产出:每个半年期的话题列表
处理顺序如下。
- 用对应时间点的AI-SciBERT把论文文本转为稠密向量。使用最后一层的[CLS]词元向量作为文档嵌入。
- 为提高计算效率,用主成分分析把维度降到能解释总信息80%的程度。
- 用K-均值聚类把相似论文归为一组。聚类数在方法标签数的10%~20%范围内进行试验。
- 将inertia值曲率最大的拐点(肘部)确定为最优聚类数。
- 把聚成的簇定义为该时间点的AI话题。
论文选择K-均值有五个理由。
- 它基于欧氏距离工作,适合长度固定的稠密嵌入。不像LDA那样假设生成分布。
- 计算快,易于扩展到大规模数据。比经过降维和基于密度的层次聚类的BERTopic、Top2Vec更轻量。
- 分析者可以直接设定聚类数k,使话题的粒度符合目的。
- 可以提取靠近中心点的文档和关键词,便于读出话题的核心含义。
- 经过领域适应的嵌入语义更一致,话题划分得更好。
案例中,每个半年期的话题数从29个增加到111个。同一时期的累计文档从2019年上半年的458篇增加到2024年上半年的18,870篇,约为41.2倍(18,870÷458≈41.2)。
第3步:用四个指标评估兴起性
- 输入:各话题的文档嵌入和方法标签、各时间点的新文档数
- 处理:计算新颖性、增长、凝聚、不确定性后,对话题类型分类
- 产出:每个话题的指标值和兴起类型
四个指标依据技术预测文献来定义。各指标的前提和计算方式如下。
- 新颖性:前提是兴起话题中有许多预示新范式的新文档。对文档嵌入应用局部离群因子(Local Outlier Factor, LOF),并按话题取平均。
- 增长:前提是兴起话题因学界和产业界关注增多而快速扩大。对当前时间点与上一时间点的新文档数之比取对数。
- 凝聚:前提是兴起话题的内容具有一定的一致性和独立性。定义为嵌入空间中构成文档与话题中心之间的平均距离。
- 不确定性:前提是兴起话题更接近变化可能性大的创新,而不是已经固化的概念。对话题内方法标签的分布应用香农熵。
LOF是一种无监督离群点检测方法,将一个点周围的密度与其邻近点的密度进行比较。LOF值高的文档位于密度低的位置,而其周围被密集的簇包围。因此它很可能是离群点,也就是新文档。邻居数k取每个半年期文档数的1%并向下取整。这是让k随文档数成比例变化,使文档增多时各时间点的检测标准保持均衡。
增长指标在两个时间点的新文档数相同时为0,增加时为正,减少时为负。不确定性在话题内使用的方法越多样时越高,方法越标准化时越低。例如,在2024年上半年的兴起话题中,ETA-LM的不确定性为3.7542,GBL-TM为3.1622。这意味着ETA-LM文档中使用的方法标签分布得更广。
论文没有使用被引次数等影响力指标,因为这类指标通常是滞后出现的后行指标。
得到指标后,把所有时间点的话题按四个指标重新聚类,划分类型。在聚类数2~10的范围内运行K-均值,并以肘部确定最优聚类数。各类型的解释标准如下。
- 兴起(emerging):新颖性、增长、凝聚、不确定性都高。
- 后兴起(post-emerging):新颖性高,但增长缓慢,凝聚强,不确定性低。
- 前兴起(pre-emerging):新颖性低,但增长或不确定性高的簇可能表示兴起前的潜力。
- 边缘(marginal):在任何指标上都不突出。
案例中得到边缘317个、前兴起350个、后兴起32个、兴起93个话题。合计317+350+32+93=792个。
第4步:构建话题演化图
- 输入:各时间点的话题以及话题之间共同所属的论文数
- 处理:用共有论文连接前后时间点的话题,并解读类型转换
- 产出:展示目标话题先行和后续路径的交互式图
处理顺序如下。
- 将与时间点T的目标话题共有论文的前一时间点话题确定为先行话题。
- 将时间点T+1中与目标话题共有论文的话题确定为后续话题。
- 为使可视化简洁,只显示共有论文在两篇以上的连接。
- 结合所连接话题的兴起类型,解读其处于技术生命周期的哪个位置。
由于每个话题都有类型,类型变化的方向也就有了含义。论文给出的解释如下。
- 前兴起 → 兴起:技术可能已从萌芽期进入成长期。
- 兴起 → 后兴起:可能已越过增长顶点,进入成熟期。
- 边缘 → 前兴起或兴起:可能反映了此前较少受关注的边缘领域的早期潜力。
- 前兴起 → 后兴起:可能很快地度过了炒作周期(hype cycle)。
- 兴起 → 边缘:可能是技术走向陈旧的信号。
结果:图Transformer、特定语言建模、高效Transformer成为兴起话题
四种类型的指标平均值
为回答第一个研究问题,论文把所有时间点的话题分为四种类型,并按类型计算指标平均值。论文表3中值得注意的数值如下。
- 后兴起类型的平均新颖性为1.1346,平均凝聚为0.8260,两个值都是四种类型中最大的。
- 平均增长在兴起类型为1.3055,前兴起类型为0.3927。
- 平均不确定性在后兴起类型为3.1928,是四种类型中最低的。
论文把后兴起类型描述为已固化为统一范式的技术,并以高凝聚作为依据。把平均不确定性最低这一点也与这一描述联系起来解读,则是笔者的解释,而不是论文的内容。
兴起类型的三个代表话题
论文认为兴起类型可能对近期的AI版图影响最大,并整理了2024年上半年兴起话题的核心论文。
- 24H1_25,基于Transformer的图学习(GBL-TM):新颖性1.0345,增长1.0678,凝聚0.7471,不确定性3.1622。涉及用于信息网络、图挖掘、分子表示等任务的图Transformer。其中有用线图Transformer预测分子性质的研究,以及用异质子图Transformer对推荐系统中用户–物品交互建模的研究。近来范围已扩大到知识图谱、时间序列和多模态数据。
- 24H1_2,低资源·特定语言建模(LM-LRSL):新颖性1.0647,增长1.3863,凝聚0.7523,不确定性3.3756。将PLM应用于特定语言的自然语言处理任务。包括俄语有害表达净化、意大利语诗歌BERT模型验证、米南卡保语情感分析·翻译语料库、爱沙尼亚语多语言BERT评估等研究。
- 24H1_15,面向语言建模的高效Transformer(ETA-LM):新颖性1.0732,增长0.9445,凝聚0.6608,不确定性3.7542。重新审视优化器、批量训练和注意力运算。大批量优化技术LAMB把BERT的训练时间从三天缩短到76分钟。Primer使训练最多加快4倍。协作式多头注意力把键·查询投影的大小缩小到四分之一,同时保持了准确率和速度。
也有其他类型的例子。边缘类型的24H1_7(面向图像·视频处理的特征表示学习)是2024年上半年最大的话题。前兴起类型的24H1_104将Transformer应用于机器人系统。后兴起类型的24H1_47涉及多语言PLM的跨语言理解。新任务仍保持关注,但随着方法趋于标准化,势头有所放缓。
演化路径:知识密集型自然语言处理话题
为回答第二个研究问题,论文选取2020年上半年的兴起话题20H1_21(“Transformers for Knowledge-Intensive NLP”)作为目标。该话题包含引领GPT-3等大型语言模型发展的研究,也包含检索增强生成(Retrieval-Augmented Generation, RAG)、ColBERT、DeBERTa等知识利用和基于检索的技术。
先行话题有三个。
- 19H1_5(前兴起):包含像GPT-1和BERT那样以Transformer结构引入PLM的论文,以及Transformer-XL。
- 19H1_12(兴起):包含Universal Transformer、Music Transformer、常识推理数据集HellaSwag等Transformer应用。
- 19H2_28(前兴起):由上述两个话题演变而来,同时涉及预训练研究和Transformer应用。
目标话题在2020年下半年分化为五个后续话题。
- 20H2_6(前兴起):涉及PLM的鲁棒性和可迁移性,在下一个半年期延续为21H1_46(前兴起)。
- 20H2_17(边缘):将PLM用于实体匹配、关系抽取等任务,在下一个半年期分化为三个话题。
- 20H2_26(前兴起):涉及自然语言处理应用以及实务·伦理考量。下一个半年期的领域适应PLM话题主要由该话题演变而来。
- 20H3_36(边缘):涉及高效训练技术。在下一个半年期分化为高效注意力话题21H1_58(前兴起)等。
- 20H2_39(前兴起):涉及按数据区分的Transformer变体。在下一个半年期分化为注意力计算效率话题21H1_8和领域应用话题21H1_27。
论文借助这张图展示了目标话题的先行和后续路径,并据此解读了GPT-3、RAG、ColBERT、DeBERTa等技术的发展。这是一条从Transformer预训练到特定领域语言建模和注意力高效化的脉络。
与既有主题模型的比较
论文将所提方法与以下三种方法进行了比较。
- LDA
- BERTopic
- 在预训练BERT上接K-均值的方法
评价指标分为三个方面。
- 话题一致性:C_v、UMass、归一化点互信息
- 聚类质量:轮廓系数、Calinski-Harabasz指数、Davies-Bouldin指数
- 计算效率:每个epoch的时间
没有哪一个模型在所有指标上领先。论文表述为,所提方法在话题一致性、聚类质量、计算效率三个方面都排第2位。论文的解释是,它在某一项标准上虽然不是第1,但在所有标准上都有均衡的表现。不过,这一排名是论文的主张,从论文表6的各项指标来看,排名可能因指标而异。例如,话题一致性指标C_v,BERTopic为0.5560,高于所提方法的0.4894。计算时间也是BERTopic比所提方法更短。
与同样使用K-均值的通用BERT相比,所提方法的C_v和Calinski-Harabasz指数更高。论文解释说,通过领域适应继续训练,嵌入的语义一致性提高,话题划分得更好。表6的差异与这一解释相吻合。不过,论文并没有单独验证表6的差异是否源于这一原因。
意义与局限
带来了什么变化
- 展示了以PapersWithCode的文本、标签和元数据取代以期刊为中心的数据库,作为CLR数据来源的可能性。
- 用每半年重新训练的AI专用PLM发现话题,反映了不断变化的AI术语。
- 在回顾过去的分析之外,提出了用新颖性、增长、凝聚、不确定性四个指标计算兴起性的可重复框架。
- 提出了通过共有论文连接话题、并结合兴起类型的转换来解读技术生命周期的方法。
对从业者的用处
论文认为,由于用PLM可以大量处理专业文献,因此能以较少的时间和成本广泛考察AI研究动向。关于兴起话题的结果,可以用于决定AI引入和应用的管理者及政策制定者的决策。源代码已公开于 https://github.com/jm-chung/AI-CLR 。
论文还给出了实务应用指南。使用新数据来源时,建议评估其可靠性、时效性、领域相关性和可获取性。在汇总13位AI专家(5位博士、8位研究生)评价的表5中,PapersWithCode的可靠性为中等,时效性为较高(Moderately High),领域相关性和可获取性为高。然而论文正文表述为,专家们认为PapersWithCode是具备高可靠性和高领域相关性的最全面、最优秀的数据。关于可靠性,表5的取值与正文表述不一致,因此引用这一评价时,最好同时核对两处。如果数据没有方法标签,可以用命名实体识别提取方法名称,以类似方式计算不确定性。
对研究者的用处
论文提供了考察快速变化的AI版图的系统化流程。案例是注意力机制,但论文表示,只要更换核心论文的选取,也可以应用于计算机视觉、语音处理、机器人学、强化学习和生成式AI。四个兴起性指标取自技术预测文献,因此也有余地与其他领域的新兴技术研究比较指标。
论文自述的局限
论文自己指出的局限有五点。
- 需要进一步改进语言建模。可以考察自编码方式之外的模型、GPT-4或Claude等大型语言模型、知识图谱和RAG。
- 需要对兴起性指标进行事后验证。话题的影响力要通过新闻、社交媒体、引用网络等,隔一段时间另行考察。
- 话题图只是把由文档相似度形成的话题用共有文档相连。需要反映实体层面的话题以及论文之间的引用关系。
- 只分析了注意力这一个案例。为确保外部效度,需要在其他AI子主题上做更多检验。
- PapersWithCode的数据可能存在以学术会议论文为主、排除非英文文献等偏差。
笔者看到的应用条件
以下不是论文中所写的内容,而是笔者着眼于实务应用而补充的条件。
- 每篇文档需要有方法标签或与之相当的结构化条目,才能按论文的方式计算不确定性指标。没有标签时,提取工作的质量将决定指标的质量。
- 凝聚被定义为与中心的平均距离。在自己的数据上,最好先确定值大和值小时分别怎么解读。
- 四个指标和类型划分是同一数据内的相对比较。把其他数据集或其他主题的指标值直接拿来对比,解读可能出现偏差。
- 每半年重新训练一次语言模型,需要GPU资源和时间。应先确定监测周期和预算。
- 数据来源的提供方式可能改变。每次收集时都要记录基准时间点,才能重现结果。
马上可以做的事
- 在关注的领域选定一个方法标签或关键词,收集相应论文的标题和摘要。然后像论文那样按半年为单位划分为累计的批次,先确认各半年期的文档数是如何增长的。
- 在训练语言模型之前,先用已有的嵌入和K-均值生成各半年期的聚类。计算每个簇的增长(新文档数之比的对数)和不确定性(方法标签分布的香农熵)。仅凭这两个指标,也能大致判断哪些簇正在壮大、方法尚未定型。
- 用共有论文数连接相邻两个半年期的簇,只保留共有论文在两篇以上的连接。选定一个关注的簇,阅读其先行簇和后续簇的代表论文,就能梳理出该主题从何而来、又分化到了哪里。
商业智能实验室(비즈니스인텔리전스랩)将继续介绍用文献和专利数据解读技术动向的方法。下一篇文章也会用同样的方式解读一篇论文。