新的研究提案真的能产出成果吗

能否凭借提案书文本的新颖性,提前筛选出能够产出成果的国家研发项目?本文梳理了用语言模型和LOF衡量的新颖性与论文、专利、技术转移之间的关联。

本文译自韩文原文。 韩文原文

负责策划或评审国家R&D项目的人员每年都要审阅大量提案。论文、专利、技术转让等成果要等到项目结束后才会出现。因此在遴选时,很难知道哪个项目会产出成果。负责人在那个时点掌握的资料,几乎只有提案文本。

由此产生一个问题:如果从提案文本中把新颖性提取为数值,能否用这个数值提前筛选出会产出成果的项目?

我们来读一篇回答了这个问题的论文。

  • 标题:Exploring the potential of novel research proposals as signals of successful national R&D: A case study on energy and resource sector in South Korea
  • 期刊:Journal of Informetrics
  • 年份:2025
  • DOI:10.1016/j.joi.2025.101722

论文提出了一个将基于Transformer的语言模型与局部离群因子(Local Outlier Factor, LOF)相结合的分析框架。语言模型把提案文本转换为数值向量。LOF计算该向量与周围提案相比有多孤立。研究团队把这一计算值作为新颖性得分,并将其与项目的投入规模和成果进行了比较。

本文使用的核心术语如下。

  • 新颖性(novelty):提案在语义上与既有提案的差异程度。论文以其与既有范式的区别程度来衡量。
  • 嵌入(embedding):将文本语义转换为数值向量的结果。
  • 国家R&D图景(national R&D landscape):把提案排布在向量空间中,语义越相似的提案距离越近。
  • 调节效应(moderation effect):一个变量增强或削弱另外两个变量之间关系的效应。

动机:提案的新颖性与项目成果之间的关系尚未得到验证

为什么提案的新颖性很重要

论文给出了需要考察提案新颖性的理由,如下。

  • 国家R&D项目的成功,对国内技术和经济体系的长期增长以及国家创新体系能力的增强具有重要作用。
  • 成功的项目通常在事后才能确认,依据是科技影响力、技术市场的经济价值、商业化可能性等指标。
  • 在事前,偏离既有知识的、富有创造性且高风险的研究可能与成功相关,因为激进式创新往往始于新的想法。
  • 提案是最直接、最快速地反映项目内容的资料。
  • 国家资源有限。因此,只有了解新颖性对投入和成果有何影响,才能有效地进行分领域预算分配和项目策划。

既有研究未涉及的部分

既有研究把成功项目的特征分为事后指标和事前特征两类来讨论。事后指标是论文和专利产出以及产业价值,事前特征是学科交叉性、增长潜力、一致性和不确定性。论文认为其中新颖性是最重要的特征。试图将新颖性量化的研究一直使用语义距离分析。

论文指出的空白如下。

  • 缺乏对提案新颖性与R&D成果之间关系进行深入实证分析的研究。
  • 分析提案的语义,需要能够处理分领域专业知识和复杂语境的自然语言处理技术。
  • 新颖性是定性且主观的概念,需要可用于专家评估和沟通的定量尺度。
  • 需要在国家R&D数据库中定义能够客观汇总投入和成果的指标。

在说明贡献的部分,论文还将既有的基于专家的方法与自己的方法进行了对比。既有方法侧重于比较和分析特定国家项目的成果。论文的方法则是在大规模提案中系统地找出新颖提案。

论文把研究目标归纳为三个研究问题。

  1. 如何衡量提案的新颖性?
  2. 新颖提案的投入和成果水平是否不同?
  3. 新颖性是否调节投入与成果之间的关系?

方法:把提案转换为向量,按其比邻近提案更孤立的程度给出新颖性得分,并与成果比较

论文在数据收集和预处理之后,把方法分为3个步骤。第1步,研究团队用基于Transformer的语言模型构建国家R&D图景。第2步,用LOF为每份提案计算新颖性得分。第3步,通过统计检验考察新颖性与R&D投入、成果指标的关系。本文也遵循同样的3个步骤。

图 1. 以拼接四个部分的文本按年份追加训练语言模型,用该模型提取各部分向量并通过LOF计算新颖性,再与投入、成果指标比较的流程

案例与数据

分析数据是KISTI(Korea Institute of Science and Technology Information)建设的NTIS(National Science and Technology Information Service)数据库。该数据库收录了韩国政府遴选的国家R&D提案。2010~2022年遴选的提案记录为764,002条,唯一提案ID为364,313个。

数据库中的信息分为两类。

  • 文献信息:项目名称、研究目标、研究内容、预期效果等文本,以及项目规模、所属机构、分类代码、是否延续。通过是否延续可以筛选出每年新遴选的项目。
  • 成果信息:研究经费、专利、论文、技术转让等各项目的成果记录。

研究团队依据KISTEP(Korea Institute of Science and Technology Evaluation and Planning)的科学技术标准分类代码,筛选出能源与资源领域的提案12,243件。该领域的新项目数量自2018年以来有所增加,最近5年每年执行的项目超过2,500个。

选择能源与资源领域作为案例的理由如下。

  • 韩国对能源资源进口的依赖度高,能源安全和供应稳定是国家课题。
  • 韩国承诺了2050碳中和目标,实现该目标需要创新性R&D。
  • 围绕可再生能源扩张、能源效率和核能政策,国内能源政策正在快速变化。

举一个数据中的例子:2010年的项目”Development of High-Temperature CO2 Capture and Storage Technology Using Molten Carbonate Fuel Cells”产出了10篇论文和4项国内专利。

第1步:构建国家R&D图景

  • 输入:逐年累积的能源与资源领域提案文本
  • 处理:按年份对韩语预训练语言模型进行追加训练,并将提案转换为向量
  • 输出:13个年度语言模型,每份提案一个768维向量

处理顺序如下。

  1. 选定预训练模型。研究团队选择了KoBERT(‘skt/kobert-base-v1’)。该模型使用韩语维基百科语句和韩语新闻语句训练而成。
  2. 将提案的四个部分(项目名称、研究目标、研究内容、预期效果)拼接为一段文本。
  3. 通过掩码语言建模(masked language modeling)和下一句预测(next sentence prediction)任务对KoBERT进行追加训练。
  4. 用逐年累积的数据分别训练模型。第j年提案的向量取自第j年模型的最后一层。

按年份分别建立模型是有原因的:随着新提案不断进入,国家R&D图景每年都在变化。追加训练属于领域适应(domain adaptation)。在此过程中,模型学习该领域的专业术语、文体和词汇分布。

选择KoBERT的依据在于提案文本的特点。论文把提案的特点归纳为三点。

  • 以带有专业术语和复杂句式结构的正式文体韩语写成。
  • 遵循逻辑结构,因此要准确提取语义需要理解上下文。
  • 每个段落和句子的领域信息都很密集,词汇变化较少。

研究团队认为,与多语言模型相比,KoBERT能更好地处理韩语特有的句法关系、敬语法和形态变化。在这一步,研究团队为2010~2022年的每一年建立了对应的模型,共13个。提案被转换为768维向量。

第2步:用LOF计算新颖性得分

  • 输入:截至第j年新遴选的提案集合(RSj)的向量
  • 处理:对四个部分分别计算LOF,按部分在年度内进行最小-最大归一化,再对归一化后的四个得分取平均
  • 输出:每份提案一个0~1之间的新颖性得分

处理顺序如下。

  1. 确定邻居数k。研究团队将逐年累积的新提案数量的1%作为k。这一设置是为了让k随图景的扩大而相应增大。
  2. 对四个部分各自的向量计算LOF,因为四个部分所含的意义不同。
  3. 将各部分的LOF按年份进行最小-最大归一化。表4中各部分得分都在0~1范围内,且每个部分都分别出现了得分为1.0000的提案。
  4. 将归一化后的四个部分得分取平均,得到整体新颖性。

LOF的计算方式如下。

  • k-距离:提案p到第k近的提案之间的欧氏距离。
  • 可达距离:p到邻居o的距离。取o的k-距离与实际距离中较大的值。
  • 局部可达密度(lrd):k除以到各邻居的可达距离之和得到的值。周围越密集,该值越大。
  • LOF:邻居们的lrd平均值除以p的lrd所得的值。

若与邻居的密度相近,LOF约为1。处于密集群体之间稀疏位置的提案,LOF大于1。研究团队把LOF高的提案视为包含与周围不同的新概念的候选。

研究团队没有采用统计方法或基于距离的方法,而是采用了基于密度的方法。针对不同的比较对象,理由如下。

  • 与统计方法相比:对提案向量分布的理论认识不足。因此不需要分布假设的基于密度的方法更合适。
  • 与基于距离的方法相比:新颖性取决于周围提案如何分布。基于密度的方法即使在不均匀或不规则的分布中也能找出离群点。

k值在2010年为10,2016年为64,2022年为122。归一化使用当年新提案LOF的最小值和最大值,公式为(LOF − 最小值) ÷ (最大值 − 最小值)。这样做的原因是比较对象每年都不同,同样的LOF值含义也会不同。

以2010年的两份提案为例进行计算。提案1415,111,320是热电复合材料与溅射靶材开发项目。该提案的整体新颖性是归一化后四个部分得分的平均值,公式为(0.1960+0.3494+0.3700+0.8704)÷4 ≈ 0.4464。这一数值是2010年新提案中整体新颖性最高的得分。提案1345,135,814的项目名称新颖性较高,为0.9073。各部分得分的完整内容可在原论文的表4中查看。

2022年,“1 kW-class portable hydrogen fuel cell generator using low-pressure hydrogen storage”得到0.2390。“Atomic-level surface control technology for electrochemical complex oxide materials for energy conversion”得到0.2258。研究团队使用Python库scikit-learn计算LOF。

第3步:检验新颖性与R&D指标的关系

  • 输入:新颖性得分、R&D投入和成果指标、控制变量
  • 处理:比较新颖组与非新颖组,调节效应回归分析
  • 输出:各指标组间差异的显著性概率,交互项系数

研究团队定义了2个投入指标和4个成果指标。

  • R&D持续性:项目从开始到结束的天数。
  • 研究经费规模:总研究经费。
  • 科学影响:SCI(Science Citation Index)收录期刊的论文数。
  • 技术商业化:签订的技术转让合同数。
  • 国内技术影响:国内专利授权数。
  • 海外技术影响:海外专利授权数。

处理顺序如下。

  1. 每年将新颖性得分前10%的提案划为新颖提案,其余为非新颖提案。
  2. 只保留截至2021年已结束的项目9,475件,其中新颖提案884件,非新颖提案8,591件。
  3. 对两组应用曼-惠特尼U检验(Mann-Whitney U test)。由于数据不满足正态性假设,选用了非参数方法。
  4. 进行调节效应回归分析。因变量为成果指标,自变量为投入指标,调节变量为是否为新颖提案(虚拟变量)。
  5. 加入团队规模、是否合作、新术语数量作为控制变量。机构类型(大学、研究所、中小企业)设为固定效应。

新术语数量是统计上一年没有出现过的术语得到的值。因此2010年的提案被排除在调节效应分析之外。分析使用的观测值为8,420件。将2个投入指标与4个成果指标组合,估计了8个回归模型。方差膨胀因子(variance inflation factor, VIF)为1.00~1.45,这是研究团队报告的范围。

结果:新颖提案的论文和国内专利较少,技术转让较多,在部分成果上与研究经费的关系更强

比较1:新颖提案与其余提案在投入和成果上的差异

研究团队比较了新颖提案884件与非新颖提案8,591件的指标平均值。差异是否显著,依据曼-惠特尼U检验的显著性概率(p值)来判断。p值小于0.05时,很难认为两组之间的差异是偶然的。

图 2. 新颖提案的SCI论文和国内专利较少、项目周期较短,技术转让则更多

结果如下。

  • 项目周期:新颖提案较短(p=0.0150)。
  • SCI论文:新颖提案较少。平均值分别为2.4717篇和3.4316篇(p=0.0005)。
  • 技术转让:新颖提案较多(p=0.0046)。
  • 国内专利:新颖提案较少(p=0.0042)。
  • 研究经费和海外专利:没有显著差异。p值分别为0.6630和0.1579。

各指标的平均值和标准差的完整内容可在原论文的表6中查看。有一处不一致。正文将国内专利的p值写为0.0042,但在表6中,该指标只标了一个星号,表示p<0.05。如果是0.0042,应属于p<0.01的标注,因此两处标注互不相符。技术转让(0.0046)在表6中也只有一个星号。

论文对这一结果做了四点解释。

  • 项目周期较短的原因:尚无技术基础的新颖研究难以获得后续支持。2021年的新颖提案中,仅用1年就结束的项目有34件,主要是清洁与可再生能源技术或基于物联网(Internet of Things, IoT)的智能技术项目。
  • 论文较少的原因:采用新的方法论或理论,实验和分析需要更多时间,评审过程也更长。应用性质较强的能源领域研究者可能比起学术发表更重视产业应用。
  • 国内专利较少的原因:没有先例的想法难以满足专利要件,申请可能被推迟或放弃。
  • 技术转让较多的原因:产业界需要新技术。在产学合作项目中,商业化可能先于论文和专利出现。

作为一个例子,获得0.1124新颖性得分的、面向IoT传感器的低照度太阳能电池供电装置项目,在2022年取得了6项技术商业化成果。

比较2:提案各部分的新颖性与成果

研究团队对四个部分各自的新颖性做了同样的比较。整理附录中的说明如下。

  • 项目名称:项目名称新颖性较低的提案,周期较长,科学影响和海外技术影响较高。项目名称较新颖的提案,技术转让较多。
  • 研究目标:在大多数指标上没有显著差异。仅在国内技术影响上,目标新颖性较低的一方更高。
  • 研究内容:没有在成果上造成显著差异。研究内容多为具体技术描述,新颖性的差异可能不容易显现。
  • 预期效果:预期效果较新颖的提案获得的研究经费显著更多。平均值分别为1624.7181百万韩元和1453.1389百万韩元。

研究团队从预期效果的结果中得出了实务建议:若想扩大研究经费规模,在预期效果中提出新颖且前所未有的贡献会有帮助。

比较3:新颖性是否改变投入与成果的关系

调节效应分析的核心指标是交互项。交互项是投入指标与是否新颖相乘得到的变量。如果该系数为正且显著,就意味着投入的效果在新颖提案中更大。8个模型在统计上全部显著。

首先需要注意如何解读系数。作为依据的表7原文文本中,看不到系数的负号。某些列中数值的排列也不清楚。因此本文按论文正文的解释来标注系数的方向。系数的完整内容可在原论文的表7中查看。

先看研究经费的效应。按论文正文的解释,在模型2(SCI论文)和模型6(国内专利)中,是否新颖提案表现出负(-)的主效应。在模型8(海外专利)中没有显著的主效应。但三个模型中,研究经费×新颖的交互项都是显著的正(+)值。这意味着在这三个成果指标上,研究经费与是否新颖之间出现了显著的正(+)交互作用。论文将其解释为:当提案新颖时,研究经费的积极效应更大。论文正文没有把技术商业化列入这一结果。

项目周期的效应则相反。在模型1(SCI论文)中,R&D持续性的主效应为3.6087(p<0.001),为正值。按论文正文,在新颖提案中这一效应减弱了。表7中该交互项记为1.3227(p<0.001),但如前所述,其符号在原文文本中无法确认。在其他成果指标上,新颖性没有调节项目周期的效应。

论文对这两个结果做了如下解释。新颖研究起初难以产出可衡量的成果,但充足的研究经费能够提升成果。另一方面,延长项目周期并不一定使新颖研究受益。因此需要有战略性的项目策划。

新颖性得分的时间变化

研究团队逐年重新计算了同一份提案的新颖性。提案1345,135,814在2010年为0.3789,2011年为0.0663,2022年为0.0905。2010年新颖性较高的提案,此后相对新颖性呈下降趋势。论文把这一变化解读为:随着研究图景的变动,新颖性的标准也在改变,这是其证据。

意义与局限

有哪些不同

  • 定义了新颖性这一事前特征,并将其与投入和成果等事后指标系统地联系起来。
  • 与专家比较特定项目的方式不同,提出了在大规模提案中系统地找出新颖提案的方法。
  • 将Transformer语言模型应用于国家R&D和国家创新体系分析。作者们主张,就其所知,这一应用是首次尝试。
  • 在部分成果指标上,研究经费与成果之间的正(+)关系在新颖提案中表现得更强。相关指标为科学影响以及国内、海外技术影响。
  • 将分析过程和模型设定设计为可根据目的调整的、可复现的结构。

对实务人员的用处

论文建议将这一方法自动化为网络服务。这样,即使不熟悉R&D数据库或自然语言处理的专家,也能够分析提案。还可以设计这样的流程:专家指定技术领域后,系统筛选相应提案并分步骤展示结果。不过,对领域模型进行追加训练需要GPU等计算资源和训练时间。新提案积累后,模型也需要定期更新。

在政策层面也有启示。论文建议不要仅以短期成果评价新颖项目,而应采用兼顾风险与回报的长期投资策略。

在实际引入时,论文叮嘱的要点如下。

  • 新颖性的决定因素因领域和情境而异,因此要广泛探索新颖提案。
  • 根据语言、领域、文档类型,试验多种语言模型。
  • 根据目的调整数据范围和新颖性标准。
  • 解读结果时,要同时采用专家验证和定性审查。
  • 根据分析需求调整嵌入维度和邻居数等设置值。

对研究者的用处

论文建议将该方法与既有的新颖性指标相结合:把论文和专利所引用期刊的多样性,或引用文献与先行文献之间的知识重叠度纳入成果评估。同样的框架也可以应用于任务导向型R&D战略评估、国家技术竞争力评估以及研究投资的社会影响分析。还可以开展后续研究,利用基于注意力的文本分类模型找出对新颖性有贡献的词语和句子。

论文自述的局限

论文自己指出的局限有五点。

  • 新颖性指标只衡量与其他文档的语义差异,无法确定原创性。需要通过专家评估或R&D分类代码新组合的分析来补充。成果指标也需要借助专利族规模、被引次数、技术转让金额等外部数据加以完善。
  • 以提案的各个部分作为分析单位。新颖性也可能出现在句子、词语、知识实体的层面。在能源领域,将新材料用于既有问题就是一例。
  • 在最新语言模型技术的采用上还有余地,而且随着数据和模型变大,计算负担也会增加。
  • 对新颖提案的解释和原因分析仍然依赖专家判断。
  • 案例研究只有一个。要推广这一关系,需要进一步验证。

笔者认为的适用条件

以下并非论文中的内容,而是笔者着眼于实务应用而补充的条件。

  • 结果是相关关系。只是显示了新颖提案与成果指标之间的关联,并不断言新颖性带来成果。
  • 分析对象是已经入选的提案。如果原样应用于混有落选提案的评审阶段,结果可能不同。
  • 组间平均值的差异远小于标准差。就SCI论文而言,平均值差异为3.4316 − 2.4717 = 0.9599,标准差为8.2791和11.5692。仅凭一个得分很难预测单个项目的成败。
  • 模型2的决定系数为0.0161。即使交互项显著,成果变动的大部分仍来自其他因素。
  • 前10%这一标准,以及将k设为累积提案1%的规则,是本案例的设置。在自己的数据上,应变换标准,确认结果是否仍然成立。
  • 提案格式每年必须一致,才能把四个部分分开比较。

马上可以做的事

  • 按年份收集本机构遴选的提案,并整理为项目名称、研究目标、研究内容、预期效果四个部分。用韩语预训练模型生成各部分的向量,再应用scikit-learn的LOF。此时将k设为累积新提案数的1%。把各部分的LOF按年份进行最小-最大归一化,再对四个得分取平均。
  • 每年选出新颖性前10%的提案,仅用已结束的项目,与其余提案进行曼-惠特尼U检验。比较指标为项目周期、研究经费、SCI论文、技术转让、国内和海外专利授权数。
  • 把新颖性靠前的提案清单拿给领域专家看,共同审查它们是否确实是新颖的项目。不能只凭得分作判断,这是使用这一方法的第一步。

关键词

相关文章