0 引言
当前,全球科技呈现爆发式增长,学科间界限逐步模糊、融合程度不断加深,持续催生出新兴交叉学科的涌现,这为从海量科技文本中有效提取情报线索、准确研判发展方向、成功破解“科技迷雾”提出了新挑战与新要求。在科研实践中,文本挖掘技术为研究人员从海量学术资源中高效识别有价值的信息提供了新的机遇
[1-2]。然而,在提取学术论文中的未来工作句(future work sentences, FWS)这一特定应用场景中,传统文本挖掘技术面临识别效率低下、精准度不足等诸多实际困难。
在学术论文中,FWS常指作者在论文中主动提出的、未解决的开放性研究问题
[3],在学术生态系统中扮演着至关重要的角色,远超其作为论文收尾部分的简单功能。它不仅是研究灵感的发源地,而且为科研人员提供了潜在的、值得探索的方向,从而为选题决策及政策的科研布局提供了有益参考,属于重要的情报线索;同时,FWS更是一种无声的学术竞争机制,鼓励研究人员对提出的开放性问题展开后续研究。这种“抢先一步”的模式加速了知识的积累与发展,确保研究资源被有效导向最具潜力的前沿领域
[4]。此外,对FWS进行大规模匹配和分析,能够将一个研究思想从“计划”到“成果”的演进过程进行量化,为科学史、文献计量学等领域提供全新的数据驱动分析工具和视角,使科研人员能系统地洞察知识的演进方向
[5]。然而FWS的表达方式灵活多变且缺乏标准化。它们可能以多种句式出现,如“未来我们将致力于”或“本研究的一个局限性在于”,这种多样性导致基于正则表达式或关键词匹配的传统方法难以全面覆盖所有可能的表达,从而导致识别准确率低下。此外,FWS往往包含复杂的语义信息,需要对上下文进行深度理解才能准确识别,而传统的文本挖掘方法缺乏这种深层语义理解能力,难以有效区分那些具有复杂内涵的句子,这极大地影响了提取效率与精度。所以,构建更具细粒度、高效率和准确性的FWS识别方法
[6],具有重要的现实意义。
大语言模型以其强大的表征学习能力,通过在海量数据上进行监督学习,极大地提高了自然语言处理任务的性能和效率,具有广泛的应用前景
[6],为自然语言处理任务带来革命性的变革,也为解决类似FWS识别问题提供一种新的解决思路和方法。
本研究旨在提出一种基于大语言模型的方法框架,用于从学术文献中自动识别FWS并对其进行分类,进而支持研究方向演变趋势的挖掘与预测。为验证方法的有效性,本研究以自然语言处理(NLP)领域为例进行实证研究,对识别出的FWS进行系统分析,以揭示该领域研究方向的演变态势并展望未来主题发展。本研究的贡献主要是证明了LLM能够克服传统方法在数据依赖和语义理解上的瓶颈,以更低成本和更高精度完成FWS的抽取;同时,构建并验证了FWS作为前瞻性知识源的有效性。
1 相关工作
1.1 未来工作句识别研究概述
当前,已有针对FWS识别的研究数量较少,并主要聚焦于2类较为传统的方法。1)手动标注,这种方法虽然能保证极高的识别精度,但其成本高昂且效率低下,无法处理海量学术文献。2)基于规则及机器学习的方法,可以提高数据处理的速度。然而,FWS没有合适且标准的语料库,这导致机器学习无法执行从大规模原始语料库中自动提取FWS的问题。Hu等
[7]在2015年以信息检索、文本挖掘和数字图书馆领域为例,开展未来工作挖掘问题;研究通过一种基于正则表达式的方法抽取学术文本中的FWS,并将其定义为问题、方法、评估和其他4个类别,实现不同领域的FWS分类。Li等
[8]利用人工设定规则来识别FWS,从中提炼出关键词并与标题和摘要中关键词进行匹配,从而得到不同领域文献与未来工作二者的概念上的联系。Hao等
[5]基于ACL论文构建了一个高质量的FWS语料并扩展到2000—2019年的ACL、EMNLP和NAACL论文,训练了机器学习模型,但没有对结果进行深入分析。谢林蕾等
[9]对融合出版领域论文中的FWS进行人工标注和类别划分,构建FWS识别与分类语料库。在此基础上,使用支持向量机、朴素贝叶斯和随机森林3种模型结合SelectKBest特征选择方法,来训练FWS自动识别模型。这些方法都存在明显的技术局限:基于规则的方法过度依赖预定义的模式和关键词,难以捕捉复杂的语义信息,导致泛化能力差和召回率低。而基于机器学习的方法则严重依赖大规模、高质量的标注语料库,这在FWS这类稀缺数据任务中是一个巨大的挑战。
近年来,Peters等
[10]提出了一种称为ELMo的上下文相关文本表示方法。然后,依次提出BERT
[11](bidirectional encoder representations from transformers)、GPT-3
[12]和其他预训练语言模型,并在NLP领域的几个典型任务上表现良好。Zhu等
[13]使用BERT对2006—2016年JASIST期刊论文上的1579篇论文进行FWS抽取,并用层次聚类方法确定了FWS的4种类别,即支持性、方法性、识别潜在影响因素和提出未来目标。之后,也有一些研究人员开始使用规则匹配和BERT相结合的方法来提取FWS
[14]。宋若璇等
[15]采用规则匹配与BERT相结合的方法从论文全文中抽取未来工作句集,其工作在一定程度上提升了抽取效果,但该方法依然需要对BERT模型进行任务特定的微调(fine-tuning),这不仅需要昂贵的数据标注成本,且微调后的模型在面对领域外的或未见过的新型句式时,泛化能力仍然有限。对于FWS这类细粒度、高专业性的任务,手动标注成本极高且耗时,难以大规模应用。总的来说,当前学界对FWS的研究还存在成本高、识别效率低、识别结果不够准、泛化能力差等问题。
1.2 基于大模型的科技文献抽取进展及应用
LLM的出现改变了NLP在文本识别领域的角色,不再仅局限于信息抽取,而是参与到整个知识挖掘、知识发现和甚至知识创新的全过程。与此同时,它也改变了传统的预训练加微调的信息抽取方式,不再依赖标签数据,而是采用少样本甚至零样本的方式,可以通过对话来实现信息抽取
[16-17]。现有研究已证明了大型语言模型在科技文献信息抽取方面的强大能力:何博文
[18]通过设置不同的Prompt,并通过大模型进行离线蒸馏与微调模型自蒸馏2个阶段,进而生成高效自动化抽取模型,研究目的在于提高专利技术功效自动化提取的准确度;时宗彬等
[19]利用可在低配计算资源下部署的LLM,采用人机协作的模式,通过构建层次化提示指令,依次识别单篇论文中核心主题句、核心材料以及材料类型特征句;Polak等
[20]利用通用语言模型对文本进行分类和结构化处理,通过人工审核提取的结构化数据,实现了较高的精确度和召回率,同时大大降低了人力成本;陈和
[21]利用大语言模型从参考文献文本数据中自动逐条识别出参考文献,并对识别出的参考文献的著录信息进行自动抽取,相较于传统文本识别方法,具有文本识别准确率高、抽取效率高、对目标文本数据要求宽松等优点;张恒等
[22]利用ChatGPT对SciBERT的训练数据进行增强,显著提升了该模型在研究流程段落识别任务上的性能。这些研究都主要集中在主题句、材料信息以及特定段落的识别上,目前还尚未出现聚焦于FWS的工作。
综上所述,现有的FWS提取研究主要依赖传统方法,这些方法存在明显的局限性。虽然基于规则和机器学习的方法能提高处理速度,但FWS句式多样、缺乏标准化语料库,导致这些方法泛化能力差、召回率低。即使是结合了BERT等预训练模型的方法,也仍然依赖昂贵的数据标注和微调过程,且在处理新句式时表现不佳。相比之下,以ChatGPT为代表的大型语言模型为FWS抽取任务带来了新的范式
[23]。它们通过强大的上下文学习(in-context learning)
[24]能力,不再依赖大规模标注数据进行微调,而是采用提示工程(prompt engineering)
[25]的方式,仅通过少量或零示例就能完成各种复杂的任务。LLM能够通过其强大的语义理解能力,有效识别复杂的、非规则化的FWS,从而实现在没有大量标注数据的情况下进行领域知识的信息抽取
[12]。尽管现有研究已证明LLMs在科技文献信息抽取上的强大能力,但目前鲜有研究专门针对FWS这一特定任务。针对这一不足,本研究提出基于LLM构建一个高效、准确的FWS自动提取框架,对FWS进行有效分类,为识别与分析特定领域未来的研究方向提供数据支持。
2 研究框架
2.1 技术路线
本研究提出的基于大语言模型的FWS自动化提取与应用技术框架见
图1。
首先,考虑到大语言模型对长文本的处理能力相对较弱,本研究对原始文献进行了预处理工作,从论文全文中提取与未来工作相关的章节,如“Conclusion”“Future Work”。同时,提取了文献的年份信息和摘要信息。再将节选的章节段落进行分句,从而提取其中与未来工作有关的句子,在这个过程中,主要对比了3种提取方法的性能,分别为利用大语言模型(Mixtral 8×7B、GPT-5 Mini、Gemini 2.5 Flash)的方法、基于正则表达式的方法和基于TF-IDF权重词表的方法。得到自动提取的未来工作句集后,为了验证FWS对未来研究的预示有效性,利用KeyBERT算法
[26]抽取了未来工作关键词和从摘要文本中获取的当前工作关键词。最后,利用提示词工程的方法抽取句子类型并划分FWS所属的细分任务领域,从而应用到该领域未来研究热点类型及热点内容的分析预测上。
2.2 未来工作句的自动提取
提取FWS的任务可以看作是文档元数据自动提取的一个特例
[8]。本研究选取了目前学界比较常用的FWS抽取方法,即基于正则匹配规则的FWS自动提取与基于TF-IDF权重词表的FWS自动提取方法
[27],与基于大语言模型的提取方法做对比,以验证本文方法的合理性。本研究随机选择了400篇数据集中的论文进行手动标注,通过计算以上3种方法与测试集的语义相似度,可以检验提取结果的精度,确定基于大模型提取方法的有效性。
2.2.1 基于传统方法的未来工作句抽取
1)基于正则表达式的方法。通过文献调研和手动标注,总结以下3类正则表达式,基于正则匹配的方法,将含有以下词语或句式的句子提取到未来工作句集中(
表1)。
2)基于TF-IDF权重词表的方法。首先,本研究对注释语料库中的句子进行预处理,包括删除英文字母和空间以外的符号、统一单词大小写和词形还原。然后,从句子中提取
N-gram (
N∈[
1,
3]) 作为特征,将文本表示为由这些
N-gram 特征组成的特征空间中的向量,并使用特征的TF-IDF值作为文本向量的权重,从而分析单词在主要类别和子类别中的重要性。单词显示越重要,权重就越高。通过这个原则找到FWS的特征。然后使用 NLTK 进行词干处理并删除停用词。
2.2.2 基于大语言模型的未来工作句抽取
近期,一系列开源的类 ChatGPT 模型,例如ChatGLM
[28]、Mixtral
[29]、Llama
[30]等陆续出现。而在FastChat提出的GPT4的自动评估框架来评估的得分中,Mixtral8×7B有着较高的排名,它是首个通过RLHF训练的模型,并在主流基准测试中超越Mixtral Instruct,成为最佳开源模型。它的性能优于Llama2 70B,在大多数基准测试上表现不逊于GPT3.5,且Mixtral8×7B模型能够支持32000个词元的上下文,它的基础模型没有提示格式,可用于序列补全或零样本/少样本推理,同时Mixtral8×7B在数学、代码生成和多语言理解任务方面表现优秀。因而选择这个模型作为本实验中的 LLM。为了节省本地资源,文中使用的模型采用bfloat16型的精度,其精度水平与原模型相比虽有略微损失的,但可以极大节省本地显存空间,节省计算资源,并且能够显著提升模型响应速度。
除了高性能的开源模型,本研究还选择了GPT-5 Mini和Gemini 2.5 Flash作为对比实验中的大语言模型。这些模型代表了非开源模型在轻量化和速度方面的最新进展,为研究提供了更全面的视角。GPT-5 Mini
[31]作为GPT-5系列中专为高效应用设计的版本,在保证较高精度的同时,极大地降低了模型体积和计算需求。尽管其参数规模远小于GPT-5,但在核心任务(如摘要生成、快速问答)上的表现依然出色,同时显著减少了推理成本。Gemini 2.5 Flash
[32]则专注于极致的推理速度和低延迟。作为Google Gemini系列中速度最快的模型,它在保持高水准性能的同时,能够实现近乎即时的响应。这使得它非常适合需要实时交互或处理大量并发请求的场景,例如对话系统或在线服务,以及需要思考的低延迟、高数据量任务。
思维链
[33]的使用主要是指将提示模板与需要提取的文本分2轮给大模型,有利于大模型形成较为完整的思维链并控制回答效果。首先,准备一系列提示模板,这些模板可以是针对FWS的结构化提示。然后,准备待提取的文本,这些文本包括当前研究的成果、结论或其他相关部分。这些文本将作为大模型的输入,帮助模型理解当前研究的背景和内容。将提示模板作为第1轮的输入,传入大模型中。模型将根据这些提示模板生成初步的FWS的理解和判断能力。将待提取文本作为第2轮的输入,传入大模型中。模型可以在第2轮生成的句子中更好地考虑到当前研究的具体内容和背景,提取更加贴合实际情况的FWS。
一般而言,LLM的输出结果往往受到提示模板的影响。具有相同意图的提示模板可能导致截然不同的结果,这主要取决于提示模板的表述方式。因此,在没有微调模型参数的情况下,实验中提示模板的选择显著地影响FWS识别和分类的质量。模板的设计准则是应该尽量减少LLM输出幻觉内容,同时力求结果尽可能准确又易于解释。在本文中设计每个子任务的模板时都秉持这两个原则。本文中的模板参考时宗彬等学者提出的框架
[19],即完整的提示词应包含Prefix、Instruct、Examples和Input 4个部分。
进行提示工程模板设计时,Prefix部分是固定不变的,其主要功能是确定模型所扮演的角色。Instruct部分则是针对具体任务的详细说明。Examples部分包含的是具体任务的示例,若没有Examples,则意味着该任务属于零样本任务。Input部分则是需要进行信息抽取的文本内容。在提示工程中,所使用的模板如
图2所示,其首要步骤是提取与未来工作相关的章节,以此来缩小FWS后续注释的范围。通常情况下,作者会在论文的“未来工作”章节或“结论”章节中阐述他们后续的研究计划
[34]。因此,如果论文中存在“未来工作”章节,就会直接摘录该章节的内容。若论文中没有“未来工作”章节,则会抽取“结论”章节的内容。而对于既没有“未来工作”章节也没有“结论”章节的论文,则会将其从语料库中剔除。其中,“未来工作句提取Prompt”的主要作用是从文献中标题为“Conclusion”“Future Work”等的段落中筛选出描述未来工作的句子,从而有效缩小信息抽取的范围。该模板主要是通过在Instruct部分的指令来引导LLM识别出FWS,并且将生成的内容限定在Input部分。鉴于句子中可能存在没有FWS的情况,所以在Input部分,当未出现FWS时,Instruct部分会进行特别说明,允许LLM输出为“None”。此外,本文还精心挑选了几类Examples,以此来丰富模板的类型,进而提升LLM答案的准确性。
对于FWS类型的判别如
图3所示,首先将筛选出含有未来工作内容说明的句子作为 Input,让 LLM 根据 Input 的内容回答该FWS的所属类型,为了确保生成类型的准确性,在 LLM 无法判断FWS具体类型时,通过“未来工作句类型判断Prompt”中提示回答为“other”类型,并将回答限制在预先设定好的FWS类型范围内,在实验中,FWS类型的选择被限制在“方法类”“资源类”“评价类”“应用类”“问题类”“其他”这6种类型之间。
2.3 未来工作句的有效性分析方法
为了评估FWS的有效性,本文综合考虑了特定时段内的FWS及摘要。摘要是对论文工作的概述,可以通过提取摘要中的关键字来推测研究的主要内容。本文假设,如果第k年未来的工作句子确实可以为研究人员提供新的研究方向,那么与第k年FWS中相关的关键字应该出现在第(k+n)年的摘要关键字集中。基于这个假设,本文提取了论文中摘要的关键词和FWS中的关键字,并以年为单位比较关键字集的2个部分之间的相似性。
采取KeyBERT方法进行摘要与FWS的关键词提取工作。BERT
[11](bidirectional encoder representations from Transformers)是一种预训练的语言模型,通过学习大规模文本语料库来捕捉文本的语义信息。BERT模型是基于Transformer
[35]架构构建的,其特点是能够同时考虑上下文信息,实现了双向的语义表示。KeyBERT使用无监督的文本摘要方法来提取关键词,基于文本中每个词与整个文本的语义相关性来确定词的重要程度。具体来说,它通过计算每个词的语义向量与整个文本的语义表示之间的相似度来衡量词的重要性。对于每个词,KeyBERT计算其与整个文本的语义相关性分数,并根据这些分数对词进行排序。本文选择排名前10的词作为关键词。
2.4 未来工作句的内容分析方法
2.4.1 FWS的类型分类
对未来工作句(FWS)进行分类,是本研究框架实现从“信息提取”到“情报分析”的关键环节。FWS的分类不仅是一种文本组织方式,更是理解未来研究方向的重要语义入口。理论意义上,FWS并非一个同质化的文本集合。 它们承载着显著异质性的研究动机、发展路径和知识诉求,例如指向方法改进、资源扩展、评估方式完善、应用场景拓展,或是提出新的科学问题。这些类型本身即代表了科学研究的不同推进路径。因此,对未来工作句进行类型划分,能够为后续的趋势分析提供更细粒度的语义支撑,使得本研究能从多维度衡量未来研究方向的演化,而不仅仅是停留在单一、笼统的总体趋势层面。
基于文献调研,本文参考大多数研究对自然语言处理领域FWS的分类方法,将FWS分为方法、资源、评估、应用、问题及其他这6种类型
[34]。该分类方法是研究者通过逐字逐句阅读语料库,确定最重要或最常见的基本概念,已通过饱和测试。
2.4.2 FWS的细分领域分类
本文采取了ACL会议论文集作为语料数据集,目前计算语言学协会年会包含多个领域,代表着当前计算语言学和自然语言处理研究的不同方面
[27]。本文基于ACL2024的会议投稿主题构建了领域词表。根据ACL2024投稿的提交主题,会议的相关主题包括但不限于
表2中的领域。
3 实验及结果分析
3.1 实验设计及结果
3.1.1 数据采集
目前,自然语言处理技术已应用于各种研究,该领域的未来工作越来越受到各个领域的研究人员的关注。因此,在本文中,从ACL Anthology Reference Corpus收集了2001—2022年发表的ACL年度会议的47429篇文章作为实验数据。
通过从论文全文中提取与未来工作相关的章节作为原始语料库,总共有 45703章。然后提取章节的所有名称并通过匹配XML标签执行频率统计,结果如
表3所示。可以看出,大多数作者在论文结束时提出了未来的工作。
3.1.2 数据预处理
根据ACL Anthology Reference Corpus提供的XML格式全文,手动更正了论文的错误格式和内容。使用正则表达式或其他文本匹配方法,从每篇论文中提取出“Conclusion”和“Future Work”等相关章节的文本内容。然后对提取出的章节文本进行清洗,去除无关信息和噪音,例如HTML标记、特殊字符、无意义的停用词等。再调用NLTK库中的句子分割器,将章节文本分割成句子级别的内容。本文利用TF-IDF的方法将提取出的句子转换为向量表示,以便于后续的相似度计算和模型训练。
在标注过程中,如果句子是未来的工作句子,本文会在句子的开头和结尾分别添加<FW>和</FW>标签。此外,本文在正式注释之前进行预注释,以验证并不断修订标签规范。随后的贴标签过程严格按照规范进行。标注完成的数据整理成统一的格式,以便于后续的数据处理和分析。
对于每个模型生成的FWS和对应的人工标注的测试集中的FWS,分别计算它们之间的余弦相似度。通过参考相关文献,本文选择余弦相似度作为评估模型生成的FWS与人工标注的测试集之间的相似程度的指标。如果余弦相似度接近于1,则表示两者非常相似,而如果接近于0,则表示两者之间的相似度较低
[36]。实验流程如
图4所示。
3.1.3 FWS提取方法的对比实验结果
本文标注了400条FWS,并计算了测试集和使用上述方法提取的FWS之间的余弦相似度。如
表4所示,最终发现基于大语言模型(GPT-5 Mini)方法提取的FWS与人工标注的FWS相似度最高,验证了大语言模型在FWS提取上的可行性。本文选用大语言模型作为提取的最终方法,并对不同的FWS提取方法进行了分析。
在FWS的提取任务中,GPT-5 Mini和Gemini 2.5 Flash这2种基于非开源大语言模型的方法表现出了更高的性能,余弦相似度分数分别达到了0.872和0.871。这一结果表明,相较于Mixtral 8×7B及传统方法,这些经过高度优化的轻量级非开源模型在识别这类特定语义句方面具有更高的准确性和效率。它们出色的语义理解能力使其能够更精准地捕捉到“未来工作”这一概念的深层含义,从而显著提升了提取的准确度。
正则表达式及TF-IDF权重词表在FWS提取中的效果相对较低,余弦相似度分别为0.660和0.656。这可能是由于这2种传统方法过于依赖于特定的规则模式及权重值,无法很好地捕捉上下文本中的语义信息,因此在提取FWS时准确度不如基于大语言模型的方法。
值得关注的是,分别将传统模型与3种大语言模型进行结合的方式,与单独使用大语言模型方法相比,它们的余弦相似度分数均有下降,甚至会出现性能低于传统模型的方法,如TF-IDF权重词表+GPT-5 Mini方法的余弦相似度仅达到0.651,低于最优基准方法0.5%。这可能是因为传统模型的固定规则限制了大模型的性能,导致在识别过程中的语义信息缺失,所以二者结合的方法与基准方法的识别性能基本持平,同样不如单独使用大语言模型时的准确率。
综上所述,基于大语言模型的方法在FWS提取任务中具有显著的优势,Mixtral 8×7B(0.755)、GPT-5 Mini(0.872)和Gemini 2.5 Flash(0.871)相较最优基准模型(0.660)分别提升了9.5%、21.2%和21.1%,能够更准确地捕捉文本的语义信息,从而提高提取的准确度。
3.2 结果分析
3.2.1 FWS的预测有效性检验
图5显示了FWS年份和摘要年份关键词之间的相关性程度。逐渐增加的相似性揭示了FWS的实际价值,证明FWS可能在一定程度上反映了未来研究方向的潜在趋势。在水平上,FWS和摘要之间的相关性随着
n的值的增加而减小,FWS关键词所处年份的4~5年内热力图颜色偏红且差异不大,相关程度在79%左右,表明FWS与后续5年内的研究主题之间存在一定相关性。
为进一步探究FWS在时间维度上反映未来研究潜在趋势的能力,本研究选取了当前学术界高度关注且性质迥异的3类重要议题——大语言模型(LLM)、可解释性AI(explainable AI)以及情感分析(sentiment analysis)作为案例,对比其在FWS、摘要和全文文本集合中的年度频率变化趋势,以检验FWS是否展现出时序上的敏感性或领先性。
图6(LLM)、
图7(explainable AI)和
图8(sentiment analysis)展示了这3类关键词的年度频率对比结果。
1)FWS作为技术范式转型的早期预警信号。
2017年前,LLM关键词在FWS和摘要中均处于极低水平,这一现象与当时的技术发展阶段相关。2017年,Transformer架构尚未被提出,深度学习在NLP领域的应用仍以循环神经网络(RNN)、卷积神经网络(CNN)等模型为主,这类模型的参数规模和上下文处理能力有限,尚未形成“大语言模型”的核心技术框架;同时,“预训练-微调”的研究范式尚未成熟,2018年,ELMo和2019年BERT等模型才逐步推动预训练技术的普及,而真正具备大规模参数和通用能力的LLM,比如GPT-3,直到2020年才正式发布。因此,2017年前学术界尚未形成对“大语言模型”的明确认知和研究聚焦。
2017—2019年,随着Transformer架构的提出和预训练模型的快速发展,学术界开始意识到大规模语言模型的潜在价值,FWS中LLM出现频次占比率先呈现增长态势,2019年相对比例突破0.8%,而摘要中同期占比为0.64%。2020年后GPT-3、ChatGLM等LLM的相继问世。2021年FWS中相对比例达到1.4%,摘要中占比不到1.1%,FWS在LLM关键词占比上的持续领先与增长优势,预示了未来关于大语言模型的工作还将继续增长,自然语言处理领域将迎来对大语言模型方法大量应用及开发的范式转变。进一步验证了其作为“学术风向标”的先行指示作用,它不仅提前捕捉到技术范式的转换信号,而且其增长幅度与速度均明显高于摘要,凸显出未来工作陈述在新兴研究方向预测上的敏感性与前瞻性上具有一定的优势。
2)FWS反映领域痛点的前瞻性关注倾向。
图7显示,explainable AI关键词的变化呈现“稳步增长、FWS持续领先”的特征。2009年起FWS中开始出现零星提及,这一阶段深度学习虽已起步,但在NLP领域的应用尚未普及,模型复杂度较低,“黑箱问题”尚未成为突出痛点,因此相关关注较为有限。2013年后,随着深度学习在机器翻译、文本分类等任务中的广泛应用,模型的复杂性日益凸显,可解释性成为制约技术落地的重要因素,在此背景下,explainable AI关键词在FWS中的占比从0.2%逐步升至2021年的3.0%。
而摘要中explainable AI关键词直到2017年后才出现较为明显的增长,2021年占比为1.9%,这一滞后性与研究周期相关,从“提出需求”到“形成成果”存在一定的时间差。研究者在FWS中对explainable AI的持续关注,较早地反映了该领域的现实需求,其在FWS中的高频出现早于摘要中的成果转化,显示出FWS对领域核心痛点的前瞻性捕捉可能。
3)FWS与成熟领域的协同演进。
图8显示,情感分析作为NLP领域一个较为成熟的方向,其关键词在2005年起就已在FWS和摘要中呈现同步出现的态势。2011—2014年,FWS中占比从3.7%升至7.8%,2017年开始,该领域的出现频率呈现下降趋势,2021年两者占比分别稳定在4.2%和3.3%,表明该领域已进入成熟发展阶段。从
图8中还可看出,FWS中出现频率的峰值领先摘要3年,分别为2014年(7.8%)和2017年(5.5%),进一步说明在成熟领域的发展过程中,FWS与领域发展趋势存在一定的相关性,且具备一定的引领作用。
3.2.2 FWS分类结果的语义一致性检验
为了进一步探究大语言模型在FWS类型识别任务上的表现,并从语义层面观察分类结果的可解释性,本文对模型输出的6类FWS进行了关键词分析。具体而言,采用TF-IDF算法量化了各类别FWS中关键词的重要性,并选取了排名前10的高频词汇,其分布情况如
图9所示。
可以看出,基于大语言模型的分类方法可以有效区分FWS的不同类别。每个类别的核心词汇呈现一定的语义聚类特征,且类别间的语义边界具有可区分度。具体而言,方法类的高频关键词主要涉及“模型”“算法”“框架”等技术手段的优化与构建,与之形成对比的是,资源类关键词则集中于“数据集”“语料库”“规模”等与数据基础积累和扩展相关性较高的术语,这暗示了2类未来工作在科研推进路径上倾向于关注不同的要素。评估类关键词中的“指标”“性能”“实验”等词汇反映出未来工作对现有技术进行科学衡量与验证的诉求;而代表外部拓展性的应用类关键词则侧重于“任务”“领域”“场景”,提示其未来工作方向可能涉及功能迁移或环境拓展。此外,问题类关键词倾向于“挑战”“局限性”“探索”,可以体现对技术体系潜在瓶颈的内在驱动。其他类的关键词则相对较为泛化,符合其作为概括性未来工作句的定位。
这种类别间的语义差异性可以更细粒度地划分FWS所阐述的科研意图重心,为追踪不同科研推进路径的演化形态提供支持,同时提升趋势分析的解释力度和信息价值。
3.2.3 FWS类型演化所反映的未来研究趋势
1)未来工作热点的类型特点。
基于未来工作句集的类型分布结果,本研究对NLP领域未来工作热点的类型特点进行了分析,结果见
图10。
可以看出,目前FWS主要可分为应用类、方法类、问题类和评估类,资源类和其他类型占比较小。其中应用类未来工作占据32.8%,表明在NLP领域中,研究者对于将自然语言处理技术应用于实际问题的兴趣较大。这表明未来的研究方向可能包括将NLP技术应用于医疗、金融、教育等具体领域,以解决现实生活中的问题。
方法类未来工作占25.9%,表明目前NLP领域的研究者对于模型、特征、算法和系统的优化和改进仍是较大的工作趋势,包括但不限于改进现有的模型和算法,探索更高效、更精确的自然语言处理技术等。问题类未来工作占20.7%,表明研究者同时也关注提出和解决一些具体的问题,如怎样解决语言理解、语言生成、情感分析等方面的挑战,以提高自然语言处理的性能等。
评估类未来工作占据了相对较少的比例(14.6%),说明研究者在如何评估和衡量自然语言处理性能方面也在进行一定的思考。未来的研究热点可能包括开发新的评估指标、构建更准确的评估数据集,以及设计更有效的评估方法。
总体而言,2001—2022年的ACL会议论文对于NLP领域的应用、方法和问题方面的思考较为平均,其中应用类型占比最大,表明当前NLP理论研究已经较为成熟,如何将理论应用于实践,在一些具体的领域和任务上发挥作用逐渐成为最为关注的话题。
2)热点类型发展趋势。
本文以年为单位构建了ACL会议论文集中的FWS类型变化折线图,有利于更直观地观察和分析热点类型的发展变化趋势。
如
图11所示,每个类型的变化趋势均较为平缓,但分层明显。应用类的未来工作发展波动不大,且始终占比最大,虽然2004—2008年略有回落,但在2008年之后始终呈现上升趋势。
对于方法类的未来工作,2001—2003年,占比迅速上升,并在2005年达到研究最高点,但在2005年之后整体上始终呈现下降趋势。该现象可能与NLP领域的研究热点和重点转移有关。随着大规模数据和深度学习等新技术的兴起,研究者开始更多地关注数据驱动的方法和端到端的模型,而非传统的基于规则或特征工程的方法。这使得一些传统的方法类未来工作逐渐失去了研究价值,导致其占比下降。
这将推动NLP技术向更高级别的语义理解和推理发展,实现更加智能化的自然语言处理应用,从而将促进NLP技术在各个行业和领域的落地应用。总的来说,未来NLP领域的应用研究将继续保持活跃,并朝着跨领域、多模态、智能化和定制化等方向发展。这将为社会带来更多智能化、高效化的自然语言处理解决方案,推动人工智能技术在各个领域的应用和发展。
3.2.4 FWS关键词所反映的研究热点变化
本研究利用KeyBERT算法提取出来了FWS的关键词并计算了其频率,以了解不同年份FWS中的研究热点内容,以及所属应用类的FWS所关注的热点。
由于空间有限,考虑到应用类型的FWS数量占比最大且预测未来仍会保持,这表明NLP领域的研究人员更加关注技术的应用,因此以下的结果分析以应用类型为例。
1)高频热点演化趋势分析。
本研究利用KeyBERT算法抽取出了FWS中的高频关键词,根据前文,已经论证了FWS对于预测5年内的热点工作有效性较高,通过研究不同年份频率较高的关键词有助于识别不同时间阶段下的学术研究热点内容,分析其变化及变化的原因。本研究以应用类FWS为例,通过对2001年、2011年和2021年的应用类FWS中关键词分布情况进行比较分析,可以观察到NLP领域在不同时间节点的研究重点和发展方向的变化。
如
图12所示,2001年的应用类FWS主要关注机器翻译(translation)、语言学(linguistic)、语义(semantic)和规则(rule)等方面。当时NLP领域的研究重点主要集中在传统的机器翻译技术和语言学理论应用上,研究主要围绕着语义理解和规则推理展开。到了2011年,应用类FWS的关键词中出现了更多与方向(direction)、语义(semantic)和数据集(larger set)相关的术语。这表明NLP领域的研究重点逐渐向着更加具体的应用方向发展,开始关注语言数据集的规模和质量,以及语义理解和方向性研究的应用。2021年,应用类FWS的关键词中出现了更多与数据集(dataset)、训练(training)、嵌入(embedding)和向量(metrics)等相关的术语。这反映了当前NLP领域研究重点向着深度学习和预训练模型的应用方向发展,关注数据集的构建和训练模型的表示能力。
2)细分领域下的热点分析。
最后本文分析了不同领域下应用类FWS的占比变化,如
图13所示。在应用热度层面,“句法:标注、分块和解析”“摘要”“语音识别”“情感分析、文体分析和论证挖掘”的热度最高。这些任务在人机交互
[37]、舆情监控
[38]、政治言论分析
[39]等领域有广泛的应用。
基于当前的趋势和技术发展,可以预测未来以上几个领域的应用热度可能会继续增长。语音识别、自然语言理解和生成等技术将被广泛应用于智能助手的开发和优化,以提供更加智能和个性化的服务。随着人们对在线服务和电子商务的依赖程度增加,智能客服和用户支持的需求也将增加。语音识别、文本分析和自然语言理解等技术可以用于开发智能客服系统,提供更高效、更便捷的用户支持服务。
4 总结及展望
4.1 总结
以FWS为研究对象,通过构建基于大语言模型的自动化提取框架,实现从海量文本中对FWS的自动提取。通过比较基于大语言模型、基于正则表达式算法以及基于权重词表算法的准确度,验证了基于大语言模型提取FWS的可行性。同时,利用大语言模型识别FWS类型和挖掘出其所属的NLP细分领域,并结合KeyBERT算法验证了FWS预测未来研究主题的有效性,最终得出结论:当时间窗口为5年时,模型预测效果最佳。在对比实验结果的基础上,文章进一步实证分析了NLP领域2001—2022年大语言模型、可解释性AI、情感分析3类研究主题的词频变化,通过对比未来工作句与摘要句,发现未来工作句对研究主题的前瞻性较高,能在一定程度上反映未来研究方向。此外,本文对基于大语言模型的FWS自动分类结果进行了语义一致性检验。在此基础上,本文深入研究了未来工作热点的类型特点、热点类型的发展趋势以及FWS关键词所反映的研究热点变化。本研究得到的结论如下。
基于大语言模型的方法在FWS提取任务中具有显著的优势,Mixtral 8×7B(0.755)、GPT-5 Mini(0.872)和Gemini 2.5 Flash(0.871)相较最优基准模型(0.660)分别提升了9.5%、21.2%和21.1%,能够更准确地捕捉文本的语义信息,从而提高提取的准确度。同时发现,在FWS提取这类需要复杂语义理解的任务中,大语言模型本身就具备了足够强大的能力,盲目地将传统规则与这些模型结合,不仅无法带来性能提升,甚至可能因为规则的限制而“束缚”了模型的推理能力。
在未来研究热点类型方面,应用类工作占据最大比例,反映了学界对NLP技术的应用和发展转向实际问题解决,问题类和评估类未来工作保持稳定。在未来研究热点内容方面,本文将NLP研究领域2001年到2022年的发展划分成四个阶段。当前NLP领域重点关注数据集的构建和训练模型的表示能力。在应用热度层面,“句法:标注、分块和解析”“摘要”“语音识别”“情感分析、文体分析和论证挖掘”的热度最高,在医疗健康、金融、教育等垂直领域,以上的细分任务均会得到更广泛的应用。
4.2 未来展望
未来可以进一步探索并优化基于大语言模型的FWS识别及分析方法,以更好地解决当前存在的挑战和问题,具体包括以下内容。
1)数据增强与扩展。在未来的研究中,应考虑引入更多领域的数据集,而不仅限于NLP领域。通过将该方法应用于物理、化学或医学等其他学科领域,可以更全面地了解其泛化能力,并为跨学科研究提供支持。
2)扩大数据集研究年份。目前的数据集只涵盖到2022年,为了更好地反映近年来的研究热点和趋势,未来工作应该将近几年的数据纳入分析范围,以捕捉最新的研究动态。
3)优化提示词工程模块。提示词工程模块在研究中发挥着关键作用,因此需要不断优化和改进,以提高FWS的准确性和可预测性。通过细化和定制化大语言模型,针对FWS识别任务的特点进行优化,以进一步提高模型的性能和效果。
通过以上工作提升基于大语言模型的FWS识别及分析方法的质量和效果,为学术研究和实践应用提供更有力的支持和指导。