面向大语言模型指令微调的锂离子电池专利细粒度技术指标抽取数据集构建

宋坤 ,  王学昭

科学观察 ›› 2026, Vol. 21 ›› Issue (4) :114-128

PDF (4892KB)
科学观察 ›› 2026, Vol. 21 ›› Issue (4) :114-128 DOI: 10.15978/j.cnki.1673-5668.20260425
数据观察

面向大语言模型指令微调的锂离子电池专利细粒度技术指标抽取数据集构建

作者信息 +

Fine-Grained Technical Indicator Extraction Dataset from Lithium-Ion Battery Patents for Instruction Tuning of Large Language Models

Author information +
文章历史 +

摘要

[目的/意义] 针对通用大语言模型在处理高度复杂的锂离子电池专利文本时,常面临垂直领域常识缺失与跨语境知识不对齐的局限,构建了一套面向大模型指令微调的双语细粒度技术指标抽取数据集,旨在赋能模型实现对复杂工业语境的精准解构。[方法/过程] 通过全球专利检索与清洗构建双语语料池,引入“非等比例分层过采样”策略,建立跨语言知识锚点;采用多智能体协作预标注与“人在回路”专家深度校验机制,完成对技术指标语义五元组的规范化淬炼。[结果/结论] 形成包含1887条高质量指令微调样本及配套评测基准的数据集。效度验证结果表明,经本数据集微调后的专家模型抽取效度实现了大幅度提升,综合评价分数(F1*)达到88.75%。本数据集能有效注入领域权重并纠正句法依存偏差,为垂直领域大模型研发、知识图谱自动化构建及专利技术方案评估提供语料支撑。

Abstract

[Objective/Significance] General large language models (LLMs) frequently encounter significant limitations when processing highly complex lithium-ion battery patent texts, particularly regarding the deficiency of vertical-domain common sense and the misalignment of cross-lingual knowledge. This research constructs a bilingual, fine-grained technical indicator extraction dataset specifically designed for model instruction tuning, aiming to empower language models with the capability to accurately deconstruct and interpret intricate industrial contexts. [Method/Process] The methodology of this study follows a rigorous and systematic process. Initially, a bilingual corpus pool is established through comprehensive global patent retrieval and data cleaning. A key innovation in this stage is the introduction of a disproportionate stratified oversampling strategy, which is utilized to establish stable cross-lingual knowledge anchors. Subsequently, the research employs a knowledge-augmented framework featuring multi-agent collaborative pre-labeling combined with a robust human-in-the-loop (HITL) expert validation mechanism. This integrated approach ensures the precise extraction and normalization of technical indicator semantic quintuples, which consist of indicator names, objects, values, relations, and experimental conditions. [Results/Conclusions] The study ultimately produces a dataset containing 1887 high-quality instruction-tuning samples and a corresponding evaluation benchmark. Performance validation demonstrates that the expert model fine-tuned on this specialized dataset achieves a substantial improvement in extraction efficacy. The comprehensive evaluation score, specifically the F1* metric, reached an impressive 88.75%. The findings indicate that this dataset effectively injects domain-specific weights into language models and corrects syntactic dependency biases. Ultimately, this work provides a foundational linguistic infrastructure for the research and development of vertical-domain large models, the automated construction of industrial knowledge graphs, and the quantitative evaluation of patent technical solutions.

Graphical abstract

关键词

锂离子电池 / 大语言模型 / 指令微调 / 专利情报 / 信息抽取 / 数据集

Key words

lithium-ion battery / large language model / instruction tuning / patent intelligence / information extraction / dataset

引用本文

引用格式 ▾
宋坤, 王学昭. 面向大语言模型指令微调的锂离子电池专利细粒度技术指标抽取数据集构建[J]. 科学观察, 2026, 21(4): 114-128 DOI:10.15978/j.cnki.1673-5668.20260425
Song Kun, Wang Xuezhao. Fine-Grained Technical Indicator Extraction Dataset from Lithium-Ion Battery Patents for Instruction Tuning of Large Language Models[J]. Science Focus, 2026, 21(4): 114-128 DOI:10.15978/j.cnki.1673-5668.20260425

登录浏览全文

4963

注册一个新账户 忘记密码

0 引言

锂离子电池作为新能源产业的核心动力源[1],其技术创新格局不仅关乎全球“双碳”目标,更是突破发达国家技术胁迫、实现高技术制造业技术赶超的战略制高点[2]。在技术演进与评估的进程中,专利文献蕴藏着极具价值的情报线索[3]。然而,传统的专利情报挖掘多聚焦于引用网络结构或网页排名(PageRank)等宏观外部特征的测度[4]。随着数智时代的全面到来,科技情报工作正经历着从传统管理信息系统向大模型驱动的“智能科技情报洞察”与“情报智能体”的深刻范式重塑[4-6]。行业迫切需要突破宏观统计的局限,深入探究非结构化专利文本,提取细粒度的微观技术指标。在转型过程中,尽管大语言模型(large language model, LLM)正深刻重塑情报分析流程,但情报分析师在框架设定、有限理性与辨别力方面的核心地位依然无法被完全替代[7]

在面向细粒度技术指标的信息抽取任务中,早期方法主要依赖基于深度学习的命名实体识别[8]与联合抽取混合神经网络[9]。以新能源专利为例,基于BERT-BiLSTM-CRF等架构的模型虽取得了一定成效[10],但此类判别式模型严重依赖海量人工标注语料,且在应对复杂实体关联时泛化能力受限。近年来,LLM的全面爆发[11]为生成式信息抽取带来了革命性的技术跃迁[12]。在交叉学科应用中,LLM已被广泛探索用于深度学习材料发现[13]与化学工具增强[14];在情报抽取实践中,零样本对话式抽取[15]、基于本地大模型结合提示工程的材料信息抽取[16]、基于ChatGPT API的智能驾驶专利知识图谱构建[17]均验证了其高效性。部分学者甚至利用大模型知识自蒸馏(knowledge self-distillation)策略,实现了无标注专利文本的关键信息自动化抽取[18]

尽管LLM在零样本抽取中展现出巨大潜力,但在面对锂电池专利中复杂的物理量纲、中英双语异构表达以及嵌套实验条件时,单一通用模型极易出现遗漏或事实性“幻觉(hallucination)”。为了提升模型在复杂业务流中的逻辑严密性与鲁棒性,基于大语言模型的自主智能体成为当前探索的前沿[19]。通过引入多智能体(multi-agent)协同框架(如 MetaGPT)将复杂任务解耦[20],并结合多智能体辩论机制(multi-agent debate)与LLM评估者(LLM-as-a-judge)进行交叉验证[21],能够有效识别并缓解单一模型的抽取误差,实现情报抽取的高质量自校验。

为了引导大模型精准适配如案件信息要素[22]、古籍限定域关系[23]等高专业壁垒场景的细粒度特征抽取,构建高质量的指令微调(instruction tuning)数据集已被证明是一条行之有效的路径,结合低秩自适应(low-rank adaptation, LoRA)等参数高效微调技术为上述微调范式的低成本、工程化落地提供了重要支撑[24]。在此进程中,以数据为中心的人工智能(data-centric artificial Intelligence, DCAI)理念被提至核心地位[25]。多项经典研究表明,数据质量对模型对齐效果的决定性远大于数据规模(即“less is more for alignment”)[26],且高质量的教科书级别数据足以让小规模模型展现出惊人的涌现能力[27]。为此,结合自我指导机制(self-instruct)[28]、基于人类反馈的强化学习(reinforcement learning from human feedback, RLHF)[29]以及人机协同交互(human-in-the-loop, HITL)的可视化提示工程[30],构建高质量的领域微调语料库,正成为赋能垂直领域大模型的核心基石。

目前,开源社区已涌现出诸如InstructIE等优秀的中文指令抽取数据集[31],但在高度细分的电池材料专利场景中,面向复杂技术参数且经过严格质量控制的双语微调数据集仍然较少。本工作遵循科学数据管理的FAIR(findable, accessible, interoperable, and reusable)指导原则[32],提出并构建了一套面向LLM微调的锂离子电池专利细粒度技术指标双语金标准数据集。本研究创新性地结合知识增强的智能体协同预打标与领域专家人在回路(human-in-the-Loop, HITL)[26,29]的深度校验机制,淬炼出高置信度的指令对数据。该数据集将在一定程度上降低大模型在电池知识产权领域的专业对齐门槛,为未来的科技情报挖掘与技术方案评估提供数据基座。

1 数据采集与处理方法

本数据集的构建以“高质量、高置信度、细粒度”为核心导向,整体流程包含底层语料检索筛选、分层抽样构建测试集,以及智能体协同与专家人在回路的深度标注3个关键阶段。

1.1 原始语料检索与分层抽样

本研究的原始语料依托incoPat全球专利数据库进行获取,为确保数据的领域代表性与技术前沿性,检索策略聚焦于锂离子电池及其核心技术指标,时间跨度限定为2021年1月1日至2025年12月31日,且专利法律状态限定为“有效(Active)”。检索式设定为:(((TIABC=(“锂离子电池” OR “锂电池”) AND TIABC=(“能量密度” OR “循环寿命” OR “倍率性能” OR “首次放电比容量” OR “固态电池”)) OR (TIABC=(“lithium-ion battery” OR “Li-ion battery”) AND TIABC=(“energy density” OR “cycle life” OR “rate capability” OR “initial discharge capacity” OR “solid-state battery”))) AND AD=[20210101 TO 20251231]) AND ((STATUS=(“有效”)))。

在完成初步检索后,共获取12323个初筛专利族,执行同族合并,最终保留了3324条高价值专利文本。统计结果显示,清洗后的语料呈现出显著的地理长尾分布特征,其中中国2982篇、美国137篇,其余少量分布于日本、韩国、印度、俄罗斯及英国等国家和地区。锂离子电池专利全球地域排名见表1

为了对大语言模型(large language model, LLM)双语跨语境解析能力进行客观且集中的评测,本研究在后续抽样中排除了小语种及极小样本国家文本,严格聚焦于中国与美国2大数据集(共计3119篇),构建纯净的中英双语语料池。

在构建包含200篇高质量说明书的“金标准”测试集时,全量语料中存在数据不平衡的问题,美国专利占比约4.4%,数量偏低,若采用传统的严格等比例抽样方法,将导致英文测试样本基数过小,进而使跨语言实体的效度评测失去统计学意义。为此,本研究采用了非等比例分层抽样对英文语料进行了适度的过采样,最终从2982篇中国专利中随机抽取160篇(设定占比80%),从137篇美国专利中随机抽取40篇(设定占比20%)。这一抽样设计不仅保障了中文核心语料在数据分布上的主导地位,同时确保了英文语境下(特别是涉及英制物理量纲换算与跨语言实体对齐任务)的效度评测具有统计学显著性。

1.2 版面解析与文本切片

为降低大语言模型处理开销并减少冗余信息干扰,本研究构建了由版面解析、标准化处理及启发式过滤组成的预处理流水线。在版面解析阶段,利用PyMuPDF提取文本块坐标信息,通过列聚类与纵轴排序重构双栏阅读顺序;同时集成光学字符识别模块(optical character recognition, OCR)补齐扫描页及内嵌图表中的技术信息。在标准化阶段,系统执行连字符修复与Unicode(统一码)规范化,并采用基于正则表达式的掩码保护策略进行自然句切分,以确保数值(如小数点)与缩写结构的完整性。依据指标特征词与物理单位词执行启发式过滤,仅保留同时满足“包含阿拉伯数字”与“命中特征词/单位”的候选句。该流程有效剔除了背景描述与法律条款等非技术段落,实现了专利语料的高效降噪。

1.3 智能体协同预标注

为了在锂电池专利的复杂语义环境下实现高精度信息提取并抑制模型幻觉,本研究构建了基于知识增强的双智能体框架(knowledge-augmented dual-agent framework, KADF)(图1)。该框架由抽取智能体(extractor agent)与裁判智能体(judge agent)组成,通过协同作业将非结构化文本转化为结构化知识。

抽取智能体负责执行细粒度技术指标的初步识别,系统调用GPT-4o模型,并设定较低的采样温度(温度参数通过缩放softmax函数的概率分布来控制生成结果的随机性,值越低,输出越确定,此处设为0.1)以确保输出的稳定性,以预处理阶段生成的XML标签增强文本为输入,利用标签中的<subject>(指标对象提示)与<value>(量值/条件提示)剥离长难句干扰,精准提取包含“指标名称、指标数值、指标关系、指标对象、实验条件”在内的五元组信息。针对英文专利语料,智能体执行跨语种抽取策略,自动将技术术语映射为规范中文术语,同时保留原始数值与物理量纲,从而实现跨语言语境下的知识对齐。裁判智能体执行零样本(zero-shot)逻辑核查。该智能体被赋予严苛的评审准则,采样温度设定为0以追求判决的确定性。裁判智能体将原始文本与初步抽取的五元组进行对比,从事实准确性、属性归属一致性以及实验条件完整度3个维度执行量化评分(0~10分)并给出仲裁理由。系统仅在最后保留获得高置信度评分(10分)的五元组作为预标注产物,而对于中低分样本则记录其仲裁理由,这种“生成-校验”的闭环机制显著降低了单一模型产生事实性幻觉的风险,为后续的人在回路阶段提供了具备高基础准确率的数据候选集。

1.4 数据标准化与专家校验

经过知识增强的双智能体框架(KADF)生成的预标注结果虽具备较好的逻辑一致性,但在实体规范化与物理量纲统一性方面仍需进一步对齐。本研究设计了全局标准化与专家深度校验过程,在数据标准化阶段,系统依据预设的归一化规则库对初步抽取的五元组进行清洗,将指标术语归一化,把语义一致但表述不同的技术术语统一映射至预定义的标准本体术语;将量纲统一化,利用启发式规则识别物理单位,并将不同量级或制式的单位进行等值换算,确保同类技术指标在统一度量衡下具有可比性;接着进行量值格式化,剥离数值中的非语义符号噪声,把区间值统一封装为标准化的JavaScript对象简谱(JavaScript object notation, JSON)数组格式。为确保数据集达到指令微调所需的“金标准”级别,本研究引入了人在回路校验机制,从预标注池中导出经过分层抽样的200篇高质量专利五元组候选集。2名具备材料科学与情报学交叉背景的专家执行背靠背审计,专家参照原始专利全文,针对3个核心维度进行逐条核实:第一是事实准确性,核实抽取的数值与实验条件是否与原文对应;第二是条件完备性,检查是否存在缺失的关键约束变量;第三是锚点强制性,执行“指标-数值”双锚点过滤法则,任何缺失核心指标名称或具体指标数值的条目均被视为无效。对于专家间存在认知冲突的样本,由首席专家进行终审裁决。通过“机器预处理-规则归一化-人工精准淬炼”的协同模式,一定程度上提高了人工审核的效率,本研究最终从初筛语料中洗练出1887条具备100%置信度的细粒度技术指标集合,构成本数据集的核心资产。专家人在回路 (HITL) 校验逻辑图见图2

2 数据样本描述

2.1 数据规模与语种分布

本数据集共包含1887条经过领域专家深度校验的高质量指令微调样本,这些样本来自分层抽样构建的200篇(160篇中国专利与40篇美国专利)核心语料池。在语种分布特征上,数据集呈现出明确的双语跨语境结构,如图3所示,数据集中的中文样本共计1502条,占样本总量的79.60%,英文样本共计385条,占总量的20.40%。

初筛语料库中中美专利比约为21∶1,在全球锂电池专利产出分布中,中国专利在绝对数量上占压倒性优势,若采用严格的等比例随机抽样,英文测试样本将被严重稀释,导致大模型在跨语言实体抽取评测上失去统计显著性。因此,本研究实施了“非等比例分层过采样”策略,人为将英文语料的抽样权重提升至20%,数据集约8∶2的语种配比具有2层考量:第一,近80%的中文核心语料符合全球电池产业现实的技术分布格局,确保微调模型在主导语境下的参数更新不发生偏移;第二,近20%的外文语料作为关键的“跨语言知识锚点”,强制模型学习典型的英制物理量纲、国际通用学术缩写及外文特定的句法依存结构。这种分布不仅保障了本数据集的领域代表性,更为解决LLM在跨语境专利分析中的知识不对齐问题提供了坚实的语料基础。

2.2 语言学属性与文本特征

在语言学属性与文本复杂度方面,本数据集有别于传统命名实体识别(named entity recognition, NER)或关系抽取任务中常采用的“短句/单句”语料范式,聚焦于包含完整上下文逻辑的专利实施例(examples)长文段。

在文本长度分布上,统计显示,本数据集单个样本的输入文本平均长度达到664个字符,如图4的文本长度频次分布与图5的中英文本核密度小提琴图所示,中文、英文在长度分布上呈现出高度的统计学一致性,其核心分布区间集中在300~1000个字符,并伴有显著的长尾特征。

这种“长文本、高密度”的输入设定对于LLM微调具有重要的学术价值:一方面,它强迫模型在冗长的上下文中学习远距离依赖机制与降噪注意力分配,有效避免了模型在指令微调后出现长文档阅读能力退化的现象;另一方面,真实的电池专利实施例往往包含繁杂的制备步骤、原料配比与测试方法,300~1000个字符的篇幅跨度最大程度地保留了指标参数存在的真实语义环境,杜绝了脱离语境的机械抽取。

2.3 知识实体与本体丰富度

本数据集通过实体对齐与聚类处理,构建了涵盖电池材料、工艺与性能的细粒度知识本体。统计结果表明,数据集共解析并规范化了427种技术指标、971种材料或部件对象以及307种实验条件参数。

在指标分布与粒度特征方面,除常规的宏观电池性能参数(如能量密度、循环寿命)外,数据集保留了较高比例的材料理化性质与中间工艺参数。如图6的核心技术指标频次分布与图7的指标特征词云所示,“首次放电比容量”“中位粒径”“烧结温度”及“压实密度”等微观特征词具有较高的出现频次,这种分布特征有助于大语言模型在微调阶段,学习跨越“材料合成-电极制备-电芯测评”完整技术链条的特定领域实体指代关系。

在物理边界与条件约束方面,鉴于电池技术参数通常需要依附于特定的测试环境,数据集对实验条件进行了独立维度的结构化标注。如图8的实验条件分布图所示,所提取的307种约束条件主要覆盖了测试倍率(如0.1C、0.5C)、温度环境(如常温、高温)以及物理测试环境(如-80 kPa)等维度。实验条件的保留,为下游的同构化技术方案对比提供必要的数据前提,同时引导模型在指令遵循过程中拟合“条件-结果”的依存逻辑。

在实体语义关联与共现特征方面,本研究对“指标对象”与“技术指标”的共现频率进行了交叉矩阵分析。如图9的对象-指标共现热力图所示,数据集中存在清晰的领域属性分布。受限于矩阵规模(971个对象×427个指标),图9仅截取展示了Top15高频核心节点的局部共现矩阵,由于细粒度数据的长尾分布特性,最大频次15已体现出显著的统计学聚集效应。其中,“正极”对象在“比容量”“中位粒径”和“烧结温度”上呈现出极高的共现热度,从材料学角度来看,正极材料(如三元高镍或磷酸铁锂)的晶体结构生长高度依赖于烧结温度,而其一次/二次颗粒的中位粒径直接决定了锂离子的扩散路径长度与比表面积,这两者共同构成了决定正极比容量的核心工艺参数,这种共现关系的捕获,证明数据集不仅抽取了结果,更保留了“工艺-形貌-性能”的因果逻辑链。而“电芯/电池”层级的对象则主要与“能量密度”“保持率”和“循环寿命”关联。保留此类客观存在的特征共现矩阵,有助于模型在监督微调过程中隐式学习锂电池领域的层级概念结构,从而在一定程度上降低抽取任务中属性错配等逻辑偏差的发生概率。

3 数据质量与验证

高质量的微调数据集是大语言模型在垂直领域内实现结构化抽取能力的前提,为客观评估本数据集的有效性与可靠性,本研究分别从数据生产阶段的质量控制以及微调任务的下游效度评测2个维度展开实证分析。

3.1 数据质量控制

本数据集的质量控制机制由“机器预标注”与“专家人工校验”2个阶段构成。在经过KADF框架预处理后,系统依据设定的规则初步过滤了低置信度样本。为克服大语言模型在垂直领域复杂语境下的认知局限,引入人在回路机制,由2名具备材料科学基础的研究人员对导出的1887条样本执行背靠背独立复核[33]

为客观量化专家人工校验的可靠性,本研究采用Cohen’s Kappa系数([34]进行一致性评估,2名校验人员依据原始专利文献,对预标注五元组的4个核心维度进行独立判定。如表2所示,在“核心指标提取”与“属性对象关联”等主要维度上,判定结果展现出较高的一致性水平。对于少数由于专利文本表述模糊或上下文指代不清引起的分歧样本,最终由第3位专家介入并经过讨论后形成共识。结果表明,本数据集的标注规范具备良好的可执行性,数据质量整体稳定。一致性水平分类参考Landis & Koch评价标准[35]>0.80视为达到极强/强一致性。

表3展示了基于通用基座大模型进行机器预标注阶段的高频典型错误,以及专家在人在回路复核阶段给出的金标准修正,这也进一步揭示了专利文献在长距离依赖、物理法理边界及领域常识方面的复杂性,凸显了领域专家深度介入的必要性。

脱离物理化学语境与专利法理规范的单纯自然语言抽取模型在面对高信息密度的工业文本时,往往退化为机械的数值捕捉器,特别是面对跨层级属性错配以及核心术语未对齐时,这种伪正确的数据一旦进入下游所构建的指标图谱,将引发严重的逻辑链条断裂。因此,1887条经过HITL纠错与清洗的金标准数据,从根本上弥补了通用大模型在垂直细分领域的常识性认知空白。

3.2 模型微调设置

为验证本数据集在提升模型专业抽取能力方面的实际效用,本研究基于所构建的1887条数据,开展了监督微调(supervised fine-tuning, SFT)[29]实验。专利实施例文段通常具有参数密集的特征,单一长句或段落中可能包含多组技术指标,本研究在预标注策略与指令微调阶段遵循全量尽抽的原则,抽取出所有的技术指标五元组。若一个实施例文段中存在多组技术指标,模型会将其并行抽取为由多个字典构成的列表。

实验选用具有良好中英双语能力与逻辑推理能力的开源大语言模型Qwen-2.5-7B-Instruct作为基座模型。相较于基础模型,Instruct版本具备一定的指令遵循先验能力,能够更高效地在小规模高质量数据集上实现特定任务的表面对齐,微调实验使用LLaMA-Factory框架实施(图10)。为客观评估模型的泛化能力与跨语言效度,本研究将数据集划分为训练集与测试集进行独立验证。考虑到全参数微调(full parameter fine-tuning)在小规模数据集上易引发严重过拟合与知识遗忘,本实验采用低秩自适应(low-rank adaptation, LoRA)参数高效微调技术,为完整覆盖专利实施例文本较长的上下文边界,最大截断序列长度(cutoff length)设定为2048 Tokens。

本实验的微调软硬件环境配置见表4,核心训练超参数见表5

3.3 训练收敛性与抽取效度评测

为全面量化本指令微调数据集的实际应用价值,本研究从模型训练的内部收敛状态与外部的下游抽取任务表现2个维度展开了效度评测。

3.3.1 模型训练收敛性分析

在监督微调(SFT)阶段,模型的训练损失(training loss)是反映数据集内部一致性与标注纯度的直接客观指标,如图11所示,基座模型在加载本研究构建的1887条指令对后,其损失值呈现出极其平滑的单调递减趋势。

具体而言,在训练的初始阶段,随着模型开始适配专利领域特定的五元组结构化指令,损失值从初始的1.90左右出现预期的快速下降,随后在余弦退火(cosine)学习率调度策略的引导下,曲线平稳进入收敛期。在整个705个全局迭代步数(Epoch=3.0)的训练周期内,梯度更新稳定,全程未出现由于数据标注噪声或逻辑冲突而引发的剧烈振荡。最终模型的全局平均训练损失(train loss)稳定在0.293,且末期单步Loss最低降至0.192。这一理想的收敛态势印证了本数据集经过KADF双智能体与HITL专家的双重严格清洗,具备高专业纯度与格式一致性,有效避免了小规模数据微调常伴随的梯度爆炸或知识遗忘现象,为下游的高效推理奠定了模型权重基础。

3.3.2 抽取效度评测

为验证本数据集在微调大语言模型进行复杂领域情报抽取中的实际效能,本研究构建了包含100条高质量锂电池专利抽样文本的独立测试集。实验采用Qwen2.5-7B-Instruct作为通用基座模型,并设计了梯度消融实验,以全面评估指令微调(SFT)对模型领域知识对齐的作用。

由于专利文本在表述上存在物理量纲的多样性,以及实验条件的隐式省略现象,传统的精确匹配指标在面对生成式语言模型时,由于对自然语言表述的多样性缺乏弹性,易引发严重的过度惩罚[36]。本研究借鉴了软匹配与多维评估的思想[37],设计了一种动态加权评价模型。在评价过程中,抽取的指标在计算前引入了归一化模块,并对技术指标五元组赋予动态权重,核心物理要素(指标名称、数值、关系)总权重设为0.7,场景要素(指标对象、实验条件)各占0.15。评分逻辑采用“核心要素一票否决制”,若核心要素匹配失败,该实例计0分;若核心要素正确,则允许场景要素存在基于字符串相似度的软匹配与隐式缺失容错,最终计算加权精确率(precision*)、加权召回率(recall*)及综合分数(F1*)。该评价体系相较于传统算法,更真实地反映了模型在复杂专利文本处理中的语义解析能力。

表6所示,实验设置了3种验证范式,以剥离指令跟随能力与领域知识注入对抽取效果的独立影响。

3种评测范式下的量化效度对比结果如图12所示。

实验结果表明,在处理高壁垒专利情报抽取任务时,模型展现出了显著的能力分层现象。

(1)基座模型(0-Shot)存在结构化响应失效问题。在未提供示例的0-Shot状态下,通用基座模型的F1*值仅为4.77%,其召回率低至2.55%。错误日志显示该模型在此设定下的格式错误率高达93.00%,表明专利五元组抽取任务叠加了“本体归一化”“跨句隐式推理”等多重深层约束,即使是百亿参数规模的模型,在面对高密度格式约束与长文本推理叠加时,也极易出现注意力坍缩与规则过载现象[39-40],导致通用模型指令跟随失效,无法稳定输出合法的JSON结构,证明了专利文本技术指标抽取任务的困难程度较高。

(2)基座模型(3-Shot ICL)实现了句法对齐但存在语义偏差。引入3个专家示例后,凭借LLM强大的上下文学习能力,3-Shot基座模型的格式错误率迅速降至0%,其F1*值提升至80.80%。然而,对错题集的溯源分析发现,其残存的约19%误差高度集中于“关系泛化失败”与“隐式实体混淆”。例如,面对区间数值(如“70~80 °C”或“9~12 h”)时,3-Shot模型常受制于示例的统计分布偏置,机械地将指标关系输出为“等于”而非“范围为”;在处理复杂制备工艺时也无法精准剥离指标对象与条件状语。这说明少样本提示仅能解决模型的格式对齐问题,并不能赋予其深层垂直领域逻辑[41]

(3)专家微调模型(0-Shot SFT)实现了领域知识的深层注入。使用构建的1887条高质量精标数据对基座模型进行指令微调后,专家模型在完全不依赖示例(0-Shot)的前提下,F1*值进一步提升至88.75%,这近8%的效度提升意味着模型相对错误率较3-Shot范式下降了约41.4%。此结果证明了本数据集能够有效将深度的图谱构建逻辑、物理量纲对齐准则与电化学常识内化为模型的底层参数权重,使其基本具备了超越简单模仿的专家级零样本泛化能力。少量的剩余误差(大约11.25%)主要源于文本中多指标极度密集共现时产生的注意力劫持,这也为后续引入多智能体交叉验证提供了优化方向。

4 数据使用声明与应用展望

4.1 数据获取与开源协议

本研究采取了“训练集-评测基准-模型权重(dataset-benchmark-model)”全栈式开源策略,完整资源包已托管至国际开源人工智能社区Hugging Face,读者可通过文章附属的开源链接获取以下核心资产。

(1)指令微调训练语料(SFT dataset):包含1887条经过多智能体预标注与专家校验的高质量双语样本。

(2)领域抽取评测基准(evaluation benchmark):包含100篇高质量抽样专利的标准指令测试集及人工校验金标准。同时配套开源了动态加权评价算法(F1*)脚本,供研究者进行跨模型效度评测。

(3)专家模型增量权重(LoRA Adapters):基于Qwen2.5-7B训练的Battery-Expert微调适配器权重,便于实现专利图谱的即插即用式解析。

本研究所有开源组件均严格遵循知识共享署名-非商业性使用4.0国际许可协议(CC BY-NC 4.0),授权科研人员在非商业场景下自由下载与二次开发。开源链接: https://huggingface.co/SongKun909/Qwen2.5-7B-Battery-Expert-LoRA

4.2 应用展望与结论

4.2.1 下游任务应用展望

本数据集作为赋能通用大语言模型领域化转型的核心种子数据,其下游应用场景可扩展至3个方面。

(1)领域大语言模型的垂直知识注入。当前通用大模型在处理复杂专利文本时,常面临垂直常识缺失与严格格式遵循坍缩的问题,研究者可利用本数据集对不同参数规模的基础模型进行高效指令微调。本数据集可以有效纠正大模型在文本分析中的特定句法依存偏差,低成本打造高置信度的垂直领域专家大模型。

(2)行业知识图谱的规模化构建。工业界的海量专利通常呈现非结构化的长文本形态,通过本数据集微调后的大模型,将具备零样本抽取泛化能力。研究人员可将开源的专家模型权重作为智能处理引擎,对数以万计的未标注锂电池专利库进行自动化解析,低成本构建细粒度技术指标的知识图谱,一定程度上克服传统正则匹配与小模型方案的精度瓶颈。

(3)多维专利技术方案评估分析。在抽取构建技术指标知识图谱的基础上,科技情报分析人员可进一步引入复杂网络计算,客观测度各项技术参数在产业链网络中的核心枢纽权重,摒弃传统的“引证量/同族数”等表层评估指标,深入技术方案的底层逻辑,构建“全面性”“先进性”与“合理性”等量化测度模型,为垂直领域技术方案评估提供可解释的情报支撑。

4.2.2 结论与局限性

本研究针对锂离子电池专利文本高度复杂、传统抽取手段受限以及大模型存在跨语境知识不对齐的痛点,构建了面向大模型指令微调的细粒度技术指标抽取数据集。数据生产全链路采用基于多智能体协作的知识增强预标注与非等比例分层过采样策略,并通过人在回路专家校验机制保障了1887条核心样本的极高信噪比。效度评测实验证实,经本数据集微调后的基座模型,在动态加权评价体系下的抽取效度实现了从不足5%~88.75%的大幅提升,验证了本数据集在模型重塑与垂直领域知识对齐上的科学性与有效性。

受限于大模型的文本解析模态瓶颈,本数据集现阶段主要聚焦于专利文本段落的高精度解构,尚未系统性整合专利文献中的图谱与数据表。在未来的工作中,拟引入多模态大语言模型进一步探索图-表-文协同的指令微调对齐范式,推动立体化的垂直领域技术指标抽取数据集建设。

参考文献

[1]

Ding Y L, Cano Z P, Yu A P, et al. Automotive Li-ion batteries: current status and future perspectives[J]. Electrochemical Energy Reviews, 2019, 2(1): 1-28.

[2]

安同良, 姜舸, 王大中. 中国高技术制造业技术测度与赶超路径:以锂电池行业为例[J]. 经济研究, 2023, 58(1): 192-208.

[3]

(An T L, Jiang G, Wang D Z. Measurement of critical technologies in China’s high-tech manufacturing and the catch-up path: lithium battery industry as an example[J]. Economic Research Journal, 2023, 58(1): 192-208.)

[4]

Abbas A, Zhang L M, Khan S U. A literature review on the state-of-the-art in patent analysis[J]. World Patent Information, 2014, 37: 3-13.

[5]

张克群, 张婷, 李姗姗, . 网络结构对专利PageRank与专利价值关系的门槛效应研究[J]. 科学学与科学技术管理, 2020, 41(2): 66-77.

[6]

(Zhang K Q, Zhang T, Li S S, et al. Research on the threshold effect of network structure on the relationship between patent PageRank and patent value[J]. Science of Science and Management of S.& T., 2020, 41(2): 66-77.)

[7]

姚长青, 程齐凯, 王莉军, . 智能情报技术:内涵、边界与体系[J]. 情报学报, 2025, 44(1): 1-9.

[8]

(Yao C Q, Cheng Q K, Wang L J, et al. Intelligent information technology: connotations, boundaries, and frameworks[J]. Journal of the China Society for Scientific and Technical Information, 2025, 44(1): 1-9.)

[9]

刘细文, 孙蒙鸽, 付芸. 从管理信息系统到情报智能体: 重塑科技情报工作范式[J]. 图书情报工作, 2025, 69(17): 3-15.

[10]

(Liu X W, Sun M G, Fu Y. From MIS to DIS agent: reshaping the paradigm of S & T documentation and information service[J]. Library and Information Service, 2025, 69(17): 3-15.)

[11]

黄晓林, 邬亭玉, 周海球, . 大语言模型会取代情报分析师吗:兼论大语言模型对情报分析流程的重塑[J]. 竞争情报, 2025, 21(3): 14-19.

[12]

(Huang X L, Wu T Y, Zhou H Q, et al. Will large language models replace intelligence analysts: with discussion on the reshaping of intelligence analysis process by large language models[J]. Competitive Intelligence, 2025, 21(3): 14-19.)

[13]

Li J X, Sun A X, Han J L, et al. A survey on deep learning for named entity recognition[J]. IEEE Transactions on Knowledge and Data Engineering, 2022, 34(1): 50-70.

[14]

Zheng S C, Hao Y X, Lu D Y, et al. Joint entity and relation extraction based on a hybrid neural network[J]. Neurocomputing, 2017, 257: 59-66.

[15]

孙甜, 陈海涛, 吕学强, . 新能源专利文本术语抽取研究[J]. 小型微型计算机系统, 2022, 43(5): 950-956.

[16]

(Sun T, Chen H T, X Q, et al. Research on term extraction of new energy patent text[J]. Journal of Chinese Computer Systems, 2022, 43(5): 950-956.)

[17]

Zhao W X, Zhou K, Li J Y, et al. A survey of large language models[EB/OL]. arXiv, 2026[2026-04-16]. https://arxiv.org/abs/2303.18223.

[18]

Xu D R, Chen W, Peng W J, et al. Large language models for generative information extraction: a survey[J]. Frontiers of Computer Science, 2024, 18(6): 186357.

[19]

Merchant A, Batzner S, Schoenholz S S, et al. Scaling deep learning for materials discovery[J]. Nature, 2023, 624(7990): 80-85.

[20]

Bran A M, Cox S, Schilter O, et al. ChemCrow: augmenting large-language models with chemistry tools[EB/OL]. arXiv, 2023[2026-04-17]. https://arxiv.org/abs/2304.05376.

[21]

Wei X, Cui X Y, Cheng N, et al. ChatIE: zero-shot information extraction via chatting with ChatGPT[EB/OL]. arXiv, 2024[2026-04-16]. https://arxiv.org/abs/2302.10205.

[22]

时宗彬, 朱丽雅, 乐小虬. 基于本地大语言模型和提示工程的材料信息抽取方法研究[J]. 数据分析与知识发现, 2024, 8(7): 23-31.

[23]

(Shi Z B, Zhu L Y, Le X Q. Material information extraction based on local large language model and prompt engineering[J]. Data Analysis and Knowledge Discovery, 2024, 8(7): 23-31.)

[24]

张玲玲, 黄务兰. 基于ChatGPT API和提示词工程的专利知识图谱构建[J]. 情报杂志, 2025, 44(3): 180-187.

[25]

(Zhang L L, Huang W L. Construction of patent knowledge graphs based on ChatGPT API and prompt engineering[J]. Journal of Intelligence, 2025, 44(3): 180-187.)

[26]

赵建飞, 陈挺, 王小梅, . 基于大语言模型知识自蒸馏的无标注专利关键信息抽取[J]. 数据分析与知识发现, 2024, 8(8): 133-143.

[27]

(Zhao J F, Chen T, Wang X M, et al. Extracting key information from unlabeled patents based on knowledge self-distillation of large language model[J]. Data Analysis and Knowledge Discovery, 2024, 8(8): 133-143.)

[28]

Wang L, Ma C, Feng X Y, et al. A survey on large language model based autonomous agents[J]. Frontiers of Computer Science, 2024, 18(6): 186345.

[29]

Hong S R, Zhuge M C, Chen J Q, et al. MetaGPT: meta programming for a multi-agent collaborative framework[EB/OL]. arXiv, 2024[2026-04-17]. https://arxiv.org/abs/2308.00352.

[30]

Chan C M, Chen W Z, Su Y S, et al. ChatEval: towards better LLM-based evaluators through multi-agent debate[EB/OL]. arXiv, 2023[2026-04-17]. https://arxiv.org/abs/2308.07201.

[31]

王劲滔, 孟琪翔, 高志霖, . 基于大语言模型指令微调的案件信息要素抽取方法研究[J]. 计算机科学与探索, 2025, 19(8): 2161-2173.

[32]

(Wang J T, Meng Q X, Gao Z L, et al. Research on case information element extraction method based on instruction fine-tuning of large language models[J]. Journal of Frontiers of Computer Science and Technology, 2025, 19(8): 2161-2173.)

[33]

刘畅, 张琪, 王东波, . 基于大语言模型技术的古籍限定域关系抽取及应用研究[J]. 情报学报, 2025, 44(2): 200-219.

[34]

(Liu C, Zhang Q, Wang D B, et al. Research on the extraction and application of ancient books’restricted domain relation based on large language model technology[J]. Journal of the China Society for Scientific and Technical Information, 2025, 44(2): 200-219.)

[35]

Hu E J, Shen Y L, Wallis P, et al. LoRA: low-rank adaptation of large language models[EB/OL]. arXiv, 2021[2026-04-14]. https://arxiv.org/abs/2106.09685.

[36]

Zha D C, Bhat Z P, Lai K H, et al. Data-centric artificial intelligence: a survey[J]. ACM Computing Surveys, 2025, 57(5): 129:1-42.

[37]

Zhou C T, Liu P F, Xu P X, et al. LIMA: less is more for alignment[EB/OL]. arXiv, 2023[2026-04-16]. https://arxiv.org/abs/2305.11206.

[38]

Gunasekar S, Zhang Y, Aneja J, et al. Textbooks are all you need[EB/OL]. arXiv, 2023[2026-04-17]. https://arxiv.org/abs/2306.11644.

[39]

Wang Y Z, Kordi Y, Mishra S, et al. Self-Instruct: aligning language models with self-generated instructions[EB/OL]. arXiv, 2023[2026-04-17]. https://arxiv.org/abs/2212.10560.

[40]

Ouyang L, Wu J, Xu J, et al. Training language models to follow instructions with human feedback[EB/OL]. arXiv, 2022[2026-04-16]. https://arxiv.org/abs/2203.02155.

[41]

Strobelt H, Webson A, Sanh V, et al. Interactive and visual prompt engineering for ad-hoc task adaptation with large language models[J]. IEEE Transactions on Visualization and Computer Graphics, 2023, 29(1): 1146-1156.

[42]

Gui H, Zhang J, Ye H, et al. InstructIE: a Chinese instruction-based information extraction dataset[C/OL]. 2023[2026-04-17]. https://www.semanticscholar.org/paper/InstructIE%3A-A-Chinese-Instruction-based-Information-Gui-Zhang/46826780f57c8f3d5f299ed2a6e11a91fca746ee.

[43]

Wilkinson M D, Dumontier M, Aalbersberg I J, et al. The FAIR guiding principles for scientific data management and stewardship[J]. Scientific Data, 2016, 3(1): 160018.

[44]

Pustejovsky J, Stubbs A. Natural language annotation for machine learning: a guide to corpus-building for applications[M/OL]. 1st ed. Sebastopol: O’Reilly, 2013[2026-04-17]. https://www.oreilly.com/library/view/natural-language-annotation/9781449332693/.

[45]

Cohen J. A coefficient of agreement for nominal scales[J]. Educational and Psychological Measurement, 1960, 20(1): 37-46.

[46]

Landis J R, Koch G G. The measurement of observer agreement for categorical data[J]. Biometrics, 1977, 33(1): 159-174.

[47]

Zheng L M, Chiang W L, Sheng Y, et al. Judging LLM-as-a-judge with MT-bench and chatbot arena[EB/OL]. arXiv, 2023[2026-04-26]. https://arxiv.org/abs/2306.05685.

[48]

Wang X, Zhou W K, Zu C, et al. InstructUIE: Multi-task instruction tuning for unified information extraction[EB/OL]. arXiv, 2023[2026-04-26]. https://arxiv.org/abs/2304.08085.

[49]

Brown T B, Mann B, Ryder N, et al. Language models are few-shot learners[EB/OL]. arXiv, 2020[2026-04-26]. https://arxiv.org/abs/2005.14165.

[50]

Liu N F, Lin K, Hewitt J, et al. Lost in the middle: how language models use long contexts[EB/OL]. arXiv, 2023[2026-04-26]. https://arxiv.org/abs/2307.03172.

[51]

Yin S, Fu C Y, Zhao S, et al. A survey on multimodal large language models[J]. National Science Review, 2024, 11(12): nwae403.

[52]

Min S, Lyu X X, Holtzman A, et al. Rethinking the role of demonstrations: what makes in-context learning work[EB/OL]. arXiv, 2022[2026-04-26]. https://arxiv.org/abs/2202.12837.

基金资助

国家社会科学基金重大项目“数智转型背景下智能情报关键技术应用研究”(23&ZD228)

PDF (4892KB)

142

访问

0

被引

详细

导航
相关文章

/