1 引言
近年来,成熟的人工智能(AI)技术不断应用到具有挑战性的基础科学研究,极大地提升了科研效率,进而引发了一场改变科学研究态势的热潮,科学研究的知识发现主体由科研人员转变为智能科学家,研究对象由传统的实验对象转变为科研数据,科研数据成为新科研范式下的核心资源。
科研数据是指各学科领域在科研活动的全过程中产生的各类数据
[1],包括以文本形式呈现的成果数据——科技文献、专利和基础研究、应用研究、试验开发、观测检验等产生的科学数据。目前,科研数据多以人类可理解可学习形式和数字化存储形式呈现,只有受到特定领域约束的科研数据及表征形式才能供给人工智能学习,阻碍了科研智能化普世化应用。
数据密集型科研范式下科研数据存在增长速度快、规模巨大、来源和格式多样化的特点,为数据管理保存、集成关联、共享利用等带来了挑战。在发展过程中着重强调了科研范式的数字化转型,提出了构建开放共享科学数据库或平台以及建立数据之间显性关联的需求,以实现科研数据的发现、访问、集成和分析,建立原本不相关领域之间的数据关系,促进知识发现
[2]。因此,世界各国持续发力,以科研数据集成共享为出发点布局相关的战略,例如欧盟在第七框架计划 (7th Framework Programme, FP7)(2007-2013年)下启动全球科学数据基础设施建设项目GRDI 2020 (Global Research Data Infrastructures),将科研数据集成共享纳入科研计划中
[3]。
海量科研数据的积累和AI技术在科学研究中的深度融合催生了科研智能化研究范式。新范式下科研数据呈现出多源异构、多维度、关联性的复杂性特点,数据密集型科研范式下共享集成的科研数据具有分散性、领域数量差异大、质量参差不齐、标准和格式不一致等问题,为机器的可读可利用带来挑战。基于此,美国部署了相关政策机制以把握新趋势下的科研数据主导权,例如2021年美国材料基因组计划面向科研智能化趋势确立了统一规范化材料数据基础设施,推动材料数据开放共享和元数据标准统一的战略目标,以充分发挥材料数据在人工智能研发领域的力量
[4]。
面向科研范式的变革,国家层级科研数据政策和计划的部署为科研智能化研究的发展和进步提供了数据保障。在研究实践中发现,新趋势下科研数据服务由领域科研人员、数据科学家以及信息服务人员组成,其中领域科研人员和数据科学家从科研智能化研究需求和前沿人工智能技术出发,不断探索和参与智能化研究趋势下的科研数据研究工作,构建高质量、细粒度、多模态的科研数据库以满足AI模型的数据需求;与此相比,信息服务人员在科研智能化研究趋势下的科研数据服务仍然集中在传统的文献元数据层面的组织、前沿技术的咨询和培训服务方面,虽然初步探索了细粒度数据的抽取和知识服务转型等相关研究,但与领域科研人员和数据科学家相比科研数据服务的探索度和参与度存在劣势,未在新科研趋势中凸显文献信息服务机构的数据和技术结合的优势。
综上可知,科研智能化研究已经认识到科研数据的重要性,并开展了相关的政策和计划部署。科研数据在科学研究中是一个生命周期运动的过程,现有研究缺乏对新趋势下科研数据生命周期运行流程、作用和需求的探索。因此,本文从科研智能化实践研究工作出发,基于科研数据生命周期视角总结梳理了新趋势下科研数据在科学研究中的生命周期运行过程、作用和潜在需求趋势,并据此为新趋势下文献信息服务机构科研数据服务的发展提供思路。
2 科研智能化趋势下科研数据生命周期运行过程分析
科研数据在科学研究中的运行流程是一个目标驱动的DIKW模型,也即是在研究目标的驱动下科研数据向信息、知识、智慧的转变过程,以支持研究目标的实现。本文以科研智能化研究前沿领域——材料和化学领域为例,探究科研智能化趋势下科研数据生命周期运行过程,主要是分析数据如何转变为最终的知识(
图1),该流程框架的构建是从研究实践角度出发,基于数据生命周期理论对各环节和流程进行详细阐述和分析。
2.1 数据管理计划(DMP)
研究主题的确定为科研项目树立了一座“导航塔”。在确定研究主题之后,需要制定辅助科研项目数据管理工作的计划。数据管理计划(DMP)是一个在整个研究项目生命周期内以描述项目数据收集、记录、管理和发布的动态文档,包括创建、记录、访问、存储和共享的技术、方法和政策
[5],在科研数据的管理和审查中发挥着关键作用。开放科学大背景下,科研资助机构作为推动开放获取的主力军,发布了科研项目申请时提交数据管理计划的政策,以实现科研数据开放共享
[6]。
对比国内外资助机构DMP服务发现,国外资助机构DMP服务提供相应的工具和模板对资助项目所涉及数据管理工作进行具体拆解和说明,重视科研数据存储后的共享与访问、安全与伦理及DMP成本管理。国内DMP以国家科技部和中国科学院为主体对资助计划或项目所产生的数据进行管理,未提供相应的DMP工具与模板,服务重点在于科研数据的汇交与管理,明确了数据相关主体职责及汇交途径,缺乏对后续共享与访问、成本管理的重视。
2.2 数据产生与收集
数据产生与收集阶段是支撑科学研究的基础环节,科研人员基于研究目标和数据可用性选择合适的数据类型和数据获取途径以获取所需研究数据内容,为AI模型提供“燃料”(
图2)。
2.2.1 数据生产途径
数据生产是开展科学研究的重要起始阶段,为科研智能化研究积累了大量可用数据。现有数据生产途径主要有科技文献、专利、实验数据和计算数据四大类,科技文献和专利文本数据通过人工抽取、半自动化和自动化方法抽取其中的元数据、实体及属性值、表格、图像和实验段落数据;实验数据是科研人员在观察、实验、调查过程中收集和生成的数据或借助电子记录实验本(ELN)工具数字化记录相关数据;计算数据是科研人员借助高通量筛选、计算平台或AI模型工具生成的模拟或预测数据。
2.2.2 数据获取途径
数据获取途径是科研人员根据研究主题、数据质量、数据结构、数据易获取性的特点选择适合的数据集构建途径。现有数据获取途径主要包括期刊出版商、专利数据库、科学数据库、开放数据平台和人工构建数据集五大途径。
目前,科研智能化研究以文本数据、数值数据和图像数据为核心,AI模型对数据的大规模和高质量要求促使科研人员将数据收集途径转向商业性出版机构和开源性平台。商业性出版机构由于科研数据收集范围广、结构化质量高成为科研人员的首选;开放数据平台因其数据易获取性和数据积累量大的优势逐渐成为科研智能化研究重要的数据获取途径,但存在数据结构不一致、数据质量低的问题。
2.2.3 数据收集方法与数据自生成式集成
数据收集方法是在科研人员确定数据获取途径后借助一定的技术批量收集所需数据。科研智能化研究所需数据量大,科研人员需要借助采集软件、爬虫代码或数据平台提供的API接口批量爬取或下载所需数据,以提高数据收集效率。
采集软件是已经封装好的爬虫平台,该软件属于“傻瓜式”采集模式,可用于网络数据采集和文献数据采集,例如八爪鱼采集器、Zetero、SciHub Pro等,适用范围局限,仅限于小规模数据采集;现有爬虫代码是基于python框架编写的,典型工具包有Scrapy、BeautifulSoup、Requests-HTML、Selenium等,使用范围广,采集方式灵活。数据自生成式集成是在机器人化学家或材料学家执行实验后将实验材料的组成、比例和实验结果数据存储到数据库或表格中作为AI模型训练数据集。
2.3 数据处理与分析
数据处理与分析是科研智能化研究的核心环节,目的是保证输入数据的质量和结构的一致性,以转化为机器可理解形式,建立研究目标与数据之间的关联。从使用的数据类型和研究目的出发将材料和化学领域的数据处理与分析分为以文本型数据为核心、以实验材料为核心、以数值型和图像型数据为核心的三大类模式。
2.3.1 以文本型数据为核心的数据处理与分析模式
以文本型数据为核心的数据处理与分析模式是从科技文献和专利中抽取实验关键元素和实验条件进行组合,并将其转化为机器可读形式,主要包括实验段落(句子)识别、数据标注、实体和关系抽取、实验文本增强、数据表征和关联挖掘/数据生成六大处理环节。
在科技文献和专利中存在大量与实验合成不相关的冗余文本信息,因此,需要识别与实验合成相关度高的段落(句子),以缩小数据抽取空间。识别方法包括基于规则的方法和基于机器学习/深度学习的方法两类。基于规则的方法需要事先了解实验段落(句子)的关键特征以构建识别规则,例如领域内特定的实验合成物质、属性标识符、指定值等。简单规则的构建以关键词匹配
[7]为代表,复杂规则的构建以模式匹配
[8]和正则表达式
[9]为代表。该方法识别速度快、易于修改和理解,但当实验段落存在大量变量或约束条件多时其灵活识别能力差。与基于规则的方法相比,基于机器学习/深度学习的方法具备较强的自主学习和灵活适应能力,通过学习实验段落(句子)特征进行分类,分为基于传统机器学习的方法和基于深度学习的方法。基于传统机器学习的实验段落(句子)方法以分类方法为核心,需要少量人工标注数据,包括适用于高维度二分类方法的逻辑回归分类
[10]、适用于低维度多分类的随机森林方法
[11]和适用于高维度多分类的贝叶斯方法
[12]。基于深度学习的方法包括适用于捕获长序列语义关系的RNN模型
[13]和适用于自监督并行计算的BERT模型
[14],该方法在学习速度和精准度上优势突出,需要大量训练数据自主学习实验段落特征,但其调参工作复杂,模型可解释性差。
标注数据是提升模型性能的基础,帮助模型学习并理解上下文信息。现有智能化领域文本抽取任务标注数据缺乏,因此,在抽取之前需要对实验段落进行人工标注以构建训练数据集。在AI模型对高质量标注数据的需求下,专业化的数据标注团队和平台相继出现,现有实验文本标注以众包标注和人工标注形式为主,知名众包标注平台以国外Amazon Mechanical Turk(MTurk)为代表,避免了团队标注效率低的问题,人工标注以小规模领域专家合作形式为代表,适用于标注数据量小的情况。
实体和关系抽取是从实验段落中识别产物、反应物、溶剂等实体和相应的实验条件以及实体-实体和实体-实验条件之间的关系。实体和关系抽取方法包括集成抽取工具和基于深度学习的方法两类。集成抽取工具将实体识别和关联挖掘代码集成为工具包,代表性集成抽取工具有OSCAR4
[15]、ChemicalTagger
[16]、ChemDataExtractor
[17]等,以 ChemDataExtractor为例,该工具是一个端到端的文本挖掘工具,利用集成的条件随机场(CRF)、基于规则的短语解析器和表解析器从科技文献文本和表格中提取化学实体、属性、测量值和实验方案。基于深度学习的方法包括基于序列的抽取方法Bi-LSTM-CRF
[18]和基于预训练语言模型的抽取方法BERT-CRF
[19]。其中Bi-LSTM-CRF利用Bi-LSTM捕获长文本句子中单词的上下文语义关系,结合CRF模型预测输入句子的最佳标签链;BERT-CRF利用语言模型有效获取文本中的上下文信息并通过抽取任务进行监督微调,结合CRF模型进行抽取。
在缺乏训练数据的情况下需要扩充已有数据量,以提高模型的泛化能力,避免出现欠拟合或过拟合现象。文本型数据的增强是对实验合成序列的“改造”,通过替换序列中化合物名称、数量、时间、温度、体积等实体和属性值以扩充标准化实验合成数据。
数据表征是数据和算法模型间的连接点,将实验合成数据转为机器可理解形式。数据表征方法主要包括Word2Vec
[20]、EMLo
[13]、BERT
[14]三类,其中Word2Vec由于其语义向量表征低维度的特点在科研智能化研究中使用率较高,但该模型生成的词向量属于静态表征,不能很好解决同义词问题;EMLo模型采用双层双向的LSTM捕获上下文信息进行编码,属于动态表征,但该模型双向特征融合能力较弱并且不具备并行处理的能力;BERT模型是基于深度双向Transformer的预训练模型,通过利用单词上下文信息表征,属于动态表征,解决了一词多义问题,具备强大的并行运算和迁移学习能力,常用于领域模型的预训练。
最后利用AI算法学习已构建的标准实验数据集或机器人自动合成的新数据中实验物质及属性、实验条件参数之间的关联为合成预测服务。数据关联方法主要以属性预测为核心,包括分类、回归传统机器学习方法和数据生成的深度学习方法,传统分类和回归机器学习方法有适用于离散属性预测的支持向量机(SVM)
[21]、随机森林回归模型
[22]以及适用于连续属性预测的高斯回归过程
[9],深度学习方法包括适用于实验合成条件和目标关联预测的变分自编码器
[13]。传统机器学习方法适用于人工提取特征较为充分、数据和计算资源受限的情况,该模型方法直观、易于实现,例如科研人员根据一组给定的沸石合成参数数据(包括组合元素的含量或范围、合成操作动作和条件等)利用随机森林模型对沸石材料结构特性进行建模
[22];深度学习方法对原始高维数据进行隐含结构与关联性的挖掘,突破了对经验性规律的依赖性,但存在模型消耗资源多、结构复杂和不可解释性,例如科研人员借助变分自编码器将合成参数压缩为低维表示建立合成条件和前体材料之间的概率分布关系
[13]。
2.3.2 以实验材料为核心的数据处理与分析模式
以实验材料为核心的数据处理与分析模式是利用机器人/自动实验装置对实验材料进行组合实验构建实验结果数据空间。由AI模型学习实验组合数据与结果数据之间的函数关联并迭代优化实验组合条件,该模式的核心环节在于通过实验组合数据的优化学习寻找最佳实验组合条件。
从数据空间构建是否基于已有知识的角度可分为自生成式自动合成和学习式自动合成。自生成式自动合成是指机器人根据已有材料数据与合成结果建立了合成材料、条件和实验结果之间的函数关系,供给模型进行迭代优化。例如Burger B等
[23]研制了一个可移动AI化学机器人,利用16个化学样品进行实验,并使用气相色谱仪分析实验结果,基于实验样品数据和结果数据利用贝叶斯优化算法进行迭代学习。学习式自动合成是根据已有的实验合成数据空间筛选合适的实验材料组合条件以指导机器人开展自动化合成。例如Coley C W等
[24]基于化学反应转化规则空间,利用神经网络模型筛选可用目标分子结构并评估反应质量。实验材料组合式的处理与分析以反应条件优化为核心环节,包括适用于二分类的线性判别分析(LDA)
[25]和适用于属性独立多分类的贝叶斯优化算法,但线性判别分析存在不适用于类别不均的数据分析问题,贝叶斯优化算法也存在计算量大、调参复杂的问题。
2.3.3 以数值型和图像数据为核心的数据处理与分析模式
以数值型数据为核心的数据处理与分析模式利用AI模型的数据表征学习和计算能力来探索材料/化学数据结构、组成和特性之间的复杂空间关联,以完成实验预测或生成任务,主要包括数据清洗、规则抽取、数据增强、特征工程和关联挖掘五大环节。
数据清洗是剔除数据集中存在的缺失、错误和重复数据或对不同表示形式进行标准化。数据清洗方法包括降噪和标准化两类,降噪基于统计学方法,利用神经网络灾难遗忘策略
[26](catastrophic forgetting)剔除学习率低的异常化学反应数据,提高了模型预测的性能。此外,同一分子结构由于数据库选择描述的原子起点不同产生了不同的SMILES表示,因此需要将其转化为规范化格式以剔除重复分子,常用工具包有Python工具包RDKit和Java工具包CDK
[27]。RDKit工具包还可以进一步计算分子描述符的功能,例如化合物结构相似性计算、分子构象优化、分子指纹生成等。CDK工具包还能完成搜索化合物子结构、3D图像生成、分子指纹生成等任务。
规则抽取是在学习化学反应中反应物和产物之间的原子映射信息基础上识别潜在的反应中心。现有抽取技术是基于深度神经网络的无监督方法,以Transformer模型为代表,由于其不依赖于标注数据的无监督特性和对不平衡反应类型的适应性,在规则提取中表现出巨大的潜力,例如Transformer模型从未标注化学反应数据中学习了原子在化学反应中的排列变化规律以提取反应规则
[28]。
数据增强借助采样方法扩充了小样本材料/化学数据,包括基于神经网络的数据增强方法、主动学习和迁移学习方法
[29]。基于神经网络的方法包括生成对抗网络
[30]、变分自动编码器
[31],通过无监督学习采样生成大量新数据。主动学习
[32]从大量未标注数据中选取有价值的数据,利用机器学习进行特征学习。迁移学习基于相关领域的知识学习训练模型,提升了模型对小数据的预测性能,如Gupta等
[33]基于ElemNet模型在OQMD源数据集进行预训练,最后迁移至目标JARVIS数据集中进行微调材料属性。
特征工程通过选择与研究目标相契合的数据描述符表征材料/化学数据特征以供给AI模型学习。特征工程包括特征选择和特征转换两大类,特征选择是从数据高维度特征中去除低价值的冗余特征,降低特征空间维度,提高模型的预测精度和泛化能力,包括过滤式、包裹式和嵌入式三类。过滤式方法是基于统计学和互信息的方法对特征的重要性进行排序,该方法计算时间效率高,但未考虑特征之间的相关性,常用方法包括相关系数
[34]和互信息
[35]。包裹式方法结合监督学习算法对特征子集进行评估,评估过程中考虑特征之间的相关性和依赖性,但存在计算复杂度高的问题
[36],以支持向量机(SVM)-递归特征消除(RFE)方法
[37]为代表。嵌入式方法嵌入到模型学习过程中,特征选择和模型训练无明显区分,常用方法包括基于惩罚项的方法和基于树的方法
[38];特征转换是指将高维特征空间映射到低维特征空间,实现特征降维,包括主成分分析(PCA)、线性判别分析等方法
[39]。
关联挖掘通过探索结构、组成和性能之间的关联以满足预测需求。挖掘方法包括以卷积神经网络构建的图结构关联模型、以Bi-LSTM和Transformer模型为基础构建的Seq2Seq深度学习模型,后者凭借其长距离依赖性的学习优势构建了化学领域反应物、试剂、催化剂和生成物之间的“翻译”关系。卷积神经网络擅长处理图像数据,能满足化合物结构图的特征学习需求,识别反应物和产物原子对之间的化学键变化,以建立反应物和产物之间的关联
[40];Seq2Seq模型擅长处理文本类“翻译”问题,其并行计算优势提高了模型的效率,该模型将非数值类型数据转化为机器可识别形式,例如通过物理化学描述符、分子指纹等方式将分子表示为字符串,建立产物和反应物字符串之间的关联以实现化学反应的逆向合成路线预测目标
[41]。
2.4 数据生成与出版
数据生成与出版是指成果数据和科学数据的生成与出版,以满足新一轮科研智能化研究对科研数据的再利用需求。
2.4.1 AI参与科研数据生成工作
科研智能化趋势下AI模型也积极参与到研究论文的撰写工作中,主要涉及论文标题、摘要和论文生成任务。以最新发布的ChatGPT
[42]为典型代表,基于庞大的领域文本训练数据集,利用生成式AI模型的优势,根据输入主题和关键词参与完整论文生成过程,包括论文写作角度和思路、研究方法或工具查询、论文大纲、相关参考文献资源、生成完整论文内容、修改论文、期刊遴选等。
科学数据的生成不拘泥于研究人员提交的实验数据和高通量计算数据,也涉及科技文献和专利中包含的相关数据。早期科学数据库的数据收集以人工摘录方式为主,随着海量文献和专利文本的发布和积累,手工方式显露出耗时且成本高的缺点,数据库开始转向自动化方式。科研智能化趋势下计算数据是指AI模型预测产生的大量数据,该数据的准确性未得到验证。此外,AI模型实现了代码自动生成,借助生成式AI模型参与到任务代码的预训练和微调工作中。
2.4.2 AI参与科研数据出版审核工作
指数级增长的科学出版物投稿量对出版工作是一个巨大的挑战,高质量人工评审工作是一个耗时耗力的过程,为解决出版繁重的评审压力并提高科研数据出版速度和效率,将机器学习模型引入审稿任务分配和评审意见撰写工作。如Charlin等
[43]设计了投递论文分配工具——Toronto Paper Matching System (TPMS),通过对投稿论文和审稿人已发表研究成果(代表审稿人的专业知识)进行文本比较计算投稿论文和审稿人专业知识之间的相关性。Yuan等
[44]利用BART预训练模型学习国际表征学习大会(ICLR)和NeurIPS会议论文与其评审意见之间的“评审翻译规律”。
2.5 数据存储与共享
数据存储是对科研项目产出的科研成果及相关的科学数据进行有序化管理,以实现科研数据的可发现、可获取和可重用。新趋势下数据存储与共享原则、政策和建设沿用了数据密集型科研范式下已有的规范,并根据最新研究特点和需求不断更新完善。
现有数据存储与共享政策主要是由资助机构和期刊出版商发布,其中资助机构是对资助项目衍生的研究论文和相关科研数据汇交和共享进行规定,以国家层面的政策为代表,如欧盟“地平线2020”计划、中国的《科技计划形成的科学数据汇交技术与管理规范》等。期刊出版商是在获取研究论文的转让权后针对论文相关的科学数据进行存储与共享管理。两者的最终目标是构建适应新研究范式的科研数据存储与共享平台。
在数据存储与共享原则方面,现有科研数据存储与共享平台是基于FAIR原则,侧重于数据发布与共享,在利用方面稍显不足,以数据汇聚/汇交为主要数据共享模式,不适用于科研智能化研究对多源异构和关联性数据存储与共享需求。面对数据融合和关联需求,PARIS共享利用原则应运而生,从机器可处理分析、在线问答访问、数据安全可靠、数据关联与迁移性以及数据的有效供给五大方面出发,解决了科研数据分布式、孤岛化、差异化等问题,实现了科研数据的高质量供给需求
[45]。
在数据存储与共享政策方面,新趋势下数据存储与共享政策更加重视开源途径的选择和研究工作中科研数据的引用,以支持智能化研究数据的可回溯性和可重用性。但现有开放数据平台发布的科研数据存储与共享政策存在规范性差、限制性小的问题,导致不同平台的科研数据质量差异大、结构不一致。此外,与国外期刊出版商相比,我国期刊出版商(以中国科学出版社为代表)的科研数据存储与共享政策较为泛化,相关规定借鉴的是国外出版商发布的政策,不利于我国开放数据平台的高质量建设和发展。
在数据存储与共享平台建设方面,新趋势下数据存储与共享平台包括通用型、领域型和自建型三类,其中通用型和领域型数据库以知名开放性数据平台为主,如Figshare、GitHub、PubChem等。数据库的建设和完善是基于科研需求的变化对存储与共享的数据类型、格式和内容等进行规范。科研智能化研究中存在研究预测结果数据与现有数据库存储格式不匹配的问题,面临批量结果数据存储和共享的需求,因此,科研人员通过自建数据库来解决上述问题,典型案例是大材库的构建
[46]。中科大研究团队为满足化学机器人对文献中化学反应知识的学习,构建了包括反应物和生成物结构、名称、试剂、溶剂、催化剂、反应温度等环境参数的化学反应数据库。
2.6 数据再利用
数据再利用是对研究成果及相关科学数据的二次利用,以支持新一轮的智能化研究。从研究成果再利用角度出发,科研智能化研究本身就是对已有数据的再开发和使用,文本文献的再利用表现为科技文献的深度挖掘和专利文本挖掘数据的再利用,科技文献由于其易获取性和内容丰富性已经成为数据再利用的核心。从科学数据重复使用角度,科学数据的再利用表现为数据库与已发布数据集的重复利用,可借助数据共享平台对其复用率进行分析,也即是通过浏览、下载和引用量评估数据库或数据集的价值和新颖性,例如Figshare、Zenodo等在数据集界面提供数据统计服务。
从上述分析可以看出,AI模型在科研数据生命周期中发挥着重要作用。AI模型作为知识发现的核心技术,也广泛参与到科研数据的全生命周期管理与服务中,推动了大规模高质量科研数据库的发展与建设。其作用主要体现在两大方面,第一,AI模型对科研数据的需求引领了新趋势下科研数据的建设和发展,为科研数据的收集、组织、共享和利用提供导向标,建设适用于AI模型训练和学习的科学数据库;第二,AI模型也广泛参与到科研数据的管理和建设环节,从数据产生与收集到再利用环节都存在AI模型的身影,以提升各环节数据处理与管理效率。
3 科研智能化趋势下科研数据作用
科研智能化是在数据密集型科研范式下萌生并发展的,数据是研究的基础和发现的源泉,AI技术是研究的发动机。科研智能化以AI模型为技术核心,捕获数据中蕴含的领域知识特征,即挖掘已有知识空间的关键信息,以构建知识路径。数据量越大,AI模型学习的隐含关键信息越全面,关联预测结果也越准确。因此,高质量、正负样本结合、多源异构性和结构化科研数据对推动科研智能化研究的发展至关重要。
(1)高质量的科研数据是科研智能化研究准确率的“加速器”
高质量数据不仅能够降低数据采集和预训练环节的复杂度,也能够提高AI模型的性能。人工智能和机器学习领域权威学者多次强调发展“以数据为中心的AI”,科研智能化研究也认识到科研数据质量对知识发现的影响,需要持续探索构建高质量数据集的方法。
现有科研数据库存在多样化的数据收集途径,科研数据的质量把控依旧存在不足之处。比如,数据的收集未充分考虑人工智能需求,存在数据冗余、标注数据较少、数据标准不一致等问题,不适用于AI模型学习。因此,科研智能化研究仍需关注领域高质量数据集的构建。
(2)正样本指示模型学习的方向,负样本设定模型学习的范围
科研数据中正样本的作用在于训练AI模型以学习数据中存在的共性特征;负样本是指科学实验中的非成功数据或低质量数据,也称为阴性数据,起到了对比区分的作用,通过划定共性特征学习的边界,避免模型重复性捕获异常特征。
现有数据库中的科研数据大多为正样本数据,不能满足科研智能化研究对负样本数据的需求,负样本挖掘仍然依靠科研小组收集自身研究团队在科研过程中的“失败数据”,数据量较小,并且收集耗时过长。因此,科研智能化研究需要重视负样本数据的收集、存储和发布。
(3)多源异构数据是模型知识学习全面性的“保护舱”
科研智能化趋势下的知识发现过程是一个复杂问题求解过程,需分解为不同层级子问题以简化求解复杂度。在明确问题目标基础上,确定不同层级问题求解所涉及的数据类型、属性参数等,以构建求解函数。异构数据拓展了对问题理解的角度或层级,多源数据丰富了不同层级属性参数信息,例如材料本身的性质特征与原子尺度的原子结构、电子结构、离子输运垒等数据相关
[47]。
多源异构性是指科研数据来源的多样化与格式、呈现形式的异构性。首先,科研数据不仅来源于项目汇交、人工收集,还来源于模型计算、文本挖掘等;其次,科研数据不仅包括文本型和数值型数据,还包括二维图像型数据、三维立体结构数据等。这些多源多尺度数据助力智能科学家从多渠道多途径了解数据特征及关联,例如材料领域微观-介观-宏观尺度数据的表征与关联
研究。
(4)数据结构化是实现人机互动的桥梁
数据结构化是指抽取后的数据需按照一定的层次和语义结构组合,形成易于理解和使用的标准化格式,标准化的最终目的是实现机器对数据的可理解和可使用。
目前领域科研数据以半结构化形式呈现,分散在大量科技文献和专利文本中,以科研人员可阅读和可理解形式出现,并且由于科研人员书写习惯的不同,不同文本之间科研数据的表述和组织呈现差异。因此,需要构建标准化语言和组织格式以规范科研数据,满足数据密集型科研范式和科研智能化科研范式对科研数据可获取性、易用性、机器可理解性和重用性的要求。
4 科研智能化趋势下科研数据潜在需求与发展趋势
4.1 科研数据潜在需求
AI模型在科学研究发展中表现出对多源异构数据集成、细粒度数据结构化、人机互动数据表示形式的探索、数据关联化挖掘和科研数据类型丰富化的发展需求。
(1)多源异构数据集成
多源异构数据保证了目标数据及属性获取的全面性,从多角度刻画了数据的特征,保证AI模型特征学习的全面化。从上述案例可发现科研智能化研究对多源异构数据的集成需求,例如AlphaFold模型
[48]在利用PDB蛋白质结构数据库基础上结合Uniclust30蛋白质序列数据学习蛋白质结构组建的规则。多源异构数据的集成不仅有利于AI模型的学习,也降低了科研人员收集数据的复杂度,提高了科研效率。
(2)细粒度数据结构化
科研智能化趋势下AI模型更加注重数据内部隐性规则学习,即需要细粒度挖掘数据特征并关联不同类型数据,构建科研人员和机器可理解的结构化数据集。典型案例是文献中的实验方法信息抽取、组织与结构化,例如组织以目标合成物质为核心的实验分解流程图,不仅能够满足科研人员的细粒度知识学习需求,也满足了AI模型对文献数据隐性知识的学习需求。
(3)人机互动数据表示的探索
现有数据组织形式是以人类可理解的形式呈现,满足了科研人员的知识学习需求,但科研智能化研究中也要关注AI模型的知识学习需求,将现有数据进一步转化为AI模型可理解形式,搭建人类语言和机器语言之间的桥梁。数据表示的探索以向量化数据库的构建为代表,如Science Navigator数据库借助向量计算技术和大语言模型实现了非结构化文献数据的向量化表征、语义搜索、相似度计算等,以作为科研智能化研究发展的数据基座。
(4)数据关联化挖掘
科研智能化趋势下的知识发现是以关联识别和挖掘为核心,构建不同类型数据之间的关联关系,以实现特征预测或数据生成的目标,如材料领域材料成分-结构-工艺-性能和化学领域分子结构-性质-功能等复杂构效关系的构建。此外,现有AI模型属于“黑箱”模型,在数据关联中的挖掘不具备可解释性,不利于预测结果的理解。因此,面对科研智能化研究需要构建可解释AI模型,助力关联规则发现与可理解性,实现不同领域科研数据隐性关系的显性化。
(5)科研数据类型的丰富化
实验流程方案数据不仅是科研智能机器人学习的重要资源,也是实验组合规律智能分析与发现的核心。实验方案的抽取与组织是对科技文献中有价值数据的提炼和总结,进一步增强了数据的机器可读性。现有实验方案是以简单的文本形式组合,以单一实验物质名称为检索核心,不能满足用户以实验目标、实验步骤或实验原理等为核心的检索需求。未来可通过构建领域实验方案知识图谱结合精准推荐技术,辅助科研人员高效选择实验方案。
4.2 科研数据发展趋势
基于上述需求分析可以看出,科研智能化趋势下的科研数据呈现出数据规模和复杂性上升、数据关联融合需求日益突出、科研数据主权问题受到各国重视的发展趋势。
(1)数据规模和复杂性上升
科研智能化研究是基于大规模科研数据发展起来的,海量数据的积累保证了领域知识获取的全面性和AI模型对领域规律学习的精准度。例如化学界的 Alpha Go模型基于1 240万个化学反应学习了化学反应的变化规则
[49]。数据的复杂性表现为多模态数据在智能化研究中的应用,融合多领域数据构建全景化科学规律助力实现任务的生成与预测。
(2)数据关联融合需求日益突出
关联挖掘是科研智能化研究的核心问题,现有研究需要融合多层级数据库中的多模态数据,以建立不同模态数据之间的关联关系,而现有多模态数据仍然存在数据关联性差、数据表示融合效果差的问题,阻碍了AI模型的高效率计算和学习。因此,探索多层级数据库的建立,多模态数据的关联、表征和融合是未来智能化研究的趋势。
(3)科研数据主权问题受到各国重视
现有科研数据主要存储于美国、欧洲等部分发达国家,一些关键核心数据仍然存在一定的获取壁垒,不利于智能化研究的发展。以我国为例,目前科学研究依赖的数据90%来自外资数据平台或出版机构,科研数据流失严重。因此,各国开始注重本国科研数据的存储与建设,例如2021年法国高等教育、研究与创新部发布《大数据、算法和源代码政策:2021-2024路线图》以建设全国一体性科研大数据平台,打通科研数据壁垒。
5 科研智能化趋势下科研数据服务相关建议
针对文献信息服务机构如何深入参与新科研范式,发挥其在数据服务中的优势,本节基于上述分析为科研数据服务的发展提出以下建议。
(1)加快构建高质量的领域科研数据网络。数据是科研智能化研究的重要驱动力之一,其获取的便利性、全面性和可用性关乎科研智能化研究的效率和质量。从使用数据来源看,现有科研智能化研究案例中使用的科研数据多来自于国外数据库、开放数据平台或商业性出版商,国内构建的数据库和开放数据平台较少被使用,利用率低,从侧面也说明了国内构建的数据库需要进一步提高数据质量和结构化程度,加强开放性高质量数据库的建立和推广。从使用数据来源数量看,科研智能化研究中使用的数据分散在多个数据平台,针对不同平台需要采取不同的数据获取和分析方法,研究过程中数据处理和分析环节占比较大。因此,需要构建统一、高质量、标准化的领域数据平台,集成开放性、商业性和私人性科研数据满足科研智能化对多源多尺度数据的需求。
(2)重视文本型数据中实验信息的挖掘。现有科研智能化研究重视文本型数据的细粒度挖掘,以构建结构化关联知识。基础科学的智能化研究以实验信息的关联挖掘和结构化为代表,已经成为自动化流程实验的重要核心资源。现有实验信息以Springer Nature出版社的Springer Protocols数据库(全球最大的实验室指南数据库)和CAS的Synthetic Methods合成试验方法数据库为代表,其便于科研人员查询和学习,但不适用于科研智能化研究的使用和输入,因此,未来需要构建实验流程知识库以支持智能化研究。
(3)关注人机互动语言的探索。AI模型是科研智能化研究的重要参与者,现有知识是面向人类学习需求的,其知识内涵和语义关系都需要进一步转化为机器数据表征模式,特征表征的全面性与否直接关系知识发现的准确性。因此,需要构建面向不同研究目标的标准化知识表征语言,搭建人类知识与机器学习的桥梁。
(4)深化嵌入科研式数据服务模式。在数据密集型时代,我国数据服务模式转变为以数据为核心的服务模式,注重前端数据服务中的数据采集、获取和挖掘服务,对科研生命周期中的研究准备服务、数据处理与分析技术选择、数据出版服务关注度较低,导致嵌入式数据服务模式对科研创新的支持和影响力度较弱。因此,从科研生命周期研究实践出发提供嵌入式数据服务,提升科研人员的信息素养和数据素养,激发科研人员的创造力、创新能力和科研能力,才能提升文献信息服务机构在科研智能化趋势中的参与度、影响力和竞争力。
(5)提升图书馆员领域知识和人工智能素养。科研智能化研究是人工智能领域与其他学科领域交叉融合的结果,其核心是领域知识与人工智能技术的交融,因此,对图书馆员的数据服务能力也提出了新的要求。在学习图情领域知识的基础上,需要具备数据分析和挖掘知识成为数据图书馆员,需要具备领域知识成为学科图书馆员,还需具备人工智能知识成为智慧化图书馆员,这样才能提升科研智能化趋势下数据服务的质量。