0 引言
在全球生物学研究日益迈向系统化与精准化的进程中,对人体多维度生物系统的深入解析已成为生命科学领域的核心命题。自21世纪初“人类基因组计划”(human genome project,HGP)完成约92%的人类基因组测序以来,生命科学领域进入了大规模国际合作的新纪元
[1]。HGP作为现代生物学研究的基石,不仅绘制了2万多个人类蛋白编码基因的参考序列,揭示了基因之间复杂的遗传信息共享机制,更重要的是确立了基因组作为生命活动核心蓝图和“总指挥”的基础性地位。基因组序列包含了决定生命体结构与功能的核心编码信息,是生命得以存在和发展的遗传基础
[2]。然而,研究表明,基因组序列这一基础蓝图,尚不足以完全解释生命功能的复杂实现过程。基因表达的动态调控、蛋白质互作网络以及细胞动态协同机制
[3],才是生命功能得以实现的关键所在。
为在HGP奠定的基因组图谱基础上进行更深层次探索,国际组织相继启动了HapMAP、ENCODE、TCGA/ICGC等大型研究计划。这些项目延续并深化HGP的成果,通过整合群体遗传学(如HapMap绘制SNP与单倍型图谱,为鉴定与疾病相关的遗传变异提供参考)、表观组学(如ENCODE系统解析基因组的功能元件)及癌症基因组学(如TCGA/ICGC全面描绘多癌种的突变谱与分子特征)等多维度信息,为系统解析基因型与表型之间的复杂关联奠定了基础
[4]。然而,传统组学技术在面对人体37.2万亿个细胞构成的超复杂系统时仍显局限。人体拥有400余种细胞类型,其在时空分布、相互作用及微环境特征上的高度异质性,难以通过组织层面的均质化分析加以全面揭示
[5]。随着单细胞转录组及空间多组学等技术的突破,研究者开始能够在单细胞分辨率下解析细胞命运决定、疾病微环境重塑等关键生命过程
[6]。
在此背景下,HCA与HRA 2大里程碑意义的国际合作计划应运而生,分别从功能多样性解析与空间结构重建2个维度,共同构建新一代人体系统生物学研究框架。HCA致力于在单细胞分辨率下解析人体各类细胞的分子特征,旨在绘制涵盖所有人体细胞类型的分子图谱,揭示细胞如何协同构建组织器官并执行生理功能的分子机制。2024年,
Nature发布的HCA系列研究成果,系统报道了发育组织图谱、数据分析和集成工具算法及特定细胞图谱的构建工作,为完成HCA首版草图奠定了坚实基础。与此同时,HRA依托“人类生物分子图谱计划”(HuBMAP),聚焦于构建多模态三维空间参考图谱。针对传统解剖学图谱的碎片化、缺乏统一空间参照系等问题
[7],HRA通过建立标准化的空间坐标系,整合分子、细胞及组织层面的多模态数据,为生物医学研究提供高精度的空间参考框架
[8]。
本文旨在系统综述HCA与HRA的最新研究进展,重点剖析二者在数据结构、技术路径及应用场景等方面的协同性与互补性,探讨其如何共同推动人类对复杂生命系统的系统性认知升级。
1 人类细胞图谱(HCA)研究进展
1.1 HCA项目背景介绍
HCA项目由英国威康桑格研究所(Wellcome Sanger Institute)的Sarah Teichmann博士与美国博德研究所(Broad Institute)的Aviv Regev博士联合发起,然后由麻省理工学院和美国哈佛大学的博德研究所创立。该项目旨在构建一个涵盖人体全谱系细胞类型的综合生物学图谱,系统解析细胞类型分类学特征、组织分布规律、细胞间交互网络以及分子特征
[9],为揭示人类健康与疾病机制提供了全新的研究范式
[10]。为实现这一目标,HCA通过建立国际协作网络,联合全球众多实验室通过跨学科合作,整合各类组织与器官的高质量数据资源,并通过开源数据协调平台推动数据共享。HCA打破了传统研究的学科壁垒,被誉为“细胞生物学领域的维基百科”
[11]。
HCA项目自启动以来,历经多个发展阶段,不断取得重要突破与关键成果(
图1)。从项目启动阶段的组织架构搭建与目标设定,到体系构建阶段的标准制定与多领域合作推进,再到应急响应阶段的快速调整与全球合作强化,以及拓展阶段的国际交流深化与数据资源整合优化。HCA始终紧跟科研前沿,积极应对全球性挑战,为细胞生物学及医学研究领域的发展注入强大动力。
1)项目启动阶段(2016—2017年)。2016年,Aviv Regev与Sarah Teichmann博士汇聚了全球科研力量,共同创立国际人类细胞图谱联盟,标志着HCA项目正式启动。2017年,项目团队发布HCA白皮书,明确项目目标与范围,旨在全面解析人体细胞类型、分布及功能特征。同时建立数据协同平台与注册表,实现全球范围内研究数据的整合与共享,为后续大规模数据采集与分析提供了有力支撑。
2)项目体系构建阶段(2018—2019年)。在此阶段,HCA项目致力于构建完善的科研项目评价体系。一方面,设立技术标准工作组,制定统一的数据采集、处理与分析标准,确保不同研究团队产生的数据具有可比性与兼容性;建立严格的伦理审查框架,保障研究过程符合伦理规范与法律法规,保护受试者权益
[12]。另一方面,推出人类发育图谱,聚焦儿科研究,探究人体发育过程中细胞的动态变化,为探索发育生物学提供关键线索。其间,HCA还成立公平工作组(EqWG),让跨越不同地理位置和种族群体的全球社区参与进来,以推动全球科学研究的平等性
[13]。
3)应急响应阶段(2020—2021年)。2020年,COVID-19大流行席卷全球,HCA项目迅速调整研究方向,成立了生物网络协调员机制,与全球疾病联盟展开紧密合作,聚焦病毒传播机制与人体免疫反应研究。通过整合多组学数据,深入分析病毒感染细胞后的基因表达变化、细胞间相互作用等,为疫情防控与治疗策略制定提供科学依据
[14]。2020年,成立独立法人实体,强化项目组织管理,提升全球合作效率与协同创新能力,进一步巩固了HCA项目在全球科研领域的影响力
[15]。2021年,创办发育和儿科研究学术会议,推出One Cell at a Time虚拟展览,提高公众对项目意义与研究进展的认知度,鼓励社会各界积极参与,为项目发展营造良好的社会环境。
4)成果拓展阶段(2022—2024年)。2022年,HCA组织非洲研讨会,为非洲地区科研人员提供与国际顶尖团队交流合作的平台,促进全球科研资源的优化配置与协同创新。同期发布多组织图谱和肺细胞图谱,包括人体组织与器官的细胞类型、分布及功能信息,为深入理解人体生理病理机制提供丰富数据资源
[16]。2023年,对数据门户进行重新设计,为18个生物网络创建独立网页,优化数据展示与访问界面;更新数据浏览器,提升数据检索与分析功能,使用户能够更便捷、高效地探索HCA数据集,极大地推动研究成果的广泛应用与转化。2024年,
Nature发布HCA项目特刊,收录40余篇高水平论文,全面展示项目在数据资源整合、算法创新、技术突破等方面的最新成果
[17]。
截至2024年底,HCA项目已取得一系列具有里程碑意义的关键成果,揭示了肺组织在健康与疾病状态下的细胞异质性
[18],构建了神经系统细胞类型的新型分类框架
[19],阐明了视网膜细胞发育的分子调控网络
[20],为人类生物学图谱的构建提供重要参考依据。
随着参与者的不断增加,HCA产生的出版物数量也逐年攀升。HCA社区成员可通过预先拟定的表单向HCA出版委员会提交预印本或经过同行评审的出版物。经HCA委员会通过“技术范围审查”和“委员会评审”环节进行评审。具体评审流程如下。
首先,委员会将审查论文是否符合HCA的技术范围(此审查非同行审查或道德审查)。接着,对于符合技术范围的论文,作者需将其数据和元数据提交至HCA数据存储库和HCA细胞注释平台。随后,每篇论文将被分配给3名HCA出版委员会成员进行严格审查,并通过投票决定该论文是否应被纳入HCA出版物。若3名成员未能达成共识,论文则将被提交至整个委员会进行额外审查,最终由多数投票决定其批准状态
[21]。
HCA的出版物涵盖
Science、
Cell、
Nature及其子刊
Nature Aging、
Nature Communications、
Nature Genetics、
Nature Immunology、
Nature Medicine、
Nature Methods等权威期刊。截至2024年,通过HCA出版物数量达到450篇,其中405篇经过了同行评审,占据了绝大部分,另外45篇为预印本。从每年的出版数量(
图2)来看,2016—2020年逐年增加,在2021年达到了92篇的高峰。之后几年虽然有所波动,但整体保持在较高水平。
1.2 合作网络与资助机构
HCA致力于推动全球在医学研究和医疗服务领域的开放合作,构建具有广泛代表性的人类细胞地图,以造福全球。为实现这一目标,HCA相继建立了多个区域性合作网络,包括HCA亚洲(2017年成立)、拉丁美洲(2020年成立)、HCA非洲(2022年成立)和中东(2023年成立)
[22]。根据HCA官网数据显示,截至2025年3月10日,HCA已解析了来自9600位捐献者的细胞数据,涵盖893个实验室、492个项目,6420万条细胞数据,涉及1700个研究机构、102个国家和3600名成员,形成了一个庞大的科研合作网络
[23]。
从资助机构来看,HCA获得了包括陈·扎克伯格基金会(Chan Zuckerberg Initiative,CZI)、欧盟“地平线2020”计划、美国赫尔姆斯利慈善信托、瑞典科学生命实验室、法国国家健康与医学研究院、英国医学研究委员会和维康信托基金会等机构的资助
[24]。其中,欧洲“地平线2020”计划资助了6个HCA试点项目,涵盖发育中的人脑、肺部、人类胰腺、类器官、发育中的人类性腺及子宫6大领域,旨在使用最先进的单细胞技术、分析方法和计算工具来表征单个细胞及其核心成分。英国医学研究委员会(MRC)对HCA的战略优先投资方向,包括发育早期到成年及老年阶段的人体健康组织。
表1为HCA的主要资助机构及其资助领域。
1.3 HCA数据收集技术与细胞类型注释共享平台
1) HCA项目数据收集与整理,从单细胞到多组学的深度解析。
在数据收集方面,HCA利用单细胞测序和空间组学来实现大规模细胞数据集成。单细胞测序和空间基因组学能够在细胞分辨率下获取基因表达谱,从而有助于识别不同的细胞类型和状态
[25]。为了提高数据质量和效率,HCA以单细胞分辨率同步捕获蛋白质表达和转录组数据,促进了蛋白质组与转录组的无缝整合
[26]。采用多组学测序技术和组合索引策略,在降低成本的同时保持高准确性和覆盖度
[27]。例如,陈·扎克伯格生物中心的研究人员及其合作者构建了活细胞跨组织图谱
[28],通过单细胞转录组测序技术对来自24个人体组织和器官的近50万个细胞进行分析,发现共享细胞类型,在不同组织中存在细微的基因表达差异。同样,Rood等
[17]将染色质可及性与转录组数据相结合,为深入解析基因调控网络提供了重要支持,揭示了细胞在组织中的分布格局及其相互作用,从而为构建全面的人类细胞图谱奠定了
基础。
在数据分析方面,HCA采用了深度生成模型和主动学习的半监督方法,有效加速了大规模单细胞数据的分析和模式识别
[29]。例如,Domínguez Conde等
[30]研究强调对基因组学、转录组学、蛋白质组学、代谢组学和表观组学的联合分析的重要性,通过互补数据揭示从基因到表型的完整调控网络,并提出机器学习和网络建模作为关键工具,可解决多组学数据异质性和维度差异问题。To等
[31]通过多组学数据融合分析,成功整合了约33.6万个细胞核液滴的配对转录组、表观遗传组以及空间转录组数据,绘制出首张人类骨骼发育图谱,系统揭示了骨骼形成机制、软骨在骨架发育中的支持作用,以及骨关节炎导致慢性关节疼痛的病理过程。
2) 细胞类型注释共享平台,推动全球科研合作与数据共享。
细胞类型注释是基于细胞的基因表达谱或其他生物学特征,将细胞归类为已知类型的关键步骤。准确的细胞类型注释对于揭示生物体发育、维持生理功能及解析疾病机制具有重要意义。然而,细胞类型注释涉及对大规模单细胞数据的处理与复杂计算方法的应用,具有较高挑战性
[32]。为此,HCA构建了完善的注释平台和工具体系,推动全球科研合作与数据共享(
表2)。
HCA数据门户作为核心资源,整合了来自全球实验室的单细胞数据,涵盖转录组、表观组、空间组学等多组学数据,支持开放访问。该平台实现了数据格式标准化与元数据规范,促进了Seurat、ScanPy等主流分析工具的应用与技术标准化,极大地提升了数据的共享与再利用效率
[32]。Terra平台作为HCA的全球数据协调枢纽,基于统一分析框架整合了转录组、表观组和空间信息,支持跨器官、跨物种的细胞功能预测。截至2025年3月,HCA数据门户已整合超过2亿个单细胞数据,涵盖肺、肾、脑等24个器官
[16],并可通过Terra平台进一步分析。在具体应用方面,SCimilarity平台通过学习统一且可解释的表示空间,实现不同研究项目之间的细胞图谱快速相似性查询,极大提高了细胞类型注释的效率与准确性
[33]。此外,由陈·扎克伯格基金会(CZI)开发的CELLxGENE Discover平台,为HCA提供了超过3300万个细胞的标准化数据集,支持便捷的数据探索、查询与细胞注释。
在细胞类型注释方法方面,HCA利用开发的PopV框架
[34],整合了监督学习方法(如随机森林、支持向量机)、无监督数据整合方法(如BBKNN、Scanorama、scVI)以及半监督方法(如scANVI),有效提升了细胞类型注释的准确性与可信度。在具体应用中,PopV能够准确识别脑区细胞类型,突出特定神经元群体,并通过不确定性评分辅助高置信度注释
[35]。Xu等
[32]开发了一项自动化的流程框架CellHint,通过评估多个数据集的细胞相似性和协调细胞注释来有效比对多个数据集,解决不同数据集在注释分辨率和技术偏差上的差异,支持多器官参考图谱的生成。此外,HCA还提供了丰富的可视化工具,如Seurat和ScanPy,支持单细胞和空间转录组数据的分析、聚类、差异基因表达分析及注释结果的直观展示
[36],为研究人员绘制细胞图谱提供了强有力的技术支持。
2 人类参考图谱(HRA)研究进展
2.1 HRA项目背景介绍
HRA是人类生物分子图谱计划(HuBMAP)的核心成果之一,旨在建立一个系统化、高精度的人体器官三维空间图谱。HuBMAP计划通过整合多组学数据和空间信息,全面描绘人体在生理和病理状态下的分子特征与细胞组成
[37]。HRA则致力于建立一套标准化的解剖学术语体系与三维参考系统,为科研人员提供可查找、可访问、可互作、可重用(FAIR)的数据平台。HRA项目经历了多个关键发展阶段(
表3)。
1)初期基础构建阶段(2017—2020年)。2017年,HRA的概念框架初步形成,重点确立统一的术语体系与数据结构,用以精确描述样本、生物结构及其空间定位。随着技术进步和数据积累,HRA的覆盖范围不断拓展,涵盖器官、解剖结构、细胞类型和生物标志物等信息。2020年3月,NIH组织50余位专家达成共识,确定了ASCT+B表格的标准框架,整合了解剖学、细胞学和生物标志物3大本体论,奠定了人体知识数字化展现的新阶段。2020年11月,在CZI年度会议上正式确立HRA核心架构。
2)快速发展阶段(2021—2022年)。2021年3月发布的v1.0首版图谱,涵盖11个器官的1424个解剖结构。此后,HRA实现了数据与代码的每半年定期更新,显著提升了用户的可视化探索和编程访问能力。2022年12月发布的第4版(v1.3),器官数量扩展至57个,解剖结构达到1588个,并对相关表格进行了修订,新增了2D功能组织单元可视化图谱
[38]。
3)系统完善阶段(2023—2024年)。2023年12月发布的第6版(v.2.0)实现重大了突破,包含33个ASCT+B表,65个与本体相连的三维参考对象,以及4499种解剖结构、1195种细胞类型和2089种生物标记物
[39]。2024年持续完善和优化,为人体知识的数字化展现提供了有力支持,2024年6月发布的v2.1版本实现36个器官跨尺度本体链接,12月发布的v2.2版新增了6个3D器官和2个器官映射抗体面板表,覆盖了71个器官,包含5800个解剖结构、2268种细胞类型和2531种生物标记物
[40]。
2.2 合作网络与资助机构
HRA的主要数据来源于HuBMAP数据共享平台,至2025年4月30日,HuBMAP数据共享平台的Top 10机构的出版物数量如
表4所示。其中,加利福尼亚大学圣地亚哥分校医学中心的出版物数量遥遥领先,达到了1422篇。其次,斯坦福医学中心的772篇,位居第2。宾夕法尼亚大学医学中心、范德堡大学医学中心的出版物数量分别为560篇和480篇,排名第3和第4。值得关注的是,位列第五的加利福尼亚大学圣地亚哥分校医学中心女性生殖研究团队,凭借404篇专题性成果,为HRA项目在生殖健康领域的垂直深耕提供了关键数据支撑与独特学术视角。其他主要合作机构,包括斯坦福研发技术研究所(211篇)、佛罗里达大学医学中心(192篇)、加利福尼亚理工学院医学中心(104篇)、布罗德研究所研发技术研究所(84篇)和罗切斯特大学医学中心(28篇)。
表5为HRA主要合作联盟的资助项目概况。HRA由多个国际组织联盟通过基金资助,共同促进HRA国际合作。其中,美国国立卫生研究院(NIH)是HRA项目的核心资助机构,其对肾脏与肺部图谱的投入占比达32%,为HRA器官图谱构建发挥了基础性和引领性作用
[41]。由NIH资助的人类生物分子图谱计划(HuBMAP),通过推进创新神经技术(BRAIN)倡议进行脑研究的细胞普查网络(BICCN)、大型跨学科、跨组织的基因型-组织表达计划(Genotype-Tissue Expression,GTEx),以及由NIH、华盛顿州西雅图艾伦研究所和美国国家科学基金会(NSF)联合资助的艾伦脑细胞图谱(Allen Brain Atlas),为HRA的整体建设、初始研究、数据采集提供了关键的资金支持
[42]。
除NHI外,HCA作为HRA的重要资助机构之一,通过构建全球化合作网络,有力推动了HRA的国际化进程。HCA发起的多个重点项目,如颇具影响力的“陈·扎克伯格基金会的种子计划,欧盟“地平线2020”计划,以及英国研究与创新医学研究理事会(MRC)的HCA和维康信托(Wellcome)的HCA试点项目,同样为HRA提供了宝贵的资金和全方位的技术支持。
2.3 HRA三维参考图谱的构建和应用
1) 标准化数据框架构建:解剖结构、细胞类型和生物标志物(ASCT+B)。
HRA依托解剖结构、细胞类型和生物标志物(ASCT+B)三维数据框架,深度融合专家知识库与海量实验数据,实现多模态生物医学数据的标准化整合,显著提升了数据的规范化管理与高效利用能力
[8]。ASCT+B表格作为HRA的核心数据框架,以三元组形式对生物医学信息进行结构化编码,展现跨系统数据整合的独特优势与应用价值
[41]。HRA汇集了多源异构数据,既包括专家精心编纂的解剖系统、细胞类型及生物标志物等知识体系,也涵盖实验获取的组织学图像、单细胞基因组、蛋白质组等。由于数据来源和格式存在显著差异,标准化处理成为多模态数据整合的关键
[43]。HRA作为社区共创的统一参考框架,有效促进了不同来源数据的规范化管理、比较分析及高效利用。ASCT+B表格在不同解剖命名系统间发挥了重要的衔接作用,为生物医学数据的跨系统比较提供了有力支撑。
随着ASCT+B表格的不断优化完善,其构建、审查及发布流程也日趋规范化。初期,主要依托生物学本体资源、科研文献数据和临床试验数据进行编码统一。后期,专家通过实验数据进行多轮修订、验证与补充,实现从组织结构、细胞类型、生物标志物的全方位信息覆盖
[7]。当前,ASCT+B表格已整合Uberon解剖本体与Cell Ontology细胞本体,建立起一套标准化术语体系和数据结构
[8],并借助ASCT+B Reporter平台(
https://apps.humanatlas.io/asctb-reporter/)实现的编写、审核和可视化展示,为生物结构的空间定位与样本描述提供了统一依据
[44]。
2) HRAlit数据库:支撑HRA构建与使用的综合性数据集。
HRA研究人员依据解剖结构、细胞类型及生物标志物的信息,结合学术研究与实验数据,对人体各器官组织进行功能区域的精细划分。此过程需综合考虑细胞类型分布、生物标志物表达情况及器官组织生理功能特征,依赖先进的算法与技术来辅助实现。HRA的构建依赖于高质量的学术文献与实验数据,前者主要源自PubMed,实验数据则涵盖HuBMAP、SenNet、KPMP、GUDMAP、GTEx及CELLxGENE Discover等门户数据。但因这些数据门户提供的元数据模式各异,跨平台数据搜索与整合面临较大挑战。为此,Kong等
[45]开发了HRAlit数据库,作为支撑HRA构建与使用的综合性数据平台。该数据库将第五版HRA(v1.4)的136个数字对象,包括31个器官、4279个解剖结构、1210种细胞类型及2089个生物标志物,与约58万名专家、71万篇出版物、8.9万资助项目及1816个实验数据集紧密链接
[41],极大提升了HRA数据的交叉检索与语义挖掘能力。
在数据整合阶段,HRAlit数据库将HRA数字对象与专家、出版物、资助项目及实验数据集有机关联,建立起结构完善、互联互通的数据网络,HRAlit数据库的数据处理流程如
图3所示。其ASCT+B表详细记录了大量实体与关系信息,为数据查询、跨域分析、深度挖掘提供了坚实的基础。HRA数字对象与实验数据集、学术文献及基金项目之间的互联互通,显著提升了数据的组织结构与可用性。研究人员对收集到的数据进行系统的清洗、标准化及去重处理,并实现了多来源数据的有效关联,构建起完整的数据链条。HRAlit数据库的标准化处理流程,显著提升了HRA数据的可用性与互操作性,用户可基于该平台识别领域内的关键专家与高影响力出版物,优先获取核心数据资源,并将HRA数据有效集成至现有本体之中。
3 对比分析
HCA与HRA作为当前国际前沿生物医学领域两项具有影响力的研究计划,均致力于揭示人体细胞的分子特征与空间组织规律,从而推动对生命系统的多维认知。HCA项目致力于绘制出人体所有细胞类型的详细图谱,重点关注细胞类型、所在位置及相互间的作用关系;HRA项目则旨在构建具有多尺度、跨组织的人体三维器官参考框架。两者在研究目标上互为补充:HCA为HRA提供了细胞层面的详尽数据支撑,而HRA则为HCA成果提供结构化、空间化的宏观参照体系,共同推动生物医学研究的深化。尽管HCA与HRA都关注细胞层面的复杂性并服务于健康与疾病的机制研究,但在核心目标、技术路径、数据类型及应用场景等方面存在显著差异。本文从数据采集与整合、数据共享与注释、空间定位技术等维度进行比较分析(
表6),以揭示其在构建人类生物图谱过程中的独特价值与协同潜力。
3.1 数据采集与整合:单细胞特性与空间系统性
HCA以单细胞数据收集为核心,通过高通量单细胞转录组学和空间基因组学技术,构建了包括肺、心脏、肠道、神经系统等18个生物网络的细胞图谱。其核心数据类型包括单细胞转录组(scRNA-seq)、表观遗传信息和蛋白质表达等,辅以空间定位技术形成初步的二维空间信息,为更全面地理解细胞特性提供支持。例如,如To等
[31]借助UDA-seq技术分析33.6万个细胞核,成功绘制了首张人类骨骼发育图谱,并揭示了骨关节炎的潜在机制。
HCA样本来源覆盖全球,力求反映不同地理区域和种族背景,既包含活体参与者,也有已故捐献者、儿科人群及不同发育阶段个体,年龄范围从发育期到衰老阶段,重点在成年人群。HRA在构建多尺度三维参考框架时也强调样本代表性,但当前核心图谱主要基于少数参考捐赠者,种族集中度较高,年龄覆盖依器官可获取性而定,未来设计上允许整合更多不同背景的空间数据。相比之下,HRA整合解剖学信息、细胞类型以及基因、蛋白质、脂质等生物标记物在空间的分布等多模态数据。以空间位置为核心,采用标准化的术语(ASCT+B表格)统一各类型数据的术语体系,将解剖结构、细胞类型和生物标记物在三维空间中进行精确定位,体现人体结构的空间分布及其动态变化。
3.2 数据共享与注释:计算机驱动与生物知识驱动
HCA通过Terra、CELLxGENE Discover等平台实现全球范围的细胞组学数据共享。其注释过程依赖Seurat、PopV、CellHint等算法工具进行自动分类与标注,快速识别和分类细胞类型,具有处理效率高、规模化优势,但在处理复杂的多模态数据和生物语义理解上存在一定的局限性。HRA则通过HRAlit数据库实现数据共享,支持跨平台查询多种类型的数据,采用ASCT+B表格来标准化细胞类型、解剖结构与生物标记物之间的关联,为数据注释提供了一套标准的术语体系
[39]。此外,HRA还利用解剖学本体和细胞本体等多种生物学知识库
[46],确保不同平台和研究者之间的数据具有兼容性和可比性。HRA的三维解剖参考模型允许研究人员在空间上注册新的数据,并探索全身不同细胞类型的相对位置,能够有效整合多种类型的数据和空间信息,提供标准化的数据注释框架。
两者在数据共享与注释上的技术路径反映了各自核心目标的差异:HCA侧重高效处理大规模单细胞数据,依赖计算驱动的自动化注释工具以快速识别细胞类型;HRA则专注于构建包含空间坐标和标准术语的跨器官参考体系,强调基于生物知识库和本体论的标准化注释以确保空间一致性
[41]。两者技术具备显著的一致性与互补性。首先,HRA依托高性能数据平台(如Terra和HRA门户),并逐步采用ASCT+B表格及本体论(如Uberon、CL)作为跨组学数据注释的通用标准,为HCA数据提供更精准且具可比性的空间注释支撑。其次,HCA的高通量自动化算法(如Seurat、CellHint)优势明显,可借鉴于HRA加速新数据整合与预标注;反过来,HRA基于本体的深度语义注释和严格空间坐标体系,为解决HCA跨样本和跨平台整合中批次效应及注释不一致问题,特别是在提升空间定位精准度与生物学解释方面,提供了重要参考。
3.3 应用场景互补性:二维细胞解析与三维空间定位
HCA主要提供细胞在组织中的类型分布及功能状态,用数字矩阵描述每一个细胞的特征,并对它们进行系统性分类,作为了解人类健康以及诊断、检测和治疗疾病的基础。适用于研究基因调控网络、新型细胞类型识别及疾病组织重塑过程。相比之下,HRA更强调细胞在器官中的空间位置与结构层级,其三维模型支持细胞之间的空间交互、解剖位置与功能状态的耦合
[41]。HRA的三维建模能力可支撑疾病机制解析、药物靶点定位、个体差异分析等更具空间复杂性的研究任务
[39],成为推进个体化诊疗的重要工具。例如,在肠道组织研究中,HRA能够支持从多尺度角度分析和可视化功能组织单元(FTU)的结构与功能,有助于深入理解肠道的复杂组织构型与生理特征
[8]。在骨骼发育与骨关节炎研究中,HCA项目利用单细胞测序技术(如UDA-seq)解析骨骼组织的细胞异质性,鉴定出关键软骨细胞亚群及其异常基因表达模式
[31]。随后,研究者将这些细胞类型特异性基因表达数据映射到HRA提供的标准化三维骨骼器官模型,并借助ASCT+B表格完成空间注释。在HuBMAP肝脏数据集中,HRA三维模型能够精确标注外分泌腺功能单元(参与胆汁分泌、糖原储存、维生素A合成及解毒等过程)在器官内的空间分布,为肝脏代谢及病理状态研究提供可视化和可比性支撑。
HRA的通用坐标框架(CCF)被广泛应用于HCA、HuBMAP、KPMP等多个系统生物学项目的组织样本注释与整合中。该框架不仅提供统一的空间参考模型,还支持跨平台、跨模态数据的语义与空间一致性映射,使得HCA所生成的高分辨率单细胞或空间数据能够在标准化的三维结构中实现高质量整合
[41]。Lee等
[47]利用HCA单细胞转录组数据解析COVID-19患者肺泡中特异性免疫细胞和上皮细胞亚群,揭示了病毒感染的分子机制。研究人员随后将这些细胞类型及其表达特征映射至HRA的标准化三维肺部模型中,通过CCF精确定位病理细胞在肺组织结构中的分布范围,并对比健康肺图谱,识别了与肺纤维化进程相关的空间重构模式
[40]。
3.4 伦理规范、全球协作与数据安全策略
HCA与HRA均高度重视全球协作与伦理治理,并在制度设计与技术实施中形成了各具特色的策略。HCA设立伦理工作组(EWG),专责制定国际统一且可互操作的政策与工具,指导研究社区在数据采集、共享与使用中平衡科研价值与隐私安全。其伦理框架以开放科学为核心,通过公开/受控访问分级制度防范大规模基因组数据的隐私泄露
[12]。HRA则遵循HuBMAP伦理与开放标准,符合FAIR原则,并以社区标准格式和链接本体的形式发布开放链接数据,配套ASCT+B表、通用坐标框架(CCF)、OMAP抗体库等工具,同时对原始影像数据实行严格访问限制,优先开放标准化参考模型、术语表与注释数据,实现科研开放与隐私保护的动态平衡。两大项目在伦理关注重点上各有侧重:HCA需应对跨国、多中心、多种族活体与手术样本管理中各国法规差异及基因数据隐私风险;HRA则聚焦高精度空间影像数据的潜在可识别性,通过限制原始数据访问防止隐私泄露。
HCA在单细胞多组学自动化注释、HRA在跨尺度三维整合及标准化术语体系(ASCT+B)和生物本体(CL、Uberon)等方面的应用形成了可借鉴范式。我国应加快单细胞与空间多组学技术的国产化、高通量化与低成本化攻关,参与国际标准制定,推动中文生物医学术语标准化与国际化,依托国家平台建设符合FAIR原则、体现中国人群特征且符合法规的数据治理体系。同时,需防范国际数据资源的地缘政治风险。HCA与HRA由美国主导,政策可能受政治影响,应建立多层防控体系。在国家层面开展关键数据风险监测与预警;在机构和个人层面依法合规获取数据;从而推进国内细胞图谱计划,构建核心数据库与工具链,并深化与欧洲、亚洲等地区合作,分散依赖风险,构建多元稳定的国际科研网络。
4 总结与展望
HCA与HRA的协同发展正在重塑人类生物学图谱的建构逻辑与研究范式。尽管两者在数据结构、分析方法和应用场景方面存在差异,但在功能信息与空间定位上的高度互补性,为精准医学、系统生物学等前沿研究提供了强有力的支撑。
4.1 实现细胞功能与空间定位的深度整合
当前研究已初步证实HCA与HRA数据的互补性,但要实现细胞功能信息与精确空间坐标的深度融合,并构建具有时间维度的动态模型,仍面临技术与理论上的挑战。构建融合HCA细胞特征、HRA解剖坐标及外部数据库信息的动态知识图谱,将成为理解组织发育、功能维持与病理变化的重要路径。HCA与HRA的协同推进,正在引领生命科学进入“细胞-空间”解析时代。随着单细胞时空组学技术与动态建模方法的不断发展,未来有望绘制出时间维度的动态生命图谱,更深入地揭示发育、衰老与疾病等复杂生物过程。通过数据的持续更新与开放共享,将进一步加速全球范围内的科研协同与创新突破。
4.2 构建跨尺度研究范式,实现多模态数据标准化整合
生命系统的复杂性要求打破细胞、组织、器官及个体层级的数据壁垒,构建多模态、跨尺度的生物系统模型。HCA通过CELLxGENE、Terra等平台推动数据的标准化与开放共享;HRA则借助ASCT+B表格和共同坐标框架(CCF),实现结构-细胞-分子的标准化关联,目前,ASCT+B表格已完成了31个人体器官的细胞类型注释,但单细胞数据与医学影像数据的坐标系统整合仍需完善。实验技术的异质性、生物样本的稀缺性以及多组学数据的复杂性,均导致标准化细胞识别与分类面临重大挑战。人工智能的快速发展为解决上述问题带来了新机遇。HCA的一系列研究表明,机器学习在细胞识别、自动注释与数据整合方面具有显著优势。未来,生物学图谱构建亟需结合深度学习与人工智能技术,开发更高效的自动化注释工具,实现单细胞组学、空间组学、影像组学等数据的统一处理与智能查询。
4.3 加速图谱数据临床转化,推动精准医疗
HCA与HRA共同揭示的细胞多样性和状态转变,描绘的细胞间相互作用和组织微环境,为理解疾病机制提供了新的视角。HCA借助空间组学技术,可对患者组织样本进行单细胞分辨率解析,揭示疾病异质性,追踪胚胎发育与器官形成过程中的动态细胞轨迹,发现罕见细胞亚群功能,从而为人体精准治疗提供理论依据
[47]。例如,在肿瘤研究中,HCA可鉴定肿瘤组织内具有耐药潜能的稀有细胞亚群及其特异分子谱,HRA则HRA则精确定位其在肿瘤微环境中的空间关系,为靶向药物设计与免疫治疗提供量化依据。在神经退行性疾病研究中,HCA刻画病灶区神经元与胶质细胞转录组重塑,HRA提供脑区层次结构定位,助力疾病早期病理机制解析与药物递送策略优化。将HCA的细胞发现与HRA定义的正常细胞类型、生物标记物及其空间结构进行比对,有助于实现疾病的早期、精准诊断,区分不同疾病亚型,甚至预测疾病进展及治疗反应。未来,基于HCA与HRA构建的个体化精准医疗决策支持系统,有望推动基础研究成果高效转化,实现疾病预防、诊断与治疗的范式变革,提升全生命周期健康管理水平。