生成式人工智能领先企业专利文本大数据研究

常登宇 ,  杨张博

科学观察 ›› 2025, Vol. 20 ›› Issue (5) :27-41

PDF (4587KB)
科学观察 ›› 2025, Vol. 20 ›› Issue (5) :27-41 DOI: 10.15978/j.cnki.1673-5668.20250713
数据观察

生成式人工智能领先企业专利文本大数据研究

作者信息 +

Generative Artificial Intelligence Leading Enterprise Patent Text Big Data Research

Author information +
文章历史 +

摘要

[目的/意义] 生成式人工智能(GenAI)的快速发展正深刻重构全球技术竞争格局,通过分析GenAI领先企业的专利文本,为中国GenAI产业的生态构建与战略布局提供经验借鉴。[方法/过程] 基于19家美国GenAI企业1059项专利文本数据,综合使用关键词共现网络分析、LDA主题建模及K-means聚类算法,从网络结构、技术主题分布与技术内容关注方面揭示了美国GenAI产业的技术创新特征与内在分异。[结果/结论] GenAI领先企业总体上在“算法、算力、算据”3大核心领域展开布局,基于核心共通AI技术,围绕自身核心业务及资源,以商业应用价值为导向进行差异化竞争与技术落地,形成一个由新兴探索者、生态布局者、整合协同者与核心驱动者4类主体构成的创新生态系统。基于研究发现,论文讨论了美国GenAI初期领先企业的发展现状,并结合中国GenAI产业发展特征,从企业、产业和政策3个层面提出政策启示。

Abstract

[Objective/Significance] The rapid development of generative artificial intelligence(GenAI) is profoundly restructuring the global technology competition landscape. By analyzing the patent texts of leading GenAI companies, it provides experience and reference for the ecological construction and strategic layout of China's GenAI industry. [Method/Process] Based on the text data of 1059 patents from 19 American GenAI companies, keyword co-occurrence network analysis, LDA topic modeling and K-means clustering algorithm are comprehensively used to reveal the technological innovation characteristics and internal differentiation of American GenAI industry from the aspects of network structure, technical topic distribution and technical content attention. [Results/Conclusions] GenAI leading companies generally develop their layout in the three core areas of “algorithms, computing power, and data”. Based on core common AI technologies, they focus on their core businesses and resources, and conduct differentiated competition based on commercial application value. With the implementation of technology, an innovative ecosystem composed of four types of entities: emerging explorers, ecological layouts, integrated collaborators, and core drivers is formed. Based on the research findings, the paper discusses the development status of leading companies in the early stage of GenAI in the United States, and combines the development characteristics of China's GenAI industry to propose policy implications from three levels: enterprise, industry and policy.

Graphical abstract

关键词

生成式人工智能 / 专利文本 / 关键词共现网络 / LDA主题 / K-means聚类

Key words

generative artificial intelligence / patent text / co-occurrence network / LDA topic / K-means clustering

引用本文

引用格式 ▾
常登宇, 杨张博. 生成式人工智能领先企业专利文本大数据研究[J]. 科学观察, 2025, 20(5): 27-41 DOI:10.15978/j.cnki.1673-5668.20250713
Chang Dengyu, Yang Zhangbo. Generative Artificial Intelligence Leading Enterprise Patent Text Big Data Research[J]. Science Focus, 2025, 20(5): 27-41 DOI:10.15978/j.cnki.1673-5668.20250713

登录浏览全文

4963

注册一个新账户 忘记密码

0 引言

生成式人工智能(generative artificial intelligence,GenAI)的发展为各行业带来了智能化升级浪潮,从ChatGPT创纪录的用户渗透速度,到DeepSeek等产品的突破性进展,其破坏性创新属性已影响到经济社会多个领域[1-2]。目前,全球GenAI领域基础研究与技术布局呈现出的“两超多强”格局,中国和美国占据主导地位[3]。截至2024年底,中国GenAI用户规模已覆盖2.49亿人,占总人口的17.7%[4],在中国302款GenAI服务备案中,仅2024年就新增238款,占比78.8%[5],各大科技企业纷纷布局GenAI产业。而美国作为人工智能技术领域发力较早且相对领先国家,近年来大力推动人工智能领域的技术创新与实践。根据斯坦福大学人工智能研究院《2025 AI Index》报告,美国2024年发布了40个标志性人工智能模型,约为中国(15个)的2.7倍,其1091亿美元私营资本投入更达到中国的11.7倍。尽管,中国现阶段GenAI产业的发展已取得了显著进展,但在基础研究、技术体系和应用生态等方面仍有持续发展的空间[6]。美国早期在人工智能领域积累的研发经验,为其GenAI企业塑造了显著的创新基础与先发优势[7]。因此,系统分析GenAI爆发初期美国领先企业的技术创新特征与内在分异,能够为中国GenAI产业以及相应新兴产业的生态构建与战略布局提供一些借鉴。

人工智能作为新一代产业变革的核心驱动力之一,大量研究从产业政策[8]、发展战略[9]和行业演化[10]等维度考察了中国或美国人工智能领域的发展态势,或从产业韧性[11]和多维临近视角[12]分析了其影响因素。而在当前的技术变革背景下,前沿科技创新往往依托多种技术组合,并深度嵌入产业生态[9]。作为人工智能领域的核心应用方向之一,专注生产内容的GenAI有着显著的技术多样性和跨领域特性,尤其体现出多种创新内容交织的生态系统特征[13]。随着GenAI成为全球人工智能竞争的焦点,中美在该领域的专利布局日益密集,呈现出数量与策略上的显著差异[14]。目前,中国专利申请已显著超越美国,2024年,全球公开的4.5万件GenAI专利中,中国占比61.5%,然而,若考虑专利的新颖性,美国在许多GenAI子领域仍然具有一定优势[15],并且,在影响力上,美国机构贡献了最多被引用次数排名前100 的人工智能论文[16]。这主要是由于中美的发展优势与技术布局不同,中国的核心优势在于庞大的用户基数塑造的海量数据资源,以及多样化应用场景催生的市场需求,表现出较强的技术规模优势,但在技术布局上较为分散和多样化,特定技术的纵向延伸较为欠缺[17]。与之相对,技术创新处于成熟发展阶段的美国则凭借其先发优势,构建起良好的研发生态系统与创新生态系统[18]

专利研发作为企业技术创新活动的外显载体,能直接客观地反映其研发投入、技术独创性和市场战略意图,并更好地解释其技术知识积累、发展路径与扩散特点[19]。然而,已有人工智能相关领域的专利研究往往通过IPC分类、被引与合作等方式探讨企业的创新活动。例如,借助专利IPC分类号,杨张博等[17]、高山行等[20]详细分析了GenAI产业的技术创新布局和专利知识网络;基于专利合作数据,刘艳秋等[21]分析了全球主要国家人工智能专利的技术分布与合作网络的演化;冯瑜满等[22]则探讨了中国人工智能创新合作网的时空格局及其影响因素。由于企业的知识创新质量、特点等多方面深层差异往往体现在专利文本,本质上编码在文字结构中[23]。IPC分类、被引与合作等分析体系较难捕捉企业知识创新的技术关联,而文本分析方法能够从海量非结构化文本中,提取关键技术主题、识别技术演化路径,通过文本分析解构企业创新专利从技术路线的独创性描述到解决方案的细节实现,从而提供更为精准和深刻的洞察。但当前GenAI领域的文本研究更多是通过公众评论文本探讨GenAI的影响及其治理[24],或使用GenAI文本挖掘技术识别潜在应用领域[25]和商业变革潜力[26],相对缺乏对GenAI专利文本自身技术特点与构成要素的研究。对GenAI领先企业的专利文本进行深入分析,能够更清晰地明确支撑GenAI发展的底层逻辑和基础,为产业生态构建与战略布局提供更为有效的借鉴。

总结来看,已有研究主要有以下几方面可行研究进路。1)在研究主题上,现有研究大多以人工智能为研究对象,较少有研究聚焦于GenAI领域,人工智能产业已发展多年,而GenAI自2022年各种相关应用被接连发布,是目前较为前沿的新技术,二者之间存在一定差别。2)在研究内容上,已有对于人工智能相关研究多集中在产业政策、行业应用等宏观层面,相对缺乏对GenAI关键核心技术及其技术布局的研究。只有明确支撑GenAI发展的底层逻辑和基础,才能为技术进步和创新提供有效借鉴,因此,有必要考察美国GenAI领域代表性企业,对其创新系统和技术布局进行系统性对比分析,为我国发展GenAI这一新兴产业做出借鉴。3)在研究方法上,已有专利相关研究中,多采用IPC分类、被引与合作等数据,而企业的知识创新质量、特点等多方面深层差异往往体现在专利文本,传统研究方法较难挖掘企业创新专利的深层技术和知识分异。

有鉴于此,本研究收集了美国19家在基础模型、应用开发及基础设施等层面具有代表性的GenAI初期较为领先企业的1059项核心技术专利数据,系统分析了美国GenAI产业的技术创新特征与内在分异。可能的边际贡献在于:1)以美国GenAI企业创新专利文本为研究对象,明确美国GenAI领先企业的技术特点和生态优势,能够基于研究结论,为我国GenAI企业、产业和政策提出研究启示;2)研究综合运用关键词共现网络分析、LDA主题建模及K-means聚类等当前文本分析的主流方法,从网络结构、主题分布与内容关注整体刻画美国GenAI产业的技术创新特征与内在分异,可为中国GenAI产业生态构建与战略布局提供经验借鉴。

1 研究设计

1.1 样本和数据

以GenAI领先企业创新专利文本数据为研究对象,对于样本企业的选取,一方面需要尽量覆盖各类企业,以揭示产业生态;另一方面,样本企业要能够较好代表技术爆发期的创新主体,确保捕捉到关键技术关注信息,避免因样本选择导致结论偏差。为系统分析GenAI技术爆发初期美国企业的创新特征与路径分化,根据《GenAI市场、份额与增长分析报告》[27]、《全球AIGC技术市场报告》[28]相关权威GenAI产业报告,选取美国19家GenAI技术爆发初期的各类领先企业。其中包括11家专注于GenAI领域的中小企业,3家投入巨大且深度涉及GenAI领域的IT企业(Microsoft、Facebook/META和Google),2家提供主要算力的硬件企业(NVIDIA和Intel),以及2家将GenAI应用于产品的软件企业(SAP和SalesForce)。样本信息如表1所示。

本研究借助德温特专利数据库(Derwent World Patents Index, DWPI)检索并收集相应的专利,具体过程如下。1)对于11家聚焦于GenAI业务的中小企业,检索其所有申请并获批的专利,对于其他企业,使用AI、artificial intelligence、GenAI、AIGC等关键词检索其申请并获批的专利。2)根据检索结果收集相关的专利信息,包括专利号、申请和授权年、专利权人、专利摘要和IPC分类号等。3)提取19家企业总计1059项专利的专利号和专利摘要,用于文本挖掘和分析。

1.2 数据清洗、处理和研究方法

专利摘要的文本挖掘和自然语言处理主要借助R语言,包括tidytext、dplyr、tokenizers、topicmodels、ldatuning等软件包,并使用Gephi和UCINET进行网络描述,使用Stata进行K-means聚类分析。具体数据收集、整理、分析过程,以及各个过程中使用的软件和命令如图1所示。

1.2.1 数据清洗处理

1)文档清洗及分词。对所收集专利摘要进行清洗和分词。分词引擎采用基于最大概率法和隐式马尔可夫模型的混合模型(MixSegment),分词过程中通过设置停用词表,清洗文本中的无用词汇,包括日期、数字、冠词、介词、标点符号等文本,生成专利号和摘要创新性分词结果的整洁数据,以进行文本分析。

2)DTM矩阵生成。根据专利号将专利文本整理为文档-词条矩阵(document-term matrix, DTM)的结构化数值数据,以备LDA主题建模和词频共现网络分析。DTM用数字表示文本语料库中的词,形成一个矩阵,其中行代表语料库中的每个唯一术语或单词,列代表语料库中的每个文档。矩阵中的值表示每个术语在每个文档中的频率[29]

3)专利创新关键词提取。采用TF-IDF算法进行关键词提取。TF-IDF算法结合词频(term frequency,TF)和逆文档比率(inverse document frequency,IDF)提取关键词,同时考虑了本文档的词频以及本文档与其他文档的词频重复率,能够过滤重复的简单词频,保证相应关键词对专利的重要性越高,其TF-TDF值就越高,对于大规模文本内容的分析有着良好的效果[30]

1.2.2 分析方法和数据分析过程

基于GenAI企业创新专利文本,依次使用关键词共现网络、LDA主题建模和K-means聚类分析解构GenAI初期领先企业的技术创新特征与内在分异,构建从产业整体生态到企业具体定位的分析链。其中:关键词共现网络分析能够弥补传统IPC分类无法量化的文本关联强度和技术关联组合,用于分析GenAI产业总体上的注意力特征;LDA主题建模相较于BERTopic等方法更适用于大规模且词汇较为一致的文本,用于提取各企业创新专利的关注主题;K-means聚类则能够识别不同企业的技术定位,以区分不同企业在GenAI领域的技术创新特征与分异,具体方法和数据分析过程如下。

1)文本网络分析。根据词条是否共同出现在同一个专利的摘要中,分析词与词之间的关系,构建词共现网络。具体来说,通过将DTM矩阵转化为词条之间的共现矩阵后,去除仅共现一次的词条,使用Gephi和UCINET软件计算网络指标,根据点度中心度绘制核心词共现网络图,并分别使用核心技术概念、桥接技术概念和TF-IDF值分析各企业在GenAI领域技术创新的文本关系特征其中,核心技术概念使用特征向量中心度测量,桥接技术概念使用网络约束测量。

2)LDA主题词模型。对每一家企业的所有专利进行建模,以比较企业间在技术创新主题上的差异。由于专利摘要由自然语言写成,不同专利的摘要会有大量词语重复,传统对文档分类的方法因为类别之间必须存在排他性,较难对重复的技术词汇进行处理。LDA属于无监督机器学习算法,能够提取一组专利文档的特定主题,以了解每个样本企业的核心研究领域。LDA通过DTM提取主题,允许不同专利包含相同的主题,如A专利包括80%的主题1和20%的主题2,而B专利包含40%的技术主题1和60%的主题2。

3)K-means聚类。使用K-means聚类算法对企业进行聚类分析,以区分不同企业在GenAI领域的技术创新特征与分异。K-means聚类是无监督机器学习算法,用于将数据集中相似的数据点聚类分组,具体过程如下:首先,随机选择K个簇心,表示每个聚类的中心,总计K个聚类;其次,将每个数据点分配到其最接近的簇心所在的聚类;然后,计算每个聚类中所有数据点的平均值,以更新每个聚类的簇心;最后,分配和更新步骤将重复执行到簇心不再变化,或达到最大迭代次数[8,31]

聚类指标中,除企业专利数量和LDA主题数量外,本文还参考相关研究计算了各企业专利文本的平均点度、模块度、中心势和平均路径长度4个指标进行K-means聚类分析[17,32-33]。其中,平均点度表示知识凝聚程度,测量一个技术关键词平均与其他多少个技术关键词直接相关联,反映企业内部不同技术概念之间相互关联的紧密程度;模块度表示知识分离程度,衡量企业的技术网络能够被清晰地划分为多少个内部紧密、但外部连接稀疏的技术社群;中心势表示知识集中程度,衡量企业技术网络被少数几个核心技术关键词所主导的程度,反映企业知识的中心化程度;平均路径长度表示知识宽度,衡量企业技术网络中,2个随机的技术概念间平均需要经过多少条边,反映企业知识体系的规模和内部传导效率。具体指标计算及其解释如表2 所示。

2 研究结果

本部分基于19家GenAI初期企业创新专利文本,依次通过文本网络、LDA文本主题和K-means聚类进行分析。

2.1 文本网络分析结果

关键词共现网络能够清晰展示企业专利创新的注意力,反映企业在特定内容和领域进行技术创新的重视程度。研究根据点度中心度最高的20个关键词绘制共现网络,并将20个关键词单独提取以清晰展示。19家GenAI初期领先企业的专利创新性关键词文本共现网络如图2所示。

可以看到,19家企业的创新重点主要包括人工智能和计算能力、数据存储与处理、神经网络、机器学习等领域,可以将其关注重点分为“算据”“算法”和“算力”3个领域。1)“算据”集中在数据处理与存储领域。关键词中的data、storage、block和input等关键词表明企业关注数据处理和存储方面,是人工智能应用的基础。2)“算法”集中在神经网络与机器学习领域。关键词中的neural、network、learning和artificial、intelligence等关键词包含了所有与构建智能模型的方法、逻辑和过程相关的词汇,表明企业在神经网络和机器学习算法方面进行创新。3)“算力”集中在计算能力与处理器领域。关键词中的computer 、device、computing和memory包含了与执行计算的物理硬件和系统能力相关的词汇,是实现智能计算的物理基础和运行环境,表明企业积极在计算能力和处理器技术方面进行创新,以支持复杂的计算任务。

为进一步解构美国GenAI产业的技术创新特征与内在分异,表3分别列出了每家企业的核心技术概念、桥接技术概念和TF-IDF值排名前5的技术创新关键词,以及总体上各指标最高频的5个关键词,以描述其主要创新概念。

1)核心技术概念,使用特征向量中心度测量,反映企业技术创新关注的重点内容。可以看到,机器学习和自然语言是这些企业在技术网络中最为关注的内容,各企业普遍在不同程度上使用了这些通用底层技术进行创新。在总体上,“processor/automatically/machine/language/learning”这些关键词构成了GenAI技术的通用框架,机器学习(machine、learning)与语言(language)等构成了该领域核心的技术基础,而处理器(processor)与自动化(automatically)等高频词的出现,则共同描绘出美国GenAI初期产业也较为依赖硬件算力,以支撑技术创新。

2)桥接技术概念,使用网络约束测量,识别连接不同技术集群的中介技术创新内容。结果表明,桥接技术概念总体较为关注“neural/memory/network/language/natural”方面,神经网络(neural、network)与自然语言(natural、language)相关的概念主导了此类关键词,神经网络与自然语言处理技术是当前GenAI领域的核心使能技术,与当前大型语言模型引领的技术浪潮高度吻合,揭示了这些创新技术内容作为关键桥梁,对理论与应用的融合作用。

3)TF-IDF值体现差异化技术概念,是各企业独特的竞争优势和市场定位。企业与某个特定领域或技术紧密绑定,在某个特定子领域内出现频率高,但在其他领域则相对较少,反映了企业在特定领域的专业化布局。总体来看,“text/conference/vector/recommendation/content”成为竞争最激烈的差异化领域,这些关键词不仅包括了GenAI典型的文本(text)和内容(content)产出,还指向了重要的推荐(recommendation)及会议(conference)应用领域以及底层向量化(vector)使能技术,揭示了解决具体商业问题已成为专利布局的核心驱动力,技术创新从技术探索转向更具商业价值的应用场景和实际落地。

总体来看,核心技术概念反映了领先企业共同积极关注的方向,多为GenAI领域的基础框架和核心要素,是较为通用且难以绕开突破的技术领域;桥接技术概念反映了企业在GenAI领域创新技术群的融合使能技术,多为热门、通用的研究方向;TF-IDF值则反映了各企业的主要竞争领域,体现了GenAI专利的多样化应用场景以及关键的底层技术实现,在将GenAI从理论推向实际应用的过程中,较为注重在特定商业需求领域进行创新。

2.2 LDA主题分析

LDA方法能够提取一组专利文档的特定主题,展现各个企业的核心研究领域。本部分对于每一个企业的专利文本的LDA主题数量,分别将数量设置为1~20运行模型,绘制数量主题的判断得分图,并综合已有研究中的4种判别方法确定最优主题数。以图3的DeepMind得分结果为例,由图3(a)可以看出,根据Cao等 [34]和Arun等 [35]的判断方法取值越低表示主题数量越合适;由图3(b)可以看出,根据Griffiths 等[36]和Deveaud等[37]判断方法,取值越高表示主题数越合适,因此,设定DeepMind技术创新文本的主题数最优值为19。

结合各企业具体专利摘要内容,根据每个主题出现概率最高的10个词确定每家企业的LDA主题(表4),主要有如下发现:

1)一些特定的专利主题在这些公司之间是重复出现的,例如,自然语言处理、机器学习和神经网络是多家公司共同关注的领域,表明它们在特定领域的专利创新上存在一定的竞争和重叠,也间接反映出当前人工智能领域的应用场景和热度一定程度上促进了特定方向专利创新。

2)各个企业GenAI创新方向主要围绕核心业务展开,聚焦于GenAI技术在不同场景中的应用,以GenAI技术为支撑以发展企业核心业务,例如,Google的主题包括网络配置和搜索引擎(主题1和主题15),而Cogito主营业务是为其他企业提供客服语音分析和辅助支持服务,其GenAI技术则聚焦于语音技术。

3)大型企业往往有一定数量的专利主题涉及硬件设施,如Google的主题7和Intel的主题11,分别涉及智慧家居和存储器电路设备等硬件设施,而中小企业则主要为技术方法和技术应用等主题。

4)每家企业的专利数量和涵盖的主题数量也存在差异。大公司积极在可能发展的方向上布局人工智能,而小公司则多关注较窄的专业领域。如DeepMind和Intel拥有较多的专利数量和多样化的主题覆盖,在人工智能技术研发和创新方面投入较大,并且在多个领域有广泛的应用。例如,如表4所示,Google的专利技术主题涉及医疗器械(主题2)、智慧家具(主题7)和VR(主题16)等不同领域。而如Appen、Automated Insights和Persado的专利数量相对较少,且主题涵盖范围较窄,在特定领域或应用场景上的研究较为深入和专注。

2.3 K-means聚类结果

根据方法部分所述,K-means聚类指标选择样本企业的专利数量、平均点度、模块度、中心势、平均路径长度和LDA主题。图4是10次K-means聚类的组内平方和及其分布,采用“肘部法”确定最优k值的数量。肘部法将平方误差和的值绘制成对聚类数(k)的函数图像,并选择WSS形成肘形的k值。可以看到,在k=4时函数出现较为明显的拐点,随着k值的增加,WSS下降速率开始降缓,这表示增加聚类数超过此点不会显著提高聚类性能,因此研究进行聚类时将k设置为4。

k 值设置为 4 时,根据19家GenAI企业的具体聚类情况,表5给出了各个企业的聚类分布,以及每个聚类的相应指标的平均值。各个聚类可以根据专利的创新规模(专利数量、平均路径和LDA主题数)和分化程度(平均点度、模块度和中心势)大致可分为新兴探索者、生态布局者、整合协同者与核心驱动者4类,总结概括如下。

1)新兴探索者(聚类1)。主要由成立时间较短、规模较小的初创企业构成,多数企业成立于2005年后。聚类数据显示,这类企业的专利总量与LDA主题数量均为最低,其创新战略高度聚焦。从网络结构看,其创新网络呈现出低平均点度的稀疏特征,但同时具备最短的平均路径长度,呈现“小而精”的特点。这一结构组合表明这类企业的技术创新是一种高效而紧凑的知识体系,尽管专业技术重点不多,但核心概念之间整合度较强,内部知识有着较高的传递效率,从而能够在其专注的细分赛道内实现快速的技术迭代和知识内聚。

2)生态布局者(聚类2)。主要由技术版图较为广阔的成熟企业构成,既有传统核心业务,也积极在GenAI领域进行创新活动。这类企业的显著特征是拥有最高的LDA主题数量和最高的模块度,形成类似不同领域结合的系统创新结构,企业的创新活动被组织成多个专业化但相对独立的业务单元或技术集群,每个集群内部高度专业,但集群间的连接相对稀疏,进而构成一个边界清晰、可分解的技术生态系统。例如,Google收购了AlphaGo的创造者DeepMind,让其保持独立运营;Microsoft与ChatGPT的开发组织OpenAI也建立了深度合作关系,成为OpenAI最大股权拥有者之一。

3)整合协同者(聚类3)。这一聚类企业的显著特点表现为最高的平均点度(知识凝聚程度)和最低的模块度(知识分离程度)并存。这一数据表明,这些企业内部的各项专利技术高度交错、紧密耦合,形成了一个有机的整体,深度整合的知识结构为这些企业带来了显著的协同优势,使其能够高效地融合不同领域的技术。以Facebook(META) 为例,该企业将旗下Facebook、Instagram和WhatsApp等社交媒体平台的核心用户数据资源作为基础,深度整合AI技术和VR技术,由此构建技术生态系统,并通过社交数据持续训练并优化AI模型,AI能力反哺提升社交体验和广告精准度,而VR技术则致力于创造下一代沉浸式社交与交互场景,核心技术间形成了深度的互补与协同效应。

4)核心驱动者(聚类4)。这类企业在专利总量上领先,且有着最高的网络中心势,技术创新网络呈现明显的核心-边缘结构。中心势指标取值较高意味着,这类企业的技术体系主要由少数几个居于中心地位的关键技术所主导,结合专利数量的领先可以发现,其创新并非多点分散,而是由这些技术核心向外辐射,为广泛的应用领域提供基础和赋能,通过巩固核心技术的领先地位并逐渐扩大创新规模,进而对整个技术生态的演化路径施加影响。在这类企业中,DeepMind凭借Gemini大模型成为GenAI领域的前沿阵地,Intel则以x86架构驱动计算产业生态的迭代进程。二者通过强化技术轴心的不可替代性与规模化延伸辐射半径参与市场竞争。

总体上,根据聚类结果和以上分析可以发现,美国领先企业展现出一个成熟且结构分明的创新生态系统,而非单一的竞争场域。该生态主要由4类创新原型共存互补,既有在垂直赛道进行快速探索式创新的“新兴探索者(聚类1)”,也存在包括覆盖多模块化技术领域的“生态布局者(聚类2)”、将不同技术深度融合以创造协同效应的“整合协同者(聚类3)”,以及凭借核心技术优势辐射并构建技术生态的“核心驱动者(聚类4)”。这种结构多样性催生了从前沿探索到规模化应用的创新链条,产业发展从单纯的技术竞争,演变为创新模式、生态位与战略定位的多方博弈。

3 结论、讨论与启示

3.1 结论

借助关键词共现网络分析、LDA主题建模及K-means聚类等方法,研究从网络结构、主题分布与内容关注方面,系统分析了美国19家GenAI初期领先企业1059项专利文本的创新特征与内在分析,主要有以下发现。

1)在技术创新方面。美国GenAI初期领先企业的技术创新活动紧密围绕算法、算力和算据方面积极布局,其专利布局并非孤立地追求单一技术点的突破,而是在机器学习、自动化技术这类核心通用技术的基础上,通过深度融合神经网络和自然语言处理等核心算法融合各类技术进行创新,并注重实际业务需求,以满足特定的商业场景和驱动多元化的应用创新。专利分析是衡量技术创新和经济价值的关键指标,本研究中的专利共现网络分析进一步揭示,这些企业的各类技术知识之间连接紧密,创新网络呈现出小世界特征。这种网络结构促进了知识的快速传播和高效整合,迅速地从核心技术扩散到广泛的应用层面,从而加速了整体的技术迭代和商业化进程。

2)在创新主题方面。通过LDA主题建模分析发现,企业创新主题与其核心业务及组织资源高度耦合,如Google、Microsoft等大型成熟企业,倾向于利用其资源和平台优势,积极在GenAI领域布局,其创新主题广泛覆盖了从底层模型开发、多模态融合到跨行业解决方案的多个层面。而如Appen、Persado等规模较小的企业,则采取聚焦战略,创新主题紧密围绕其核心业务展开,垂直深耕技术方法和技术应用,结合核心业务与GenAI技术开展创新活动并参与市场竞争。

3)在战略布局方面。K-means聚类分析的结果揭示,美国GenAI产业初期的创新生态系统结构分明、角色多元。该生态由4类定位清晰的创新原型构成,既包括如Appen、Cogito等聚焦特定赛道的新兴探索者,也涵盖了如Google、Microsoft、IBM等通过各类技术组合形成竞争战略的生态布局者、整合协同者和核心驱动者。各类企业根据自身技术专长占据了独特的生态位,使得GenAI产业避免在单一赛道上的过度同质化竞争,产业创新结构富有韧性和层次感。

3.2 讨论与启示

GenAI产业的快速发展引领了新一轮科技革命,而美国各GenAI爆发初期的领先企业也在后续的市场竞争过程中,表现出显著分化的经营现状。Google、Microsoft和Nvidia等大型企业借助早期的积极布局,在GenAI产品市场占据有利地位,DeepMind在并入谷歌后,凭借在前沿基础研究进一步巩固和加强了创新领先地位,Persado和Yseop则通过深耕营销、金融等垂直行业,将AI技术与具体业务场景深度融合,构筑了坚实的商业护城河。相反,许多初期领先企业如Narrative Science、Automated Insights和Ayasdi则先后被大型企业收购,融入更大的商业体系,加速了其技术的规模化应用。通过对比美国GenAI初期领先企业战略布局及其当前发展状况,能够为中国GenAI的技术布局和发展提供一些启示。

1)在企业层面,企业应避免陷入技术规模的军备竞赛,而应根据自身条件,在产业生态中找到并巩固适合自身的生态位,实现从技术规模竞争向创新模式和战略定位竞争的转变。美国领先的GenAI企业并非单一地追求技术领先和专利数量,而是形成了差异化的创新角色,尽管各类创新角色发展现状有所优劣,但通过层次化的生态布局,能够显著避免单一赛道上的同质化竞争,促进资源利用效率和市场规模扩张。因此,企业应明确自身在资源禀赋、核心业务和技术能力上的独特性,如规模较小、技术相对专一的专精特新“小巨人”企业,可以借鉴“新兴探索者”的模式,在特定的垂直应用领域精耕细作,形成紧凑高效的技术优势。而腾讯、百度和阿里巴巴等大型科技公司则可以应利用其平台与数据优势,采取“生态布局者”“整合协同者”或“核心驱动者”的策略,构建能够赋能多个业务板块的协同技术体系。

2)在产业层面,产业发展的重心应从单纯追求更大参数的模型,系统性地向结构完整且功能互补的创新生态系统演进。中国GenAI产业的成熟度,需要考虑其是否形成了一个结构完整且功能互补的创新生态系统,而非仅仅拥有几家头部企业。在这一方面,可以借鉴美国GenAI产业呈现出的创新生态,将产业发展重心从追求技术突破逐渐系统性地发展、培育一个结构分明、角色多元的成熟生态系统,既要有进行前沿探索的初创企业,也要有进行平台化布局和技术整合的成熟企业,引导资本和人才流向高质量数据服务、中间软件开发和面向商业需求的场景化应用等关键环节,从而打造一条从基础研究到价值实现、富有韧性的完整创新生态链条。

3)在政策层面,施策方向应注重精准化的环境营造,根据企业不同的生态定位实施分类指导。企业的创新活动往往与其核心业务及商业价值导向紧密耦合,政策工具应根据企业不同的生态位角色进行调整,例如,对处于初创期的专精特新“小巨人”企业,可通过设立监管沙盒、优化早期融资渠道等方式,为初创企业在数据使用、算法测试等方面提供一个合法、低风险的创新实验环境,鼓励其在细分领域的创新风险承担;对于腾讯、百度和阿里巴巴等大型科技公司,政策应侧重于支持其进行长周期的基础性、前瞻性研究,并鼓励其构建开源技术社区,以发挥其对整个产业的赋能作用。而美国GenAI初期领先企业的发展现状也表明,随着GenAI产业的快速发展,逐渐会有一部分初期企业如被大型企业收购,合理的收购行为能够加速其技术的规模化应用,但垄断性的收购行为可能会扼杀潜在的竞争,损害创新多样性。因此,应充分发挥市场在资源配置中的决定性作用,更好发挥政府作用,推动有效市场与有为政府的有机结合,引导产业发展由政策驱动向需求驱动平稳过渡,最终形成一个内生动力强劲、结构稳定的成熟且健康的产业生态。

参考文献

[1]

Wang H, Fu T, Du Y, et al. Scientific discovery in the age of artificial intelligence[J]. Nature, 2023, 620(7972): 47-60.

[2]

Kanervisto A, Bignell D, Wen L Y, et al. World and human action models towards gameplay ideation[J]. Nature, 2025, 638(8051): 656-663.

[3]

郑春晓, 赵亚娟, 王春, . 全球人工智能发展态势: 基础技术领域[J]. 科学观察, 2024, 19(4): 26-36.

[4]

(Zheng C X, Zhao Y J, Wang C, et al. The development trend of global artificial intelligence: basic technology field[J]. Science Focus, 2024, 19(4): 26-36.)

[5]

中国互联网络发展状况统计报告:第55次[EB/OL].[2025-08-07]. https://www.cnnic.cn/n4/2025/0117/c88-11229.html.

[6]

国家互联网信息办公室关于发布2024年生成式人工智能服务已备案信息的公告[EB/OL].[2025-01-08]. https://www.cac.gov.cn/2025-01/08/c_1738034725920930.htm.

[7]

戚凯. ChatGPT与数字时代的国际竞争[J]. 国际论坛, 2023, 25(4): 3-23.

[8]

(Qi K. ChatGPT and international competition in the digital age[J]. International Forum, 2023, 25(4): 3-23.)

[9]

王山, 陈昌兵. 中美人工智能技术创新的动态比较: 基于人工智能技术创新大数据的多S曲线模型分析[J]. 北京工业大学学报(社会科学版), 2023, 23(3): 54-67.

[10]

(Wang S, Chen C B. Dynamic comparison of artificial intelligence technology innovation between China and America: analysis of multi-S curve model based on big data of artificial intelligence technology innovation[J]. Journal of Beijing University of Technology (Social Sciences Edition), 2023, 23(3): 54-67.)

[11]

张宝建, 李鹏利, 陈劲, . 国家科技创新政策的主题分析与演化过程: 基于文本挖掘的视角[J]. 科学学与科学技术管理, 2019, 40(11): 15-31.

[12]

(Zhang B J, Li P L, Chen J, et al. Thematic analysis and evolution process of national science and technology innovation policy: based on the perspective of text mining[J]. Science of Science and Management of S & T, 2019, 40(11): 15-31.)

[13]

袁野, 赵玉莹, 尹西明. 科技领军企业牵头创新联合体持续突破关键核心技术的演化博弈研究[J/OL]. 科研管理, 2024: 1-25. (2024-12-16)[2025-08-07]. https://kns.cnki.net/KCMS/detail/detail.aspx?filename=KYGL20241213003&dbname=CJFD&dbcode=CJFQ.

[14]

(Yuan Y, Zhao Y Y, Yin X M. Research on evolutionary game of science and technology leading enterprises leading innovation consortium to continuously break through key core technologies[J/OL]. Science Research Management, 2024: 1-25. (2024-12-16)[2025-08-07]. https://kns.cnki.net/KCMS/detail/detail.aspx?filename=KYGL20241213003&dbname=CJFD&dbcode=CJFQ.)

[15]

吴逸菲, 樊春良. 创新系统视角下美国国家人工智能战略的演化逻辑及趋势分析[J]. 科学学与科学技术管理, 2024, 45(7): 29-48.

[16]

(Wu Y F, Fan C L. Analysis of the evolutionary logic and trends of the U.S. national artificial intelligence strategy from the perspective of innovation systems[J]. Science of Science and Management of S & T, 2024, 45(7): 29-48.)

[17]

杨伟, 李福玲, 张晓泉. 人工智能产业创新网络结构韧性内生因素研究: 以上海为例[J/OL]. 科研管理, 2025: 1-21. (2025-01-06)[2025-08-07]. https://kns.cnki.net/KCMS/detail/detail.aspx?filename=KYGL20250103001&dbname=CJFD&dbcode=CJFQ.

[18]

(Yang W, Li F L, Zhang X Q. Research on the endogenous factors of structural resilience of innovation network in AI industry: taking Shanghai as an example[J/OL]. Science Research Management, 2025: 1-21. (2025-01-06)[2025-08-07]. https://kns.cnki.net/KCMS/detail/detail.aspx?filename=KYGL20250103001&dbname=CJFD&dbcode=CJFQ.)

[19]

陈钰芬, 王科平. 多维邻近性视角下人工智能合作创新网络演化研究[J]. 管理学报, 2023, 20(7): 1045-1055.

[20]

(Chen Y F, Wang K P. Research on the evolution of AI cooperative innovation network from the perspective of multi-dimensional proximities[J]. Chinese Journal of Management, 2023, 20(7): 1045-1055.)

[21]

Zhang C, Zhang C, Zheng S, et al. A complete survey on generative AI (AIGC):is ChatGPT from GPT-4 to GPT-5 all you need[EB/OL].[2025-08-07]. https://doi.org/10.48550/arXiv.2303.11717.

[22]

杨锡怡, 贾佳, 周小宇, . 中美两国人工智能头部企业研发和创新的比较分析与启示[J]. 中国科学院院刊, 2024, 39(6): 1084-1096.

[23]

(Yang X Y, Jia J, Zhou X Y, et al. Comparative analysis and insights into R & D mode of top artificial intelligence companies in China and the US[J]. Bulletin of Chinese Academy of Sciences, 2024, 39(6): 1084-1096.)

[24]

García H A, Krystyanczuk M, Schindowski R. Which companies are ahead in frontier innovation on critical technologies Comparing China, the european union and the united states[R]. Bruegel Working Paper, 2025.

[25]

数字中国发展报告:2024[EB/OL].[2025-04-29]. https://www.nda.gov.cn/sjj/ywpd/sjzg/0429/20250429185719359511883_pc.html.

[26]

杨张博, 韩淑君, 孙笑明, . 中美AIGC领先企业技术创新布局比较研究[J]. 科学学研究, 2025, 43(2): 265-277.

[27]

(Yang Z B, Han S J, Sun X M, et al. A comparative study of patent technological innovation layout of leading AI-generated content firms in China and the U.S[J]. Studies in Science of Science, 2025, 43(2): 265-277.)

[28]

陈婧嫣, 姜李丹, 薛澜. 跨国比较视阈下的人工智能政策: 目标、理念与路径[J]. 科学学与科学技术管理, 2021, 42(3): 87-100.

[29]

(Chen J Y, Jiang L D, Xue L. Artificial intelligence (AI) policy in a cross-national comparative perspective: goals, concepts, and paths[J]. Science of Science and Management of S & T, 2021, 42(3): 87-100.)

[30]

孙笑明, 王晨卉, 李泽贤, . 产品预研研究回顾及展望[J]. 创新科技, 2024, 24(2): 14-30.

[31]

(Sun X M, Wang C H, Li Z X, et al. A review and prospect of product pre-research[J]. Innovation Science and Technology, 2024, 24(2): 14-30.)

[32]

高山行, 王慧, 杨张博. 生成式人工智能领先企业专利布局实证分析: 基于复杂网络分析与K均值聚类算法[J]. 科技进步与对策, 2025, 42(4): 55-66.

[33]

(Gao S X, Wang H, Yang Z B. Empirical analysis of patent layout of leading generative artificial intelligence companies based on complex network analysis and K-means clustering algorithm[J]. Science & Technology Progress and Policy, 2025, 42(4): 55-66.)

[34]

刘艳秋, 韩俊敏, 王建国, . 人工智能专利技术分布、演化及合作创新网络分析[J]. 中国科技论坛, 2021(3): 64-74.

[35]

(Liu Y Q, Han J M, Wang J G, et al. Analysis on the distribution, evolution and cooperative innovation network of artificial intelligence patent technology[J]. Forum on Science and Technology in China, 2021(3): 64-74.)

[36]

冯瑜满, 马丽, 金凤君. 中国人工智能创新合作网络的时空格局及其影响因素分析[J]. 地理科学, 2025, 45(1): 130-140.

[37]

(Feng Y M, Ma L, Jin F J. Spatial-temporal evolution and influencing factors of artificial intelligence innovation collaboration network in China[J]. Geographical Science, 2025, 45(1): 130-140.)

[38]

Kanbach D K, Heiduk L, Blueher G, et al. The GenAI is out of the bottle: generative artificial intelligence from a business model innovation perspective[J]. Review of Managerial Science, 2024, 18(4): 1189-1220.

[39]

陈升, 刘子俊, 张楠. 数字时代生成式人工智能影响及治理政策导向[J]. 科学学研究, 2024, 42(1): 10-20.

[40]

(Chen S, Liu Z J, Zhang N. Generative artificial intelligence impacts and governance policy orientation in the digital age[J]. Studies in Science of Science, 2024, 42(1): 10-20.)

[41]

Singh S, Singh S, Kraus S, et al. Characterizing generative artificial intelligence applications: text-mining-enabled technology roadmapping[J]. Journal of Innovation & Knowledge, 2024, 9(3): 100531.

[42]

Cano-Marin E. Transformative potential of generative artificial intelligence (GenAI) in business: a text mining analysis on innovation data sources[J]. ESIC Market, 2024, 55(2): e333.

[43]

Generative AI market size, share & growth analysis, by model (generative adversarial networks or GANs and transformer-based models), by industry vs application, and regional forecast, 2024-2032[EB/OL].[2025-07-21]. https://www.fortunebusinessinsights.com/generative-ai-market-107837.

[44]

Global AIGC technology market 2025 by company, regions, type and application, forecast to 2031[EB/OL].[2025-01-10]. https://www.globalinforesearch.com/reports/2612915/aigc-technology.

[45]

Wang D D, Zhu S H, Li T, et al. Integrating document clustering and multidocument summarization[J]. ACM Transactions on Knowledge Discovery from Data, 2011, 5(3): 1-26.

[46]

Kaleel S B, Abhari A. Cluster-discovery of Twitter messages for event detection and trending[J]. Journal of Computational Science, 2015, 6: 47-57.

[47]

Sinaga K P, Yang M S. Unsupervised K-means clustering algorithm[J]. IEEE Access, 2020, 8: 80716-80727.

[48]

Tirado R, Hernando Á, Aguaded J I. The effect of centralization and cohesion on the social construction of knowledge in discussion forums[J]. Interactive Learning Environments, 2015, 23(3): 293-316.

[49]

Zhang J J, Guan J C. The impact of competition strength and density on performance: the technological competition networks in the wind energy industry[J]. Industrial Marketing Management, 2019, 82: 213-225.

[50]

Cao J, Xia T, Li J T, et al. A density-based method for adaptive LDA model selection[J]. Neurocomputing, 2009, 72(7/8/9): 1775-1781.

[51]

Arun R, Suresh V, Veni Madhavan C E, et al. On finding the natural number of topics with latent dirichlet allocation: some observations[M]// Advances in knowledge discovery and data mining. Berlin, Heidelberg: Springer, 2010: 391-402.

[52]

Griffiths T L, Steyvers M. Finding scientific topics[J]. Proceedings of the National Academy of Sciences of the United States of America, 2004, 101(suppl 1): 5228-5235.

[53]

Deveaud R, SanJuan E, Bellot P. Accurate and effective latent concept modeling for ad hoc information retrieval[J]. Document Numérique, 2014, 17(1): 61-84.

基金资助

国家社会科学基金重大项目(23&ZD053)

国家自然科学基金面上项目(72372127)

西安交通大学基本科研业务费(SK2025038)

PDF (4587KB)

797

访问

0

被引

详细

导航
相关文章

/