产业链视角下企业专利技术主题识别与技术竞争力分析方法

李贞贞 ,  胡思思 ,  钟永恒 ,  王辉 ,  刘佳

科学观察 ›› 2025, Vol. 20 ›› Issue (6) :76-89

PDF (4023KB)
科学观察 ›› 2025, Vol. 20 ›› Issue (6) :76-89 DOI: 10.15978/j.cnki.1673-5668.20250805
数据观察

产业链视角下企业专利技术主题识别与技术竞争力分析方法

作者信息 +

Identification of Enterprise Patent Technology Themes and Analysis Method of Technology Competitiveness from the Perspective of Industrial Chain

Author information +
文章历史 +

摘要

[目的/意义] 以企业研发为主导的科技创新是产业创新发展的核心动力,探究企业专利技术主题识别与技术竞争力分析方法,有利于掌握企业技术研发动态、把握创新机遇和方向。[方法/过程] 视企业专利数据为研究对象,首先,利用自适应分词扩展、KeyBERT模型提取专利文本关键词;然后,通过PMI词对凝聚度计算来增强词对语义相关性,以改进BTM主题模型识别专利技术主题;最后,构建企业技术竞争力评价指标体系,分析产业链各技术主题的企业技术竞争力差距。[结果/结论] 对激光产业进行实证研究,识别出3个上游技术主题、2个中游技术主题和4个下游技术主题,得到各技术主题企业技术竞争力综合评分,证明分析方法的有效性。

Abstract

[Objective/Significance] Technological innovation led by enterprise research and development is the core driving force for industrial innovation and development. Exploring methods for identifying enterprise patent technology themes and analyzing technological competitiveness is beneficial for grasping the dynamics of enterprise technological research and development, seizing innovation opportunities and directions. [Method/Process] Taking enterprise patent data as the research object, firstly, using adaptive word segmentation extension and KeyBERT model to extract patent text keywords. Then, the PMI word pair cohesion calculation is used to enhance the semantic relevance of word pairs, in order to improve the recognition of patent technology topics in the BTM topic model. Finally, establish an evaluation index system for enterprise technological competitiveness and analyze the gap in enterprise technological competitiveness among various technological themes in the industrial chain. [Results/Conclusions] Empirical research was conducted on the laser industry, identifying 3 upstream technology themes, 2 midstream technology themes, and 4 downstream technology themes. The comprehensive evaluation of enterprise technological competitiveness for each technology theme was obtained, proving the effectiveness of the analysis method.

Graphical abstract

关键词

技术主题识别 / 企业技术竞争力 / BTM主题模型 / KeyBERT / 点互信息

Key words

identification of technical themes / enterprise technological competitiveness / BTM topic model / KeyBERT / point mutual information

引用本文

引用格式 ▾
李贞贞, 胡思思, 钟永恒, 王辉, 刘佳. 产业链视角下企业专利技术主题识别与技术竞争力分析方法[J]. 科学观察, 2025, 20(6): 76-89 DOI:10.15978/j.cnki.1673-5668.20250805
Li Zhenzhen, Hu Sisi, Zhong Yongheng, Wang Hui, Liu Jia. Identification of Enterprise Patent Technology Themes and Analysis Method of Technology Competitiveness from the Perspective of Industrial Chain[J]. Science Focus, 2025, 20(6): 76-89 DOI:10.15978/j.cnki.1673-5668.20250805

登录浏览全文

4963

注册一个新账户 忘记密码

0 引言

深入落实创新驱动发展战略,加快建设现代产业体系,实现科技自立自强,是我国推进科技创新发展的首要任务。随着技术创新进入前所未有的密集活跃期,企业作为我国战略科技的一股重要力量,其知识产权的创造能力对中国经济高质量发展起到关键性作用[1]。迅速、准确地识别企业技术主题,并对企业开展技术竞争力分析,能够揭示企业技术定位与优势、明晰行业技术发展趋势和竞争对手动向,为企业制定科学合理的创新战略与发展规划提供依据。

专利是技术创新成果的载体,蕴涵了丰富的技术知识前沿,能够有效揭示企业技术创新领域和能力[2]。通过文本挖掘方法对企业专利进行挖掘、对比和研究,有助于快速识别关键核心技术主题,掌握企业知识产权布局,探索企业科技创新技术主题内容和热度,揭示企业科技创新主题发展方向[3]。因此,本研究基于企业专利数据,从产业链视角深入挖掘企业技术主题内涵,并对各技术领域下我国企业的技术竞争力展开分析对比研究,为企业识别技术领域竞争态势、探寻技术创新机会提供借鉴。

1 文献综述

1.1 专利技术主题识别研究

专利技术主题识别旨在通过定性或定量的方式从专利文献中识别隐藏技术主题信息,主要包含传统定性分析方法、文献计量方法以及文本挖掘方法等。

传统定性分析方法主要依靠专家知识和经验甄别技术主题,具有较强的主观性,且时间周期长[4]。文献计量法是从科技文献中获取表征技术的关键信息来识别技术主题,如使用专利分类号体系、构建专利引文网络、专利异构信息网络等揭示技术领域[5]

随着大数据时代下专利数据的飞速增长,为探索更全面、更深层次的主题信息,利用计算机技术进行文本挖掘方法被广泛应用在专利技术主题识别中,主要包括文本聚类法[6]、SAO结构语义分析法[7]以及主题模型识别法[8]。主题模型是一种无监督的学习方法,可以利用算法自动挖掘文本特征,再进行筛选,无需人工标注语料,省时省力且效率较高,受到研究学者的青睐[9]。LDA主题模型和BTM主题模型常被用于解决海量文本数据的聚类和主题挖掘问题[10]。LDA模型作为经典的主题模型之一,因能够自动从海量文本中提取结构化主题,在专利技术主题识别任务中应用最为广泛[11]。但LDA模型采用词袋法表示文本主题信息,模型中单个词语缺乏对主题描述精确的语义表达,易造成主题识别效果不佳、难以解释等问题。Biterm主题模型(biterm topic model, BTM)是为了解决短文本稀疏的问题而被提出,该模型通过提取文档中词共现的方式,来提高主题模型对文本的分类效果[12]。后来被研究学者应用于任意长文本的主题建模,依然呈现出较好的效果[13]。相较于LDA模型,BTM最大的改进在于采用词对(biterm)作为主题建模的单元,即对语料中出现的任意2个词语组成的共现词对进行建模,这种方式能够更深层次地挖掘文本潜在语义信息,在主题挖掘中展现出较好的效果[14]。但BTM模型中的词对为文本中任意2个不同词项构成的无序对,这种无序性,并未考虑词语之间的相关性。因此,国内外学者通过提升词对之间相关性的方式来改进BTM主题模型。如高慧颖等[15]利用PMI算法计算词对中2个词语的语义相关性来改进BTM模型,吴迪等[16]采用词频特征加权改进BTM模型提取主题词,Huang等[17]通过引入具有词对频率和语义相似性先验知识的噪声主题来扩展BTM主题模型,Niu等[18]结合BERT模型和词对频率有效改进BTM主题模型。

主题模型建模的基本单位是词,专利文献与通用语料相比,包含了大量领域专业术语,这些术语通常是由多个词组型词汇组成的复合结构,常用的分词方法会将专利文献中的专业术语切分成多个单独的词汇,产生大量的知识碎片,导致主题识别结果不佳,而现在对于BTM主题模型的改进中鲜有对于复合词汇的研究。基于此,本研究基于专利文献的特征,在专利技术主题识别模块中,采用自适应的方法进行分词扩展,将专业术语作为主题建模的基本单位,保留专利文献中的核心知识,并通过PMI词对凝聚度计算来改进BTM模型,以丰富主题语义信息、改善主题判别准确性。

1.2 企业技术竞争力研究

技术是一家企业的核心竞争力,企业的自主研发能力越强,其在技术竞争中取得优势的能力越强[19]。技术竞争力是衡量企业技术创新能力的重要标尺,能够体现企业在技术层面的竞争优势。

根据研究视角不同,企业技术竞争力研究归纳为3类:投入产出视角、专利视角和其他视角。基于投入产出的视角主要根据企业技术研发活动的投入产出,研究企业研发资源对企业技术竞争力的影响,如从R&D经费、R&D人员、技术人员等投入维度和专利、新产品等产出维度来建立评价体系[20]。基于专利视角开展企业技术竞争力评价研究是使用专利信息刻画企业在技术领域的竞争地位。专利作为技术创新最重要的载体,能较为准确地反映知识和技术生产主体的创新能力和水平,常被研究学者用来作为评价企业技术竞争力的主要指标[21]。基于专利的企业技术竞争力评价研究主要分为单指标评价法、多指标评价法和专利组合分析法[22]。目前,基于专利视角对企业技术竞争力进行评价的研究多采用专利组合分析法。如宋扬等[23]基于技术研发投入、技术研发规模、技术研发质量3个维度,把握通信制造业上市公司竞争力现状。武兰芬等[24]构建技术规模、技术质量和技术价值的评价指标体系,深度分析新能源汽车动力电池机构的技术竞争力。蒲芳等[25]通过技术积累水平、持续研发能力和攻关突破能力,评估我国新能源汽车主要生产企业的技术竞争力。林静静等[26]从技术活跃度、技术价值度、技术集中度、技术潜力度、技术合作度、技术优势等6个维度测度企业技术竞争力。此外,部分学者还探索了推拉模型及人类技术共生模型等其他视角的企业技术竞争力评价方法[27]

通过文献调研发现,基于专利视角的企业技术竞争力研究最为广泛和成熟。专利是反映企业技术创新能力最直观的数据,因此本研究参考现有方法,从专利视角出发,采用企业的专利组合分析方法,构建基于技术生产力、技术规模、技术质量、技术宽度、技术活跃度等5个维度的评价指标体系,多方位衡量企业的技术竞争力,研判产业链视角下各企业的技术竞争力位势、技术创新能力及研发优势领域。

综上所述,现有研究对企业技术竞争力的分析主要针对某一产业或技术领域,从产业链视角分类判断企业技术竞争力的研究较少;且在基于专利文本识别技术主题模块,采用LDA、BTM等主题模型进行建模时,忽视了分词过程中专利文本的知识碎片化。鉴于此,本研究从产业链视角出发,以企业专利数据为研究对象,提出了一种基于自适应分词扩展与语义增强BTM模型的企业专利技术主题识别与技术竞争力分析框架,利用统计学方法扩展原有分词结果识别专利文本复合语词,并通过增强词对的语义相关性来改进BTM模型,识别出各产业链环节专利技术主题;构建了5个维度的企业技术竞争力评价指标体系,从微观层面对产业链各环节技术主题的企业技术竞争力进行深入探讨,为企业明晰核心技术地位、制定技术创新研究战略提供新思路。

2 研究方法

2.1 研究框架

本研究构建的企业专利技术主题识别与技术竞争力分析框架主要包括4个环节。①企业专利数据集构建。划分产业链,收集产业链各环节重点企业,根据企业名称制定检索式获取专利文本集。②专利文本数据预处理。收集领域术语词集形成领域词典,采用统计学方法对专利数据集进行分词扩展,识别出复合词汇,并提取关键词代表专利文档核心知识和主旨信息。③专利技术主题识别。构建BTM主题模型,通过增强词对中双词的语义相关性来改进双词采样方式,提取各技术主题特征词,结合专家解读识别各主题语义信息,并得到“企业-技术主题”关联关系。④企业技术竞争力分析。构建基于专利的企业技术竞争力评价指标体系,对产业链各环节技术主题内企业技术竞争力展开分析评价,掌握产业链各环节重点企业专利技术主题分布。具体研究框架见图1

2.2 数据集构建

本研究利用企业专利数据开展研究,以特定领域企业专利文献作为数据源。首先,收集领域重点企业,根据企业主营业务对应到产业链上、中、下游各环节中;然后,根据企业名称,并考虑企业曾用名,在目标数据库中以专利“所有权人”字段进行检索,获取企业所拥有的全部专利,构建企业专利数据集;最后,关联企业所属产业链环节信息,得到特定领域“产业链环节-企业-专利”三维关系数据集。

2.3 文本数据预处理

分词是文本数据预处理的一项重要工作,为后续建模任务提供结构化的数据支撑。针对分词无法有效识别复合结构术语词汇的问题,本研究运用自适应的方法进行分词扩展。首先,基于领域科技论文关键词和标准文献中术语集合汇聚形成领域专业词典,利用jieba分词工具对专利文本进行分词;然后,采用左右信息熵依次计算相邻词语组合而成候选复合词的自由度,设定阈值,将超过阈值的多个词汇拼接成为复合词视为一个完整词语,从而得到最终分词结果;最后,使用KeyBERT算法计算每个词语的权重值,筛选符合阈值的词语作为文本的关键词,以提高后续主题挖掘的辨识度。

2.3.1 复合词识别

熵是一种表示信息量的指标,左右熵能够用来衡量一个字符串的自由度[28]。通过一个候选复合词左边和右边的信息熵可以反映这个词语是否有丰富的左右搭配,计算方法见式(1)~式(3)。

$E_{w}(w)=-\sum_{l \in L} P(l w \mid w) \times \log _{2} P(l w \mid w)$
$E_{R}(w)=-\sum_{r \in R} P(w r \mid w) \times \log _{2} P(w r \mid w)$
$E_{\min }(w)=\min \left(E_{L}(w), E_{R}(w)\right)$

式中:候选复合词w的左、右相邻词语分别是lrEL(w)、ER(w)分别为词语w的左、右信息熵;Emin(w)为左右熵的最小值;EL(w)、ER(w)越大,表明信息含量越大,可以搭配的词语越丰富,词语w是独立词汇的可能性就越大;Emin(w)越大,表示2个词语一起出现的语境越多,是组合词的可能性越大。

2.3.2 关键词提取

关键词能更加精确、有效地体现文本信息,在主题挖掘中具有较高的分析价值。而采用BTM模型得到的主题会向高频特征词倾斜,导致能够代表专利文本核心信息的低频特征词被淹没。为提高专利文本词语的主题代表性,本研究使用keyBERT算法对分词扩展结果进行关键词提取,保留具有主题代表性的特征词汇,从而提高主题特征词抽取的准确度。

keyBERT是一种无监督的关键词提取算法,通过端到端(end-to-end)的深度学习方法来检索和提取关键词或关键短语[29]。该模型使用双向变换器编码器从文本中提取上下文特征,自动对未标注的数据进行标注,无需任何先验知识。首先,使用BERT算法获取文档和词语的向量表示;然后,使用词嵌入模型提取n-gram词作为候选特征词;最后,计算文档向量和特征词向量的余弦相似度,获取与文档最相似的词语,作为文档关键词。keyBERT算法使用上下文和语义特征来提取文档关键词,在语义和质量上均优于Rake、YAKE、TF-IDF等常用的关键词提取算法[30]

2.4 专利技术主题识别

对产业链环节内专利文本进行技术主题识别,有助于快速把握企业技术方向。BTM主题模型将文档中词语两两组合生成词对集合来进行模型训练,有效扩展了传统主题建模的词语数量,并且这种显示的词语共现模式增强了主题模型学习能效。词对是在上下文中出现的无序二元组,即将每个文档作为一个独立的上下文单元,从中抽取任意两个词语作为词对。如文本“基于本发明提供的光学器件及应用模块,能够实现光束的多样化整形”经过数据预处理后包含光学器件、应用模块、光束、多样化、整形5个词语,BTM构造的Biterm词对为(光学器件,应用模块)、(光学器件,光束)、(光学器件,多样化)、(光学器件,整形)、(应用模块,光束)、(应用模块,多样化)、(应用模块,整形)、(光束,多样化)、(光束,整形)、(多样化,整形)。然而词对的无序性导致BTM模型忽略了词对中2个词语的语义相关性,如词对(应用模块,整形),虽然在同一文本中出现,但在整个文档集中共现频次小、语义相关性弱、主旨意思体现不强,若这些词对参与模型训练,可能会导致挖掘的主题质量不高。本研究针对BTM双词抽取过程中缺少双词间顺序及语义关系的问题,利用PMI从统计的角度发现词语共现情况来分析词语间语义相关性,增强词对中双词的语义信息,筛选满足设定阈值的词对参与模型训练,使BTM主题模型中双词的特征具有语义以及上下文关联,以提高生成的主题质量。

点互信息(pointwise-mutual information,PMI)常用于衡量2个事物之间的相关性,可以较好地反映2个词语的凝聚程度[31]。给定词对(a,b)的点互信息计算方法见式(4)。

$Q_{\mathrm{PMI}}(a, b)=\log _{2} \frac{P(a, b)}{P(a) \times P(b)}$

式中:QPMI (a,b)为给定词对(a,b)的点互信息的PMI值;P(a)、P(b)分别为词语a,b在文档集中出现的概率;P(a,b)为词语ab同时出现在文档集中出现的概率;PMI值越大,表明词语ab的相关度越高。

本研究采用融入词对语义增强的BTM主题模型进行专利技术主题识别,建模过程包含4个步骤:①对预处理完成后的专利文本词语进行两两组合,形成词对集合;②依次计算词对中2个词语的PMI值,设置阈值筛选出语义相关性较大的词对,构建语料库;③使用构建好的语料库对BTM进行模型训练,为模型计算合适的参数;④依据参数进行吉布斯采样直至收敛,完成模型构建,获得专利文本的主题分布和各主题下的特征词分布。模型见图2

经过上述流程,可得到各产业链环节专利技术主题,依据“技术主题-专利-企业”关联关系可将各企业匹配上多个技术主题,选取企业在主题中专利数量占该主题全部专利数量比重累计到达50%以上的主题作为企业的最终主题,即1个企业可对应多个技术主题。

2.5 企业技术竞争力分析

企业技术竞争力表示某一行业中各企业之间的技术发展水平,挖掘企业技术竞争力能够掌握我国企业相关技术的发展态势,进一步推动我国企业提升技术创新能力。本研究基于专利数据,采用技术生产力、技术规模、技术质量、技术宽度、技术活跃度5项指标来衡量企业的技术竞争力。各指标及描述见表1

熵权法常用于指标的客观赋权,为消除指标数值之间单位和量纲各不相同的问题,首先采用极差法对各指标数据进行无量纲化处理,然后通过熵权法得到各指标权重,经过赋权计算得到企业技术竞争力综合评分。本研究基于产业链各环节筛选出的技术主题,计算各主题下的企业技术竞争力,企业技术竞争力综合评分TCI越大,表明企业在该技术领域的优势程度越明显。

3 实证分析

3.1 实验数据收集

实验选取激光领域为研究对象,采用先验知识构建激光产业链。使用企查查数据库检索激光领域企业,结合专家判定,筛选得到规模以上企业212家,并对应至激光产业链上、中、下游。选用IncoPat专利数据库,以企业名称包括企业曾用名为限定制定检索式,检索时间为2025年3月24日,合并申请号并选取有效专利后共获得专利数据35618条。

3.2 实验数据预处理

3.2.1 复合词识别结果

对国家标准《激光术语》(GB/T 15313—2008)进行汇总,得到286个技术术语,收集激光领域科技论文5000篇得到关键词11669个,并结合领域专家经验,最终收集激光领域专业词汇12482个,形成激光领域词典。将领域词典加载到jieba自定义词典中,组合专利标题和摘要字段作为实验文本进行分词,并借助哈工大中文停用词表去除对研究无意义的停用词。研究采用词语左右信息熵来判别边界,得到词语间紧密度进行复合词语的判定,根据式(1)~式(3)编写Python程序,计算各相邻词语的左右熵,观察结果认为当最小熵值≥0.5时组合词具有较高的紧密度,为一个完整词语。实验数据中左右熵最小值排名前20的复合词见表2

3.2.2 关键词提取结果

复合词汇识别完成后,利用keybert工具包得到每个候选词语的权重,权重值越高表明与当前文本主题内容越相近,越能代表当前专利的关键词。为提高主题识别的准确度,依据结果选取候选词语中权重大于0.3的词语为专利文本关键词。以专利CN109967877B为例,预处理步骤为:①使用句号拼接标题字符串和摘要字符串;②jieba加载领域词典后进行分词并去除停用词;③计算词语左右熵识别复合词语;④使用keyBERT计算词语权重,抽取关键词语。专利文本预处理步骤及关键词抽取结果示例见图3

3.3 专利技术主题识别实验

3.3.1 词对语义增强

本研究采用PMI算法增强BTM主题模型中词对的语义相关性,从数据预处理后的专利文本中,提取出共现次数>10并且PMI>2的词对作为模型的输入,产业链上游专利文本共现词结果示例见表3

3.3.2 主题识别模型对比

为验证本研究技术主题识别模型的有效性,将本研究方法与BTM和LDA主题模型进行对比,利用主题一致性(topic coherence,TC)和JS散度(jensen-shannon divergence, JSD)来验证主题挖掘效果,分别体现主题的内聚程度与差异性。BTM模型使用python中的bitermplus包来构建,模型参数统一设定为α=0.5, β=0.01,迭代次数为1000次,主题数分别设置为5、10、15、20、25、30个。将仅进行数据预处理的BTM模型简写为BTM-R1,本研究模型简写为BTM-R2,各模型对比实验结果见图4

图4可以看出,BTM及其改进模型均优于LDA主题模型,但随着主题数量的增加,改进的BTM模型TC值存在下降趋势,JS散度提升不明显,说明主题数量的增加导致主题内相关词语变多,每个主题内聚度增强但主题间差异变小。BTM-R1模型在主题一致性和JS散度上略高于BTM模型,表明采用复合词识别和关键词提取的方法对专利文本进行预处理,有助于提升BTM模型特征词的提取效果。本研究提出的模型在主题一致性和JS散度上均表现出了较好的结果,优于其他模型,表明通过增强BTM模型词对中词语的相关性,进一步提高了词语的主题语义表达能力,表现出较好的主题识别效果。

3.3.3 最佳主题数选择

在构建BTM主题模型时,需要自定义主题数量K。实验利用Renyi 熵计算最佳主题数,Renyi 熵越小,表明主题模型的预测效果越好。设定主题数量的变化范围为[2,30],主题数变化步长为1,采用本研究构建主题模型计算每次生成的Renyi 熵,不同产业链环节Renyi 熵随主题数量的变化情况见图5。由图5可知,对激光产业链上、中、下游专利文本进行主题建模时的最佳主题数量分别为5、6和8个。

3.4 技术主题识别结果

根据以上分析,本研究综合考虑自适应分词扩展和词对语义增强改进BTM主题模型,设置最佳主题数分别对激光产业链各环节专利文本进行主题建模,得到技术主题识别结果。通过充分了解激光领域知识,从产业链视角下对激光领域专利技术主题识别结果进行分析和标注,将判定的相同主题方向进行合并,确定主题名称。使用本研究主题模型挖掘得到的主题可视为从应用角度对激光技术进行细分,识别出的产业链各环节技术主题内容见表4

表4可以看出,各主题方向的内容区分较为明显。激光产业链上游企业的技术领域主要集中在激光元器件、激光材料和激光配件3个方面。主题U1的特征词包含透镜、镜头、光学系统、镜片等,主题U2的特征词包含镀膜、基板、玻璃基板、镜片、棱镜等,该两类主题聚焦于光学镜头及模组,判定主题内容为“激光元器件”;主题U3、U5的特征词为半导体激光器、玻璃、材料、晶体等,强调光源材料,判定技术主题为“激光材料”;主题U4的特征词为电路、控制、驱动、电源等,判定技术主题为“激光配件”。激光产业链中游企业专利识别出的核心技术主题为2个,分别是光纤激光器和半导体激光器。主题M1、M2、M3、M6均包含光纤激光器、芯片、激光器等特征词,可判定技术主题为“光纤激光器”;主题M4、M5均出现半导体激光器,判定技术主题为“半导体激光器”。激光产业链下游企业的4个主题分别为增材制造、激光显示、激光加工、激光测量。结合激光产业链下游分类以及各主题的特征词,判定主题D1为“增材制造”,主题D2、D5为“激光显示”,主题D3、D4、D6、D7的技术主题为“激光加工”,主题D8为“激光测量”。为进一步验证主题名称的准确性,分别选取每个主题下文档主题概率值最高的5篇专利进行分析对比,结果表明主题标注较为准确。

3.5 企业技术竞争力分析结果

根据表1中指标,计算各主题内各企业的技术竞争力,并对比企业之间的差距,识别我国激光产业链各环节中企业在技术领域的技术地位。利用式(5)得到激光产业各环节技术主题中企业的技术竞争力综合得分与排名,部分结果见表5图6

根据表5得到的激光产业链上游企业技术竞争力综合评分结果,发现浙江水晶光电科技股份有限公司、山东华光光电子股份有限公司和江西沃格光电股份有限公司在激光元器件和激光材料领域综合实力表现突出,表明专利数量占优势的企业技术研发水平通常较高。激光配件领域中东文高压电源(天津)股份有限公司综合得分相对领先,其专利数量低于苏州瑞可达连接系统股份有限公司,表明企业所拥有的专利质量高于该技术领域平均水平,技术研发水平较高。由图6可知,在激光产业链中游,武汉锐科光纤激光技术股份有限公司技术研发水平较高,其综合评分远高于其他企业;激光产业链下游中,增材制造、激光显示、激光加工、激光测量技术领域技术研发能力最优的企业分别是湖南华曙高科技股份有限公司、深圳光峰科技股份有限公司、大族激光科技产业集团股份有限公司和北京万集科技股份有限公司,且在各技术领域占据了绝对优势。

为验证研究结果的有效性,邀请激光领域情报专家对激光产业链各环节技术主题识别结果进行解读,并分析各技术主题企业技术竞争力排名结果。此外,根据中商产业研究院发布的《2025—2030年中国激光器市场前景及投资机会研究报告》显示,大族激光是亚洲最大的激光加工设备生产商、锐科激光是国产光纤激光器龙头企业、杰普特超快激光器技术领先、炬光科技半导体激光器上游核心器件供应商,这些企业都是中国激光器行业重点企业。结合专家意见以及已公开的资料,显示本研究结果较为合理。

通过以上分析可以看到,利用主题模型对专利技术文本进行技术主题识别,再基于各主题专利数据计算企业技术竞争力评价指标,能够客观评价相同细分技术领域下企业的技术研发水平,反映企业技术差距,有助于企业根据自身排名调整研发策略、确定研发方向。

4 结束语

以企业研发为主导的科技创新,是加速提升我国产业高质量发展的重要保障。本研究从产业链视角出发,基于重点企业专利数据,构建了针对产业链各环节的专利技术主题识别模型以及企业技术竞争力评价指标体系。创新之处体现如下:首先,在专利文本预处理阶段,采用左右熵改进文本分词结果,并利用KeyBERT模型提取文本关键词以表征专利文本主题信息;其次,在技术主题识别阶段,运用PMI计算BTM主题模型词对中两个词语的凝聚度,筛选出具有语义相关性的词对,使BTM主题模型中双词的特征具有语义以及上下文关联,从而识别出激光产业链各环节的技术主题特征词,判别技术主题内容;最后,在企业技术竞争力分析阶段,构建基于技术生产力、技术规模、技术质量、技术宽度和技术活跃度的企业技术竞争力评价指标体系,对产业链各环节技术主题的企业技术竞争力进行深入探讨。

对激光产业链进行实证研究,该方法有效划分了产业链各环节细分技术主题,其中,上游环节主要包括激光元器件、激光材料及激光配件3个技术主题,中游环节主要为光纤激光器和半导体激光器,下游环节则以增材制造、激光显示、激光加工及激光测量技术为主,并通过计算企业技术竞争力评价指标得到产业链各技术领域企业技术竞争力排名。结合激光领域专家知识验证所识别的技术主题与企业排名较为准确,从而验证了本研究方法的有效性。该研究成果不仅丰富了专利技术主题识别与企业技术竞争力评价的理论框架,同时为科学合理地衡量企业技术竞争力提供实践路径,分析结果以期为促进企业技术创新发展提供一定的决策支持。

本研究仍存在一些局限:(1)数据源具有局限性,仅选用了国内企业专利作为分析数据,未纳入国外企业,缺乏英文专利数据;(2)产业链关键技术主题识别结果不够细致,淹没了专利数量较少的技术主题;(3)企业技术竞争力评价指标体系设计缺乏完备性,还需更深入研究。未来将考虑面向特定领域的全球企业进行分析,扩展数据类型,尝试结合大语言模型,进一步提升产业链技术主题识别准确性。

参考文献

[1]

陈凤, 戴博研, 余江. 从追赶到后追赶: 中国领军企业关键核心技术突破的目标迁移与组织惯性应对研究[J]. 科学学与科学技术管理, 2023, 44(1): 163-182.

[2]

(Chen F, Dai B Y, Yu J. From catch-up to post catch-up: research on target transition and organizational inertia response of China’s leading enterprises undertaking breakthroughs of key parts of core technology[J]. Science of Science and Management of S & T, 2023, 44(1): 163-182.)

[3]

Zhang R Z, Yu X, Zhang B, et al. Discovering technology opportunities of latecomers based on RGNN and patent data: the example of Huawei in self-driving vehicle industry[J]. Information Processing & Management, 2025, 62(1): 103908.

[4]

余辉, 周晶, 夏文蕾, . 基于“标杆—个性” 的企业技术专利研发方向识别:以新能源汽车企业为例[J]. 情报理论与实践, 2024, 47(11): 130-138.

[5]

(Yu H, Zhou J, Xia W L, et al. Research on enterprise technological patent R & D direction identification based on “benchmark-personalization”: an example of the new energy vehicle enterprises[J]. Information Studies (Theory & Application), 2024, 47(11): 130-138.)

[6]

黄怡, 隗玲, 张凯. 基于PaECTER-BERTopic与大模型的专利技术主题识别及演化分析:以生成式人工智能领域为例[J]. 数字图书馆论坛, 2025(2): 1-11.

[7]

(Huang Y, Kui L, Zhang K. Patent technology topic identification and evolution analysis based on PaECTER-BERTopic and large model: a case study of generative artificial intelligence[J]. Digital Library Forum, 2025(2): 1-11.)

[8]

田鹏伟, 张娴. 基于异构信息网络融合的专利技术主题识别研究[J]. 情报杂志, 2021, 40(8): 45-52.

[9]

(Tian P W, Zhang X. Research on the patented technology topics identification based on heterogeneous information network[J]. Journal of Intelligence, 2021, 40(8): 45-52.)

[10]

宋凯, 朱彦君. 专利前沿技术主题识别及趋势预测方法:以人工智能领域为例[J]. 情报杂志, 2021, 40(1): 33-38.

[11]

(Song K, Zhu Y J. Patent frontier technology topic identification and trend prediction: a case analysis of artificial intelligence[J]. Journal of Intelligence, 2021, 40(1): 33-38.)

[12]

李欣, 王静静, 杨梓, . 基于SAO结构语义分析的新兴技术识别研究[J]. 情报杂志, 2016, 35(3): 80-84.

[13]

(Li X, Wang J J, Yang Z, et al. Identifying emerging technologies based on subject-action-object[J]. Journal of Intelligence, 2016, 35(3): 80-84.)

[14]

Gou Y R, Chen Q M. Discovery and analysis of key core technology topics in proton exchange membrane fuel cells through the BERTopic model[J]. Energies, 2024, 17(21): 5418.

[15]

胡泽文, 王梦雅, 韩雅蓉. 基于LDA2Vec-BERT的新兴技术主题多维指标识别与演化分析研究:以颠覆性技术领域: 区块链为例[J]. 现代情报, 2024, 44(9): 42-58.

[16]

(Hu Z W, Wang M Y, Han Y R. Multidimensional indicator identification and evolution analysis of emerging technology topics based on LDA2Vec-BERT: a case study of blockchain technology in the field of disruptive technology[J]. Journal of Modern Information, 2024, 44(9): 42-58.)

[17]

王治莹, 陈笑, 刘翰界. 基于文本数据的灾害信息风险监测与预警集成方法研究[J]. 灾害学, 2024, 39(4):81-87.

[18]

(Wang Z Y, Chen X, Liu H J. An integrated method for risk monitoring and early warning of disaster information based on text data[J]. Journal of Catastrophology, 2024, 39(4): 81-87.)

[19]

Lin Y, Wang X L, Yang J, et al. Core technology topic identification and evolution analysis based on patent text mining: a case study of unmanned ship[J]. Applied Sciences, 2024, 14(11): 4661.

[20]

Pan Y, Hashim N H, Goh H C. Public perception of cultural ecosystem services in historic districts based on biterm topic model[J]. Scientific Reports, 2024, 14: 11717.

[21]

Zhou W, Wang Y, Gao C Y, et al. Emerging topic identification from app reviews via adaptive online biterm topic modeling[J]. Frontiers of Information Technology & Electronic Engineering, 2022, 23(5): 678-691.

[22]

徐菲菲, 陈赛红, 田宇. 基于BTM模型和改进聚类算法的热点话题检测[J]. 计算机应用与软件, 2022, 39(5): 283-290.

[23]

(Xu F F, Chen S H, Tian Y. Hot topic detection based on btm model and improved clustering algorithm[J]. Computer Applications and Software, 2022, 39(5): 283-290.)

[24]

高慧颖, 公孟秋, 于思佳. 基于改进BTM模型的医疗服务质量因素识别[J]. 北京理工大学学报, 2022, 42(11): 1167-1174.

[25]

(Gao H Y, Gongmeng Q, Yu S J. Identification of medical service quality factors based on COA-BTM model[J]. Transactions of Beijing Institute of Technology, 2022, 42(11): 1167-1174.)

[26]

吴迪, 马文莉, 杨利君. 遗忘曲线和BTM词频双层加权微博用户画像[J]. 计算机工程与设计, 2023, 44(12): 3800-3808.

[27]

(Wu D, Ma W L, Yang L J. Forgetting curve and BTM word frequency double weighted microblog user portrait[J]. Computer Engineering and Design, 2023, 44(12): 3800-3808.)

[28]

Huang J J, Peng M, Li P W, et al. Improving biterm topic model with word embeddings[J]. World Wide Web, 2020, 23(6): 3099-3124.

[29]

Niu W N, Tan W A, Jia W. CS-BTM: a semantics-based hot topic detection method for social network[J]. Applied Intelligence, 2022, 52(15): 18187-18200.

[30]

胡旭博, 原长弘. 关键核心技术: 概念、特征与突破因素[J]. 科学学研究, 2022, 40(1): 4-11.

[31]

(Hu X B, Yuan C H. Key part of core technology: concept, characters and breakthrough factors[J]. Studies in Science of Science, 2022, 40(1): 4-11.)

[32]

李显君, 谢南香, 徐可. 我国自主品牌汽车企业技术竞争力实证分析[J]. 中国软科学, 2009(5): 125-134.

[33]

(Li X J, Xie N X, Xu K. Study on technological competitiveness of China-owned brand automotive enterprises[J]. China Soft Science, 2009(5): 125-134.)

[34]

赵蓉英, 李新来, 李丹阳. 基于专利计量的企业技术竞争力研究:以国外船舶柴油机领域为例[J]. 数字图书馆论坛, 2020(2): 52-58.

[35]

(Zhao R Y, Li X L, Li D Y. Technological competitiveness research of enterprises based on patent analysis: taking foreign marine diesel engine as an example[J]. Digital Library Forum, 2020(2): 52-58.)

[36]

聂洪光, 韩竺蔓, 张庆. 基于专利计量的我国人工智能A股上市企业技术竞争力研究[J]. 辽宁大学学报(哲学社会科学版), 2021, 49(1): 75-80.

[37]

(Nie H G, Han Z M, Zhang Q. Research on the technical competitiveness of Chinese artificial intelligence companies based on patent measurement[J]. Journal of Liaoning University (Philosophy and Social Sciences Edition), 2021, 49(1): 75-80.)

[38]

宋扬, 潘云涛, 赵筱媛. 基于专利分析的通信制造业上市公司技术竞争力评价研究[J]. 科技管理研究, 2019, 39(11): 85-92.

[39]

(Song Y, Pan Y T, Zhao X Y. Research on technology competitiveness evaluation of communications manufacturing listed corporation in China based on patent analysis[J]. Science and Technology Management Research, 2019, 39(11): 85-92.)

[40]

武兰芬, 吴登晓. 专利视角下中国新能源汽车动力电池机构技术竞争力研究[J]. 情报探索, 2023(5): 61-69.

[41]

(Wu L F, Wu D X. Research on technological competitiveness of the institutions of China’s new energy vehicle power battery from the perspective of patent[J]. Information Research, 2023(5): 61-69.)

[42]

蒲芳, 王. 基于专利分析的我国新能源汽车生产企业技术竞争力研究[J]. 科技管理研究, 2019, 39(6): 163-170.

[43]

(Pu F, Wang J. Research on technological competitiveness of new energy automobile production enterprises on the basis of patent analysis in China[J]. Science and Technology Management Research, 2019, 39(6): 163-170.)

[44]

林静静, 林甫. 基于专利指标的企业技术竞争力评价框架研究[J]. 现代情报, 2016, 36(10): 22-27.

[45]

(Lin J J, Lin F. Study on patent index-based evaluation framework for enterprise technology competitiveness[J]. Journal of Modern Information, 2016, 36(10): 22-27.)

[46]

钟祥喜, 肖美华, 刘金香. 东、中西部物联网企业技术竞争力比较分析:基于推拉模型及人类技术共生模型[J]. 科学管理研究, 2013, 31(4): 80-84.

[47]

(Zhong X X, Xiao M H, Liu J X. Comparative analysis of company’s technological competitiveness of East and Midwest Internet of Things: based on “push pull model” and “human technology symbiotic model”[J]. Scientific Management Research, 2013, 31(4): 80-84.)

[48]

Liang J Y, Shi Z Z. The information entropy, rough entropy and knowledge granulation in rough set theory[J]. International Journal of Uncertainty, Fuzziness and Knowledge-Based Systems, 2004, 12(1): 37-46.

[49]

Ouyang Z H, Xu Q H, Zhang T Z, et al. Coupling analysis of disaster-causing factors in coal mines and dual prevention mechanism based on the KeyBERT model and accident-causation theory model[J]. Frontiers in Earth Science, 2025, 13: 1586785.

[50]

赵玉桐, 杨建林. 基于跨领域专利的颠覆性技术识别研究:以人工智能领域为例[J]. 情报理论与实践, 2023, 46(3): 174-182.

[51]

(Zhao Y T, Yang J L. Research on disruptive technology identification based on cross-domain patents: taking the field of artificial intelligence as an example[J]. Information Studies (Theory & Application), 2023, 46(3): 174-182.)

[52]

邓云峰, 冯永康, 王双燕. 应急决策文本的多维语义挖掘方法:基于TF-IDF和PMI的技术框架[J]. 中国安全生产科学技术, 2025, 21(5): 36-45.

[53]

(Deng Y F, Feng Y K, Wang S Y. Multidimensional semantic extract method for emergency decision-making texts: a technical framework based on TF-IDF and PMI[J]. Journal of Safety Science and Technology, 2025, 21(5): 36-45.

[54]

Koltcov S, Surkov A, Filippov V, et al. Topic models with elements of neural networks: investigation of stability, coherence, and determining the optimal number of topics[J]. PeerJ Computer Science, 2024, 10: e1758.

基金资助

2024湖北省技术创新专项软科学研究类面上项目(2024EDA073)

2025湖北省技术创新专项软科学研究类重点项目(2025EDA011)

青海省重点研发与转化计划“盐湖资源绿色高值利用科技成果数字化服务系统”(2023-QY-213)

PDF (4023KB)

521

访问

0

被引

详细

导航
相关文章

/