基于BERTopic的计算机视觉领域热点技术主题及演化分析

王蓝蓝 ,  刘艳丽

科学观察 ›› 2024, Vol. 19 ›› Issue (2) :46-60

PDF (4269KB)
科学观察 ›› 2024, Vol. 19 ›› Issue (2) :46-60 DOI: 10.15978/j.cnki.1673-5668.202402005
数据观察

基于BERTopic的计算机视觉领域热点技术主题及演化分析

作者信息 +

Hot Technology Topics and Evolution Analysis in the Field of Computer Vision Based on BERTopic

Author information +
文章历史 +

摘要

[目的/意义] 当前人工智能发展迅猛,计算机视觉作为人工智能的重要分支之一,其新的热点技术主题不断涌现。通过对计算机视觉领域的前沿热点主题演化进行分析,可以深入了解计算机视觉领域的热点技术、发展方向和演化路径,为相关研究和实践提供指导和参考。[方法/过程] 基于德温特专利数据库中计算机视觉相关专利数据,采用BERTopic模型提取主题,并采用基于BERT的DTM模型进一步对主题进行演化分析,总结近年计算机视觉的研究前沿及热点主题。[结果/结论] 计算机视觉领域的热点研究主题主要集中在自动驾驶、多模态人工智能、人机交互和三维建模等领域,计算机视觉整体表现出巨大的发展空间与潜力。

Abstract

[Objective/Significance] With the rapid development of artificial intelligence, computer vision is one of the important branches of artificial intelligence, and its new hot technical topics are constantly emerging. By analyzing the evolution of cutting-edge hot topics in the field of computer vision, we can gain an in-depth understanding of the hot technologies, development directions and evolutionary paths in the field of computer vision, and provide guidance and reference for related research and practice. [Method/Process] Based on computer vision-related patent data in the Derwent patent database, the BERTopic model was used to extract topics, and the BERT-based DTM model was used to further analyze the evolution of the topics, and summarize the research frontiers and hot topics of computer vision in recent years. [Results/Conclusions] Hot research topics in the field of computer vision are mainly concentrated in the fields of autonomous driving, multi-modal artificial intelligence, human-computer interaction, and three-dimensional modeling. Computer vision as a whole shows huge development space and potential.

Graphical abstract

关键词

Bertopic / 计算机视觉 / 热点主题 / 演化分析

Key words

BERTopic / computer vision / hot topics / evolution analysis

引用本文

引用格式 ▾
王蓝蓝, 刘艳丽. 基于BERTopic的计算机视觉领域热点技术主题及演化分析[J]. 科学观察, 2024, 19(2): 46-60 DOI:10.15978/j.cnki.1673-5668.202402005
Wang Lanlan, Liu Yanli. Hot Technology Topics and Evolution Analysis in the Field of Computer Vision Based on BERTopic[J]. Science Focus, 2024, 19(2): 46-60 DOI:10.15978/j.cnki.1673-5668.202402005

登录浏览全文

4963

注册一个新账户 忘记密码

1 引言

计算机视觉(Computer Vision)是计算机科学重要分支之一,是指用摄像头和电脑等对目标进行识别、跟踪和测量,并处理成更适合人眼观察或传送给仪器检测的图像,目标是使计算机能像人通过视觉观察理解世界,并具有自主适应环境的能力,其核心技术包括视觉感知和视觉生成[1],其中视觉感知涉及识别分类、目标检测、图像分割、表示学习等,视觉生成涉及图像与视频的生成、视觉与文字结合等。在政策规划、标准体系支撑下,计算机视觉架构以人物、图文、视频等内容为主要分析对象,逻辑上分为基础层、技术层、产品层、应用层。中国计算机视觉行业下游商用价值不断拓宽和深化,未来落地领域将会更加多元。预计2025年中国计算机视觉行业市场规模将翻倍增长至1655.7亿元,呈现迅猛增长态势1(1 https://main.qcloudimg.com/raw/8ba8ac305ff2b2c735c1635bb1cdd87f/2021%E5%B9%B4%E4%B8%AD%E5%9B%BD%E8%AE%A1%E7%AE%97%E6%9C%BA%E8%A7%86%E8%A7%89%E5%B8%82%E5%9C%BA%E6%8A%A5%E5%91%8A.pdf.)。随着人工智能科学技术的蓬勃发展,计算机视觉技术将在安全防范、医疗健康、工业自动化、智能家居等民用领域和军事侦察、自主武器、情报监视等国防领域发挥越来越重要的作用[2]。专利文献蕴含了丰富的技术主题信息,利用文本挖掘技术对专利技术主题进行挖掘分析,可以深入了解热点技术主题、技术发展方向和技术演化路径。本研究基于Bert和DTM等文本挖掘方法,针对计算机视觉技术专利文本数据,进行技术主题挖掘识别和分析,以研究计算机视觉领域的热点技术、发展方向和演化路径,为相关领域的科学研究和科研管理实践提供指导和参考。

2 研究设计

2.1 数据获取及预处理

(1)数据获取

本研究选取的数据类型为专利数据,数据来源为德温特专利数据库(DII),德温特专利数据库覆盖涉及近50个国家/地区的、各种语言公布的专利(如德国、法国、日本、西班牙、葡萄牙等非英语国家专利),经过阅读后统一用英语编辑改写成DWPI专利数据。该数据库的优势在于,具有专利人员对原始专利信息进行二次改写的、独特的DWPI专利摘要。选择DII专利数据库的DI专利分析平台进行专利数据的收集,数据采集年份为2010-2022年。对计算机视觉相关内容进行调研,并对DI专利分析平台的检索策略进行适配。为检索出最为贴近的计算机视觉领域专利,经过多次检索调整,缩减调整检索式为:(CTB=(COMPUTER ADJ VIS*)) AND AY>=(2010) AND AY<=(2022);对检索得到的数据进行合并专利同族等预处理,获得数据15823条,去除空白和字段严重不全的数据,最终获得15651条数据。

(2)主题识别文段选择

在进行主题建模时,本研究综合考虑技术主题的识别效果和字段包含的技术信息,将专利Title及Novelty字段合并作为技术主题识别的输入,大幅减少了冗余信息的干扰。

2.2 研究方法及框架

2.2.1 BERTopic主题聚类方法

技术主题识别是分析主题演化的基础。目前多数主题识别采用改进的LDA算法,LDA主题模型属于软聚类算法,很容易产生重叠的主题;主题数量需要由用户自行指定;忽略了上下文的语义关系等等[3];Top2Vec主题考虑了语料库中单词之间的语义关系,适合对短文本数据训练语义向量后做主题建模。Top2Vec不需要提前设定主题数,可以利用文档和单词的语义向量距离自动划分文本中存在的主题个数,支持分层迭代地将最小主题合并到语义上最相似的主题中来完成主题数量的优化[4,5]。同时,近年来,越来越多的研究利用神经网络来改善主题模型,证明了依赖预训练语言模型的优势[6-8]。有学者将LDA算法与k-means等聚类方法相结合[9-11],另有学者通过关键词聚类分析[12,13]、SAO结构识别[14,15]等文本挖掘方法,从专利数据中提取相关信息,并进行聚类分析,以完成技术主题划分。随着主题挖掘研究的深入,张金柱等[16]将相互包容系数应用于关键词共现网络的构建,采用简单中心算法分析关键词间共现关系的强度,并进行聚类,以提取技术主题。刘小玲等[17]利用专利文本内容、引用关系和分类信息来构建专利的多属性向量,并利用聚类方法获得技术主题。

BERTopic2(2 https://github.com/MaartenGr/BERTopic.)是Maarten于2022年提出的一种使用预训练模型的主题模型[18],利用BERT词向量、Transformer和c-TF-IDF等技术创建主题集群,同时在主题描述中保留重要的单词,是一种属于预训练模型的更为灵活的主题模型[19]。由于其聚类生成可与主题表示的生成过程分离,支持自动查找主题数量,在涉及经典主题模型和那些遵循主题建模的其他聚类方法的研究中具有较好的竞争力[20],因此取得了良好的主题识别效果。滕广青等人[21]采用BERTopic主题建模的方法提取美国石墨烯领域主题,对不同数据源维度下的领域知识演化进行跟踪,对比不同数据源维度下的知识演化分析效果。徐汉青[22]等人应用BERTopic模型对检索到的相关文献进行主题识别与知识结构提取,以洞察AI在图书馆领域的研究现状和未来发展动向。Zankadi H等[23]利用BERTopic主题模型从社交媒体上的学习者文本内容中识别和提取主题兴趣,以丰富他们对MOOC的课程偏好。Guizzardi S等[24]利用BERTopic主题模型识别出MEDLINE语料库中的关于骨再生的医学热点主题,并进行了主题跟踪。Contreras K等[25]使用LDA和BERTopic对2086篇西班牙语文本进行分析并进行比较,得出BERTopic可实现更强的主题连贯性和可解释性。

2.2.2 研究框架

(1)获取数据及文本预处理

在将文本输入模型之前需要对专利文本数据进行预处理。将每篇专利经过DII改写的Title和摘要中的Novelty字段进行合并,将合并后的文本视为一个单独的文档。对文档进行预处理,主要包括去除停用词、同义词替换、词形转化、分词等等,获得预处理之后的文本数据。这属于文本聚类的预处理阶段,对文本进行合适的预处理有助于模型最后的文本聚类效果。

(2)文本向量化

将文本输入模型,处理的第一步是文本的向量化,即嵌入(Embedding),在进行主题建模和聚类之前,需要将文本数据转换为数值向量表示,这是主题建模的基础。在本研究构建的BERTopic中,是基于Sentence-BERT框架将预处理后的文档转换为密集的向量表示,通过在BERT的输出中添加池化操作,获得固定大小的句子嵌入[26]。其中,有两个重要的可选步骤,一是加权方案(Weighting Scheme),计算文本中每个单词或子词的权重,这些权重将在生成嵌入向量时使用,可以选择适当的加权方案,以考虑到词在文本中的重要性和在整个文集中的普遍性;二是表示调优(Representation Tuning),对嵌入向量进行微调,以改进主题的质量,这是一个自动的优化过程,可以提高聚类的性能。本研究采用all-MiniLM-L6-v2句向量模型对预处理后的文本进行嵌入表示,该模型使用SBERT训练,是专门为语义相似性任务训练的英语语言模型,它对大多数用例都非常有效,不仅在训练速度上有了极大提升,并且仍然在性能上表现优越。表2列出了BERTopic中最具影响力的参数,对这些参数值的确定主要依赖在经验值范围内的多轮搜索。

(3)降维处理

接下来是向量的降维处理,即维度降低(Dimensionality Reduction),一种将高维数据映射到低维空间的技术。在文本聚类中,维度降低的目的是减少嵌入向量的维度,由于维数灾难,聚类模型通常难以处理高维数据,因此在将文档数字化表示后,必须降低表示的维度,以减少计算和存储的复杂性,并提高聚类效果。降维的方法有很多,比如UMAP、PCA、t-SNNE等,BERTopic默认选择的是UMAP。首先,UMAP是一种在降维时可以保留数据的局部和全局结构的技术,保留此结构很重要,因为它包含创建语义相似文档集群所需的信息。其次,与PCA和t-SNE降维算法相比,UMAP能够在较低的投影维度中保存更多的高维数据的局部和全局特征[27]

(4)聚类

第三步是聚类(Clustering),使用聚类算法将嵌入向量聚类为不同的主题。根据已经生成的嵌入向量和表示调优后的向量,在本模型中,选取HDBSCAN聚类算法对降维后的文档嵌入进行主题建模。它通过将DBSCAN转换为分层聚类算法扩展得到,可以自动推荐最优的簇类结果,允许将噪声建模为离群值,防止将不相关的文档分配给任何集群[28]。对文本进行聚类,为聚类得到的每个集群分配一个主题,并进行动态主题表示。BERTopic模型假设主题的时间性质不会影响全局主题的创建,即同一个主题可能以不同的表现形式出现在不同的时间段,这是该模型的一个显著优势,因为某个主题在不同年份的表达是存在差异的。

(5)主题表示

最后是词袋表示(Bag-of-words)及主题表示(Topic Representation),在开始主题表示之前,需要选择一种允许BERTopic算法模块化的技术。本研究采用基于类的TF-IDF(class-based TF-IDF,c-TF-IDF)进行主题提取和精简[29,30],即将一个聚类中的所有文档组合成一个长文档,计算每个词在每个聚类中出现的频率,得到词袋表示结果,其中可以找到每个聚类中每个词的频率,如下所示:

$W_{x, c}=|| t f_{x, c}|| X \operatorname{Iog}\left(1+\frac{A}{f_{x}}\right) $

其中tfx,c表示在聚类c中单词x的频次,fx表示单词x在所有聚类中的频次,A表示每个聚类所包含的平均单词数。经典的TF-IDF一样,将tf与idf相乘以获得每个类别中每个单词的重要性分数,本研究没有使用经典的TF−IDF过程,而是使用了算法的修改版本,可以提供更好的表示。

最大边际相关性(Maximal Marginal Relevance)为该算法的可选项,主要是指在生成c-TF-IDF表示后,获得一组描述文档集合的词。从技术上讲,这并不意味着这个单词集合描述了一个连贯的主题。在实践中,很多词确实描述了一个相似的主题,但有些词在某种程度上会过拟合文档。因此,为了提高单词的连贯性,使用最大边际相关性来找到最连贯的单词,而单词本身之间没有太多重叠,这可以删除对主题没有贡献的单词,还可以使用此技术使主题表示中生成的单词多样化[31]。同一个词的许多变体可能会出现在主题表示中,为了减少同义词的数量,可以增加单词之间的多样性,同时仍然与主题表示相似。

(6)动态主题建模

静态主题建模假定时间是静止的当下,不考虑文档主题分布随时间的变化,而动态主题建模(DTM)旨在分析主题随时间演变,比静态主题建模技术能更好地考虑技术的发展演化[32]。基于BERTopic的动态主题模型加入了时间戳因素,可以了解一个主题在不同时间是如何表示的,BERTopic通过计算每个时间步的主题表示来实现DTM,而无需多次运行整个模型。首先需要拟合未考虑时间因素的BERTopic模型,获得全局主题表示作为主要主题,然后对于每个主题和时间单位计算c-TF-IDF,获得的每个时间单位都有特定的主题表示,从而无需从已经创建的嵌入中创建集群。

接下来,有两种主要方法可以进一步微调这些特定主题表示,即全局调整和进化调整。第一种是时间t的主题表示可以通过将其c-TF-IDF表示与全局表示的平均表示进行全局微调,即每个主题表示略微向全局表示移动,同时仍保留其某些特定词;第二种是时间t的主题表示可以通过将其c-TF-IDF表示与时间t-1的c-TF-IDF表示平均来微调进化。在实际使用中,可以同时使用这两种方法,以获得较好的模型主题结果。

(7)主题演化分析

在技术主题的提取过程中,可以发现对于每一年的主题而言,都有可能存在以下变化:新技术主题出现、旧技术主题扩张、旧技术主题收缩、旧技术主题消失等[33]。对于以上不同的情况,具体的表现也存在差异。如图1所示,每个时间段都会出现一个或多个主题,主题用圆圈表示,圆圈的大小表示当前时间段内该主题内专利的数量。

单个技术主题的演化趋势包括新生技术、扩张技术和收缩技术。新生技术是指在时间段t不存在,但在t+1时间段中出现的主题,该类技术与已经存在的技术仅有较弱的共现关系或完全没有共现关系,如图中时段t+1中子技术3是新生技术。扩张技术是时间段t存在的主题,在t+1时间段内继续存在,且包含相关专利的数量增多,即规模扩张,如图中时段t+1中子技术1。收缩技术是时间段t存在的技术,在t+1时间段内继续存在,但包含专利的数量减少,即规模缩小,如图中时段t+1中的子技术2。本研究以此来揭示技术主题的演化趋势。

3 主题识别及趋势分析

3.1 专利申请变化趋势分析

通过专利申请量的年度变化趋势可以从宏观层面把握该技术的热点变化[34]。如图2所示,计算机视觉近十年的专利申请量逐年增加。计算机视觉作为AI行业占比最高的细分领域,2010-2017年随着人工智能的发展呈现相对平缓的增长趋势。2018年后AI技术加速变革计算机视觉市场应用,计算机视觉赋能城市安防、交通、医疗、金融、零售等领域,计算机视觉行业下游商用价值不断拓宽和深化。同时世界人工智能政策从技术端加大关键技术研发力度,从应用端推动新技术产业化落地。计算机视觉作为人工智能关键应用技术,将持续受益于政策红利。2018年以来计算机视觉专利数量飞速增长,2022年达到4000件以上,而伴随产业化加速落地,市场应用需求将倒逼计算机视觉基础理论和关键技术的发展创新。

3.2 热点主题分析

使用BERTopic进行主题的识别,首先要确定主题数量。本研究不手动指定,而是观察模型的自动聚类结果,共得到110个主题。主题太多会导致颗粒度太细,从而信息过载。通过缩减数据集以及选择合适的主题缩减方法来对主题进行分层合并。主题合并是将相似的主题合并为一个更大的主题集合,从而减少主题的数量并提高主题的可解释性。主题合并通过基于相似性度量的迭代聚类来完成,其中相似性度量基于主题之间的共同词项和权重,如图3所示。

分层主题建模是将主题组织为层次结构,每个层次上的主题代表不同的抽象层次。在分层主题建模中,每个主题都可以看作是更高层次的主题的一个分支,这些主题可以按照其相关性和抽象程度组织为树形结构。分层主题建模通常用于对大型语料库进行主题建模,以便更好地组织和理解主题之间的关系。该方法也可以用来合并主题,减少主题的数量。分层聚类的原理在于可以通过使用主题术语矩阵(c-TF-IDF矩阵)来近似潜在的层次结构,该矩阵包含有关每个主题中每个单词的重要性的信息,并为我们的主题提供了一个很好的数字表示。两个c-TF-IDF表示之间的距离越小,则越相似。图4为采用分层主题建模技术得出技术主题合并后的情况。

图5显示的是各个技术主题之间的相似度,越相似的主题则越大概率被认为可以合并为一个主题,图5可以为后续的技术主题合并及人工解读技术主题提供参考。

图6给出BERTopic模型主题聚类识别后的词得分情况,词得分越高,说明该词汇越能代表该技术主题。在技术解读的过程中,参考词得分可以明确某主题的代表性词汇,同时该主题的TOP4代表性词汇会自动生成主题的命名,例如Topic0的主题命名为0_image_feature_training_detection。

最终,通过模型对技术主题进行合并及人工解读,汇总得出计算机视觉领域的技术主题及对应词表,共得出22个二级技术主题,将其合并为7个一级技术主题,如表3所示。

3.3 主题演化分析

图7为基于BERTopic的DTM不同时间窗口主题支持专利文档数量,可以看到在未进行主题合并的二级技术主题中,技术主题强度基本呈现出增强上升趋势。其中编号为0_image_feature_training_detection(运动行为识别与分析)、1_video_vision_vehicle_computer vision(智能城市应用)、2_rod_plate_device_mounting(自动驾驶)、3_point cloud_camera_cloud data_calibration(三维场景感知重建和运动建模)、4_human face_face image_video_editing(人脸识别与检测)、5_text_document_text image_text detection(图像的文本检测和光学字符识别OCR)等主题表现出较高的技术主题强度转折。

(1)运动行为识别与分析(0_image_feature_training_detection)。行为识别与分析一直是计算机视觉领域的热点,尤其随着多模态数据的发展,行为识别伴随着近年来各式新型传感器的兴起,多模态人体行为识别研究逐渐成为行为识别领域内一个新的研究热点。概括而言,基本的多模态人体行为识别流程为:多模态数据集获取、数据预处理、特征提取与选择、人体行为识别算法。该方法与计算机视觉方法框架类型两者融合可行性高,多模态融合分析将能提升行为识别的准确性,为用户带来更好的使用体验。

(2)智能城市应用(1_video_vision_vehicle_computer vision)。在智慧城市建设中,计算机视觉技术主要应用在以下三个方面:智能交通管理、智能环境监测、智能安防监控等领域。

(3)自动驾驶(2_rod_plate_device_mounting)。自动驾驶是指能够感知周围环境并且在很少或者没有人类驾驶员输入的情况下行驶,感知系统是使自动驾驶汽车能够从环境中采集数据并且提取相关信息以安全驾驶的基本组件[35]。尤其是车辆导航的障碍检测和路径规划是自动驾驶和计算机视觉结合的重要领域,其中包括定位(Localization)、障碍物检测(Objective Detection)、场景理解(Scene Understanding)、目标预测(Target Prediction)和跟踪(Tracking)等几个方面。2022年3月,交通运输部、科学技术部联合发布的《“十四五”交通领域科技创新规划》提出要推动智慧交通与智慧城市协同发展,大力发展智慧交通,推动云计算、大数据、物联网、移动互联网、区块链、人工智能等新一代信息技术与交通运输融合。

(4)三维场景感知重建和运动建模(3_point cloud_camera_cloud data_calibration)。三维视觉能够获取三维矢量信息,实现识别、定位和场景重建等功能,应用上相比二维成像技术而言也更加广泛,将成为AI时代的关键技术[36]。2022年3D视觉感知智能终端市场(包括智能手机、XR头显设备与平板电脑)规模达到269亿元,智能手机仍然是最大的应用场景;汽车电动化与智能化进程为3D视觉感知渗透率提升带来机遇,预计2027年汽车电子市场3D视觉感知市场规模将达到473亿元;2022年智能家居3D视觉感知市场规模为8.1亿元,预计2027年达到19.1亿元,2022-2027年复合年均增长率为19%3(3 https://pdf.dfcfw.com/pdf/H3_AP202308101593847118_1.pdf?1691696470000.pdf.)。

(5)人脸识别与检测(4_human face_face image_video_editing)。计算机视觉在人脸图像识别中的应用包括人脸检测、人脸识别、活体检测和情感识别。在人脸检测领域,深度学习模型可以通过学习大量的人脸图像,自动提取人脸区域的特征,从而实现高效准确的人脸检测。在人脸识别领域,最流行的是基于卷积神经网络(CNN)的人脸识别算法,它使用CNN模型自动提取人脸特征向量,然后使用分类算法对这些特征向量进行比对,从而实现准确的人脸识别。据《2022-2026年人脸识别行业现状调研与发展前景研究报告》显示,在技术层面,人脸识别技术已经从2D转向3D。在人脸识别智能门锁的初期,使用的大部分产品都是2D人脸识别技术,后来智能门锁制造商转向了另一种热成像人脸识别技术,即3D人脸识别技术4(4 https://www.sohu.com/a/710588724_121332851.)。同时根据《人脸识别安全白皮书》预测数据,未来我国人脸识别市场规模将保持年均23%的增速,到2024年市场规模可突破100亿元,2028年市场规模预计在235亿元左右5(5 https://bg.qianzhan.com/trends/detail/506/230530-3bf8cf95.html.)。

(6)图像的文本检测和光学字符识别OCR(5_text_document_text image_text detection)。在过往40余年的技术发展历程中,OCR始终具备很强的产业应用背景,是计算机领域里少数几个一开始就由工业界和学术界双轮驱动的领域。美国权威机构Grand View Research发布的《全球OCR(Optical Character Recognition)市场预测以及趋势分析》预测,2018年以来全球OCR市场将以13.7%的复合年增长率稳健发展,至2025年全球OCR市场规模将达到133.81亿美元。

图8是基于BERTopic模型解读的一级技术主题热点演化情况,可以看到,主题一(图像与视频分析)、主题二(场景理解与模拟)、主题三(人机交互与识别)、主题四(多模态分析与融合)、主题五(产品检测与异常监控)、主题六(人工智能与学习)和主题七(医学与农业)等7个一级技术主题均表现出扩张。其中主题一、主题二和主题三表现出较为明显的热度和扩张趋势。

主题三(人机交互与识别)的扩张趋势最明显。人机交互(Human-ComputerInteraction,HCI)主要是研究用户与系统之间的信息交换,它主要包括用户到系统和系统到用户的信息交换两部分。人机交互产品通过将用户意图转化为机器可以理解的内容,可协助用户解答问题或帮助用户完成特定任务。2020年,中国人机交互核心产品市场规模为58.5亿元,同比增加59.84%。预计2022年我国人机交互核心产品市场规模将达到120亿元,2023-2028年均复合增长率约为24.14%,据此估计2026年将达到285亿元。人机交互的一大发展趋势是虚拟现实(VR)和增强现实(AR)。虚拟现实技术是一种模拟现实环境的计算机技术,通过头戴式显示器、手柄、传感器等设备,为用户创造出一个与真实世界相似或完全不同的虚拟环境。用户可以通过佩戴虚拟现实头显,进入一个由计算机生成的虚拟世界,并与其中的对象进行互动[37]。虚拟现实技术可以与智能可穿戴设备结合使用,在虚拟现实环境中提供更多的功能和交互方式,从而提供更加身临其境的虚拟现实体验。2022年2月国务院在《“十四五”国家老龄事业发展和养老服务体系规划》中提到,要加快人工智能、脑科学、虚拟现实、可穿戴等新技术在健康促进类辅助器具中的集成应用。2022年4月,国务院办公厅在《国务院办公厅关于进一步释放消费潜力促进消费持续恢复的意见》中提到,加快超高清视频、互动视频、沉浸式视频、云游戏、虚拟现实、增强现实、可穿戴等技术标准预研,加强与相关应用标准的衔接配套。2022年底,已有20多个省份发布虚拟现实产业相关建设规划。近年来,各地各部门持续加强政策支持和规划引领,工信部等先后出台《关于加快推进虚拟现实产业发展的指导意见》《虚拟现实与行业应用融合发展行动计划(2022—2026年)》等,助力相关产业快速发展。

3.4 结果解读

主题一:图像与视频分析。图像分割是计算机视觉研究中的一个经典难题,图像分析的第一步,目前的发展方向是语义分割,包括从图像到视频中的分割,同时对分割的精确度有很大的要求,示例级别(Instance level)的图像分割也是一个前沿研究方向[38];目标检测与跟踪是计算机视觉领域中的一个关键任务,旨在在图像或视频中准确地检测出目标物体并对其进行定位,在安全监控、智能驾驶、人脸识别等领域广泛应用[39];图像超分辨率(Super-Resolution,SR)是指通过图像处理技术将低分辨率图像转换为高分辨率图像的过程,即从已知的图像中恢复更高分辨率的图像,图像超分辨率技术是一项重要的图像处理技术,其在提升图像质量和细节方面具有巨大潜力,多模态技术引入图像超分辨率方案中是目前大模型背景下的研究前沿之一[40]

主题二:场景理解与模拟。三维重建是通过利用多个视角的图像或深度传感器的数据,计算机可以还原出真实世界中的三维场景,三维重建的发展需要高精度的传感器和算法,还需要大规模的数据集和强大的计算能力来支持模型的训练和推理[41]。此外,三维场景理解可以更全面地描述场景的几何结构、光照条件和物体的运动状态。通过对三维场景的理解,计算机可以更好地模拟和预测真实世界的行为,为智能交通、智能家居等提供更智能、更安全的解决方案。

主题三:人机交互与识别。简单来说,人机交互特征识别就是通过人类与计算机之间的交互,让计算机能够识别人类的特征、行为和意图,从而提供更智能、个性化的服务和体验[42]。这一技术涉及计算机视觉、语音识别、自然语言处理等多个领域,并在智能家居、智能手机、智能机器人等设备中得到了广泛应用[43]。基于计算机视觉的手势识别、行为意图识别等是未来人机交互的重要前沿技术领域之一[44]

主题四:多模态分析与融合。多模态数据是指通过不同的方法或视角收集到的耦合的数据样本。多模态图像融合通过综合不同传感器获取的互补信息,来获取显著提升信息量和质量的融合图像,对于增强视觉和改善图像语义分析应用具有重要意义[45]

主题五:产品检测与异常监控。在制造行业和工业生产中,人工质检习惯于在产品下线时对其进行检查,而借助计算机视觉技术可以通过分析高分辨率摄像机镜头、传感器数据和生产指标、使用自定义模型来检测产品中的缺陷和异常[46]。目前依靠计算机视觉技术的产品检测与异常监控在各类跨行业的缺陷和异常检测中都有许多应用案例,如半导体制造、化学品生产等[47]

主题六:人工智能与学习。迁移学习是机器学习和人工智能的一个分支,其目的是将从一个任务(源任务)中获得的知识应用到一个不同但相似的任务(目标任务)中[48]。视觉语言模型的迁移学习同样吸引了大量的注意,迁移学习的目的是使得预训练过的视觉语言模型可以更好地适应下游任务。对抗样本攻击是近年来计算机视觉领域的热点研究方向,通过对图像添加细微的噪声,对抗样本使计算机视觉系统做出错误判断。对抗样本攻击的研究起初重点关注图像分类任务,随着研究的深入逐步拓展到目标检测、人脸识别等更加复杂的计算机视觉任务中。相关的生成对抗网络(GAN)则是深度视觉生成的有效工具,近年来受到了极大关注,成为快速发展的研究方向[49]。GAN能够接收多种模态的输入数据,包括噪声、图像、文本、视频,以对抗博弈的模式进行图像生成和视频生成,已成功应用于多项视觉生成任务[40]

主题七:医学与农业等应用。计算机科学与医学的交叉应用已广泛应用于诊断辅助、药物研发、基因组学、数字病理学、穿戴设备、医学教育、电子健康记录、机器人手术、电子处方和远程医疗等领域,尤其是影像诊断、病理诊断等应用场景[50]。同时,计算机视觉技术作为一种高效、准确的自动化检测手段,在农业产品分类检测领域扮演着越来越重要的角色。机器视觉系统通过模拟人眼的视觉功能,借助相机和计算机视觉算法,对农业产品的外观、尺寸、颜色、标签等特征进行快速、无损的分类、检测。

4 结语

本研究选择专利数据,基于BERTopic模型对2010-2022年计算机视觉领域的专利技术主题进行识别和演化分析研究,发现计算机视觉热点技术主要分布在自动驾驶、多模态人工智能、人机交互和三维建模等领域的应用方面。未来计算机视觉领域技术必然助力人工智能实现更大的突破。同时,本研究是对计算机视觉领域的热点技术主题演化的初步探索,仍然存在一些不足与局限:主题模型提取效果依赖主题相似度计算,专家解读存在一定的主观性。后续研究考虑融合多源数据,采用语义关联模型进行研究,可以减少主观解读主题对结果带来的影响。

参考文献

[1]

余京蕾. 浅谈计算机视觉技术进展及其新兴应用[J]. 北京联合大学学报, 2020, 34(1): 63-69.

[2]

(Yu J L. A study on the progress of computer vision and its newly developing applications[J]. Journal of Beijing Union University, 2020, 34(1): 63-69.)

[3]

苗杰. 基于主题分析的国家科技情报研究[D]. 南京: 南京大学, 2022.

[4]

(Miao J. Research on national scientific and technological information based on topic analysis[D]. Nanjing: Nanjing University, 2022.)

[5]

李明洋. 基于文本挖掘的在线医疗社区知识发现研究[D]. 长春: 吉林大学, 2023.

[6]

(Li M Y. Research on knowledge discovery in online medical communities based on text mining[D]. Changchun: Jilin University, 2023.)

[7]

李拓航. 学术文本中的自动关键词技术研究[D]. 长春: 吉林大学, 2023.

[8]

(Li T H. Research on automatic keyword technology in academic texts[D]. Changchun: Jilin University, 2023.)

[9]

逯万辉. 科学文献主题建模方法及其效果评估研究[J]. 现代情报: 1-16.

[10]

(Lu W H. Research on scientific literature topic modeling method and its effect evaluation[J]. Modern Intelligence: 1-16.)

[11]

Bianchi F, Terragni S, Hovy D. Pre-training is a hot topic: Contextualized document embeddings improve topic coherence[J]. ArXiv e-Prints, 2020: arXiv: 2004.03974.

[12]

王乃钰, 叶育鑫, 刘露, . 基于深度学习的语言模型研究进展[J]. 软件学报, 2021, 32(4): 1082-1115.

[13]

(Wang N Y, Ye Y X, Liu L, et al. Language models based on deep learning: a review[J]. Journal of Software, 2021, 32(4): 1082-1115.)

[14]

李景玉. 预训练语言模型探究[J]. 科技资讯, 2022, 20(19): 5-9, 18.

[15]

(Li J Y. Research on pre-trained language models[J]. Science and Technology Information, 2022, 20(19): 5-9, 18.)

[16]

吴胜男, 田若楠, 蒲虹君, . 基于社交媒体的医药领域关联主题预测方法研究[J]. 数据分析与知识发现, 2021, 5(12): 98-109.

[17]

(Wu S N, Tian R N, Pu H J, et al. Predicting related medical topics from social media[J]. Data Analysis and Knowledge Discovery, 2021, 5(12): 98-109.)

[18]

宋凯, 朱彦君. 专利前沿技术主题识别及趋势预测方法——以人工智能领域为例[J]. 情报杂志, 2021, 40(1): 33-38.

[19]

(Song K, Zhu Y J. Patent frontier technology topic identification and trend prediction: a case analysis of artificial intelligence[J]. Journal of Intelligence, 2021, 40(1): 33-38.)

[20]

陈玲, 林平, 段尧清. 产业链视角下结合K-means和LDA的专利技术主题挖掘与趋势分析——以虚拟现实技术为例[J]. 知识管理论坛, 2020, 5(3): 135-146.

[21]

(Chen L, Lin P, Duan Y Q. Technology topic mining and trend analysis from the perspective of industrial chain combined with K-means and LDA—taking virtual reality technology as an example[J]. Knowledge Management Forum, 2020, 5(3): 135-146.)

[22]

张金柱, 张晓林. 基于被引科学知识主题突变的突破性创新识别[J]. 现代图书情报技术, 2016(S1): 42-50.

[23]

(Zhang J Z, Zhang X L. Breakthrough innovation identification based on mutation of cited scientific knowledge topics[J]. Data Analysis and Knowledge Discovery, 2016(S1): 42-50.)

[24]

陈健, 李宏伟, 周德秀. 基于关键词聚类技术的主题地图构建研究——以地理信息可视化领域为例[J]. 测绘与空间地理信息, 2010, 33(5): 115-120, 123.

[25]

(Chen J, Li H W, Zhou D X. Research on thematic maps based on technology of keywords clustering—taking GIS visualization as an example[J]. Geomatics & Spatial Information Technology, 2010, 33(5): 115-120, 123.)

[26]

周海炜, 吴成凤. 基于专利SAO结构和多指标评价的新兴技术识别研究——以手机芯片领域为例[J]. 情报杂志, 2022, 41(2): 86-94, 48.

[27]

(Zhou H W, Wu C F. Emerging technology identification based on patent SAO structure and multi-index evaluation: mobile chip as an example[J]. Journal of Intelligence, 2022, 41(2): 86-94, 48.)

[28]

冯立杰, 周炜, 王金凤, . 基于SAO语义分析的多维技术演化路径与技术创新机会识别研究[J]. 情报学报, 2022, 41(11): 1149-1160.

[29]

(Feng L J, Zhou W, Wang J F, et al. Examining multi-dimensional technology evolution path and technology innovation opportunity identification based on SAO semantic analysis[J]. Journal of the China Society for Scientific and Technical Information, 2022, 41(11): 1149-1160.)

[30]

张金柱, 吕品. 基于主题关联度改进的主题演变和突变分析[J]. 情报理论与实践, 2018, 41(3): 129-135.

[31]

(Zhang J Z, Lyu P. Topic evolutionand mutation analysis based on improved topic correlation method[J]. Information Studies: Theory & Application, 2018, 41(3): 129-135.)

[32]

刘小玲, 谭宗颖. 基于专利多属性融合的技术主题划分方法研究[J]. 数据分析与知识发现, 2022, 6(S1): 45-54.

[33]

(Liu X L, Tan Z Y. Research on technology topic division method based on patent multi-attribute fusion[J]. Data Analysis and Knowledge Discovery, 2022, 6(S1): 45-54.)

[34]

Grootendorst M. BERTopic: Neural topic modeling with a class-based TF-IDF procedure[J]. arXiv preprint arXiv: 220305794, 2022.

[35]

郝雯柯, 杨建林. 基于语义表示和动态主题模型的社科领域新兴主题预测研究[J]. 情报理论与实践, 2023, 46(2): 184-193.

[36]

(Hao W K, Yang J L. Predicting emerging topics in social sciences based on semantic representation and dynamic topic model[J]. Information Studies: Theory & Application, 2023, 46(2): 184-193.)

[37]

Egger R, Yu J. A topic modeling comparison between LDA, NMF, Top2Vec, and BERTopic to demystify twitter posts[J]. Frontiers in Sociology, 2022, 7: 886498.

[38]

滕广青, 江瑶, 庹锐. 基于多数据源维度的领域知识演化对比研究:以美国石墨烯领域研究为例[J]. 情报资料工作, 2023, 44(6): 61-70.

[39]

(Teng G Q, Jiang Y, Tuo R. Comparative study on domain knowledge evolution based on multiple data source dimensions: taking graphene field research in the United States as an example[J]. Information and Documentation Services, 2023, 44(6): 61-70.)

[40]

徐汉青, 滕广青. 机遇与挑战:基于BERTopic的AI环境下图书馆主题文本挖掘[J]. 情报科学: 1-20.

[41]

(Xu H Q, Teng G Q. Opportunities and challenges: library subject text mining in AI environment based on BERTopic[J]. Information Science: 1-20.)

[42]

Zankadi H, Idrissi A, Daoudi N, et al. Identifying learners’ topical interests from social media content to enrich their course preferences in MOOCs using topic modeling and NLP techniques[J]. Education and Information Technologies, 2023, 28(5): 5567-5584.

[43]

Guizzardi S, Colangelo M T, Mirandola P, et al. Modeling new trends in bone regeneration, using the BERTopic approach[J]. Regenerative Medicine, 2023, 18(9): 719-734.

[44]

Contreras K, Verbel G, Sanchez J, et al. Using Topic Modelling for Analyzing Panamanian Parliamentary Proceedings with Neural and Statistical Methods; proceedings of the 2022 IEEE 40th Central America and Panama Convention (CONCAPAN), F, 2022[C]. IEEE.

[45]

Reimers N, Gurevych I. Sentence-bert: Sentence embeddings using siamese bert-networks[J]. arXiv preprint arXiv: 190810084, 2019.

[46]

Mcinnes L, Healy J, Melville J. Umap: Uniform manifold approximation and projection for dimension reduction[J]. arXiv preprint arXiv:180203426, 2018.

[47]

McInnes L, Healy J, Astels S. Hdbscan: hierarchical density based clustering[J]. The Journal of Open Source Software, 2017, 2(11): 205.

[48]

姚严志, 李建良. 基于类信息的TF-IDF权重分析与改进[J]. 计算机系统应用, 2021, 30(9): 237-241.

[49]

(Yao Y Z, Li J L. Feature weight analysis and improvement of TF-IDF based on category information[J]. Computer Systems & Applications, 2021, 30(9): 237-241.)

[50]

徐冬冬, 吴韶波. 一种基于类别描述的TF-IDF特征选择方法的改进[J]. 现代图书情报技术, 2015, (3): 39-48.

[51]

(Xu D D, Wu S B. improved TF-IDF feature selection based on categorical description[J]. New Technology of Library and Information Service, 2015, (3): 39-48.)

[52]

孟令阁, 马建芬, 张雪英. 基于主题的SVM与MMR融合的会议摘要技术[J]. 计算机工程与设计, 2016, 37(10): 2695-2699.

[53]

(Meng L G, Ma J F, Zhang X Y. Meeting summarization technology confused with SVM and MMR based on theme[J]. Computer Engineering and Design, 2016, 37(10): 2695-2699.)

[54]

朱晓霞, 宋嘉欣, 孟建芳. 基于动态主题—情感演化模型的网络舆情信息分析[J]. 情报科学, 2019, 37(7): 72-78.

[55]

(Zhu X X, Song J X, Meng J F. Analysis of online public opinion information based on the dynamic theme-emotion evolution model[J]. Information Science, 2019, 37(7): 72-78.)

[56]

单晓红, 韩晟熙, 刘晓燕. 基于技术主题演化的颠覆性技术识别研究[J]. 情报理论与实践, 2023, 46(8): 113-123.

[57]

(Shan X H, Han S X, Liu X Y. Research on disruptive technology identification based on the evolution of technology themes[J]. Information Studies: Theory & Application, 2023, 46(8): 113-123.)

[58]

马超. 全球标准数字化专利发展态势及热点分析[J]. 科学观察, 2023, 18(5): 57-75.

[59]

(Ma C. Analysis of global standard digitization patent development trend and hotspot[J]. Science Focus, 2023, 18(5): 57-75.)

[60]

黎飞龙. 浅析国内汽车自动驾驶发展现状及未来趋势[J]. 电信快报, 2023, (5): 35-37.

[61]

(Li F L. Analysis on the present situation and future trend of auto-driving in China[J]. Telecommunications Information, 2023, (5): 35-37.)

[62]

吕海清, 李雪飞. 真实感三维人脸建模技术综述[J]. 软件导刊, 2018, 17(1): 1-3, 7.

[63]

(Lv H Q, Li X F. A survey of realistic 3D face modeling technology[J]. Software Guide, 2018, 17(1): 1-3, 7.)

[64]

刘金美. 借助计算机技术助推虚拟现实技术应用效果的提升[J]. 信息与电脑(理论版), 2023, 35(20): 54-56.

[65]

(Liu J M. With the help of computer technology to promote the application of virtual reality technology effect[J]. Information and Computers (Theoretical Edition), 2023, 35(20): 54-56.)

[66]

张俊威. 基于深度学习的图像分割方法[J]. 数字技术与应用, 2023, 41(3): 120-122, 154.

[67]

(Zhang J W. Image segmentation method based on deep learning[J]. Digital Technology and Applications, 2023, 41(3): 120-122, 154.)

[68]

尹宏鹏, 陈波, 柴毅, . 基于视觉的目标检测与跟踪综述[J]. 自动化学报, 2016, 42(10): 1466-1489.

[69]

(Yin H P, Chen B, Chai Y, et al. Vision-based object detection and tracking: a review[J]. Acta Automatica Sinica, 2016, 42(10): 1466-1489.)

[70]

吴春生, 佟晖, 范晓明. 生成对抗网络人脸生成及其检测技术研究[J]. 数字通信世界, 2023, (7): 28-33.

[71]

(Wu C S, Tong H, Fan X M. Overview of research on face generation and detection techniques in generation countermeasures networks[J]. Digital Communication World, 2023, (7): 28-33.)

[72]

郭婉莹, 冉红霞. 计算机视觉中场景理解的专利技术分析[J]. 中国科技信息, 2023, (13): 49-52.

[73]

(Guo W Y, Ran H X. Patent technology analysis of scene understanding in computer vision[J]. China Science and Technology Information, 2023, (13): 49-52.)

[74]

贾淑滟. 基于计算机视觉的人机交互技术研究[J]. 绵阳师范学院学报, 2022, 41(5): 76-84.

[75]

(Jia S Y. Research on human-computer interaction technology based on computer vision[J]. Journal of Mianyang Teachers’ College, 2022, 41(5): 76-84.)

[76]

曾泽钦, 陈燕, 邹湘军, . 基于机器视觉感知的交互式虚拟装配研究[J]. 机械设计与制造, 2022, (9): 261-266.

[77]

(Zeng Z Q, Chen Y, Zou X J, et al. Research on interactive virtual assembly based on machine vision perception[J]. Machinery Design & Manufacture, 2022, (9): 261-266.)

[78]

杨晓楠, 王帅, 牛红伟, . 眼动交互关键技术研究现状与展望[J]. 计算机集成制造系统: 1-22.

[79]

(Yang X N, Wang S, Niu H W, et al. Research status and prospects of key technologies of eye movement interaction[J]. Computer Integrated Manufacturing System: 1-22.)

[80]

孙影影, 贾振堂, 朱昊宇. 多模态深度学习综述[J]. 计算机工程与应用, 2020, 56(21): 1-10.

[81]

(Sun Y Y, Jia Z T, Zhu H Y. Survey of multimodal deep learning[J]. Computer Engineering and Applications, 2020, 56(21): 1-10.)

[82]

邓剑勋. 基于计算机视觉的检测方法与应用[J]. 信息与电脑(理论版), 2017, (17): 17-18, 22.

[83]

(Deng J X. Detection method and application based on computer vision[J]. China Computer & Communication, 2017, (17): 17-18, 22.)

[84]

黄涛. 基于机器视觉的产品检测技术研究[J]. 信息记录材料, 2020, 21(7): 87-88.

[85]

(Huang T. Research on product inspection technology based on machine vision[J]. Information Recording Materials, 2020, 21(7): 87-88.)

[86]

刘夏鸣. 一种基于迁移学习的视觉多任务模型探析[J]. 科学技术创新, 2022(23): 103-106.

[87]

(Liu X M. A transfer learning based multi-task model for computer vision[J]. Scientific and Technological Innovation, 2022(23): 103-106.)

[88]

周涛, 甘燃, 徐东伟, . 图像对抗样本检测综述[J]. 软件学报, 2024, 35(1): 185-219.

[89]

(Zhou T, Gan R, Xu D W, et al. Survey on adversarial example detection of images[J]. Journal of Software, 2024, 35(1): 185-219.)

[90]

杨健程, 倪冰冰. 医学3D计算机视觉:研究进展和挑战[J]. 中国图象图形学报, 2020, 25(10): 2002-2012.

[91]

(Yang J C, Ni B B. Advances and challenges in medical 3D computer vision[J]. Journal of Image and Graphics, 2020, 25(10): 2002-2012.)

PDF (4269KB)

2413

访问

0

被引

详细

导航
相关文章

/