1 引言
21世纪以来,随着互联网技术的快速发展,人们面临着前所未有的信息轰炸,如何有效利用和挖掘各种信息资源,获取潜在的、有价值的知识和情报已成为当前的迫切需求。在这些海量的信息中,有相当一部分是无结构的自由文本数据,例如Web网页、学术论文和研究报告等,另外还包括我们经常使用的社交化媒体,如微博、朋友圈中的文本内容。采用常规的数理统计和数据挖掘的方法难以对上述文本数据进行有效的分析和处理,因此文本挖掘技术应运而生。文本挖掘以符号群为基本信息单元,以统计数理分析、计算语言学为基础,结合信息检索技术和机器学习,分解文本内容,关注文本的内容特征,实现对文本细粒度、深层次、全面的分析和处理
[1]。而作为文本挖掘领域的新兴技术,主题模型更是弥补了常规文本挖掘方法不能反映词汇间语义关系的缺陷,近年来受到了国内外学者的普遍关注,在文本分类、信息检索、情感分析、话题挖掘等领域获得了广泛的应用。在此背景下,为了整体把握主题模型的研究现状和研究热点,本文从主题模型的基本原理、起源和历史演变出发,采用文献计量学中文献外部特征统计分析和共词分析的方法,从时间趋势、机构分布、核心作者、学科和期刊分布等角度揭示主题模型在国际和国内的研究发展态势,并通过关键词的共现和聚类,归纳总结主题模型的研究热点分布,以期为相关研究人员提供借鉴和参考。
2 主题模型概述
主题模型是一种语言模型,是文本挖掘领域中结合机器学习和自然语言处理等相关方法的一种统计模型,其基本思想认为文本是由多个主题混合而成的,而主题是特征词上的一种概率分布,即每篇文本是主题的混合分布,而每一个主题是一组特征词的混合分布
[2]。同时,主题模型也是一种典型的生成概率模型,而生成模型指的是一篇文献的每个特征词都是通过“以一定的概率选择了某个主题,并从这个主题中以一定的概率选择了某个词汇”产生的,因而一篇文档中的特征词与其出现的概率可以表示为:
P(特征词|文档)=∑主题 P(特征词|主题)×P(主题|文档)
其中,P(特征词|文档)表示每个文档中每个特征词的出现概率;P(特征词|主题)表示每个主题中每个特征词的出现概率;P(主题|文档)表示每个文档中每个主题出现的概率。
主题模型起源于1990年Deerwester
[3]提出的隐性语义索引(latent semantic indexing,LSI),其工作原理是利用奇异值分解技术实现文本维度的压缩,使得压缩后的潜在语义空间能够反映不同特征词之间的语义关系,但LSI不是概率模型,因而LSI并不算是主题模型。在LSI的基础之上,1999年Hofmann
[4]提出概率隐含语义索引(probabilistic latent semantic indexing,pLSI),该模型通过引入概率模型,显式地对文本及其隐含主题进行建模,是第一个真正意义上的主题模型;但仍不是完整的概率模型,其参数只与训练文本相关,很难直接用于对新文本建模。随后,Blei等
[5]又在pLSI的基础上提出了隐含狄利克雷分布模型(latent dirichlet allocation,LDA),该模型集成了pLSI的优点,同时也克服了pLSI的理论缺陷,并在之后被广泛应用于诸多领域。后来的学者也对该模型进行了扩展和改进,衍生出了层次概率主题模型(hierarchical topic model,hLDA)
[6]、作者主题模型(author-topic,AT)
[7,8,9]、动态主题模型(dynamic topic model,DTM)
[10]等相关模型。
3 数据来源与研究方法
3.1 数据来源
本研究以
Web of Science核心合集和中国学术期刊网络版(CNKI学术期刊全文数据库)为数据源,分别检索国际和国内发表的研究主题为“主题模型”的学术文献。考虑到第一个真正意义上的主题模型是Hofmann在1999年提出的pLSI模型,另外由于LDA模型是目前最常用的主题模型,也衍生出了诸多扩展和改进模型,因此,为保证检全,在设计检索式的过程中将pLSI和LDA也纳入检索词。在保证数据全面性的同时,由于部分检索词的多义性,笔者对初步的检索结果进行了评估和筛选,剔除不相关文献,以确保数据的准确性。最终检索得到国外数据库文献1 288篇,国内数据库文献865篇,检索细节见
表1。
3.2 研究方法及工具
本研究采用文献外部特征统计分析和共词分析方法对主题模型在国际和国内的研究发展态势和研究热点分布进行梳理和揭示。对于国外数据,将通过TDA软件抽取和统计文献外部特征,并对作者关键词进行自动和人工清洗,把同根词、同义词、近义词、单复数形式和复合形式进行合并,最终生成关键词的共词矩阵和相异矩阵;对于国内数据,将通过SATI软件完成抽取和分析工作,由于软件本身不具备关键词清洗的功能,因此,将采用半人工的方式进行数据清洗,以确保研究结果的可靠性。另外,使用专业统计软件SPSS 20.0对关键词矩阵进行聚类分析,值得注意的是,SPSS的系统聚类模块已经嵌入了相似度算法,若不对其进行阻止,则会在上述相异矩阵的基础上再进行一次相似度计算,造成对相似度的高估和扭曲。因而,需要在Syntax编辑窗口对Syntax进行编辑,阻止聚类模块在聚类之前重复计算相 似度
[11]。
4 主题模型的研究发展态势
4.1 时间趋势分析
学术论文数量的时序变化,可以作为衡量某领域发展情况的一项指标
[12]。通过对学术论文的发文时间进行统计,有助于了解该领域的发展脉络和趋势。从主题模型研究的发文时间分布情况(见
图1)可以看出,国内外的主题模型研究从整体上均呈现增长态势,且增速相对较快。从发文情况的国外数据可以看出,在2005年以前,主题模型研究的总体发文较少,发文数量以个位数计,其中最早正式发表的期刊论文是2000年法国学者Bigi B等
[13]撰写的“A fuzzy decision strategy for topic identification and dynamic selection of language models”,该文提出了一种基于模糊关系的主题模型,并通过主题分类精度验证了模型的有效性。从2005年开始,发文数量开始逐年上升,其中2015年发文共计282篇,2016年(截至2017年1月1日)已累计发文309篇。国内发文的时间分布与国外发文类似,国内学者自2005年开始在主题模型方面有所涉猎,最早发文的是华东师范大学的姚红玉等人
[14],于2005年发表了“基于pLSA的智能学习支持系统”,该文对比了pLSA与LSA算法,阐明了pLSA算法的优势,并提出基于pLSA的学习支持系统的具体设计与实现。国内发文量的快速增长出现在2007年,起步相对滞后,但后续发展速度较快,表明国内学者对主题模型的研究热情在逐步提高。
4.2 发文机构和作者分布
统计学术论文的发文机构和作者的分布情况,有助于研究人员了解该领域较为突出的研究机构和学者,帮助其明确自身所处的位置,找到标杆,从而进行有效的学习研究。
4.2.1 发文机构分布
对主题模型研究的发文机构进行统计排序,列举出发文量前10位的研究机构(见
表2)。从国际发文情况来看,中国在TOP10的发文机构中占据7所,包括中国科学院、清华大学、浙江大学等,可见,中国作为后起之秀,在主题模型研究方面已成为国际上主要的研究群体,形成了一定的研究规模,对推动主题模型的发展起到了积极作用。另外3所TOP10发文机构分别是美国的加州大学欧文分校、卡内基梅隆大学和普林斯顿大学,这3所大学在计算机科学、数据分析和图书情报领域都具有较强的科研实力。从国内发文情况来看,武汉大学的发文数量最多,在文本分类、文本主题挖掘、遥感图像场景分类等方面均取得了一定的研究成果。另外,国内主题模型研究的二级发文机构相对集中,主要分布在高校计算机学院和图情学院,如武汉大学计算机学院和信息管理学院、苏州大学计算机科学与技术学院、中国科学院计算技术研究所等。
4.2.2 作者分布
对主题模型研究的发文作者进行统计排序,列举出发文量最多的前10位作者(见
表3)。从国际发文情况来看,发文最多的是清华大学计算科学与技术系的唐杰教授、美国罗特格斯州立大学的熊辉教授以及武汉大学测绘遥感国家重点实验室的张良培教授,分别发文12篇,他们的研究方向主要集中在社会网络分析、文本分类与推荐、遥感图像场景分类等方面,其他的高产作者还包括中国科学院自动化研究所的徐常胜研究员、印第安纳大学图书馆与信息科学学院丁颖博士等。从国内发文情况来看,发文最多的是武汉大学信息管理学院李湘东教授和苏州大学计算机科学与技术学院的严建峰教授,分别发文14篇和11篇,他们的研究方向主要集中在文本分类、并行LDA和消息传递算法等方面,其他的高产作者还包括苏州大学的刘晓升以及武汉大学的黄莉和唐晓波等。
4.3 学科和期刊分布
统计学术论文的学科和期刊分布情况有助于研究人员了解该领域的学科交叉态势,明确重点相关的研究领域,同时还可以为其提供期刊投稿建议。其中,在分析论文的学科分布情况时,两种文献数据源的学科分类方式存在一定的差异:Web of Science核心合集采用的“Web of Science类别”共包含了生命科学与生物医学、自然科学、社会科学等5个大类252个小类;而CNKI数据库采用的文献学科分类则包括了基础科学、工程科技、农业科技等10个一级类168个二级类。
4.3.1 学科分布
对主题模型研究论文的学科分布进行统计,列举出发文量最多的前10个学科(见
表4)。从中可以看出,计算机科学与技术是主题模型研究最活跃的学科,在国际发文中其他较为活跃的学科还包括工程学、图书情报学、数学、运筹与管理科学等,国内发文中其他较为活跃的学科还包括互联网技术、图书情报与数字图书馆、自动化技术、新闻与传媒等。由此可见,主题模型研究的学科分布呈现多样化趋势,该方法不断渗透并应用到其他学科当中,成为文本或其他形式数据挖掘和分类的有力工具。
4.3.2 期刊分布
对主题模型研究论文的发文期刊进行统计,分别列举了发文量最高的10种国内外期刊(见
表5)。主题模型研究共涉及到了400余种国际期刊和300余种国内期刊,且期刊主要集中在计算机科学和图书情报领域。
5 主题模型的研究热点分布
关键词是作者对文章研究内容的直接概括,是文章主题的高度凝练。对文章关键词进行词频统计和聚类分析能够帮助研究人员梳理该领域的知识结构和研究热点,为今后开展相关研究提供参考和借鉴。
5.1 关键词词频统计
抽取主题模型研究论文的文章关键词,并通过软件和人工的方式进行关键词清洗,最终分别得到2 839个、2 312个关键词。经观察,选择频次≥9的国际发文关键词(共50个)和频次≥6的国内发文关键词(共50个)作为下一步聚类分析的基础,国际和国内发文关键词频次统计见
表6。
由
表6可知,国际主题模型的研究内容主要集中在社交网络和媒体、推荐系统、信息检索、话题监测与跟踪等方面,而国内主题模型研究则主要集中在文本分类与聚类、社交网络、协同过滤、场景分类、情感分析等方面。
5.2 关键词聚类分析
通过TDA和SATI软件生成关键词的共词矩阵,并采用Cosine系数将共词矩阵转化为相似矩阵
[15],但是由于相似矩阵中的0值过多,统计时容易造成误差,因而用1和全部相似矩阵上的数据相减,得到关键词的相异矩阵,见
表7和
表8。
将上述相异矩阵分别导入到SPSS中,采用系统聚类方法对关键词进行聚类,得到聚类树状图,再通过关键词反向回溯文献的方式,人工识别主题模型领域的研究热点,需要注意的是,由于部分关键词含义过于宽泛,对研究热点的揭示作用较弱,在进行热点识别时,笔者将不再考虑这类关键词。综合国际和国内发文的关键词聚类结果(见
图2和
图3),可将主题模型领域的研究热点归纳为以下几个方面(见
表9)。
5.3 主题模型研究热点分析
由
表9可知,国际和国内在主题模型领域所共有的研究热点包括7个,分别是:协同过滤和个性化推荐、图像分类标注和检索、情感分析和观点挖掘、信息检索、网络舆情话题探测和跟踪、社会网络分析和社交网络主题挖掘,这些研究热点不论是在国际还是国内都具有很高的关注度,是当下主题模型领域的重要研究课题。另外,国际和国内在主题模型领域的研究还存在以下差异:从研究层次上看,国内的研究多侧重于实际应用,理论方面的研究较少,在主题模型算法设计和性能优化、大规模数据挖掘方向上还有所欠缺,研究层次不够深入;从研究方法上看,除了最初的pLSI和LDA模型外,国际上还提出了作者-主题模型和分层狄利克雷过程等扩展模型,而国内在上述研究热点中未有涉及模型的扩展和优化,研究方法相对单一;从研究对象上看,国际上主题模型的研究对象包括文本、图像、语音、视频等多种类型的数据,而国内则主要是对文本和图像的研究,对语音和视频数据的研究相对较少,研究对象有待进一步扩展。
6 结语
面对信息的爆炸式增长和数据类型的多样化,常规的数理统计和数据挖掘方法难以进行有效的分析和处理,因而文本挖掘技术和主题模型方法应运而生,近年来受到了国内外学者的普遍关注,在多个领域获得广泛的应用。在这样的背景下,本文采用文献计量学中的文献外部特征统计分析和共词分析的方法,梳理和揭示了主题模型在国际和国内的研究发展态势和研究热点分布,研究结果如下:国际和国内的主题模型研究从整体上均呈现增长态势,且增速相对较快,其中,中国作为主题模型研究的后起之秀,在该领域已成为国际上主要的研究群体,对推动主题模型的发展起到了积极作用。另外,国际和国内在主题模型领域的研究既存在一致性也存在差异性,一致性主要体现在国际和国内拥有包括协同过滤和个性化推荐、图像分类标注和检索等在内的7个共同的研究热点,差异性则主要体现在国内主题模型研究层次不够深入、研究方法相对单一和研究对象有待进一步扩展3个方面。期望能够为相关研究人员提供借鉴和参考。