期刊共被引矩阵“解耦-降维”的期刊聚类算法研究

孙唯一 ,  吴登生

科学观察 ›› 2026, Vol. 21 ›› Issue (3) :76-89

PDF (5128KB)
科学观察 ›› 2026, Vol. 21 ›› Issue (3) :76-89 DOI: 10.15978/j.cnki.1673-5668.20251014
数据观察

期刊共被引矩阵“解耦-降维”的期刊聚类算法研究

作者信息 +

Research on Journal Clustering Algorithm Based on Decoupling-Dimensionality Reduction of Journal Co-Citation Matrix

Author information +
文章历史 +

摘要

[目的/意义] 期刊间的共被引用网络信息能够反映期刊间的关联关系,分析共被引信息并进行期刊聚类有助于更好地实现学科结构态势探究的目标,为科研工作者的未来研究提供参考。[方法/过程] 提出了一种期刊共被引矩阵“解耦-降维”的期刊聚类算法,即通过添加样本外共被引信息对样本共被引方阵进行解耦,然后利用t-SNE与层次聚类方法对解耦后共被引矩阵进行降维并聚类。选择了管理科学领域的重要英文期刊进行实证分析,从WoS核心合集数据库中收集2018—2022年5年间905种期刊的共被引信息作为初始数据。[结果/结论] 结果表明,期刊共被引矩阵“解耦-降维”的期刊聚类算法相较于传统共被引方阵聚类能够有效提升期刊聚类效果,并且证明额外被引网络信息能够为期刊聚类提供一定帮助。

Abstract

[Objective/Significance] The co-citation network information between journals can reflect their associative relationships. Analyzing this co-citation information for journal clustering aids in achieving a better analysis of disciplinary structure trends, providing reference value for future research by scientific researchers. [Method/Process] This paper proposes a “decoupling-dimensionality reduction” algorithm for journal clustering based on the co-citation matrix. Specifically, it decouples the sample co-citation matrix by incorporating out-of-sample co-citation information, and then utilizes t-SNE and hierarchical clustering methods to reduce the dimensionality and cluster the decoupled co-citation matrix. This paper conducts an empirical analysis on important English journals in the field of management science, collecting co-citation information from the WoS Core Collection database for 905 journals spanning the five-year period from 2018 to 2022 as initial data. [Results/Conclusions] Experimental results indicate that the “decoupling-dimensionality reduction”algorithm for journal clustering based on the co-citation matrix effectively enhances the clustering results compared to traditional co-citation matrix clustering methods, and proves that additional cited network information can provide certain assistance for journal clustering.

Graphical abstract

关键词

期刊分类 / 共被引分析 / 引文网络 / 管理学

Key words

journal classification / co-citation analysis / citation network / management

引用本文

引用格式 ▾
孙唯一, 吴登生. 期刊共被引矩阵“解耦-降维”的期刊聚类算法研究[J]. 科学观察, 2026, 21(3): 76-89 DOI:10.15978/j.cnki.1673-5668.20251014
Sun Weiyi, Wu Dengsheng. Research on Journal Clustering Algorithm Based on Decoupling-Dimensionality Reduction of Journal Co-Citation Matrix[J]. Science Focus, 2026, 21(3): 76-89 DOI:10.15978/j.cnki.1673-5668.20251014

登录浏览全文

4963

注册一个新账户 忘记密码

0 引言

随着当今科学技术的快速发展,新的研究内容与研究方向不断产生,学科间的融合创新每时每刻都在发生,清晰准确地区分学科间的类别对科研人员具有重大意义[1-5]。期刊作为学科识别的重要载体,常常作为学科领域划分的重要依据。期刊间存在丰富的关联关系,通过这些关联关系能够有效识别出学科领域划分,有助于研究学科间的知识流动与结合交互,从而分析学科的发展态势[6-9]

已有大量的工作聚焦于期刊间关联关系的计算,例如期刊的引用关系[10-15]、期刊的关键词耦合关系[16-21]、期刊的编委共现关系[22-24]、期刊作者耦合关系[25-31]、基于内容主题关联[32-36]等。其中基于期刊间的引文关系聚类一直是期刊聚类研究的重要方向之一,引文关系主要包括引用关系、被引关系、引文耦合与共被引关系等。卢超等[37]考虑引文提及次数,设计多种添加权重方法研究权重对文献耦合网络的影响研究,最终得到结论文献耦合网络蕴含了大量的节点信息,结合内容调整的引文网络有助于文献计量研究。逯万辉[38]通过引文网络进行了颠覆性信号与演化路径的研究。孙海生[39]通过对文献耦合网络进行数学计算机角度的分析,研究学科间的关联关系。Zhang等[40]在综合考虑内容关联与引文关联的基础上,提出一种更稳健的学科研究方法。

共被引分析相较于引文耦合分析,对时间更加敏感,更好地捕捉了期刊特征的动态变化以及最新学科研究方向的趋势,对期刊聚类与学科分类识别有重要作用[41-42],而引文耦合分析关注于静态数据,在文献发表后数据便不会产生额外变动;除此之外,一篇文章的引文耦合信息主要来由单一作者信息源独立生成,存在一定的主观因素与不可控性,而一篇文章的共被引信息则是在更长时间区间内的多篇文章信息共同作用下形成,在统计聚合的过程中共被引信息包含的噪声信息得到了一定的稀释与抵消。因此本文更多关注于共被引分析。

在基于共被引信息进行期刊聚类时,现有研究更多关注于样本期刊间的共被引信息分析,通过样本期刊共被引方阵间的数据进行期刊聚类分析,然而在实际情况中,样本期刊外还存在着大量可以提供期刊特征信息的期刊共被引网络数据。在理论上,利用这些样本外的期刊共被引网络数据能够补充原有样本期刊的特征信息,因此通过添加样本外信息将共被引方阵维度拓展为矩阵实现共被引矩阵的“解耦”,实现原有样本期刊耦合方阵中耦合信息的进一步拓展与延伸,从而进一步提升期刊聚类的结果,这是一个可以尝试的研究方向。

同时,期刊共被引网络数据常常存在维度高的特征,很难直接对期刊共被引网络数据进行期刊聚类分析。一个学科领域的期刊常常涉及上万篇文章,产生大量的被引信息交互,传统的聚类算法直接用于期刊聚类很难获得较好的聚类结果。一方面,高维的期刊被引网络数据具有稀疏性,期刊论文的被引来源分布于不同领域、不同方向、不同期刊的文章中,部分被引来源期刊可能只被样本期刊引用极少的次数,因此数据分布十分稀疏,不利于聚类分析;另一方面,对基于空间距离进行相似度分析的大部分传统聚类算法来说,在期刊共被引网络数据的高维稀疏空间中,各个样本点间的距离差分度不够明显,从而导致传统聚类方法效果表现很差。进行“降维”处理能够有效解决高维度与稀疏性的问题,从而有助于后续的聚类分析。

为综合利用样本外共被引信息且避免直接利用期刊共被引网络进行聚类时面临的数据高维与稀疏性问题,本文提出了期刊共被引矩阵的“解耦-降维”期刊聚类算法,基本思路是,首先依据选定的信息填充标准对原始共被引方阵的耦合信息进行“解耦”填充,然后采取先降维再聚类的思路,利用t-分布随机近邻嵌入(t-distributed stochastic neighbor embedding,t-SNE)算法[43]对解耦后的高维期刊共被引数据进行降维处理,再通过层次聚类方法对期刊进行聚类分析。利用降维聚类的方法能更好保留原始数据的结构分布信息,更加真实全面地刻画期刊之间的聚落关系[32,44]。本文通过对比期刊共被引信息和样本共被引方阵聚类结果的聚类结果,证明了“解耦-降维”期刊聚类算法的可行性,同时通过调整“解耦”参数设置,进一步探讨额外期刊共被引网络耦合信息为期刊聚类提供有效信息的可行性,从而实现聚类效果提升的目标。

1 研究设计

通常来说,2种期刊共同被另一期刊所引用,则称这2种期刊形成了共被引关系。1种期刊的研究内容相对明确,如果2种期刊的共被引关系较多,则一定程度能证明2种期刊的主题较为相似。本文提出期刊共被引矩阵“解耦-降维”的期刊聚类算法,基于期刊论文间的共被引网络信息,构建样本期刊共被引方阵并进行信息填充,获得解耦期刊共被引矩阵,利用t-SNE降维方法与层次聚类方法结合的方法进行期刊聚类,对比分析共被引网络的期刊聚类结果。具体方法流程如图1所示,首先通过数据爬取收集期刊间被引数据网络,然后对已获得的数据进行处理,构建解耦后期刊共被引矩阵与原始样本期刊共被引方阵,利用t-SNE方法对得到的高维稀疏特征矩阵进行降维处理,最后基于层次聚类方法进行聚类,调整参数并观察共被引网络信息对期刊聚类结果的影响。

共被引矩阵包含了期刊间的被引耦合关系,通过被引次数的累计可以衡量期刊间被引耦合关系强度的大小。与传统共被引分析基于共被引方阵进行处理的方法不同,“解耦-降维”的期刊聚类算法在此基础上通过信息填充对原方阵进行解耦。通过收集期刊间被引数据并进行初步预处理可以得到如表1所示的矩阵数据。

考虑到不同期刊的发文量存在较大差异,使用篇均被引量代替矩阵中被引次数来表示期刊间的关联强度,篇均被引量计算方法见式(1)和式(2)。

${x}_{\mathrm{A}\to \mathrm{C}}=\sum _{i}^{j}{x}_{i\to C}$
${y}_{\mathrm{A}\to \mathrm{C}}=\frac{{x}_{\mathrm{A}\to \mathrm{C}}}{{Q}_{\mathrm{A}}}$

式中:xA→C为样本期刊A被期刊C引用次数;i为样本期刊A中的某一篇文章;j代表所有文章;xi→C为期刊A中某篇文章i被期刊C引用次数;yA→C为篇均被引数量;QA为样本期刊A在限定时间内所有发文数量。

共被引分布矩阵存在数据高维稀疏的特征且数据量较大,其中可能存在许多噪声信息,为了保证解耦与信息填充后能够提升聚类效果,需要设定信息填充的标准。基于期刊间引用关系的特征规律,设定了以下2个填充规则,从而保证解耦后期刊共被引分布矩阵的信息的有效性。

(1)填充篇均被引量较大的期刊。期刊论文间的引用信息并不都能代表期刊间的关联程度,部分引用信息并不是作者基于内容上的关联进行引用产生的。因此,当样本期刊对某一被引来源期刊的被引数量过小时,有可能代表着无关内容的引用。本文设定阈值a,当期刊的篇均被引量大于等于该阈值时,保留该被引数据,否则删除该数据并修改为0。以图2为例,若设定a=0.1,即代表样本期刊A在限定时间段内的所有文章中至少有10%的论文被期刊C引用,此时可以认为期刊C是样本期刊A的重要被引来源。

(2)保留样本期刊数目较多的被引来源期刊。基于期刊被引矩阵进行期刊聚类的目的是利用基于被引矩阵所提供的部分样本期刊的被引耦合信息得到更好的期刊聚类结果。本文设定引用样本期刊数量阈值n,即在期刊被引矩阵中,若被引来源期刊引用样本期刊的数量大于等于该阈值,则认为该被引来源期刊数据体现了期刊间的某种关联关系,可以保留此信息进行信息填充,若某被引来源期刊引用样本期刊个数小于n,则可以认为该被引来源期刊数据无法提供有效信息。例如设定n=2,在图2中,C引用了2种样本期刊而D仅引用了1种样本期刊,因此在共被引网络矩阵中填充C相关数据而不保留D相关数据。

t-SNE 算法是一种用于数据降维与可视化的非线性降维方法,广泛应用于高维数据(例如文本图像等)的降维处理,以完成后续(例如聚类可视化等)工作。传统的线性降维算法在处理复杂结构数据表现较差,且更多关注于全局特征结构,从而忽视数据的局部特征。t-SNE算法首先计算高维空间数据间的欧氏距离并转化为概率分布,然后在低维空间构建新的概率分布,通过计算KL散度(Kullback-Leibler divergence)使得2个分布尽可能相似,从而在保留分布特征的情况下实现高维数据向低维数据的转化。

期刊被引网络数据存在高维稀疏的特征,同时被引网络的局部结构信息能够为期刊聚类提供有效信息,因此选取t-SNE算法进行期刊被引网络数据的降维。

在进行聚类分析时,本文采用了层次聚类(hierarchical clustering)方法。层次聚类方法作为一种常用无监督聚类算法,不需要事先指聚类个数且不需要目标函数,从而避免了初值选择问题与局部极小值问题。图3展示了层次聚类的基本步骤,层次聚类分为向上凝聚与向下分裂2种策略,本文使用了向上凝聚策略。

2 管理学领域的实证分析

本文收集了FMS期刊(Federation of Management Societies of China)英文期刊列表中被Web of Science核心合集(WoS核心集)完整收录的2018—2022年共905种期刊为样本,共计3665399条被引数据,46994种被引来源期刊,样本期刊数据部分统计信息如表2所示,部分数据如表3所示。FMS期刊列表涵盖了管理科学领域的各方面期刊,同时管理科学领域相关研究存在着大量细分的不同方向研究,适合观察期刊聚类结果。

在905种期刊中,总发文量最多的为Journal of Cleaner Production,共23498篇;最少的为International Journal of Entrepreneurial Behavior & Research,共19篇。不同期刊的发文量与被引量存在巨大差距,一部分与期刊的规模发行方式有关,另一部分与期刊的内容与风格有关。

t-SNE降维需要设置4个重要参数,分别是嵌入维度、困惑度、前期扩大因子与学习率。为了便于可视化降维结果,结合数据特征,将嵌入维度设置为2,困惑度设置为10,前期扩大因子设置为90.5,学习率设置为9,进行t-SNE降维,将降维处理结果作为最终的期刊论文主题分布降维特征。在对聚类结果进行评估时,选取轮廓系数作为评价指标,轮廓系数值越大,代表聚类效果越好。

2.1 聚类结果分析

以FMS提供的分类作为标准,观察被引矩阵网络期刊聚类结果,905种样本期刊在FMS分类中被分为32个类别,表4展示了样本期刊的FMS类别分布。其中:包含最多样本期刊的类别为金融,共包含64种期刊;最少的类别为战略管理,包含6种期刊。FMS类别基于专家评议,缺乏具体数据逻辑支撑,存在类别间的数量区分较大、部分期刊涉及学科交叉没有进行识别等潜在问题。

为确保聚类维度相同,方便与FMS提供的分类进行对比,在实验中,选取阈值a为0.2,引用样本期刊数量阈值n为2,聚类结果数量为32个,进行期刊被引矩阵聚类,聚类结果中最大的类别包含53种样本期刊,最小的类别包含12种期刊。图4展示期刊被引矩阵聚类结果的轮廓系数分布,类别中轮廓系数越大的点越多,代表聚类结果越合理,所有类别中大部分数据点的轮廓系数均大于0,轮廓系数分布正常,可以看出聚类结果中每个类别的聚类结果较为合理。

t-SNE降维聚类可视化结果如图5所示,其中每个点的坐标为t-SNE降维后结果,根据聚类标签进行上色得到可视化结果。可以看出,在可接受范围内,大部分期刊分布已呈现出较为明显的聚类特征,“解耦-降维”的期刊聚类算法形成的聚类标签分布也较为合理。

为进一步验证算法的合理性与有效性,图6展示了“解耦-降维”的期刊聚类形成标签与FMS提供分类的桑基图对比结果。由于专家评定类别的主观性特点,例如专家评定中 “一般管理”与其他管理类别存在一定的主观分类标准,因此“解耦-降维”的期刊聚类形成标签与FMS主观评定的类别标准存在一定差异。不难看出,在可接受的合理范围内,“解耦-降维”的期刊聚类算法能够保证在聚类结果总体合理的情况下,识别出部分期刊原有类别的不合理之处,并进行一定的修改。

为进一步体现算法修正后聚类标签的合理性,以算法聚类结果中26类为例,表5展示了期刊共被引矩阵“解耦-降维”的期刊聚类算法聚类标签与FMS列表提供的类别。可以看出,26类中的大部分期刊在FMS提供的分类标准中为信息管理,而FMS分类不为信息管理的4种期刊British Journal of Educational Technology, Decision Sciences, Journal of Management in Engineering, Online Information Review都有一定的学科交叉内容,由此可知,“解耦-降维”的期刊聚类算法能够一定程度上识别交叉学科期刊并且提供期刊分类结果的修正参考。

2.2 解耦被引矩阵与原始被引方阵聚类结果对比

在进行期刊聚类研究时,多数研究关注于样本期刊间的被引方阵信息。在实际中,除了样本期刊间的被引信息,还存在样本期刊外的被引数据信息,因此,在理论上,“解耦”后形成的被引矩阵网络相较于样本方阵包含了更多期刊信息,利用被引矩阵能够得到更好的期刊聚类结果。

对被引网络矩阵与样本方阵分别进行数据筛选后,再进行t-SNE降维处理与层次聚类。在进行数据筛选时,将篇均被引数量阈值a设置为0.2,引用样本期刊数量阈值n设置为2,最后使用轮廓系数作为聚类结果的评判标准,最终的聚类结果如图7所示。可以看出,期刊被引矩阵的聚类效果总体略优于样本方阵的聚类结果,说明样本外被引信息提供了一定的足以体现期刊特征的有效信息。

为更直观地体现解耦被引矩阵与样本方阵聚类结果的区别,选取FMS分类为农业经济的14种期刊。表6展示了14种期刊在2种数据聚类结果下的标签分类。在基于解耦被引矩阵的聚类结果中,Marine PolicyMarine Resource Economics 2种期刊与农业经济主题有所区别,而在基于样本方阵的聚类结果中,除上述2种期刊,还存在Australian Journal of Agricultural and Resource Economics和China Agricultural Economic Review 2种期刊与农业经济主题相关联却被排除在主要分类外。由此可以看出,基于解耦被引矩阵的聚类结果相较于样本方阵聚类结果更为一致合理,证明引入样本外信息的聚类方法优于传统期刊聚类方法。

2.3 篇均被引系数对期刊聚类的影响

在理论上,样本外共被引信息的引入的方式,也即“解耦”信息的填充的方式,能够对期刊聚类结构产生一定的影响。因此本文对额外信息在期刊聚类工作中的影响机理进行分析,通过调整“解耦”信息参数观察期刊聚类结果的变化,从而尝试总结共被引矩阵中额外信息对期刊聚类产生影响的定性规律。

在进行共被引矩阵构建与数据填充时,设置篇均被引系数阈值的作用是限制样本矩阵与被引来源矩阵的关联强度。篇均被引系数阈值越高,代表对样本期刊与被引来源期刊关联强度要求越高,意味着只填充了关联强度较高的数据,更多数据被删除;反之则对样本期刊与被引来源期刊关联强度要求较低,更多数据得到了保留,因此不同的篇均被引系数阈值设定会对聚类结果有一定程度的影响。

图8展示了引用样本期刊数量阈值n设置为2、聚类数量设置为2~150时,篇均被引系数阈值a分别设置为0、0.1、0.2、0.3与0.4时得到的聚类结果轮廓系数对比。可以看出,轮廓系数随着篇均被引系数阈值的升高表现出先上升再下降的趋势,在篇均被引系数阈值设定为a=0时的聚类效果差于a=0.1~0.4,代表对篇均被引数量的筛选能够获得更好的聚类结果,证明篇均被引数量限制的合理性。同时,发现将阈值a设定在0.2~0.3时的聚类效果最佳,当阈值a过小时,代表对被引来源期刊关联强度的筛选条件比较宽松,意味着大量包含噪声的数据没有得到筛选进行了填充,因此没有得到较好聚类结果;当阈值a过大时,代表对被引来源期刊关联强度的筛选条件比较严格,构建矩阵时提供的大部分额外信息都没有得到保留,因此没有得到较好的聚类结果。

2.4 引用样本期刊数量阈值对期刊聚类的影响

引用样本期刊数量阈值的作用是对共被引矩阵包含的信息进行筛选与限制,共被引矩阵在提供代表期刊特征的辅助信息时也包含了干扰聚类结果的噪声信息,当引用期刊样本数量为1时,则代表此数据不能提供期刊间的耦合信息,因此不同的阈值设定将会对聚类结果存在着一定程度的影响。

图9展示了篇均被引系数a设置为2,引用样本期刊数量阈值n设置为1、2、3、4时得到的聚类结果轮廓系数对比。可以看出,轮廓系数随着引用样本期刊数量阈值的升高表现出先上升再下降的趋势,将阈值n设定在2时,聚类效果最佳,当阈值n过小时,代表对被引数量的筛选条件比较宽松,意味着大量包含噪声的数据没有得到筛选直接进行了保留填充,因此没有得到较好聚类结果;当阈值n过大时,代表对被引数量的筛选条件比较严格,被引矩阵提供的大部分信息都没有得到保留且将原本样本间信息也得到了破坏,因此没有得到较好的聚类结果。

可以看出,期刊聚类效果与“解耦”系数有着很大的关联,聚类结果轮廓系数随着篇均被引系数或引用样本期刊数量阈值的提高呈现先上升再下降的趋势。对于篇均被引系数的影响机理,合理推测篇均被引系数代表对被引来源期刊关联强度的筛选,篇均被引系数过小时,代表噪声数据没有有效筛选就进行了“解耦”填充;篇均被引系数过大时,代表共被引矩阵所提供的大部分额外信息都没有得到保留,同时样本方阵信息受到了破坏。对于引用样本期刊数量阈值的影响机理,推测可能原因是引用样本期刊数量阈值代表对被引来源期刊处理标准的筛选,样本期刊数量阈值过小时,代表无效被引来源期刊没有适当筛选就进行了“解耦”填充;样本期刊数量阈值过大时,代表共被引矩阵所提供的大部分额外信息都没有得到保留,同时样本方阵信息因数据标准化处理失真。

篇均被引系数阈值与引用样本期刊数量阈值期刊聚类的结果都有着显著的影响,侧面印证了期刊“解耦”信息能够对期刊聚类结果起到一定的作用。合理利用样本外耦合信息能够帮助研究人员更好进行期刊聚类以及学科结构识别等工作。

3 结论与展望

学术期刊是学科知识与学科分类的重要载体,准确清晰的期刊聚类对科研人员的科研工作有着重要意义。期刊间的共被引关系是期刊关联关系的重要部分,通过期刊共被引信息能够识别期刊间的聚类集群。在样本被引方阵外还存在着大量样本外被引信息能够对期刊聚类结果产生影响。

本文采用对共被引矩阵进行“解耦-降维”的期刊聚类算法,成功实现期刊聚类并进行聚类结果分析。首先,收集样本期刊被引信息,根据设定篇均被引数量标准与引用样本期刊数量标准进行矩阵“解耦”的信息填充;然后,由于数据存在高维与稀疏的特征,同时为了尽可能保留期刊被引网络间的部分结构信息,采用了t-SNE降维方法进行数据降维;最后,采用常见无监督聚类方法层次聚类对降维结果进行聚类得到最终聚类结果。

本文选取了管理科学领域FMS英文期刊列表进行实证分析,以收录于WoS核心集中905种期刊在2018—2022年的期刊被引信息作为原始数据(共计3665399条被引数据,46994种被引来源期刊),进行聚类结果可视化并与FMS提供的分类进行对比分析,为FMS期刊分类提供了一定的参考价值,并与传统样本被引方阵的聚类结果进行对比,对“解耦-降维”的期刊聚类算法的有效性进行分析,除此之外,通过调整“解耦”参数——篇均被引数量阈值与引用样本期刊数量阈值,观察样本外信息对期刊聚类结果的影响。实验结果表明,期刊共被引矩阵“解耦-降维”的期刊聚类算法相较于传统样本方阵聚类方法能够有效提供期刊特征信息,有助于提升期刊聚类与学科识别效果;同时发现,聚类结果的轮廓系数随篇均被引系数或引用样本期刊数量阈值的提高呈现先上升再下降的趋势,推测篇均被引系数通过影响被引来源期刊关联强度干涉聚类结果,引用样本期刊数量阈值通过影响被引来源期刊处理标准干涉期刊聚类结果,得出定性结论并对作用机理进行合理的猜测。

期刊共被引矩阵“解耦-降维”的期刊聚类算法能够有效利用期刊论文的共被引信息,更加直接地反映学术期刊间的交互,迅速地反映当下学科研究领域的划分状态,并且利用了更多的数据,更能全面反映期刊间的聚落结构以及期刊的特征信息,同时“解耦”参数对期刊聚类结果的影响也能够帮助研究人员进一步理解文献计量学中不同特征元素的内在含义与深层作用机制。但对于新创立或数据量小的期刊共被引数据矩阵提供信息有限,而且对于数据筛选的准确度要求更高。在未来的研究中,可进一步拓展本算法,结合引文耦合信息进行期刊聚类,综合考量引用与被引信息,进一步探讨引用与被引信息在期刊聚类中的交互作用。同时,随着期刊聚类领域研究的发展,大量更复杂更合适的算法被应用于期刊聚类的研究[45-47],将其他更先进的方法与“解耦-降维”的期刊聚类算法进行融合改进也是本研究未来的方向之一;除此之外,不同学术研究领域呈现多元化、复杂化的趋势,越来越多的期刊关注学科领域的融合与交叉,因此期刊可能存在多标签现象[48-50],如何解决多标签期刊分类问题也是期刊聚类领域的研究热点。

参考文献

[1]

杨宁, 黄飞虎, 张志强. 科学数据集共被引网络节点影响力及传播力研究[J]. 情报理论与实践, 2023, 46(11): 45-51.

[2]

(Yang N, Huang F H, Zhang Z Q. Research on the node influence and dissemination in scientific dataset co-citation network[J]. Information Studies: Theory & Application, 2023, 46(11): 45-51.)

[3]

He D N, Wang W J, Luo X G, et al. Cluster analysis of hotspots and research trends of epirubicin-induced cardiotoxicity: a bibliometric study[J]. Frontiers in Pharmacology, 2025, 16: 1616162.

[4]

Leydesdorff L, de Moya-Anegón F, Guerrero-Bote V P. Journal maps, interactive overlays, and the measurement of interdisciplinarity on the basis of Scopus data (1996—2012)[J]. Journal of the Association for Information Science and Technology, 2015, 66(5): 1001-1016.

[5]

Shen L N, Xiong B, Li W, et al. Visualizing collaboration characteristics and topic burst on international mobile health research: bibliometric analysis[J]. JMIR Mhealth & Uhealth, 2018, 6(6):e135.

[6]

Kocak M, García-Zorita C, Marugán-Lázaro S, et al. Mapping and clustering analysis on neuroscience literature in Turkey: a bibliometric analysis from 2000 to 2017[J]. Scientometrics, 2019, 121(3): 1339-1366.

[7]

王婧, 李文兰. 期刊视角下ESI题录数据聚类研究[J]. 图书情报导刊, 2020, 5(11): 60-65.

[8]

(Wang J, Li W L. Data clustering research of ESI bibliography from the perspective of journal[J]. Journal of Library and Information Science, 2020, 5(11): 60-65.)

[9]

孟阳, 吴登生, 李建平. 基于学科布局的科研机构层次聚类模型构建与实证分析[J]. 系统科学与数学, 2019, 39(7): 1054-1067.

[10]

(Meng Y, Wu D S, Li J P. Model construction and empirical analysis of institute hierarchical clustering based on discipline layout[J]. Journal of Systems Science and Mathematical Sciences, 2019, 39(7): 1054-1067.)

[11]

陈勇跃, 徐春萌, 徐廷梅. 引文网络知识融合结构单元中的知识融合与价值传递机制研究[J]. 情报学报, 2024, 43(10): 1182-1198.

[12]

(Chen Y Y, Xu C M, Xu T M. Mechanism of knowledge fusion and value transmission in structural unit of citation-network knowledge fusion[J]. Journal of the China Society for Scientific and Technical Information, 2024, 43(10): 1182-1198.)

[13]

Batagelj V, Ferligoj A, Doreian P. Advances in network clustering and blockmodeling[M]. Hoboken: John Wiley & Sons, Ltd., 2020.

[14]

苟昌会, 徐惠珍. 投资者情绪研究演化分析: 基于CiteSpace文献共被引分析[J]. 经营与管理, 2024(8): 12-20.

[15]

(Gou C H, Xu H Z. Evolution analysis of investor sentiment research: based on CiteSpace literature co-citation analysis[J]. Management and Administration, 2024(8): 12-20.)

[16]

高楠, 周庆山. 基于共被引方法的情报学前沿领域识别与演进趋势分析[J]. 现代情报, 2024, 44(5): 3-19.

[17]

(Gao N, Zhou Q S. Research fronts identification and evolution trend analysis of information science based on co-citation method[J]. Journal of Modern Information, 2024, 44(5): 3-19.)

[18]

Kleminski R, Kazienko P, Kajdanowicz T. Analysis of direct citation, co-citation and bibliographic coupling in scientific topic identification[J]. Journal of Information Science, 2022, 48(3): 349-373.

[19]

Šubelj L, van Eck N J, Waltman L. Clustering scientific publications based on citation relations: a systematic comparison of different methods[J]. PLoS One, 2016, 11(4): e0154404.

[20]

Baccini A, Barabesi L. Interlocking editorship. A network analysis of the links between economic journals[J]. Scientometrics, 2010, 82(2): 365-389.

[21]

Leydesdorff L. Can scientific journals be classified in terms of aggregated journal-journal citation relations using the Journal Citation Reports[J]. Journal of the American Society for Information Science and Technology, 2006, 57(5): 601-613.

[22]

温芳芳, 杨倩倩, 李翔宇. 我国人文社会科学学科交叉性的测度及其演化规律研究:基于国家社科基金关键词耦合分析[J]. 现代情报, 2022, 42(3): 157-167.

[23]

(Wen F F, Yang Q Q, Li X Y. Research on the interdisciplinary measurement and evolution of Chinese social science and humanity: based on the keywords coupling analysis of the national social science fund projects[J]. Journal of Modern Information, 2022, 42(3): 157-167.)

[24]

Chen G, Hong S Q, Du C X, et al. Comparing semantic representation methods for keyword analysis in bibliometric research[J]. Journal of Informetrics, 2024, 18(3): 101529.

[25]

Lozano S, Calzada-Infante L, Adenso-Díaz B, et al. Complex network analysis of keywords co-occurrence in the recent efficiency analysis literature[J]. Scientometrics, 2019, 120(2): 609-629.

[26]

Radhakrishnan S, Erbis S, Isaacs J A, et al. Novel keyword co-occurrence network-based methods to foster systematic reviews of scientific literature[J]. PLoS One, 2017, 12(3): e0172778.

[27]

Shen L N, Xiong B, Hu J M. Research status, hotspots and trends for information behavior in China using bibliometric and co-word analysis[J]. Journal of Documentation, 2017, 73(4): 618-633.

[28]

Wang M Y, Chai L H. Three new bibliometric indicators/approaches derived from keyword analysis[J]. Scientometrics, 2018, 116(2): 721-750.

[29]

余颖, 罗奕初, 石进, . 编委对期刊研究主题的影响研究:以信息科学领域为例[J]. 现代情报, 2024, 44(4): 142-153.

[30]

(Yu Y, Luo Y C, Shi J, et al. Research on the influence of editorial board on journal research topics: taking information science field as an example[J]. Modern Information, 2024, 44(4): 142-153.)

[31]

Liu A N, Lu Y W, Gong C, et al. Bibliometric analysis of research themes and trends of the co-occurrence of autism and ADHD[J]. Neuropsychiatric Disease and Treatment, 2023, 19: 985-1002.

[32]

Nwagwu W E. Bibliographic coupling networks of global research on data literacy by documents, sources and authors[J]. Journal of Librarianship and Information Science, 2025, 57(3): 876-893.

[33]

步一, 王冰璐, 徐扬. 结合时间信息的作者耦合分析方法[J]. 情报杂志, 2017, 36(10): 148-151.

[34]

(Bu Y, Wang B L, Xu Y. Towards the improvements of author bibliographic coupling analysis combined with time information[J]. Journal of Intelligence, 2017, 36(10): 148-151.)

[35]

张汝昊, 袁军鹏. 融合引用语义和语境特征的作者引文耦合分析法[J]. 情报学报, 2022, 41(8): 796-811.

[36]

(Zhang R H, Yuan J P. Semantic-and contextual-based author bibliographic coupling analysis[J]. Journal of the China Society for Scientific and Technical Information, 2022, 41(8): 796-811.)

[37]

Bu Y, Ni S K, Huang W B. Combining multiple scholarly relationships with author cocitation analysis: a preliminary exploration on improving knowledge domain mappings[J]. Journal of Informetrics, 2017, 11(3): 810-822.

[38]

Maltseva D, Batagelj V. Citation and bibliographic coupling between authors in the field of social network analysis[J]. Journal of Data and Information Science, 2024, 9(4): 110-154.

[39]

Qiu J P, Dong K, Yu H Q. Comparative study on structure and correlation among author co-occurrence networks in bibliometrics[J]. Scientometrics, 2014, 101(2): 1345-1360.

[40]

Song Y H, Wu L J, Ma F. A study of differences between all-author bibliographic coupling analysis and all-author co-citation analysis in detecting the intellectual structure of a discipline[J]. The Journal of Academic Librarianship, 2021, 47(3): 102351.

[41]

Song Y H, Lei L X, Wu L J, et al. Studying domain structure: a comparative analysis of bibliographic coupling analysis and co-citation analysis considering all authors[J]. Online Information Review, 2023, 47(1): 123-137.

[42]

许元杰, 李建平, 吴登生. 基于期刊论文主题耦合的学科结构识别方法研究[J]. 图书情报工作, 2024, 68(21): 3-15.

[43]

(Xu Y J, Li J P, Wu D S. Identifying the discipline structure with topic coupling analysis of journal article[J]. Library and Information Service, 2024, 68(21): 3-15.)

[44]

马健兵, 徐池. 基于论文语义与引用网络的技术发展趋势分析[J]. 软件导刊, 2024, 23(11): 100-106.

[45]

(Ma J B, Xu C. Technology development trend analysis based on paper semantic and citation network[J]. Software Guide, 2024, 23(11): 100-106.)

[46]

Glenisson P, Glänzel W, Janssens F, et al. Combining full text and bibliometric information in mapping scientific disciplines[J]. Information Processing & Management, 2005, 41(6): 1548-1572.

[47]

Ahlgren P, Jarneving B. Bibliographic coupling, common abstract stems and clustering: a comparison of two document-document similarity approaches in the context of science mapping[J]. Scientometrics, 2008, 76(2): 273-290.

[48]

Saini N, Saha S, Bhattacharyya P. Automatic scientific document clustering using self-organized multi-objective differential evolution[J]. Cognitive Computation, 2019, 11(2): 271-293.

[49]

卢超, 董克. 文献耦合网络的引文内容加权研究:基于提及次数的方法[J]. 情报杂志, 2022, 41(11): 171-178.

[50]

(Lu C, Dong K. Study on adding weight to bibliographic network using citation content: a method based on citation mention[J]. Journal of Intelligence, 2022, 41(11): 171-178.)

[51]

逯万辉. 基于专利引文网络挖掘的技术研发路径识别与颠覆性创新信号探测研究[J]. 情报学报, 2024, 43(9): 1059-1069.

[52]

(Lu W H. Path identification and disruptive innovation of technology R & D based on analysis of patent citation network[J]. Journal of the China Society for Scientific and Technical Information, 2024, 43(9): 1059-1069.)

[53]

孙海生. 基于Web of Science数据库的文献耦合网络实证研究[J]. 情报杂志, 2018, 37(10): 201-207.

[54]

(Sun H S. Empirical research on bibliographic coupling networks: based on web of science database[J]. Journal of Intelligence, 2018, 37(10): 201-207.)

[55]

Zhang R H, Yuan J P. Improving bibliographic coupling and co-citation: a study evaluating the effects of various full-text citation features[J/OL]. Journal of Information Science,2025,[2025-10-14]. https://sage.cnpereading.com/doi/10.1177/01655515251322483

[56]

宋歌. 共被引分析方法迭代创新路径研究[J]. 情报学报, 2020, 39(1): 12-24.

[57]

(Song G. Research on iterative innovation path of co-citation analysis method[J]. Journal of the China Society for Scientific and Technical Information, 2020, 39(1): 12-24.)

[58]

黄福, 侯海燕, 任佩丽, . 基于共被引与文献耦合的研究前沿探测方法鄰选[J]. 情报杂志, 2018, 37(12): 13-19.

[59]

(Huang F, Hou H Y, Ren P L, et al. Selection of research front detection methods based on bibliographic coupling and co-citation[J]. Journal of Intelligence, 2018, 37(12): 13-19.)

[60]

Van Der Maaten L, Hinton G. Visualizing data using t-SNE[J]. Journal of Machine Learning Research, 2008, 9: 2579-2605.

[61]

卢小莉, 吴登生. 基于期刊作者耦合的学科结构识别研究[J]. 情报学报, 2020, 39(11): 1154-1161.

[62]

(Lu X L, Wu D S. Identifying the structure of disciplines through journal author coupling analysis[J]. Journal of the China Society for Scientific and Technical Information, 2020, 39(11): 1154-1161.)

[63]

张妍, 潘蕊, 方匡南. 基于合作者网络社区发现的学科主题分析:以国际统计学期刊为例[J]. 经济管理学刊, 2023, 2(2): 219-240.

[64]

(Zhang Y, Pan R, Fang K N. Subject topic analysis through community detection in coauthorship network: taking international statistical journals as an example[J]. Quarterly Journal of Economics and Management, 2023, 2(2): 219-240.)

[65]

逯万辉, 谭宗颖. 基于深度学习的期刊分群与科学知识结构测度方法研究[J]. 情报学报, 2020, 39(1): 38-46.

[66]

(Lu W H, Tan Z Y. The measurement of scientific knowledge structure based on journal clustering and deep learning[J]. Journal of the China Society for Scientific and Technical Information, 2020, 39(1): 38-46.)

[67]

杨欣谊, 杨建林, 叶文豪. 基于异质信息网络的领域知识簇网络特征分析[J]. 情报学报, 2025, 44(9): 1128-1143.

[68]

(Yang X Y, Yang J L, Ye W H. Network characterization of domain knowledge clusters based on heterogeneous information network[J]. Journal of the China Society for Scientific and Technical Information, 2025, 44(9): 1128-1143.)

[69]

李秀霞, 李文. 基于知识元挖掘的交叉学科学术期刊分类:以信息资源管理学期刊为例[J]. 中国科技期刊研究, 2025, 36(3): 367-374.

[70]

(Li X X, Li W. Classification of interdisciplinary academic journals based on knowledge element mining: taking information resource management journals as an example[J]. Chinese Journal of Scientific and Technical Periodicals, 2025, 36(3): 367-374.)

[71]

王方媛, 徐慧婷. 基础学科交叉特征及热点主题识别:以Web of Science大语言模型主题论文为例[J]. 文献与数据学报, 2025, 7(3): 49-63.

[72]

(Wang F Y, Xu H T. Identifi cation of interdisciplinary characteristics and hot topics of fundamental disciplines: take papers of large language models theme in web of science as an example[J]. Journal of Library and Data, 2025, 7(3): 49-63.)

[73]

秦杨, 孙连宵. 基于共现网络的学科交叉测度与机构分析:以健康信息学为例[J]. 大学图书情报学刊, 2025, 43(4): 103-109.

[74]

(Qin Y, Sun L X. Interdisciplinary measurement and institutional analysis based on co-occurrence networks: a case study of health informatics[J]. Journal of Academic Library and Information Science, 2025, 43(4): 103-109.)

PDF (5128KB)

177

访问

0

被引

详细

导航
相关文章

/