Scopus 中“相关度”是什么意思?
上次更新时间 2021年5月28日
在 Scopus 中,您可以按日期、作者、来源出版物名称、引用情况或相关度来对文献列表进行排序。
在默认情况下结果是按照日期排序的,最新发表的内容排在最前。
“相关度”这个词语经常会造成人们的误解。我们说“我在 Scopus 上找到一些相关程度很高的论文”时,所表达的意思是我们找到的论文与我们开始搜索时的想法相符。对于我们人类来说,相关度是一个主观性很强的概念。
另一方面,搜索引擎中的相关度则不同,它只不过是一种统计学上的计算结果(当然计算过程非常复杂精密)。该过程所得出的结果表示的是文献结果中的文字与搜索式中的词语和所设置标准的契合程度。
我们的搜索引擎使用一个精密的模型来决定相关性,这个模型是根据在信息检索学领域经过实证的理论,以及长年处理网络、数据以及企业检索所积累的经验建立起来的。搜索引擎将根据一系列不同的要素为搜索式找到的每一条文献给出一个评分。计算的结果取决于搜索式本身、所搜索的文献以及这两个不同要素之间的相互平衡与制约。
按这个评分排序将有助于我们在大量的文献中进行评估和挑选。对于一些搜索来说,列在最前的论文很有可能就是与我们想要的主题最为相关的内容;而在其他搜索中,我们则可以通过观察排在最前端的结果来思考应当怎样对搜索进行修改和调整,才能得到更好的结果。
在计算排序评分时将考虑以下要素:
因素 | 计算 |
|---|---|
点击数 | 一个词语在文章中出现的频率越高,它与该论文主题的相关度也就越强。因此一个词语在轮次中出现的次数在相关度计算中具有重要作用,这部分内容将在下节详细说明。 |
词语的意义是否重大? | 不同词语的重要性也互不相同。几乎所有文献都会包含的词语对于评分的影响要小于不常见的词语。我们根据词频/逆向来计算。Scopus 使用文件频率 (TF/IDF) 这一算法来得出每个特定的词在某个文献集合(在此情况下为 Scopus 中的所有文献)中的权重,该理论最初是由 Karen Spärck Jones 在 1972 年提出的。例如:词语 "experiment" 在 Scopus 所收录的全部学科领域中都可能相当常见,而像 "crocodile" 或 "Cryptococcus" 这样的词在整个学科收录范围内就较为稀少,因而对于评分的影响也更高。 |
词语出现的位置 | 词语在文献中的位置也非常重要。如果词语出现在科研论文的标题、摘要或关键字部分,那么它就可能非常重要。如果它只在参考文献中被提及,则可能不是很重要。为了反映这种差异,Scopus 给文献不同位置出现的词语赋予了不同的权重。 |
文献中的位置 | 出现位置较早的词语可能具有较高的重要性。因此词语首次出现的位置会影响到评分。 |
接近程度 | 搜索结果中不同词语之间的距离越小,评分就越高。 |
完全性 | 在搜索式中包含多个词语的情况下,如果所有这些词语都出现在一篇文献的同一个字段中,那么该文献的评分就会高于词语散布于各处的文献。 |
Scopus 提供的搜索功能非常详尽,因此上述的相关度计算并不一定都适用。比如带有通配符的词语就不会影响评分(因为它代表的不是一个词,而是一组可能的词)。根据之前的定义,Scopus 中的一些结果列表也无法按照搜索引擎的相关度排序,这是因为它们并不是由文本搜索产生的。例如论文的施引论文列表就不行。
上述因素的相对影响力经过了我们的调节,能够在各种搜索和主题上发挥最佳的效用。该相关度模型中还允许使用其他的影响因素。例如引用情况、流行程度或者日期。但是这些衡量尺度所依赖的并不是文本,计算这些因素就意味着我们需要对输入的搜索条件作出判断或假定。因此我们并没有将其包含在内。
参考文献
Spärck Jones, Karen (1972) "A statistical interpretation of term specificity and its application in retrieval"。Journal of Documentation 28 (1): 11-21. doi:10.1108/eb026526。
您的问题是否得到了解答?
相关解答
最近查看过的答案
由于您的 Cookie 偏好设置,该功能已禁用