「相關性」在 Scopus 有什麼意義?
上次更新日期 2021年5月28日
在 Scopus 中,可以依日期、作者、來源出版品名稱、引用程度或「相關性」等來排序文獻清單。
依預設,這些結果是在日期上排序,以最近出版的優先。
「相關性」是經常造成混淆的詞彙。我們說「我在 Scopus 上找到一些相關程度很高的論文」時,所表達的意思是我們找到的論文與我們開始搜尋當時的想法相符。對於我們人類來說,相關性是一個主觀性很強的概念。
另一方面,搜尋引擎相關性僅是一種統計上的計算,但是是一種十分精細與細膩的計算。這種計算告訴我們,文獻中做為搜尋結果傳回的文字如何反映在搜尋查詢中執行的條件與規則。
我們的搜尋引擎使用精密的相關性模型,這種模型是來自「資訊擷取」科學中已獲得證實的概念,以及在網頁、資料與企業搜尋的長期經驗而得。每一份做為結果傳回的文獻都有根據各種不同因素所計算出的得分。計算的結果是根據查詢本身、所搜尋的文獻,以及兩種不同因素彼此平衡的方式。
排序此排名分數將協助我們在一組大文獻內評估與選擇。對於一些搜尋來說,列在最前的論文很有可能就是與我們所考慮的主題最相關的內容;而在其他搜尋中,我們則可以透過觀察列在最前的結果來思考應該如何對搜尋進行修改和調整以便得到更好的結果。
在計算排序評分時將考慮以下的要素:
因素 | 計算 |
|---|---|
搜尋擊中次數 | 文獻中出現的詞彙頻率越高,則表示其與文章主題的相關性越高。因此,某詞彙在文獻中出現的次數就會在計算相關性時扮演一定的角色,且將在以下章節中有所詳述。 |
某字詞的重要性為何? | 並非每個字詞的重要性都一樣。在幾乎所有文獻中都會出現的詞彙的得分將低於較不尋常的詞彙。我們是以「詞彙頻率/逆向」來進行計算。Scopus 使用「詞頻/逆向頻率」(TF/IDF) 此一演算法來得出每個特定的詞在某個文獻集合(在此情況下為 Scopus 中的所有文獻)中的權重,該理論最初是由 Karen Spärck Jones 在 1972 年提出的。例如:experiment 一字在 Scopus 所收錄的全部學科領域中都可能相當常見,而像 crocodile 或 Cryptococcus 這類詞在整個學科收錄範圍內就較為罕見,因而對於評分的影響也更高。 |
可以在哪裡找到此字詞? | 詞彙出現在文獻哪裡也很重要。如果字詞出現在科學文章的標題、摘要或關鍵字中,則其重要性可能很高。如果只有在參考文獻中提及,則可能並非很重要。為了反應此對比,Scopus 會指派不同的權重給在文獻不同章節內的擊中。 |
文獻中的位置 | 在文字中,某詞彙出現得越早,則表示其重要性可能越高。因此,第一次出現的位置會對排名有所貢獻。 |
鄰近性 | 搜尋式中不同詞語之間的距離越小,評分就越高。 |
完整性 | 在搜尋式中包含多個詞語的情況下,如果所有這些詞語都出現在一篇文獻的同一個欄位中,那麼文獻的評分就會高於詞語散佈於各處的文獻。 |
由於 Scopus 中可以使用詳細搜尋,因此並非總是可以套用上面列出的所有相關計算。特別是:包含萬用字元的詞彙對排名並無貢獻,因為此並非為單一詞彙,而是一組可能性。請記住,返回我們上述的定義時,在 Scopus 上的某些結果清單將無法依搜尋引擎相關性排名,因為它們並非來自文字搜尋。這種情況的例子就是,有引用另一份文章的一份文獻清單。
我們已經將上述各項因素的相關貢獻轉為範圍廣泛的搜尋與主題的最佳混合。相關性模型可允許提供比 Scopus 目前採用的更多貢獻因素。例如,引用程度或熱門程度或日期。然而,新增這些非文字手段到計算世界中將要求我們根據所輸入的搜尋規則做出判斷或假設。基於此原因,它們並未包含在內。
參考文獻
Spärck Jones, Karen(1972 年)「詞彙特定姓與其在擷取中的應用的統計學解釋」。文獻期刊 28 (1): 11-21. doi:10.1108/eb026526。
您的問題是否得到了解答?
相關答案
最近查看的答案
由於您的 cookie 偏好設定,此功能已停用