Что значит «релевантность» применительно к базам данных Scopus?
Last updated on 27 мая 2021 г.
На сайте Scopus можно сортировать список документов по дате, автору, названию места публикации, цитируемости или «релевантности».
По умолчанию результаты сортируются по дате, и первыми отображаются самые недавние публикации.
Термин «релевантность» нередко понимают неверно. Если сказать «Я нашел в Scopus очень релевантные публикации», это будет означать, что были найдены статьи, содержание которых совпадает с тем, о чем думал читатель в момент начала поиска. Релевантность для людей ― это нечто субъективное.
Что такое релевантность для поисковых систем?
С другой стороны, релевантность для поисковых систем ― это всего лишь статистические расчеты, хоть иногда и достаточно сложные. Этот расчет показывает, насколько хорошо текст найденных в результате поиска документов соответствует терминам и критериям, сформулированным в поисковом запросе.
Как рассчитывается релевантность поисковой системой в Scopus?
Нашей поисковой системой используется сложная модель релевантности, основанная на проверенных концепциях науки о поиске информации и многолетнем опыте веб-поиска, корпоративного поиска и поиска данных. Каждому включаемому запросом в результат документу присваивается рейтинг, составляемый из множества различных коэффициентов. Результат расчета зависит от самого запроса, искомых документов и того, как эти два различных фактора сбалансированы относительно друг друга.
Сортировка по рейтингу помогает оценивать и выбрать документы из большого количества найденных документов. В одних поисках первые по списку статьи могут действительно наиболее точно соответствовать теме, о которой мы думаем; в других ― мы, видя, что оказывается в начале списке, можем понять, как следует изменить критерии поиска, чтобы получить более оптимальные результаты.
При вычислении на рейтинг влияют следующие факторы:
Фактор | Расчет |
|---|---|
Количество совпадений | Чем чаще термин встречается в документе, тем с большей вероятностью он связан с темой статьи. Поэтому то, сколько раз термин встречается в документе, играет определенную роль при расчете релевантности, и данный фактор описывается подробнее в следующих разделах. |
Насколько важным является слово? | Не все слова важны в равной степени. Термин, встречающийся практически во всех документах, меньше влияет на рейтинг, чем что-то необычное. Мы используем расчеты на основе частоты встречаемости термина и обратной частоты. Scopus использует частоту документа (TF/IDF) (концепция, первоначально предложенная Карен Спарк Джоунс (Karen Spärck Jones), 1972 г.) для назначения весового коэффициента конкретному слову в любой совокупности документов ― в данном случае во всех документах Scopus. Например, слово «эксперимент» с высокой вероятностью достаточно часто встречается во всех отраслях знаний Scopus, а слово «крокодил» или «криптококковый» в любых отраслях встречается реже и сильнее влияет на рейтинг. |
Где найдено слово? | Также важным фактором является то, где термины встречаются в документе. Если слово встречается в названии, кратком описании или ключевых словах научной статьи, то скорее всего оно очень важно. Если оно упоминается только в источниках, возможно, оно не очень важно. Чтобы отразить эту неравнозначность, Scopus присваивает найденным соответствиям в различных частях документа разные весовые коэффициенты. |
Положение в документе | Чем ближе к началу текста встречается термин, тем важнее он может быть. Положение первого упоминания термина в тексте влияет на рейтинг. |
Близость | Чем ближе различные найденные термины запроса расположены друг к другу, тем выше рейтинг. |
Полнота | Если запрос состоит из нескольких слов, то документ, в котором встречаются все эти слова в одном поле, будет иметь более высокий рейтинг, чем документ, в котором искомые слова разбросаны по всему документу. |
При подробном поиске в базах данных Scopus не всегда получается применить все перечисленные выше расчеты релевантности. Следует отметить, что термины с подстановочными знаками не могут влиять на рейтинг, потому что это не один термин, а совокупность возможных терминов. Напомним, возвращаясь к приведенному выше определению, что оценить релевантность для поисковой системы некоторых списков результатов Scopus невозможно, потому что они не являются результатом поиска по тексту. Примером может служить список статей, цитирующих другую статью.
Мы скорректировали влияние описанных выше факторов на рейтинг, чтобы получить оптимальное сочетание для широкого спектра поисков и тем. Модель релевантности позволяет использовать больше влияющих факторов, чем в настоящее время используется базами данных Scopus. Например, цитируемость, популярность или дата. Однако включение этих не связанных с текстом критериев в расчет требует от нас оценки или допущений в отношении вводимых критериев поиска. По этой причине они не включаются.
Источники
Карен Спарк Джоунс (Spärck Jones, Karen) (1972) «A statistical interpretation of term specificity and its application in retrieval» (статистическая интерпретация специфичности терминов и ее применение для извлечения данных). Journal of Documentation 28 (1): 11-21. doi:10.1108/eb026526.
Did we answer your question?
Related answers
Recently viewed answers
Functionality disabled due to your cookie preferences