UniResearch logo
简体中文
English
Try Now
Back to Articles

从关键词匹配到语义理解:学术搜索的技术演进与方法边界

By user September 11, 2026

摘要

学术搜索是文献调研、综述撰写、科研选题的基础环节。多数研究者将学术搜索简单理解为输入关键词获取论文,但真实科研场景下的检索难点,不在于数据库能否命中已知标题的文献,而在于海量科研记录中识别真正匹配研究问题的相关成果。同一科研概念存在多元表述,不同学科术语体系存在差异,研究者检索目标也随任务动态变化。本文系统梳理学术检索技术的演进脉络,剖析关键词检索、向量语义检索与混合检索的技术原理、适用场景与固有局限,并讨论引用网络与知识图谱作为文本之外相关性证据的价值与边界,区分不同科研任务对应的检索策略,同时讨论生成式 AI 给学术搜索带来的新变化,为科研人员合理选用检索手段、规避检索偏差提供方法论参考。

关键词:学术搜索;关键词检索;语义检索;混合检索;知识图谱;文献调研;信息检索

一、学术检索的核心矛盾:并非简单 “查找已知文献”

(一)两种不同的检索任务

如果研究者掌握论文完整标题、作者、DOI、期刊卷期等明确元数据,完成文献定位难度较低,依靠元数据检索即可精准命中目标成果。科研实践中真正的难点为主题性检索:研究者提出研究问题,检索系统需要从海量文献集合中筛选出能够回应该问题的相关论文。市面上各类文献调研工具的核心挑战,也正集中于主题检索场景。

例如查询 “极端气候与粮食安全”,数据库会返回大量包含 “气候”“粮食”“农业” 的文献,但很多文献仅字面词语重合,并未回应研究者真正关心的科学问题。同一概念会存在多样化表述,部分研究使用 “气候冲击” 替代 “极端气候”,使用 “作物产量稳定性” 替代 “粮食安全”;不同学科之间还存在完全差异化的概念体系。

(二)学术检索的两组基础矛盾

第一组矛盾:研究者使用有限检索词,而领域描述同一科学问题存在数十种表达形式。信息检索领域将该现象归纳为词汇不匹配,查询与论文研究主题相近,但字面词项不一致,极易造成相关文献漏检。

第二组矛盾:检索词字面重合,但是研究语境与研究主题完全不同。部分词汇具备多学科多义性,以 “网络” 为例,可以指代社会网络、神经网络、计算机网络、生态网络。这就意味着学术检索的核心挑战,不是判断 “文档是否包含该词汇”,而是识别该词汇在当前科研语境下对应的具体科学概念。

二、关键词检索的技术逻辑与适用边界

(一)BM25 概率相关性模型的运行原理

在语义检索快速发展的背景下,不少观点认为关键词检索已经过时。但关键词检索至今仍是学术检索体系的重要基础,代表性的 BM25 概率相关性模型,不只是统计词项出现频次,同时综合词项出现频率、词项在全文档库区分能力、文档长度等多个维度,计算查询与文献之间的相关性得分。

BM25 对词频做饱和处理,避免文档反复堆砌专业术语就获得更高相关性得分。高频通用词汇例如 “研究”“分析” 权重被压低;而罕见专业术语,区分能力会显著提升。

(二)关键词检索的适用场景与固有短板

关键词检索的优势集中在信息需求已经明确,可使用标准化专业术语表达的场景。适合检索特定化合物、基因、算法、疾病名称、实验标准、特定作者、论文标题、精确短语。这类场景下,严格字面匹配反而可以过滤大量语义近似但主题无关的干扰文献。

关键词检索的短板同样突出:当研究者自身无法精准描述研究概念,对领域术语不熟悉时,仅依靠词面匹配会出现大量漏检。其失效机制详见第三节。

在开展系统综述、证据合成这类对可复现性要求严苛的研究任务时,研究者仍需要完整保留关键词、受控词表、精确短语检索能力,规避语义泛化带来的检索不可追溯风险;这类平台通常需要完整保留检索式并支持布尔逻辑与字段限定检索,以便结果可复现。以 UniResearch 这类智能学术研究平台为例,依托完备的海量文献库,同样支持布尔逻辑与字段限定检索,方便研究者构造严谨可控的检索式。

三、词面匹配失效的三类典型问题

传统词面检索的失效,长期被归纳为三类典型情形:同义表达、多义词歧义、复杂概念组合关系失效。这三类问题在学术搜索场景中尤为突出,也是很多AI 文献解读结构化智能解读类工具需要着力解决的现实痛点。

(一)同义表达:同一概念,多元术语表述

同一科学概念,不同作者、不同子领域会使用差异化术语。例如同一科学概念,有的研究写作“药物不良反应(ADR)”,有的写作“药物不良反应”“药害事件”;再如“命名实体识别”与“专名识别”。这类术语分歧在不同子领域之间尤其明显。关键词匹配只识别字面重合,同义表述的文献会被系统遗漏,造成重要成果丢失。

(二)多义词歧义:相同词汇,不同研究语境

“模型”“压力”“结构”“记忆” 这类词汇,横跨多个完全独立的研究领域。检索系统仅仅识别词语出现,无法区分该词所处的学科语境,返回大量主题无关的文献,加重人工筛选负担。

(三)复杂组合含义:关系大于孤立词汇

大量科研查询的含义来源于多个术语之间的逻辑关系,而不是各个词语单独的含义。当检索查询代表 “某方法用于某类研究对象”,传统检索系统拆分独立词项检索,会返回分别包含各个词汇、但是不具备对应逻辑关系的无关文献。

为应对以上缺陷,Semantic Scholar 引入知识图谱嵌入,将查询与文献映射为标准化概念实体,依靠实体语义关系完成结果重排序,在传统词面检索难以处理的查询场景,检索效果得到改善。检索范式由此发生转变:从统计 “查询与文档重合词语数量”,转向判断查询与文档是否指向相近的科学概念。

四、语义检索的技术路径与内在局限

第四节将从稠密向量表示的角度,讨论另一种语义检索路径。

(一)向量表示:把文献转化为空间语义向量

向量表示(稠密表示)是主流实现思路:将整篇文献映射为高维空间当中的向量;主题相近的文献,向量在空间当中距离更近,即便字面词汇完全不重合,依然可以被识别为相关成果。

在科研文献向量学习领域,SPECTER 模型具备代表性,该模型除文本内容之外,把文献引用关系作为模型训练的重要信号,假设相互引用的论文往往存在学术关联,以此学习文献在知识体系当中的位置;同时配套 SciDocs 评测数据集,支撑引用预测、文档分类、推荐等七项文档级任务。后续研究进一步提出,同一篇文献应针对不同任务生成差异化向量表示;为此发布的 SciRepEval 多格式评测基准涵盖分类、回归、邻近、搜索四种任务格式,用于评估面向多任务的论文表示学习方法。

(二)向量语义检索的四类内在局限

向量语义检索擅长同义拓展、跨概念召回,但是它的有效性建立在“概念可以由向量几何距离近似表达”这一假设之上。这一假设在多种真实场景下并不成立,导致检索系统存在以下几类难以绕开的内在局限:

精确实体匹配能力薄弱。当查询指向特定分子编号、基因名称、算法版本、标准缩写、药物名称、研究对象等精确语义实体时,向量检索倾向于召回“主题近似”但实体完全不匹配的文献。例如检索某方法针对特定疾病的研究,语义检索会返回大量该方法应用于其他疾病的文献,造成无关结果膨胀。这种偏差源于训练目标 —— 向量化追求的是概念距离的平滑化,与精确字符串命中天然背离。

长文档编码的细节丢失。受 Transformer 上下文窗口与显存成本约束,现有向量模型通常仅以标题、摘要或局部段落作为编码输入,全文细节 —— 尤其是 Methods、Results 中的具体参数、条件限定、表格数据 —— 往往被截断或压缩。长文档与查询的语义匹配精度因此难以逼近全文阅读水平。

否定、数值比较、时序类查询处理能力弱。向量空间中的距离度量难以编码“不是”“少于”“早于”“排除 X”等逻辑关系。当查询带有否定、量级比较或时间约束时,向量检索的命中率与精确率均显著下降,往往需要借助后处理规则或二次检索来弥补。

距离可解释性差,领域迁移存在表征漂移。向量之间的距离只反映高维空间中的几何接近度,研究者无法直观理解“为什么这两篇文献被认为相似”,检索结果的可解释性显著弱于基于关键词命中或布尔逻辑的结果。模型在新领域部署时,向量分布会向训练语料的主题偏移,跨学科检索的稳定性面临挑战。

此外,“语义相似”具备多重维度,同样是不可忽视的认知更新:两篇论文可以是主题相似、方法相似、研究对象相似、引用谱系相似、适合互相推荐 —— 多种“相似”无法用同一套向量完全覆盖。语义检索给系统增加更多相关性判断证据,但不等于机器完全读懂论文全部内涵。

不少科研工具已经开始践行这一设计思路,诸如 UniResearch 在内的AI 科研助手平台,依托成熟的语义搜索能力,在基于文献向量完成概念层面语义召回的同时,仍允许研究者叠加术语、年份、期刊等字段筛选,在拓展概念检索范围的同时守住检索可控性,更适配陌生领域的探索式文献调研。

五、引用网络:文本之外的另一重学术关系

(一)引用关系承载的学术信息

科研文献区别普通网页的显著特征,是论文之间存在结构化引用网络。一篇文献的参考文献代表知识来源;多篇文献共同引用同一篇奠基文献,往往代表归属于同一研究传统;一篇论文被跨领域大量引用,说明该方法正在向其他学科扩散。向前追溯参考文献,可以看到理论方法源头;向后追踪被引文献,可以观察该研究后续修正、拓展、批判的演进脉络。

因此现代学术检索,不再只分析文献文本内容,同时挖掘文献和其他文献之间的关联关系。Semantic Scholar 将论文、作者、实体、引用关系构建异构文献图谱;OpenAlex 同样构建实体互联的学术图谱,支持围绕作品、机构、主题、引用关系开展分析。

需要明确重要边界:两篇文献共同被同一批论文引用,仅证明二者存在某种学术关联,不能直接等价为二者研究结论相同,引用网络只反映知识谱系,不能直接判断论文质量与结论正误。

(二)图谱工具在领域探索中的实践价值

对于刚进入陌生研究领域的研究者,单纯关键词检索容易困在热门关键词的局限内。借助文献关联图谱,可以从少数几篇种子文献向外拓展,识别研究分支、跨学科连接、奠基性经典成果。

研究者可以借助文献关联图谱从少量种子文献向外拓展,挖掘研究谱系、分支以及潜在跨学科连接,完成陌生领域的全景摸底,像 UniResearch 就提供文献关联图的可视化解析能力,支持知识图谱自动构建文献溯源,但需要注意,图谱输出仅可作为分析线索,所有核心判断依旧必须回归原始论文进行阅读校验。

六、混合检索:关键词检索与语义检索的互补融合

(一)单一检索模式各自存在短板

关键词检索擅长精确命中,但同义术语、跨学科概念场景下漏检风险高。

向量语义检索擅长同义拓展、跨概念召回,但在精确实体匹配、长文档细节捕获、否定与数值比较、向量可解释性、领域迁移稳定性等方面存在内在局限(详见第四节(二))。

二者不存在谁彻底取代谁,行业主流解决方案为混合检索(Hybrid Retrieval):并行执行稀疏词项检索(BM25 等)与稠密向量语义搜索,获取多路候选文献,再通过融合策略、交叉编码器完成重排序。形成“初步多路召回 – 候选集合 – 重排序 – 输出结果”的多阶段检索架构。但近年研究表明,融合策略与融合权重对最终效果影响显著 —— 传统 RRF 加权融合亦不必然优于单一最优稠密检索器,融合方式仍需按任务调优。不少一站式科研工具,也将混合检索作为核心检索架构。

(二)混合检索模式下研究者的能力要求

混合检索架构普及之后,研究者需要清楚自己当前执行的是哪一类检索任务。精确实体检索、文献综述需要可复现记录,应当优先关键词、字段检索;陌生领域探索、跨学科挖掘,更多启用语义、引用网络能力。语义拓展能力是补充手段,不能完全抛弃可控的词面检索逻辑。

七、学术检索效果的四维评价指标

普通使用者习惯于浏览检索首页结果主观感受检索系统好坏,但科研文献调研,尤其是系统综述、证据综合场景,不能依靠主观体验评判检索质量,应当同时考察召回率、精确率、排名质量、可重复性四项核心指标。

召回率:全部真实相关文献集合当中,有多大比例被检索系统找出;系统综述场景下,漏检关键文献会直接改变综述结论。

精确率:系统返回结果当中,真正和研究主题相关的文献占比;精确率低会带来巨大人工筛选负担。

排名质量:真正高价值相关文献,出现在结果列表的位置。

可重复性:检索策略可以完整记录、复现、解释,该指标对于系统综述、荟萃分析具备硬性要求。

Gusenbauer 与 Haddaway 对 28 套学术检索系统做了实证评测,发现在精确率、召回率与可重复性上各系统表现差异显著,约半数系统(及极少数开放获取数据库)可被推荐用于证据合成,而 Google Scholar 不适合作为系统综述的主要检索系统。这一结果提示:下文将说明的“召回率、精确率、排名质量、可重复性”四维框架,是在实证维度基础上、结合排名应用场景的补充,也为研究者挑选合适的文献调研工具提供评判标尺。

八、分任务适配的学术检索策略

下文四类任务,其差异本质上是对上述四项指标的优先级取舍不同 —— 系统证据检索以召回率与可重复性优先,陌生领域探索以召回率优先、精确率可容忍下降。

(一)已知目标文献:优先精确检索

已经掌握论文标题、DOI、作者、基因编号、化学物质编号、固定专业术语,优先使用关键词 + 字段精确检索,不需要过度开启语义扩展,避免引入无关干扰结果。

(二)系统证据检索:优先可控、可复现检索流程

系统综述、荟萃分析重点在于检索流程可追溯。重视数据库选择、字段限制、布尔逻辑、同义词表、受控词表、检索时间记录,核心是可以解释每一篇文献为什么被纳入候选集合。数据库检索与引用前向、后向追踪互为补充,不可单一依赖某一种手段。以 PubMed 为例,其 2017 年 6 月上线的“Best Match”排序即综合词面、词频与学习排序信号的工业级实现,证据合成场景下仍按本节原则组织检索策略。

(三)陌生领域探索:语义与引用网络优先

研究者对领域术语体系不熟悉,关键词无从下手。操作路径:先获取少量代表性种子论文,借助AI 文献解读结构化智能解读挖掘文章核心观点,依托语义检索找概念近似文献,依托引用图谱向前追溯源头、向后追踪后续衍生研究,迭代更新关键词,完成 “搜索‑学习‑再搜索” 循环。

(四)跨学科研究检索:重视语义概念关联

不同学科使用不同术语描述同类科学现象,传统关键词检索极易出现漏检。语义检索、知识图谱可以挖掘概念层面关联,借助多文献对比解读文献矩阵分析能够快速梳理跨领域研究异同。但跨学科得到的候选文献,必须人工研判:概念相似不等于研究假设、实验条件、证据标准可以直接互相迁移。

不存在普适最优的检索手段,检索工具的选择必须匹配自身的科研任务目标。

九、生成式 AI 辅助科研 给学术搜索带来的新变化

生成式 AI 改变了检索交互界面:用户不再只能输入关键词,可直接输入完整自然语言研究问题。但是底层检索的固有挑战并没有消失:文献从哪里获取、如何判定相关性、如何排序、证据如何溯源、反例文献会不会被遗漏。

生成界面只是上层包装,底层依然依赖检索系统召回文献。如果底层检索遗漏关键文献,大模型无法自行补全缺失的文献;如果召回大量弱相关文献,大模型会把错误素材组织成逻辑通顺、看似可信的回答。

因此在 AI 检索场景,证据可追溯性更为关键:研究者需要能够看到 AI 回答背后对应的原始文献来源,能够回到检索结果集合,校验是否存在重要成果被遗漏。市面上不少AI 文献综述工具,同样需要警惕底层检索不全带来的结论偏差。

十、结语

学术检索技术演进,不是关键词被彻底淘汰的单线替代过程,而是从单一相关性证据走向多重证据融合的发展过程。关键词检索记录文献表层词项,语义向量捕捉概念相似关系,引用网络反映学术谱系,混合检索将多路信号融合输出。

关键词、精确匹配、布尔检索、引用追踪,至今仍然具备不可替代的科研价值。各类技术各自只能观测文献的某一侧面,不存在一种万能检索模式适配全部科研任务。对于当代科研人员,科研效率不只是学会输入查询词,更要理解当前检索结果依靠哪一类相关性证据生成,主动管控检索策略,而不是完全把相关性判断交给黑盒检索系统。随着学术研究智能化推进,一站式科研工具正在把检索、解读、图谱分析融为一体。研究者需要根据任务目标,灵活组合关键词、语义检索、引用图谱多种手段,以此降低漏检、误检风险,支撑高质量文献调研工作。

参考文献

[1] Robertson S, Zaragoza H. The Probabilistic Relevance Framework: BM25 and Beyond [J]. Foundations and Trends in Information Retrieval, 2009, 3(4): 333-389. DOI: 10.1561/1500000019.

[2] Xiong C, Power R, Callan J. Explicit Semantic Ranking for Academic Search via Knowledge Graph Embedding [C]//Proceedings of the 26th International Conference on World Wide Web (WWW 2017). 2017: 1271-1279. DOI: 10.1145/3038912.3052558.

[3] Cohan A, Feldman S, Beltagy I, Downey D, Weld D S. SPECTER: Document-level Representation Learning using Citation-informed Transformers [C]//Proceedings of ACL 2020. 2020: 2270-2282. DOI: 10.18653/v1/2020.acl-main.207.

[4] Singh A, D’Arcy M, Cohan A, Downey D, Feldman S. SciRepEval: A Multi-Format Benchmark for Scientific Document Representations [C]//Proceedings of EMNLP 2023. 2023: 5548-5566. DOI: 10.18653/v1/2023.emnlp-main.338.

[5] Ammar W, Groeneveld D, Bhagavatula C, et al. Construction of the Literature Graph in Semantic Scholar [C]//Proceedings of NAACL-HLT 2018, Volume 3 (Industry Papers). 2018: 84-91. DOI: 10.18653/v1/N18-3011.

[6] Lee D, Hwang S W, Lee K, Choi S, Park S. On Complementarity Objectives for Hybrid Retrieval [C]//Proceedings of ACL 2023. 2023: 13357-13368. DOI: 10.18653/v1/2023.acl-long.746.

[7] Al-Joofi W, Sagheer A, Hamdoun H. A Multi-Stage Hybrid Retrieval Framework for the Scientific Literature with Cross-Encoder Re-Ranking [J]. Applied Sciences, 2026, 16(10): 4813. DOI: 10.3390/app16104813.

[8] Gusenbauer M, Haddaway N R. Which academic search systems are suitable for systematic reviews or meta-analyses? Evaluating retrieval qualities of Google Scholar, PubMed, and 26 other resources [J]. Research Synthesis Methods, 2020, 11(2): 181-217. DOI: 10.1002/jrsm.1378.

[9] Mourão E, Pimentel J F, Murta L, et al. On the performance of hybrid search strategies for systematic literature reviews in software engineering [J]. Information and Software Technology, 2020, 123: 106294. DOI: 10.1016/j.infsof.2020.106294.

[10] Fiorini N, Canese K, Starchenko G, et al. Best Match: New relevance search for PubMed [J]. PLOS Biology, 2018, 16(8): e2005343. DOI: 10.1371/journal.pbio.2005343.

[11] Priem J, Piwowar H, Orr R. OpenAlex: A fully-open index of scholarly works, authors, venues, institutions, and concepts [EB/OL]. arXiv:2205.01833, 2022.

返回顶部
微信客服
微信客服

扫码添加微信客服

微信公众号
微信公众号

扫码关注微信公众号

微信群聊
微信群聊

扫码加入微信交流群

智能客服
智能客服

7×24小时在线解答

微信客服
微信客服扫码添加专属客服
微信客服

扫码添加微信客服

微信公众号
微信公众号扫码关注获取最新动态
微信公众号

扫码关注微信公众号

微信群聊
微信群聊加入科研交流社群
微信群聊

扫码加入微信交流群

智能客服
智能客服7×24小时在线解答