检索(Retrieval) 上下文与记忆

别名: 召回

从记忆库中找出与当前问题最相关片段的过程:把查询 embed 成向量、逐条相似度比对、阈值过滤、top-k 排序,再把命中注入当前上下文。见[第 11 章](/chapters/11-memory-retrieval/)。

它是什么

检索(Retrieval)是从记忆库中找出与当前问题最相关片段的过程。它的输入是查询(一段用户问题),输出是若干命中({ entry, score })。检索不是搜索的终点——命中要注入当前上下文、被模型读到,才算完成闭环(见第 11 章的「写入 → 检索 → 回填」时序)。

三步流水线

本章的检索是暴力检索:embed 查询 → 逐条相似度比对 → 阈值过滤 → top-k 排序。阈值与 k 直接决定注入质量:minScore 太高相关记忆全被过滤(Agent 变「失忆患者」),太低无关记忆灌进上下文(模型被噪声带偏);原则是宁可少注入,不可错注入。注入顺序也有讲究——最相关的放最前面,影响模型的注意力分配(这是上下文工程在记忆场景的具体化)。

与相邻概念的关系

检索是向量检索(检索的具体手段)、RAG(检索 + 生成的完整范式)与长期记忆(检索层的服务对象)共有的核心动作。生产系统还会在向量召回之外叠加 BM25 精确匹配与重排,把「语义相似」与「字面命中」都抓回来。

相关词条