知识的组织与检索

RAG 基础解决了“给定一批文本块,如何找到最相关的几个”,但更根本的问题是:这些文本块本身应该怎样组织? 简单切块会丢失知识的内在结构和跨文档关系,也无法回答统计、规则归纳和多跳推理等需要整体视野的问题。

例如,知识库里有 100 份案例,其中 90 份属于 A、10 份属于 B。Top-K 检索只能返回少量最相似案例,无法可靠回答两类案例的比例。又如,三个孤立案例分别说明退伍军人和医生符合条件、教师不符合条件;当护士来询问时,只召回“医生”案例可能让模型错误类推。两类问题都说明:相似度检索不等于归纳,知识库需要在索引阶段主动提炼统计、规则和关系。

结构化索引:从信息检索到知识建模

结构化索引会在检索前先用模型整理知识,完成归纳、抽象和关联。RAPTOR 自下而上把文本块聚类并生成多层摘要,使检索可以在不同抽象层次进行;GraphRAG 则把实体和关系组织成图,更适合多跳推理与实体消歧。

结构化并非越多越好。自然语言转成三元组时,条件、时间和例外可能丢失。因此更稳妥的做法是分层互补:核心内容保留完整自然语言,再用结构化元数据辅助导航;只有查询经常需要跨文档综合、多跳关系或实体消歧时,才值得承担构建知识图谱的成本。

文件系统范式:用目录结构组织知识

另一种更轻量的做法,是把上下文组织成目录和文件,而不是扁平的向量碎片。资源可以按层次逐步加载:先看一句话概述,再看核心摘要,最后按需读取完整原文。这与 Agent Skills 的渐进式披露遵循同一原则。

Markdown 等纯文本格式同时适合人和 Agent 阅读、编辑与版本控制。但把文档放进目录并不自动形成知识结构;文件之间仍需通过入口页、索引和链接建立关系。知识库应更像 Wikipedia,而不是一堆彼此孤立的文本文件。

知识应该如何更新

知识库不是一次建成后永久不变的静态资产。新资料进入时,需要判断它是在补充已有知识、修正旧结论,还是使旧版本失效。至少要处理三类变化:增量更新索引;让失效内容退出默认检索;在检索前按调用者权限过滤可见内容。

版本号、生效时间、失效时间和来源不是附加信息,而是判断一条知识能否继续使用的条件。新旧政策若被同时召回却没有版本标记,模型很容易生成自相矛盾的答案。

智能体化 RAG:把检索变成工具

传统 RAG 是单向数据流:查询 → 检索 → 注入 → 生成。它在模型开始推理前就决定了上下文。智能体化 RAG(Agentic RAG)则把检索变成 Agent 可以反复调用的工具,由 ReAct 循环主导整个过程:分析问题、选择查询、阅读结果、判断信息是否充分,不足时调整查询继续搜索,最后再综合回答。

两者的差异不在于是否使用向量检索,而在于谁控制检索过程。传统 RAG 像只能搜索一次就开始写报告;智能体化 RAG 更像研究者,会随着新证据不断修正下一步查找方向。

把外部资料引入上下文,也会引入间接提示注入和知识投毒风险。检索内容应明确标记为外部资料,而不是 Agent 必须服从的指令;转账、删除、发送信息等高风险动作,也不能仅凭检索到的文字自动执行。

上下文感知检索

固定大小或递归切分都会让文本块脱离原始语境。一句“该公司第二季度收入增长了 3%”,如果没有公司名称、年份和章节信息,向量表示本身就已经丢失了关键语义。

上下文感知检索(Contextual Retrieval)在索引前先为每个文本块补一段简短背景,再将背景与原始内容一起建立稀疏和稠密索引。例如补上“本段来自 ACME 公司 2025 年第二季度财报的关键业绩章节”,既增加了 BM25 可精确匹配的关键词,也让 embedding 更准确地表达文本块的含义。

它与上下文压缩中的运行期压缩不同:上下文感知检索发生在索引期,为文本块补充背景;上下文压缩发生在任务运行期,按当前目标删减会话历史。前者做加法,后者做减法。

从数据集中提取深层知识

很多有价值的知识并不写在单篇文档里,而是隐藏在大量案例的统计规律中。从这类数据学习,需要先把非结构化案例转成一致的结构化表示,再分析哪些因素真正影响结果。

以司法案例为例,可以先让模型从样本中发现并抽取动机、伤害、自首、社会影响等因素,再把多选字段转换为独立特征,通过聚类寻找案件原型并分析关键差异。得到的不是一份可直接检索的文档,而是一套由数据支持的判断结构。Agent 可以据此按重要性追问缺失信息,再检索最接近的案例提供参考。

关键在于:知识库不只是保存和召回已有结论,也可以先从数据中提炼结构化规律,再用这些规律驱动后续对话和检索。

前沿探索:多模态记忆

现实经验不只存在于文本中。图像、声音、界面状态和空间关系都可能成为未来任务所需的记忆。多模态记忆要解决的不只是“把图片转成文字”,还包括保留哪些视觉细节、如何建立跨模态索引,以及在什么情境下主动召回这些信息。

这一方向仍处于早期阶段,但它延续了本章的同一条主线:记忆与知识的价值,不在于保存得多,而在于能否以合适的结构,在需要时被可靠找到和使用。

相关阅读

  • RAG 基础——文档分块、稠密与稀疏嵌入、混合检索。
  • 用户记忆系统——跨会话记忆的层次、格式和整理机制。
  • 上下文压缩——运行期的信息提炼与检索精度问题。

参考来源

这页有帮助吗?