2024–2026,RAG 的玩法换了一代人
入门篇我们搭好了一条标准流水线: 解析 → 分块 → 改写 → 混合检索 → 重排 → 生成。
那条流水线能解决八成问题。但剩下两成—— 多跳推理、全局总结、该不该搜的判断——它无能为力。
于是 2024 年以来,RAG 迎来了一波大换代: 知识图谱进场、智能体接管流水线、强化学习直接训练”检索本能”。
这篇进阶篇,就讲这些新故事。依然不需要代码,看思路就够。
一、先看清:RAG 演进四部曲
用一张时间线定位所有新概念:
第一代 · Naive RAG(朴素版)。 就是入门篇搭的那条:切块入库、向量检索、拼给模型。 够用,但检索是”一锤子买卖”——搜一次就定生死。
第二代 · Advanced RAG(优化版)。 在流水线每个环节做精装修:查询改写、混合检索、重排、上下文工程。 效果上限提高,但骨架没变,还是固定流程。
第三代 · Modular RAG(模块化)。 流水线拆成乐高积木:检索可以循环、可以嵌套、可以按需组合。 RAG 从”一条线”变成”一堆零件”,为下一代埋好伏笔。
第四代 · Agentic RAG(智能体版),当下进行时。 把”要不要检索、检索什么、结果可不可信”这些决策交给 LLM 自己判断。 流水线升级成了会思考的员工。
本篇的主角,大多属于第三代和第四代。先从检索自身的进化讲起。
二、层次化检索:给知识库画张地图
入门篇讲过一个死结:小块搜得准但看不全,大块读得全但搜不准。 父子分块解了一半,另一解法是 RAPTOR——给知识库建一座摘要金字塔。
做法分三步:
- 把所有块用聚类算法归类(讲同一话题的块凑一堆)
- 让 LLM 给每一堆写一份摘要
- 对摘要再聚类、再摘要,层层向上,直到塔尖
于是知识库有了两个入口:
细节问题 → 塔底搜原文块 宏观问题 → 塔顶搜摘要
妙在哪?普通 RAG 只能回答”碎片问题”, 而”这份报告的整体结论是什么”这类总结型问题, 靠几块碎片永远拼不出答案——但一份高层摘要直接命中。
一句话:RAPTOR 让知识库同时保有细节和全局观。
三、边生成边检索:写到一半去查字典
传统流程是”先搜后答”:检索一次,拿齐资料,一口气生成。 但有些问题没法一次搜齐——
“张三现在在哪家公司?“(需要先查张三是谁,再查那家公司的近况)
每答一步都依赖上一步的新信息。两个代表做法:
FLARE:让模型一边生成一边自查—— 预测的下一句如果模型自己都没把握(置信度低), 就拿这句话当新查询,主动触发一轮检索,查完再继续写。 像写作时遇到不确定的地方,停下来翻字典。
DRAGIN:不逐句看置信度,而是让模型自己判断—— “此刻我需不需要查资料?要查的话,用什么关键词?” 把检索时机和检索词都交给模型动态决定。
共同点:检索从”开场一次”变成”全程随叫随到”。 这已经隐隐有了智能体的味道——下一章先讲一个更根本的争论。
四、长上下文 vs RAG:谁杀死谁
这两年模型上下文从 4K 冲到上百万 token, “RAG 已死,直接把整个知识库塞进上下文”的声音不断。真相是:各有死穴。
长上下文的死穴: 贵(按 token 计费,全量塞入成本爆炸)、慢、 以及著名的 lost in the middle——塞得越多,中间内容越被忽略。 大海捞针测试满分,不代表多文档推理满分。
RAG 的死穴: 检索是漏斗,漏斗就有漏网之鱼。资料没被召回,模型神仙难救。
2024 年的一个漂亮解法是 Self-Route(自我路由):
先把问题 + 少量检索资料给模型,让它自己判断: “就这些资料够不够答?” 够 → 直接用检索模式回答(便宜) 不够 → 把整份文档全部塞进上下文(贵但保底)
实测结论很务实:混合路由的效果逼近全量长上下文,成本只有它的零头。
记一句公道话:长上下文和 RAG 不是替代关系,是分工关系。 而且别忘了还有 Prompt Caching——固定资料的前缀缓存打骨折, 天平还在动态倾斜,这场争论没有终局。
五、向量检索的两大盲区
无论检索做得多精,有两类问题向量天生搞不定。这是本篇最重要的”为什么”。
盲区一:多跳推理。 “A 公司创始人投资的那家公司,主营什么?” 答案不在任何一块文档里—— 它藏在”创始人是谁”(块 1)和”那家公司做什么”(块 37)的连接里。 向量只会找”长得像问题的块”,它不知道这两块需要被串起来。
盲区二:全局性总结。 “这五百份客服投诉的共同主题是什么?” 答案需要读完所有文档再归纳, 而向量检索永远只能捞回”和问题最像的几块”—— 问题本身是抽象的,哪块都”不像”它。
一句话诊断:
向量检索是”近视眼”:看得清局部,看不清关系,更看不全全局。
谁补上这两个盲区?知识图谱。下一章,主角登场。
六、GraphRAG:微软的知识网络
微软 2024 年开源的 GraphRAG,是目前最出圈的图谱方案。
第一步:从文档里抽知识图谱。 让 LLM 通读所有文档,抽出”实体”和”关系”: (张三)—[创办]→(A 公司)—[供货]→(B 公司)…… 原文里散落两段的话,在图上变成了一条通路。 多跳问题 = 图上找路径,盲区一解决。
第二步:社区检测(这是神来之笔)。 用图算法把关系紧密的实体自动聚成一个个”社区”—— 好比把整张关系网自动切成一个个”圈子”(法务圈、供应链圈), 再让 LLM 给每个圈子写一段圈层摘要。
第三步:两种搜索模式。
- 局部搜索:从问题实体出发,沿关系走,拿相关子图回答。治具体问题
- 全局搜索:把所有圈层摘要分发下去做 map-reduce 式归纳。治总结型问题,盲区二解决
代价也要说清:构建图谱要让 LLM 通读全部文档,索引成本可达普通 RAG 的十倍以上,文档更新后图谱还得重算。贵,但有些问题只有它能答。
于是 naturally 有了下一个问题:能不能便宜一点?
七、轻量图谱:LightRAG 与 HippoRAG
GraphRAG 太贵,2024 年下半年出现了两个有名的”平替”。
LightRAG:双层索引,一次构建。 GraphRAG 的全局搜索要为每一层社区反复生成摘要; LightRAG 简化为两层——实体层 + 关系层, 构建只跑一遍,查询时”局部模式 / 全局模式”按问题切换。 效果保住大半,成本砍到几分之一。
HippoRAG:模仿海马体的记忆方式。 灵感来自人脑海马体:新知识不是孤立存储,而是挂到已有知识网络上。 它用经典的图算法(个性化 PageRank)模拟”联想”: 检索命中一个实体后,像涟漪一样沿着关系扩散开, 把”相关联的邻居”一起带出来。多跳问题在联想中自然被串起。
怎么选?给个务实结论:
不缺钱、要深度全局总结 → GraphRAG 要图谱效果但要控成本 → LightRAG 看重多跳联想、资料更新频繁 → HippoAG / HippoRAG
图谱讲完了。接下来是本篇真正的主题词:Agentic。
八、Agentic 三基石:会反思的 RAG
前面所有架构有个共同点:流程是人定死的。而 Agentic RAG 的核心转变是—— 把三个关键决策交还给模型自己:
基石一 · Self-RAG(自我反思):何时检索、可信与否。 模型边生成边给自己打”反思标签”: 这个问题需不需要查资料?(不总需要——闲聊就别检索) 检索结果可靠吗?我的回答有依据吗?把”自省”练进模型行为里。
基石二 · CRAG(检索纠错):先验货,再使用。 检索回来的资料先过一道”评估器”: 质量高 → 直接用; 质量差 → 判定检索失败,触发补救——改写查询重搜、或转用网页搜索。 不再”搜到什么认什么”。
基石三 · Adaptive RAG(按题路由):看菜下饭。 问题进来先判复杂度: 简单事实题 → 一次检索搞定; 多跳复杂题 → 拆解 + 循环检索; 闲聊 → 压根不检索。 不同的问题花不同的力气,效果与成本双优。
三者组合的意象:一个知道自己几斤几两、会自查作业的员工。 再进一步,就是把这个员工放出去自由干活——
九、检索智能体与 Deep Research
Agentic 的完全体:把 LLM 变成一个会用搜索引擎的智能体。
骨架是经典的 ReAct 循环:
思考(我缺什么信息)→ 行动(发起一次检索)→ 观察(读返回结果)→ 再思考(够了吗?不够继续搜)→ …… → 输出答案
检索不再是流程图上的固定节点,而是智能体手里的工具, 想用就用、想用几次用几次。
2025 年爆火的 Deep Research(OpenAI、Google 都发布了同名能力)就是这套循环的豪华版:
- 接到任务,先拆解成研究计划
- 多轮检索,交叉验证多个来源
- 发现矛盾就再搜,直到证据链完整
- 汇总成一份带引用的结构化报告
像什么?一个不知疲倦的实习研究员。 而它背后的检索决策能力从哪来?下一章是当前最前沿的答案。
十、用强化学习训练”检索本能”
前面的智能体靠提示词驱动:“请你先思考再搜索……” 提示词是嘱咐,模型未必真听话。2025 年的 新做法是:直接训练它。
代表工作 Search-R1,思路一句话讲清:
把”搜索”变成环境里的一个动作, 让模型在多轮对话中自己决定何时搜、搜什么、怎么用结果—— 只有最终答案正确才给奖励,用强化学习逼出最优检索策略。
训练出来的模型展现出了惊人的行为: 该搜时搜、搜到一半发现偏了会换关键词、信息够了主动停手。 这些没人显式教过——是奖励信号下自己长出来的策略。
同一路线的还有 R1-Searcher、ReSearch 等,方法上互相卷得飞起。 意义在于:检索能力从”外挂的提示词”变成了”模型的本能”。
这是 RAG 叙事的根本转折:从”给模型搭流水线”到”训练模型自己会用工具”。
十一、多模态 RAG:不解析,直接看
入门篇说过,PDF 解析是重灾区。2024 年出现了一个釜底抽薪的思路: 别解析了,把页面当图片,直接搜图。
代表工作 ColPali,两步走:
- 把每一页文档截图,用视觉模型把整页变成向量(保留版面、表格、图示的全部信息)
- 检索时,问题向量和页面向量做”后交互”精细匹配
好处立竿见影:版面零损失(表格就是表格,不再是散装文字)、 管道大幅缩短(跳过解析和分块)。 代价:页面向量很占存储,且生成侧仍需把页面交给多模态模型去读。
适用判断很简单:
版面复杂、表格图表多的资料(财报、画册、PPT、扫描件)→ ColPali 真香 纯文本文档 → 传统管道更省
顺带把”后交互”补上:入门篇埋的 ColBERT 线索—— 双塔各自压缩后比对(快而糙),交叉编码器逐对精算(准而慢), 后交互取中间:文档先切成多个向量保留细节,查询来了再逐词细比。 快慢之间,还有一档。
十二、表格问答:Text-to-SQL
“上季度华东区销售额多少?“——这种问题,答案在数据库里,不在文档里。 文档式 RAG 对它无能为力,需要另一条路:Text-to-SQL。
思路是个翻译官:
用户中文问题 → LLM 翻译成 SQL → 数据库执行 → 拿到结果 → LLM 组织成人话
关键依赖:模型必须知道表结构(有哪些表、字段什么含义), 所以要把库表结构(schema)作为上下文喂给它。 库表太多塞不下?那就先检索”和问题相关的表结构”再翻译—— 这就是 TableRAG 一类方案的思路:RAG 的思想反过来服务 SQL。
再进一步,文档与表格可以合流: 一个系统里,文字问题走向量检索,数字问题走 SQL, 由路由判断谁接手。“知识”从来不只是文本一种形态。
十三、记忆系统:RAG 的近亲
聊天机器人聊了三小时,转头忘了你是谁——因为它没有记忆。 2025 年记忆成了独立赛道,但它和 RAG 血缘极近,一句话区分:
RAG 检索知识库(静态资料),记忆检索对话历史(动态经历)。
Mem0:轻量记忆层。 对话结束后,让 LLM 从中提炼”值得记的事实”(用户偏好、关键决定), 存成向量,下次对话前检索注入。 核心思想:记忆不是存聊天记录,是存提炼后的事实卡片。
Zep / Graphiti:时序知识图谱记忆。 把记忆组织成图谱,而且每条边带时间戳—— “用户 3 月喜欢 A,6 月改喜欢 B”。 检索时能感知新旧,回答”我现在该推荐什么”就用最新的偏好。 记忆有了时间轴,就有了”遗忘”和”更新”的能力。
记忆与 RAG 正在融合:知识库答事实,记忆层管个性化, 同一个检索框架,两种数据源。
十四、持续优化:把旋钮交给算法
系统跑起来只是开始,怎么越调越好?三个新工具:
DSPy:提示词变成可优化参数。 传统调 prompt 全靠手感,改一个词跑一遍评测。 DSPy 的主张:把提示词写成程序里的参数, 你只声明”输入什么、要什么输出”,框架自动搜索最优提示组合。 玄学变工程。
RAFT:开卷考试特训。 Retrieval-Augmented Fine-Tuning—— 用”带干扰项的开卷题”微调模型:训练材料里故意混入无关文档, 逼模型学会”从一堆资料里分辨哪个真有用”。 正好治入门篇诊断过的”资料对答案错”病。
Embedding / 重排器微调: 用自己领域的数据(问句-正确块的对子)微调检索模型, 让”意思相近”贴合你的业务语义。领域词汇多时收益显著。
方法论依旧朴素:一次只动一个变量,评测集上见真章。
十五、终局思考:知识到底放在哪
最后退后一步,看这场游戏的大棋盘。 所有 RAG 争议的本质是同一个问题:
知识应该放在哪?模型脑子里、检索库里、还是上下文里?
三条路线正在同时推进:
路线一:外挂(RAG 的立场)。 知识放库,随取随用。优点实时可溯源,缺点受检索质量天花板限制。
路线二:内化(训练的立场)。 把知识直接练进参数,或者像 Search-R1 那样把”检索能力”练进本能。 知识在脑子里,用起来零延迟——但更新一次就是一次训练。
路线三:上下文(长文本的立场)。 借助百万上下文 + 前缀缓存,知识现场搬运。 最灵活,也最贵。
务实的答案从来不是三选一: 高频核心知识内化、长尾知识外挂、任务资料进上下文—— 分层放置,按需路由。
再加上 MCP 这类协议把”知识源接入”标准化(任何模型即插即用任何知识库), 未来的图景大概是:模型带着检索本能,通过标准接口,在分层知识体系里自主取用。
到那时,RAG 作为一个”系统”可能会消失—— 但”检索增强”作为一种能力,已经长进了 AI 的骨子里。
写在最后
回看这十几章的新故事,其实只讲了两个方向:
检索侧的进化:从一条流水线,到摘要金字塔、知识图谱、 边生成边检索——把”找资料”这件事做得越来越深
决策侧的革命:从人定流程,到 Self-RAG 反思、CRAG 纠错、 智能体循环、强化学习内化——把”怎么找”的决定权交还给模型
入门篇教你搭好流水线,这篇告诉你流水线正在被重构成什么形状。
技术会更迭,论文会过期,但有一条判断标准始终有效:
回到问题本身:用户问的是什么?答案存在哪?怎么让模型在作答那一刻恰好握着它?
想明白这三问,任何新架构都只是这道题的新解法。
📖 上一篇:《RAG 入门 · 一篇搞懂》