RAG(检索增强生成)
| 分类 | 🧠 基础概念 |
| 阅读时间 | ⏱️ 19 分钟 |
| 更新时间 | 📅 2026-06-30 |
| 条目编号 | ENC-CONCEPT-03-rag |
关键要点 ✦
- RAG 三阶段流程:检索(Retrieve)→ 增强(Augment)→ 生成(Generate)
- 向量检索 + 关键词检索(Hybrid Search)是 2026 年最主流的 RAG 方案
- RAG 能有效降低 LLM 幻觉,但检索质量(Recall)仍是最大瓶颈
- Agentic RAG 将 Agent 的推理能力与 RAG 结合,支持多轮检索和工具调用
- 2026 年 Chunk 策略已从固定长度演进为语义分块(Semantic Chunking)
详细解释
RAG(Retrieval-Augmented Generation,检索增强生成)是 AI Agent 生态中最重要的技术范式之一。它解决了 LLM 的两个核心痛点:知识时效性和事实准确性(幻觉)。
RAG 的工作流程分为三个阶段:
1. 检索(Retrieve):根据用户查询,从外部知识库(向量数据库、文档库、API)中搜索最相关的信息片段。
2. 增强(Augment):将检索到的信息与原始查询一起构造为增强的上下文。
3. 生成(Generate):LLM 基于增强后的上下文生成回答,引用检索到的具体信息。
关键技术
文档分块(Chunking):将长文档切分为适当大小的片段。2026 年主流采用语义分块(Semantic Chunking),根据文本的自然语义边界切分,而非固定长度。
向量嵌入(Embedding):将文本片段转换为高维向量,用于语义相似度检索。主流嵌入模型包括 OpenAI text-embedding-3、Cohere Embed v3。
混合检索(Hybrid Search):结合向量检索(语义相似度)和关键词检索(BM25 算法),是 2026 年最主流的方案。
重排序(Re-ranking):对检索结果进行二次排序,提升最相关文档在上下文中的位置。
Agentic RAG:下一代 RAG
传统 RAG 是单次检索-生成的线性流程。Agentic RAG 将 Agent 的推理能力融入其中:Agent 可以多轮检索(根据中间结果决定下一步)、查询重写(将模糊的用户问题转化为精确的检索查询)、工具链调用(除检索外还能调用计算器、API 等工具)。Agentic RAG 的准确率比传统 RAG 提升了约 25%。
🎯 应用场景
✅ 最佳实践
- 使用语义分块(Semantic Chunking)而非固定长度分块
- 混合检索(向量 + BM25 关键词)准确率比纯向量检索高 10-15%
- 引入重排序(Re-ranking)步骤,提升检索结果的相关度
🔮 未来展望
Agentic RAG(结合 Agent 推理的 RAG)将在 2027 年成为主流。Agent 不再被动检索,而是能根据任务上下文自主决定检索策略。