📖 Agent 百科
AI Agent 领域最权威的知识库 — 从基础概念到前沿技术
每个条目都经过严谨校对,帮你建立完整的 Agent 知识体系
AI Agent(人工智能体)
AI Agent(人工智能体)是能够自主感知环境、制定计划并使用工具完成目标的智能系统,是 2026 年 AI 产业最核心的应用形态。
LLM(大语言模型)
大语言模型(LLM)是以 Transformer 架构为核心的深度学习模型,经过海量文本训练,具备语言理解、生成和推理能力,是 AI Agent 的智能核心。
RAG(检索增强生成)
RAG(检索增强生成)通过将外部知识检索与 LLM 生成相结合,显著提升了 AI Agent 回答的准确性和时效性,是减少幻觉的标准化方案。
Function Calling(函数调用)
Function Calling 使 LLM 能够通过结构化输出来调用外部函数和 API,是 AI Agent 与现实世界交互的核心机制。
Tool Use(工具使用)
Tool Use 使 AI Agent 能突破纯语言模型的局限,调用外部工具执行真实操作,是 Agent 区别于聊天机器人的核心能力。
Prompt Engineering(提示工程)
Prompt Engineering 是设计和优化 AI 提示词的系统工程,在 Agent 场景中直接决定了 Agent 的行为质量和安全性。
Chain of Thought(思维链)
Chain of Thought 通过引导模型显式展示推理步骤来提升复杂任务的解决能力,是现代 AI Agent 推理能力的基础技术之一。
Vibe Coding(氛围编程)
Vibe Coding 是用自然语言描述编程需求、由 AI 自动生成代码的新型编程范式,正在重新定义软件开发者的角色和流程。
MCP(Model Context Protocol)
MCP 是 AI Agent 与外部工具之间的标准化通信协议,被誉为「AI 世界的 USB 接口」,是 2026 年 Agent 生态最重要的基础协议。
A2A(Agent-to-Agent Protocol)
A2A 是 Google 推出的 Agent 间通信开放协议,使不同厂商的 AI Agent 能够相互发现、协商和协作,与 MCP 构成 Agent 通信协议栈的上下两层。
Agent Card(智能体能力卡)
Agent Card 是智能体的标准化能力声明文档,使 Agent 能够被其他 Agent 和系统自动发现和调用。
SSE(Server-Sent Events)
SSE 是一种轻量级服务器推送技术,在 AI Agent 生态中广泛用于实时状态传输和流式结果返回。
Single Agent(单智能体架构)
单智能体架构是最基础的 Agent 设计模式,一个 Agent 独立完成所有工作,适合简单任务和个人使用场景。
Multi-Agent System(多智能体系统)
多智能体系统通过多个专业化 Agent 的协作实现复杂任务,是 2026 年企业级 Agent 部署的主流架构选择。
Agent Swarm(智能体群)
Agent Swarm 是去中心化的多智能体群体架构,通过 Agent 间的局部交互涌现出全局智能行为,适用于复杂协作场景。
Agentic RAG(智能体增强检索)
Agentic RAG 将 Agent 的自主决策能力融入检索增强生成流程,支持多轮检索和自适应策略,是企业级知识问答场景的主流架构。
ReAct Pattern(推理-行动模式)
ReAct 模式将推理和行动紧密交织,Agent 每步先思考再行动,是现代 AI Agent 最基础的工作循环模式。
Prompt Injection(提示注入攻击)
Prompt Injection 是 AI Agent 领域最严重的安全威胁,攻击者通过构造特殊输入劫持模型行为,属于 OWASP Top 10 中风险等级最高的问题。
OWASP Top 10 for LLM Applications
OWASP Top 10 for LLM Applications 是 LLM 和 Agent 安全领域的权威风险排行榜,2026 年版本新增了 Agent 特有的安全风险分类。
Agent Memory Poisoning(记忆投毒)
Agent Memory Poisoning 是 2026 年最具破坏力的 Agent 安全威胁之一,攻击者通过污染 Agent 的记忆系统实现隐蔽且持久的恶意操控。
Tool Chain Attack(工具链攻击)
Tool Chain Attack 利用 Agent 对外部工具的信任,通过供应链投毒或中间人攻击来间接操控 Agent 行为,是 2026 年最危险的 Agent 攻击面之一。
SWE-bench(软件工程基准)
SWE-bench 是评估 AI 编程 Agent 能力的权威基准测试,通过真实 GitHub Issue 修复任务来量化 Agent 的编码能力。
GAIA(通用AI助手基准)
GAIA 是 Meta 设计的通用 AI 助手评测基准,通过需多步推理和工具使用的真实世界问题来衡量 AI Agent 的综合能力。
HumanEval(代码生成基准)
HumanEval 是 OpenAI 发布的函数级代码生成基准,曾是最主流的 AI 编程能力评测标准,但 2026 年已接近饱和。
LangChain(语言链框架)
LangChain 是最广泛使用的 LLM 应用开发框架,提供从模型调用到 Agent 编排的全栈工具链。
CrewAI(多智能体协作框架)
CrewAI 是专为多智能体团队协作设计的 Python 框架,通过角色化的 Agent 和任务分配机制实现高效的 Agent 团队协作。
AutoGPT(自主GPT)
AutoGPT 是首个开源自主 AI Agent 项目,开创了「LLM 自主设定和执行子目标」的范式,对后续 Agent 产品产生了深远影响。
LangGraph(Agent 编排引擎)
LangGraph 是基于图结构的 Agent 编排框架,通过状态图建模 Agent 的动态决策流程,是构建生产级复杂 Agent 的核心工具。
Agent Store(智能体商店)
Agent Store 是 AI Agent 的分发和交易平台,类似 App Store 但面向 AI Agent,是 2026 年 AI 经济的重要基础设施。
MCP Marketplace(MCP 市场)
MCP Marketplace 是 MCP 协议生态中工具 Server 的分发平台,开发者可发布工具、用户可扩展 Agent 能力,是 Agent 生态的关键基础设施。
Agentic AI(智能体 AI)
Agentic AI 代表 AI 从被动工具到主动代理的根本性范式转变,是 2026 年 AI 产业最核心的趋势,正在重新定义人与 AI 的协作方式。
Embedding(嵌入与向量化)
Embedding 技术将非结构化数据转换为语义向量,是 RAG 系统和 Agent 记忆系统的核心基础设施。
Multimodal AI(多模态 AI)
多模态 AI 使 Agent 能理解和处理图像、音频、视频等多种输入,大幅扩展了 Agent 的感知范围和应用场景。
Reasoning Model(推理模型)
推理模型通过延长内部思考时间来提升复杂任务的解决能力,是 2026 年 AI Agent 处理高难度问题的核心引擎。
Fine-Tuning(微调)
微调是在预训练模型基础上进行额外训练以定制化 Agent 行为的技术,是深度优化 Agent 领域能力的核心手段。
Knowledge Distillation(知识蒸馏)
知识蒸馏通过大型模型「教」小型模型的方式来降低 AI Agent 的运行成本,是 2026 年 Agent 经济性的关键技术之一。
Token Economics(Token 经济学)
Token 经济学研究 AI Agent 的运行成本,2026 年推理成本的 128 倍下降是 Agent 产业化的经济性拐点。
Streamable HTTP(流式 HTTP)
Streamable HTTP 是 MCP 协议的新一代远程传输方式,基于标准 HTTP 协议实现 Agent 与工具 Server 之间的高效通信。
OpenAI API(OpenAI 接口协议)
OpenAI API 是调用 GPT 系列模型构建 AI Agent 的标准接口,其设计理念和接口规范已成为整个 AI 行业的参考标准。
MCP Security(MCP 安全机制)
MCP Security 是 MCP 协议的安全机制集合,涵盖认证、授权、审计和数据保护,是 MCP 生态从开放走向可靠的关键。
Plan-and-Execute(规划-执行架构)
Plan-and-Execute 先制定详细计划再逐步执行的 Agent 架构模式,适合需要人类审批和长时间运行的企业级复杂任务。
Supervisor Pattern(监督者模式)
Supervisor Pattern 通过一个监督者 Agent 集中协调多个专业子 Agent 的协作,是 2026 年最主流的可生产化多智能体架构。
Reflection Pattern(反思模式)
Reflection Pattern 让 Agent 对自身输出进行自我审查和改进,是提升 AI Agent 输出质量和可靠性的关键架构模式。
Agent Data Privacy(Agent 数据隐私)
Agent 数据隐私涉及 Agent 收集、处理和保护用户数据的全生命周期,是 2026 年企业部署 Agent 的首要合规考量。
Agent Access Control(Agent 访问控制)
Agent 访问控制通过最小权限原则确保 Agent 只能访问完成任务所必需的资源,是 Agent 安全防护的第一道防线。
Agent Supply Chain Security(Agent 供应链安全)
Agent 供应链安全管理 Agent 生态中第三方组件(LLM、MCP Server、框架)的风险,是 2026 年 Agent 安全最复杂的新领域。
MMLU(大规模多任务语言理解)
MMLU 是覆盖 57 个学科的大规模知识评测基准,曾是 LLM 最权威的评测标准,2026 年已接近饱和。
LiveBench(实时基准评测)
LiveBench 通过每月更新的动态题库解决数据污染问题,是 2026 年最受认可的实时 LLM 能力评测基准。
Chatbot Arena(聊天机器人竞技场)
Chatbot Arena 通过人类匿名对战投票生成 ELO 评分,是最能反映真实用户体验的 AI 能力评测平台。
OpenAI Agents SDK(OpenAI 智能体 SDK)
OpenAI Agents SDK 是 OpenAI 官方推出的 Agent 开发框架,提供从单 Agent 到多 Agent 协作的一站式构建能力。
LlamaIndex(数据索引框架)
LlamaIndex 是连接 LLM 与外部数据的专业框架,提供从数据摄取到检索的全链路能力,是构建 RAG 和知识库 Agent 的首选工具。
Google ADK(Agent Development Kit)
Google ADK 是 Google 官方 Agent 开发工具包,深度集成 Gemini 模型和 Google 服务生态,原生支持 A2A 多 Agent 通信协议。
AI Agent Regulation(AI Agent 监管)
全球 AI Agent 监管正在快速跟进技术发展,欧盟、中国、美国各自推出了针对 AI Agent 的立法和监管框架。
Agent Pricing Model(Agent 定价模式)
Agent Pricing Model 研究 AI Agent 产品和服务的商业化定价策略,2026 年正处于从传统 SaaS 定价向 Agent 原生定价的转型期。
Open Source Agent Ecosystem(开源 Agent 生态)
开源 Agent 生态由 OpenClaw、DeepSeek 等开源项目和社区驱动,正在改变 AI Agent 产业的竞争格局。
Agent 记忆模块(Memory)
Agent 记忆模块是让智能体在多次交互间保持上下文与经验的关键组件,分为短期记忆与长期记忆,是生产级 Agent 的标配能力。
上下文窗口(Context Window)
上下文窗口是 LLM 单次推理可处理的 Token 总量上限,决定了 Agent 一次能「看到」多少信息,是成本、延迟与能力之间的关键权衡点。
幻觉(Hallucination)
幻觉指 LLM 生成看似合理却与事实不符的内容;在 Agent 场景中幻觉会被转化为错误操作,是生产落地的核心风险之一。
安全护栏(Guardrails)
安全护栏是在 Agent 输入与输出环节施加的约束与校验机制,用于拦截有害内容、规范格式与限制越权,是 Agent 生产上线的必备保护层。
智能体编排(Orchestration)
智能体编排是对多个 Agent、工具与子任务进行统一调度、状态管理与结果聚合的工程能力,是复杂多 Agent 应用的骨架。
工作流 vs 智能体(Workflow vs Agent)
工作流是按固定步骤确定性执行的自动化流程,智能体是能自主决策完成开放目标的系统;生产落地应优先用工作流,仅在必要时引入 Agent。
Computer Use(计算机操作)
Computer Use 指 Agent 像人一样直接操作图形界面(看截图、点按钮、打字),使其能驱动无 API 的旧系统与桌面软件,是工具使用的重要补充。
事实接地(Grounding)
事实接地指让模型生成锚定在可验证真实信息源(文档/数据库/工具结果)上,而非凭空生成,是提高事实性、降低幻觉、建立信任的关键技术。
自我反思与修正(Self-Reflection)
自我反思指 Agent 在产出后审视自身结果、发现错误并修正的能力,把单次生成升级为「生成-批评-改进」循环,是提升复杂任务成功率的核心机制。
RLHF 与后训练对齐(Post-Training Alignment)
RLHF 是用人类偏好数据微调模型以符合人类期望的技术,与 SFT、DPO 共同构成大模型后训练对齐阶段,决定了 Agent 底层模型的可用性与安全性。
Anthropic Messages API
Anthropic Messages API 是 Claude 模型的官方接口,采用 messages 数组承载多角色对话,支持工具定义、流式输出与扩展思考,是构建 Claude 系 Agent 的标准入口。
OpenAI Realtime API
OpenAI Realtime API 是基于 WebSocket 的低延迟语音/多模态接口,支持语音对话与打断处理,使 Agent 能以自然语音方式交互,是语音 Agent 的核心协议。
AG-UI 协议(Agent-UI 通信)
AG-UI 是连接 Agent 后端与前端的事件流协议,标准化了思考、工具调用、状态变更如何实时同步到 UI,让前端无需关心 Agent 内部即可渲染动态状态。
ANP(Agent Network Protocol)
ANP 是面向开放网络的 Agent 间通信协议,以去中心化身份与协商机制让任意 Agent 自主互联、协作与交易,目标是构建「Agent 的互联网」。
结构化输出(Structured Output)
结构化输出指让 LLM 严格按预设 Schema 生成结果(如 JSON),是 Agent 可靠调用工具、解析模型结果的前提,通常通过 JSON Mode、Function Calling 或约束解码实现。
OpenAPI 工具接入(Tool from API)
OpenAPI 工具接入指把已有的 REST API(OpenAPI/Swagger 描述)自动转换为 Agent 可调用的工具,让企业存量 API 无需重写即可被 Agent 使用,是连接现实系统的捷径。
编排者-工作者模式(Orchestrator-Worker)
编排者-工作者模式由中央 Orchestrator 拆解并分发任务给多个专业 Worker Agent 再汇总,是多 Agent 协作中最常用、最易控的架构。
路由器模式(Router Pattern)
路由器模式用轻量 Router 按意图把输入分发到最合适的下游 Agent 或工具,以最小协调开销实现对症下药,是控制成本与延迟的利器。
管道/顺序架构(Pipeline)
管道/顺序架构把任务拆成固定线性阶段,每阶段由专门 Agent/单元完成,上阶段输出即下阶段输入,确定性高、易调试,适合流程标准化场景。
图/状态机架构(Graph & State Machine)
图/状态机架构用显式节点与边定义 Agent 执行流,全局状态在节点间传递,使多步流程可视化、可断点续跑、可精确控制,是企业级 Agent 的主流编排范式。
多方辩论模式(Multi-Agent Debate)
多方辩论模式让多个持不同立场的 Agent 就同一问题论证与反驳,由裁判或汇总者得出更稳健结论,通过对抗暴露盲点提升复杂决策质量。
黑板架构(Blackboard Architecture)
黑板架构让多个独立知识源(Agent)围绕共享黑板异步读写中间成果,谁满足条件谁行动,最终汇聚出完整解,适合多专家渐进求解的开放任务。
越狱攻击(Jailbreak)
越狱攻击通过精心构造的提示诱导模型突破自身安全对齐、输出本应被拒的有害内容,常见手法有角色扮演、虚拟场景与指令覆盖,在 Agent 场景下后果更严重。
数据外泄(Data Exfiltration)
数据外泄指 Agent 在运行中把敏感信息(用户数据、密钥、系统提示、内部文档)以隐蔽方式发送到外部,可致隐私违规与凭据失窃,是 Agent 最严重后果之一。
SSRF(服务端请求伪造)
SSRF 指诱导服务端(Agent 或其工具)向内部/受限网络发起非预期请求,可探测内网、窃取云凭据,Agent 的 HTTP 类工具使其成为 SSRF 新载体。
过度代理(Excessive Agency)
过度代理指 Agent 被授予超出任务所需的权限与能力,一旦被诱导或出错,破坏远超必要,是 OWASP LLM Top 10 的核心风险之一,根治需最小权限原则。
对抗性攻击(Adversarial Attack)
对抗性攻击通过精心设计的输入(文本扰动、视觉对抗样本、训练投毒)使模型出错;在 Agent 场景可与注入、记忆投毒结合,形成隐蔽而系统性的威胁。
红队测试(Red Teaming)
红队测试指以攻击者视角系统性尝试突破 Agent 防护(越狱、注入、权限滥用、数据外泄)以发现并修复漏洞,是 Agent 上线前与持续运营中的必要安全实践。
AgentBench(智能体综合能力基准)
AgentBench 是面向 LLM Agent 的综合评测基准,覆盖 OS、数据库、网页等八大真实环境任务,考察 Agent 在多样化场景下的真实执行力,是 Agent 研究从聊天走向操作的里程碑。
WebArena(网页智能体基准)
WebArena 是评测网页智能体的基准,提供由真实网站克隆出的受控网页环境,用端到端任务考察 Agent 在真实网页上的操作与信息整合能力,是 Web/Computer Use 研究的核心基准。
TAU-bench(工具代理基准)
TAU-bench 是评测工具使用型 Agent 在多轮对话中调用工具完成真实业务(如客服改单)的基准,强调在不确定用户意图下与真实系统交互的能力。
GPQA(研究生级科学推理)
GPQA 是研究生难度的科学推理基准,跨化学/物理/生物且刻意「靠搜索难以答出」,用于考验模型深层知识与推理,是衡量推理模型事实推理的关键标尺。
MT-Bench(多轮对话能力)
MT-Bench 是用大模型评委评测模型多轮对话与指令遵循能力的基准,含 80 组两轮交互问题,开创了 LLM-as-Judge 的可扩展评测范式,是早期广泛采用的对话质量标尺。
ToolBench / Berkeley Function Calling
ToolBench 与 Berkeley Function Calling Leaderboard 是评测模型函数/工具调用能力的基准,考察从大量候选工具中正确选择并生成合法参数的能力,是工具型 Agent 的底座试金石。
Microsoft AutoGen
Microsoft AutoGen 是微软开源的多 Agent 对话框架,通过可对话的 Agent 抽象让多个 Agent 以消息传递协作,原生支持代码执行,是多 Agent 研究与落地的代表性框架。
Microsoft Semantic Kernel
Microsoft Semantic Kernel 是微软面向企业应用的开源 Agent/LLM 集成框架,以插件、原生函数与规划器为核心,强调与现有代码和企业系统(Azure)的无缝集成与生产可用性。
Dify
Dify 是开源的低代码 LLM 应用开发平台,提供可视化工作流编排、RAG 管线、Agent 构建与模型路由,让团队无需大量代码即可搭建并运营生产级 AI 应用。
Hugging Face smolagents
smolagents 是 Hugging Face 开源的极简 Agent 框架,核心约千行代码,主打用「写代码」而非「调 JSON 工具」来表达行动(CodeAgent),强调轻量透明,适合研究与原型。
Agno(原 Phidata)
Agno(前身 Phidata)是高性能 Agent 开发框架,主打极快的 Agent 实例化、内置记忆与知识、多模态与多 Agent 协作,以运行时性能为核心卖点,适合对延迟与并发敏感的生产场景。
Pydantic AI
Pydantic AI 是 Pydantic 团队推出的类型安全 Agent 框架,把 Python 类型系统与数据校验深度引入 Agent 开发,强调结构化输出、依赖注入与可测试性,深受工程化团队青睐。
Agent-as-a-Service(智能体即服务)
Agent-as-a-Service(AaaS)指把智能体能力以云服务/API/订阅形式对外提供,用户无需自建即可调用专业化 Agent,降低了使用门槛并催生新的商业模式。
中国智能体生态
中国智能体生态指以国产大模型为底座,叠加应用层 Agent、开发框架、算力与监管构成的本土产业网络,受政策、数据与市场需求共同塑造,呈现模型-框架-应用-合规四位一体特征。
智能体投融资(Agent Investment)
智能体投融资指资本对 Agent 赛道(模型、框架、应用、基础设施)的投资并购活动。2024–2026 年 Agent 成为 AI 最热投资主题,资金向能落地、有收入的应用层集中。
智能体职业与咨询(Agent Jobs & Consulting)
智能体职业与咨询指围绕 Agent 落地兴起的新岗位与专业服务,包括 Agent 架构师、提示工程师、Agent 运维与合规顾问,以及帮助企业落地 Agent 的咨询生态。
AI 内容质量与 AI Slop
AI 内容质量与 AI Slop 指由 Agent/大模型批量生成的低质、同质、注水内容泛滥现象,它侵蚀信息环境、损害信任,也倒逼平台与监管建立内容标识与质量甄别机制。