🧠 基础概念

LLM(大语言模型)

别名:大模型大语言模型Large Language Model基础模型
分类🧠 基础概念
阅读时间⏱️ 19 分钟
更新时间📅 2026-06-30
条目编号ENC-CONCEPT-02-llm
大语言模型(LLM)是基于海量文本数据训练的深度神经网络模型,能够理解和生成自然语言。LLM 是 AI Agent 的「大脑」,提供核心的语言理解与推理能力。

关键要点 ✦

详细解释

大语言模型(LLM)是驱动 AI Agent 的核心引擎。它基于 Transformer 架构,在海量文本数据上进行预训练(Pre-training),学习语言的统计规律和世界知识。在 Agent 架构中,LLM 承担着"大脑"的角色——理解用户意图、推理问题、制定计划、生成工具调用。

LLM 的核心机制是自注意力(Self-Attention):在处理每个词时,模型能够注意到输入序列中所有其他词的关联关系。这使得 LLM 能够捕捉长距离依赖和理解复杂语境。

主流架构

密集模型(Dense):所有参数参与每次推理,如 GPT-3、Llama 3(2024年前主流)。

混合专家(MoE):模型分为多个"专家"子网络,每次推理只激活部分专家。这是 2026 年的主流架构,代表有 GPT-4、Claude 4、Gemini 2.5、DeepSeek-V3。MoE 的优点是推理效率高、成本低。

多模态模型:能处理文本、图像、音频、视频等多种输入。如 GPT-4o、Gemini 2.5 Pro。

LLM 的局限

幻觉(Hallucination):模型会生成看似合理但事实错误的内容。即使顶级模型,事实性问题上的错误率仍有约 3-8%。

知识截止日期:模型的训练数据有截止时间限制。最新信息需要通过 RAG 或工具调用来获取。

推理能力上限:对于需要多步复杂推理的任务,LLM 仍有较高的错误率。Agent 系统中的多轮验证和工具调用可以部分缓解这一问题。

📖 相关条目

🛠️ 相关产品

🏷️ 标签LLM大语言模型Transformer预训练基础模型