LLM(大语言模型)
别名:大模型大语言模型Large Language Model基础模型
| 分类 | 🧠 基础概念 |
| 阅读时间 | ⏱️ 19 分钟 |
| 更新时间 | 📅 2026-06-30 |
| 条目编号 | ENC-CONCEPT-02-llm |
大语言模型(LLM)是基于海量文本数据训练的深度神经网络模型,能够理解和生成自然语言。LLM 是 AI Agent 的「大脑」,提供核心的语言理解与推理能力。
关键要点 ✦
- 现代 LLM 均基于 Transformer 架构,核心机制是自注意力(Self-Attention)
- GPT-4 系列参数规模达 1.8T(万亿),推理成本已降至 2023 年的 1/128
- LLM 的能力边界由训练数据、模型规模和推理算力共同决定
- MoE(混合专家)架构是 2026 年主流 LLM 的选择,如 GPT-4、Claude 4、Gemini 2.5
- 2026 年 Q1 头部 LLM 在 MMLU、HumanEval 等基准上差距已缩小至 5% 以内
详细解释
大语言模型(LLM)是驱动 AI Agent 的核心引擎。它基于 Transformer 架构,在海量文本数据上进行预训练(Pre-training),学习语言的统计规律和世界知识。在 Agent 架构中,LLM 承担着"大脑"的角色——理解用户意图、推理问题、制定计划、生成工具调用。
LLM 的核心机制是自注意力(Self-Attention):在处理每个词时,模型能够注意到输入序列中所有其他词的关联关系。这使得 LLM 能够捕捉长距离依赖和理解复杂语境。
主流架构
密集模型(Dense):所有参数参与每次推理,如 GPT-3、Llama 3(2024年前主流)。
混合专家(MoE):模型分为多个"专家"子网络,每次推理只激活部分专家。这是 2026 年的主流架构,代表有 GPT-4、Claude 4、Gemini 2.5、DeepSeek-V3。MoE 的优点是推理效率高、成本低。
多模态模型:能处理文本、图像、音频、视频等多种输入。如 GPT-4o、Gemini 2.5 Pro。
LLM 的局限
幻觉(Hallucination):模型会生成看似合理但事实错误的内容。即使顶级模型,事实性问题上的错误率仍有约 3-8%。
知识截止日期:模型的训练数据有截止时间限制。最新信息需要通过 RAG 或工具调用来获取。
推理能力上限:对于需要多步复杂推理的任务,LLM 仍有较高的错误率。Agent 系统中的多轮验证和工具调用可以部分缓解这一问题。
📖 相关条目
🛠️ 相关产品
🏷️ 标签LLM大语言模型Transformer预训练基础模型