入门 📋 6 个步骤 第 318 / 470 篇

Kimi K3 上手:2.8 万亿开源模型,长程编程 + Agent Swarm 300 子代理并行

月之暗面 7 月 17 日发布 Kimi K3:全球首个开源逼近 3T 级模型(2.8T 参数 MoE),1M 上下文、原生多模态、SWE-bench 80.2% 开源第一,Agent Swarm 可并行 300 子代理产出 104 页论文。本教程讲清四端入口、API 定价与缓存、思考强度调优与 Agent Swarm 实战写法。

2026.08.23· 15 分钟阅读· 约 1990 字· 🚀 Kimi K3

7 月 17 日,月之暗面在 WAIC 前夕发布 Kimi K3:2.8 万亿参数 MoE 模型,896 个专家每次只激活 16 个,原生支持文本/图像/视频,100 万 token 上下文——全球首个开源逼近 3 万亿级别的模型。它的定位很明确:长程编程、知识工作、深度研究,并在 Agent Swarm 模式下可并行最多 300 个子代理,一段提示词产出 104 页带引用的调研报告。

🚀 本教程适合:想用 K3 做编程 Agent、知识工作 Agent,或体验「Agent Swarm 并行研究」的新手与进阶用户。我们讲清四端入口、API 定价、思考强度与 Agent Swarm 实战写法。

先搞懂:K3 是谁、强在哪

K3 是 K2.5 的全面升级,围绕「长任务 Agent」专项优化——架构上做了三件事:

维度K3 数据对你的意义
参数规模2.8T(MoE,激活 16/896)开源模型规模上限,长程推理更稳
上下文1M token整仓代码库 / 长报告一次读入
多模态原生文本/图像/视频读图表、看截图、审视频,无需外挂 OCR
编程SWE-bench Verified 80.2%开源模型编程第一梯队
AgentSwarm 300 子代理 / ~4000 步并行研究、并行写作
持续运行48 小时稳定会话长任务不中途掉链

注意版本节奏:K3 于 7 月 17 日发布,完整权重 7 月 27 日开源(Hugging Face / 自定义「Kimi K3 License」)。发布当天只能走 API 与官方客户端。

Step 1:四个入口——选对入口再开始

1 Web / App / Work / Code / API
K3 的可用入口:

1. kimi.com(Web)
   · 日常对话与深度研究
   · 模式选择:
     Deep Research / Slides /
     Docs / Sheets / Swarm

2. Kimi 手机 App
   · 多模态输入(拍照/视频)
   · 随身知识工作

3. Kimi Work 桌面客户端
   · 文档/表格/演示一体
   · Office Agent 直出
     Word/Excel/PPT/PDF

4. Kimi Code
   · 编程场景专用
   · 长程编程 Agent

5. Kimi API(开发者)
   · https://api.moonshot.cn/v1
   · OpenAI 兼容接口
   · 接自有 Agent 工作流

建议:
· 纯体验 → Web / App
· 办公产出 → Work
· 编程 → Code
· 自建 Agent → API
💡 多端数据互通:Web 上的对话可以在 App 接着聊。把「重任务」放 Work/Code 客户端,「随手查」放手机。

Step 2:API 接入与定价——缓存命中省 90%

2 开发者的接入姿势
API 定价(每百万 token):
· 输入(未命中缓存):$3.00
· 输入(命中缓存):$0.30
  ——省 90%,三家国产旗舰
     中缓存优惠最大
· 输出:$15.00

接入要点:
· OpenAI 兼容端点:
  https://api.moonshot.cn/v1
· 计费口径:系统提示词 +
  对话历史 + 附件都算 token
· 长文档/重复上下文场景:
  务必开缓存,收益显著

缓存优化姿势:
1. 把不变的系统提示词
   放在最前(命中缓存)
2. 重复文档预处理为
   稳定前缀
3. 长会话复用同一
   上下文缓存

与
《分层路由降本》
《前缀缓存》
结合:把「热上下文」
固定住,冷任务走便宜模型

输出定价不低($15/M):长程编程动辄几万 token 输出,预算敏感场景建议配合思考强度调节与输出上限控制。

Step 3:思考强度——low / high / max 怎么选

3 用思考强度换「速度与预算」
K3 默认思考强度为 max
(极致),后续提供三档:

· low:快速作答
  适合:简单问答、格式转换、
  低风险任务
  成本:最低,输出更快

· high:平衡
  适合:日常编程、常规
  知识工作

· max:极致推理
  适合:复杂算法、多步
  规划、数学证明、
  高价值代码审查
  成本:最高

选档口诀:
· 任务复杂度低 → low
· 常规工作 → high
· 高风险/高价值 → max

注意:思考强度影响的是
「思考预算」,不改变
能力上限——用错了只是
浪费钱或欠思考

与
《思考级别调优》
的做法一致:先跑 low 看
结果质量,不够再升级
💡 团队可约定默认档位:代码评审用 max、周报总结用 high、聊天回复用 low——按任务价值分配思考预算,成本可降一半以上。

Step 4:Agent Swarm——300 个子代理并行干活

4 「临时公司」模式上手
Agent Swarm 原理:
· 编排器模型拆解任务
· 启动数十到数百个
  专业子代理并行工作
· 各自研究/核查/起草
· 编排器汇总为成品

经典案例:一个提示词
产出 104 页带引用的
文献综述(Word/PDF
直出),全程无需干预

写作要点(决定成败):
1. 任务要具体
   ✗「研究电动车」
   ✓「对比 2026 Q2 印度与
     美国前五 EV 厂商销量,
     逐条注明来源,输出 PDF」

2. 明确产出格式
   · 指定文件类型
     (Word/PDF/表格/幻灯片)
   · 指定篇幅与结构

3. 说明约束
   · 数据时效(如「截至
     2026-08」)
   · 来源数量与权威性

运行形态:
· 界面显示子代理动态
· 长任务最多约 40 分钟
· 可关闭标签页稍后回看

与
《多 Agent 羊群效应》
《群体安全》
对照:并行规模越大,
越要防「互相抄答案」

Swarm 是重武器不是玩具:任务越模糊,并行子代理越容易各自跑偏。写不清需求,就不要开 Swarm——先单模型聊清楚,再放大规模。

Step 5:长程编程与知识工作——场景清单

5 K3 最适合的六类任务
1. 大仓代码评审
   · 1M 上下文整仓读入
   · 架构梳理 / 依赖分析 /
     潜在 bug 定位

2. 文档批量处理
   · 混合媒体(文字/表格/
     截图)理解
   · 证据、假设、不确定性
     可追溯

3. 深度研究
   · Deep Research 模式
   · 多源检索 + 交叉验证 +
     引用标注

4. 办公产出
   · Office Agent:Word 批注、
     带透视表的财务模型、
     LaTeX 公式
   · 直出 PPT/Excel/PDF

5. Agent 编排底座
   · 2.8T 模型当编排器
   · ClawHub Skills 5000+
     技能库按需调用

6. 端侧/私有化验证
   · 7-27 起权重开源
   · 企业可自托管(见
     Step 6)

不适合:
· 高频短对话(成本高)
· 预算紧张的简单任务
💡 从「一件 20 分钟以上的知识工作」开始体验(如月度行业综述),对比 K3 与旧模型的产出质量与引用可追溯性——这才是它值钱的地方。

Step 6:开源权重与本地部署展望

6 开源了,然后呢?
开源信息:
· 完整权重:2026-07-27 发布
· 平台:Hugging Face / ModelScope
· 许可:自定义「Kimi K3 License」
· 生态协作:与推理伙伴、
  开源维护者对齐技术细节

本地部署的现实考量:
· 2.8T 总量 / 16 专家激活:
  激活参数量约 104B/次
  (与 261 号教程 Muse Glimmer
   30B 端侧路线不同量级)
· 单卡跑不动 → 集群/量化/
  蒸馏或走 API
· 企业私有化:模型网关 +
  量化部署,参考
  《本地 Ollama Agent》
  《Qwen 本地部署》

务实路线:
· 个人/小团队:API 优先
  (缓存命中后成本可控)
· 企业:先 API 验证效果,
  再评估私有化成本收益
· 离线/合规场景:等社区
  量化与蒸馏生态成熟

别被「开源」冲昏头:开源的是权重,不是「免费算力」。2.8T 模型跑起来的算力成本与运维复杂度,比 API 账单更考验预算。

常见问题速查

你遇到的现象大概率原因 & 解决
Swarm 跑偏任务不够具体:写清对比维度、来源要求、产出格式再开 Swarm
账单偏高开上下文缓存 + 思考强度降档:简单任务用 low/high,别一律 max
长文档记不住1M 上下文也有限:关键信息放前缀,重复内容走缓存命中
想本地部署评估激活参数与算力:个人先 API,企业评估量化/集群后再定
多模态输入报错确认入口支持:图像/视频输入在支持多模态的客户端与 API 使用
← 返回教程中心