7 月 17 日,月之暗面在 WAIC 前夕发布 Kimi K3:2.8 万亿参数 MoE 模型,896 个专家每次只激活 16 个,原生支持文本/图像/视频,100 万 token 上下文——全球首个开源逼近 3 万亿级别的模型。它的定位很明确:长程编程、知识工作、深度研究,并在 Agent Swarm 模式下可并行最多 300 个子代理,一段提示词产出 104 页带引用的调研报告。
🚀 本教程适合:想用 K3 做编程 Agent、知识工作 Agent,或体验「Agent Swarm 并行研究」的新手与进阶用户。我们讲清四端入口、API 定价、思考强度与 Agent Swarm 实战写法。
先搞懂:K3 是谁、强在哪
K3 是 K2.5 的全面升级,围绕「长任务 Agent」专项优化——架构上做了三件事:
| 维度 | K3 数据 | 对你的意义 |
|---|---|---|
| 参数规模 | 2.8T(MoE,激活 16/896) | 开源模型规模上限,长程推理更稳 |
| 上下文 | 1M token | 整仓代码库 / 长报告一次读入 |
| 多模态 | 原生文本/图像/视频 | 读图表、看截图、审视频,无需外挂 OCR |
| 编程 | SWE-bench Verified 80.2% | 开源模型编程第一梯队 |
| Agent | Swarm 300 子代理 / ~4000 步 | 并行研究、并行写作 |
| 持续运行 | 48 小时稳定会话 | 长任务不中途掉链 |
注意版本节奏:K3 于 7 月 17 日发布,完整权重 7 月 27 日开源(Hugging Face / 自定义「Kimi K3 License」)。发布当天只能走 API 与官方客户端。
Step 1:四个入口——选对入口再开始
1 Web / App / Work / Code / API
K3 的可用入口:
1. kimi.com(Web)
· 日常对话与深度研究
· 模式选择:
Deep Research / Slides /
Docs / Sheets / Swarm
2. Kimi 手机 App
· 多模态输入(拍照/视频)
· 随身知识工作
3. Kimi Work 桌面客户端
· 文档/表格/演示一体
· Office Agent 直出
Word/Excel/PPT/PDF
4. Kimi Code
· 编程场景专用
· 长程编程 Agent
5. Kimi API(开发者)
· https://api.moonshot.cn/v1
· OpenAI 兼容接口
· 接自有 Agent 工作流
建议:
· 纯体验 → Web / App
· 办公产出 → Work
· 编程 → Code
· 自建 Agent → API
💡 多端数据互通:Web 上的对话可以在 App 接着聊。把「重任务」放 Work/Code 客户端,「随手查」放手机。
Step 2:API 接入与定价——缓存命中省 90%
2 开发者的接入姿势
API 定价(每百万 token):
· 输入(未命中缓存):$3.00
· 输入(命中缓存):$0.30
——省 90%,三家国产旗舰
中缓存优惠最大
· 输出:$15.00
接入要点:
· OpenAI 兼容端点:
https://api.moonshot.cn/v1
· 计费口径:系统提示词 +
对话历史 + 附件都算 token
· 长文档/重复上下文场景:
务必开缓存,收益显著
缓存优化姿势:
1. 把不变的系统提示词
放在最前(命中缓存)
2. 重复文档预处理为
稳定前缀
3. 长会话复用同一
上下文缓存
与
《分层路由降本》
《前缀缓存》
结合:把「热上下文」
固定住,冷任务走便宜模型
输出定价不低($15/M):长程编程动辄几万 token 输出,预算敏感场景建议配合思考强度调节与输出上限控制。
Step 3:思考强度——low / high / max 怎么选
3 用思考强度换「速度与预算」
K3 默认思考强度为 max
(极致),后续提供三档:
· low:快速作答
适合:简单问答、格式转换、
低风险任务
成本:最低,输出更快
· high:平衡
适合:日常编程、常规
知识工作
· max:极致推理
适合:复杂算法、多步
规划、数学证明、
高价值代码审查
成本:最高
选档口诀:
· 任务复杂度低 → low
· 常规工作 → high
· 高风险/高价值 → max
注意:思考强度影响的是
「思考预算」,不改变
能力上限——用错了只是
浪费钱或欠思考
与
《思考级别调优》
的做法一致:先跑 low 看
结果质量,不够再升级
💡 团队可约定默认档位:代码评审用 max、周报总结用 high、聊天回复用 low——按任务价值分配思考预算,成本可降一半以上。
Step 4:Agent Swarm——300 个子代理并行干活
4 「临时公司」模式上手
Agent Swarm 原理:
· 编排器模型拆解任务
· 启动数十到数百个
专业子代理并行工作
· 各自研究/核查/起草
· 编排器汇总为成品
经典案例:一个提示词
产出 104 页带引用的
文献综述(Word/PDF
直出),全程无需干预
写作要点(决定成败):
1. 任务要具体
✗「研究电动车」
✓「对比 2026 Q2 印度与
美国前五 EV 厂商销量,
逐条注明来源,输出 PDF」
2. 明确产出格式
· 指定文件类型
(Word/PDF/表格/幻灯片)
· 指定篇幅与结构
3. 说明约束
· 数据时效(如「截至
2026-08」)
· 来源数量与权威性
运行形态:
· 界面显示子代理动态
· 长任务最多约 40 分钟
· 可关闭标签页稍后回看
与
《多 Agent 羊群效应》
《群体安全》
对照:并行规模越大,
越要防「互相抄答案」
Swarm 是重武器不是玩具:任务越模糊,并行子代理越容易各自跑偏。写不清需求,就不要开 Swarm——先单模型聊清楚,再放大规模。
Step 5:长程编程与知识工作——场景清单
5 K3 最适合的六类任务
1. 大仓代码评审
· 1M 上下文整仓读入
· 架构梳理 / 依赖分析 /
潜在 bug 定位
2. 文档批量处理
· 混合媒体(文字/表格/
截图)理解
· 证据、假设、不确定性
可追溯
3. 深度研究
· Deep Research 模式
· 多源检索 + 交叉验证 +
引用标注
4. 办公产出
· Office Agent:Word 批注、
带透视表的财务模型、
LaTeX 公式
· 直出 PPT/Excel/PDF
5. Agent 编排底座
· 2.8T 模型当编排器
· ClawHub Skills 5000+
技能库按需调用
6. 端侧/私有化验证
· 7-27 起权重开源
· 企业可自托管(见
Step 6)
不适合:
· 高频短对话(成本高)
· 预算紧张的简单任务
💡 从「一件 20 分钟以上的知识工作」开始体验(如月度行业综述),对比 K3 与旧模型的产出质量与引用可追溯性——这才是它值钱的地方。
Step 6:开源权重与本地部署展望
6 开源了,然后呢?
开源信息:
· 完整权重:2026-07-27 发布
· 平台:Hugging Face / ModelScope
· 许可:自定义「Kimi K3 License」
· 生态协作:与推理伙伴、
开源维护者对齐技术细节
本地部署的现实考量:
· 2.8T 总量 / 16 专家激活:
激活参数量约 104B/次
(与 261 号教程 Muse Glimmer
30B 端侧路线不同量级)
· 单卡跑不动 → 集群/量化/
蒸馏或走 API
· 企业私有化:模型网关 +
量化部署,参考
《本地 Ollama Agent》
《Qwen 本地部署》
务实路线:
· 个人/小团队:API 优先
(缓存命中后成本可控)
· 企业:先 API 验证效果,
再评估私有化成本收益
· 离线/合规场景:等社区
量化与蒸馏生态成熟
别被「开源」冲昏头:开源的是权重,不是「免费算力」。2.8T 模型跑起来的算力成本与运维复杂度,比 API 账单更考验预算。
常见问题速查
| 你遇到的现象 | 大概率原因 & 解决 |
|---|---|
| Swarm 跑偏 | 任务不够具体:写清对比维度、来源要求、产出格式再开 Swarm |
| 账单偏高 | 开上下文缓存 + 思考强度降档:简单任务用 low/high,别一律 max |
| 长文档记不住 | 1M 上下文也有限:关键信息放前缀,重复内容走缓存命中 |
| 想本地部署 | 评估激活参数与算力:个人先 API,企业评估量化/集群后再定 |
| 多模态输入报错 | 确认入口支持:图像/视频输入在支持多模态的客户端与 API 使用 |