进阶 📋 6 个步骤 第 336 / 470 篇

Qwen3.8-Flash 上手:125B 只激活 6B 的 Next 架构,把 1 元/百万 Token 的模型接进你的 Agent

8 月 26 日阿里发布并开源 Qwen3.8-Flash:Next 架构(Qwen4 雏形)125B 参数仅激活 6B,训练成本降 90%,输入 1 元、输出 3 元/百万 Token,SWE-bench Pro 等智能体评测全面超越 Claude Opus 4.6,首发内置千问办公标准模式。本教程讲架构要点、API 接入与成本核算。

2026.08.27· 14 分钟阅读· 约 1457 字

8 月 26 日晚,阿里发布并同步开源千问最新模型 Qwen3.8-Flash:Transformer 参数 125B,每次推理只激活 6B,性能却超越 Claude Opus 4.6、接近 Opus 4.8——而推理价格低至输入 1 元、输出 3 元每百万 Token,训练成本比上一代 Qwen3.7-Plus 降了近 90%。对做 Agent 的人来说,这是「能力级」模型第一次以「白菜价」敞开供应,还带上了 1M 长上下文与多模态。本教程从架构要点讲到 API 接入与成本核算。

🚀 本教程适合:已经会用 API 调模型的开发者、AI 产品经理、想给 Agent 换更划算「大脑」的团队。需要一点 Python 或 curl 基础。

先搞懂:Next 架构凭什么「又快又省」

Qwen3.8-Flash 用的不是小修小补,而是下一代(Next)架构——官方明说这是未来 Qwen4 的雏形。四个关键设计,个个都冲着「花更少的钱干同样的活」去:

架构要素是什么对 Agent 的意义
QSA 稀疏注意力用轻量索引器按微块粒度挑出重要上下文1M Token 长上下文、缓存命中场景提速 8 倍以上
Gated Residual残差流从 1 条拆成 4 条,动态门控读写跨层信息传递更高效,训练更稳
N-gram Embedding51B 参数的「外挂查表记忆」,不参与每次计算极低资源把模型容量做大
激活仅 6B125B 参数里每次只用 6B推理成本断崖式下降

注意区分:此前本中心介绍过 Qwen3.8-27B 本地部署(Ollama 全家桶),那是 270 亿参数的「全家用」型号;本次的 Flash 是 125B-A6B 的云端 API 型号,两者定位不同、互不替代。

Step 1:先看评测,值不值得换

1 智能体任务全面领先,不只是「便宜」

官方与第三方口径一致:Flash 在智能体与多模态任务上全面压过 Claude Opus 4.6,重点看这几个数字:

SWE-bench Pro(智能体编程)    62.5  领先 Opus 4.6 约 9.1 分
JobBench(专业工作任务)      55.7  领先 Opus 4.6 近 20 分
AndroidWorld(手机操作)       高 22.5 分
MathVision(视觉数学推理)     高 25.1 分
ERQA(具身智能)              高 31.5 分
DeepSWE 1.1(长程编程)       58.7
💡 结论先行:如果你主要在跑「智能体编程、专业办公、长程任务」类工作负载,Flash 是当前性价比最强的候选之一;如果你的负载是纯短问答,便宜的基础模型可能更够用。

Step 2:拿到 API Key

2 千问 AI 平台或阿里云百炼,二选一
1. 打开 qianwen.ai(千问 AI 平台)或阿里云百炼控制台
2. 注册登录,进入「API Key 管理」
3. 创建新的 API Key,复制保存(只显示一次,别泄露)
4. 在模型列表中确认 Qwen3.8-Flash 已可见(8-26 上线)

拿到的 Key 长这样:
sk-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx
💡 想先用订阅额度?阿里云 Token Plan 已接入千问 App / PC,本中心《阿里云 Token Plan》教程讲了「订阅额度当 API Key」的用法,和本教程可以搭配看。

Step 3:零代码体验——千问办公标准模式已内置

3 不想写代码,先到千问办公里点两下

Qwen3.8-Flash 首发上线「千问办公」,其标准模式已内置该模型,官方称可完成 95% 的日常办公任务:

1. 打开千问办公(网页版或 PC 客户端)
2. 保持默认「标准模式」,不要手动切到专业模式
3. 直接下任务:写周报、总结会议纪要、做表格、长文档分析
4. 观察它用模型 + 工具(文档/表格/浏览器)自主完成任务
🚀 体验完你大概就明白「模型 + Harness 协同优化」是什么意思了——同一模型,在千问办公里的完成率比裸 API 高一大截。

Step 4:把 Flash 接进你自己的 Agent

4 OpenAI 兼容接口,改一个 model 字段即可

千问开放平台提供 OpenAI 兼容的 /v1/chat/completions 接口,Dify、OpenClaw、Claude Code 等工具大多能直接对接:

import openai

client = openai.OpenAI(
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
    api_key="sk-你的Key",
)

resp = client.chat.completions.create(
    model="qwen3.8-flash",
    messages=[{"role": "user", "content": "把这份会议纪要改写成周报,分三条要点"}],
)
print(resp.choices[0].message.content)

别急着改全部流量:先在测试环境用小流量对比新老模型的效果与失败率,再逐步放量。模型换得越频繁,越要守住「先小步验证」的习惯。

Step 5:长上下文与多模态实测

5 1M 上下文 + 视觉,两招用满

Flash 原生支持 262,144 Token 上下文,可经 YaRN 扩展到 1,000,000 Token;同时是多模态 MoE,图片输入直接可用:

· 长文档:把整份 50 万字合同丢进去做全局审查
  (QSA 稀疏注意力在缓存命中时提速 8 倍,长文不卡)
· 长会话:让 Agent 连续跑多轮工具调用,不截断历史
· 多模态:截图 + 文字一起发,让它「看图办事」
· 手机/桌面截图:配合 Qwen-UI-Agent 类框架做界面理解
💡 实测建议:长上下文场景优先开缓存(prompt cache),配合 Flash 的低价,长任务成本可以压到很低。

Step 6:成本核算——一个月到底花多少

6 把账算明白再放量

按每百万 Token 输入 1 元、输出 3 元(约为 Claude Opus 4.6 的 3%,DeepSeek-V4-Flash 忙时价的 1/3、闲时价的 2/3)粗算:

场景月用量(输入/输出)约月成本
个人编程助手200M / 20M约 0.26 元
小团队办公 Agent2G / 200M约 2.6 元
中台长程任务20G / 2G约 26 元
🎉 到这里你已经把「新一代效率模型」从了解到接入走通了。想把它和降本路由一起用,可搭配本中心《DeepSeek 峰谷定价分层路由》与《Agent 经济学》两篇一起读。
← 返回教程中心