8 月 11 日至 12 日,「DeepSeek Harness 团队」微信公众号完成注册的消息在行业刷屏——该账号认证主体为北京深度求索人工智能基础技术研究有限公司,头像是一只黑色鲸鱼,独立于 DeepSeek 主公众号运营,被外界解读为 Harness 业务线首次设立官方发布阵地。结合 5 月内部立项、崔添翼带队、8 月 1 日面向全球开发者启动内测招募等一系列动作,DeepSeek「不再只做模型」的转型路径正清晰浮出水面。
一、Harness 是什么:「Model + Harness = Agent」
Harness 的通俗表述是「把模型变成智能体的工具」:模型负责理解需求、推理与生成方案,Harness 则负责在模型之外调度上下文、工具、任务状态、反馈与边界,把模型能力落到真实环境中,完成从理解需求到交付代码的完整闭环。2026 年,Harness 直接带动了代码智能体成为 2022 年「GPT 时刻」以来首个成功商业化的杀手级应用——其中最知名的两款是 OpenAI 的 Codex 与 Anthropic 的 Claude Code,它们直接让两家公司的模型与其他模型企业的产品形成代差。DeepSeek 官方招聘信息给出了自己的公式「Model + Harness = Agent」,并写道:「我们正在把 DeepSeek 的前沿模型能力,转化为领先的 Agent 产品。其中除模型本身以外的所有工作,都属于 Harness 的范畴。」一个更直接的信号是:8 月 2 日公测的 DeepSeek-V4-Flash 正式版,其 API 文档明确写道——公开基准测试中的 Code Agent 任务,使用 DeepSeek Harness 极简模式(即将发布)作为框架进行测试。这意味着 Harness 已在真实评测链路中被内部验证。
二、为什么是崔添翼:系统工程专家的信号
Harness 团队负责人崔添翼的履历本身就是一个判断:本科毕业于浙江大学计算机系,曾获 6 枚 ACM 亚洲区域赛金牌,2013 年起在量化交易机构 Jane Street 工作九年,2022 年联合创办量化交易公司 TSY 资本,2026 年 3 月加入 DeepSeek 负责 Harness 团队。高频量化交易系统的核心壁垒从来不是策略创新,而是极端复杂环境下的稳定执行、异常兜底、全程日志追溯与风险精准可控——对系统的严谨性、稳定性、容错性要求远超普通互联网产品。把这样一位系统工程专家调任智能体项目负责人,传递出的行业判断是:AI 智能体的落地瓶颈早已不是大模型的算法能力,而是系统工程能力——市面上优质大模型层出不穷,但能稳定落地产业场景、完成闭环作业的智能体寥寥无几,核心差距就在于任务调度、自主执行与异常容错的底层系统能力。团队自 6 月起大规模扩招(Agent Harness 产品经理、研发工程师等岗位,负责人亲自参与终面),并放出目标:推动公司多个部门规模至少扩大一倍;8 月 1 日崔添翼面向全球公开征集内测用户,优先筛选具备 Agent Harness 开源项目经验的开发者,申请人需提交代码托管平台账号与代表作品。
三、从「算力售卖」到「全链路 Agent」:商业模式的转向
长期以来,外界对 DeepSeek 商业模式的认知停留在基础模型服务——通过售卖 API 调用与模型权重获利,是典型的「算力售卖」轻量化变现。而 Harness 的落地标志着 DeepSeek 正从单一基础模型供给者,向全链路 AI 工作流解决方案的构建者转型。这一转向的时间窗口颇有意味:V4-Flash 公测后以 7.22 万亿 Token 的单周调用量登顶 OpenRouter 全球榜首(7 月 27 日至 8 月 2 日当周),模型侧的性价比势能仍在;Harness 补上的正是「从模型能力到可交付产品」的关键一环——可自主读取解析代码仓库、批量修改源码文件、自动化运行单元测试、精准定位代码漏洞、自主修复程序 bug,实现从需求对接、代码开发到测试运维的端到端全流程作业,产品能力与 Claude Code 直接对标。封闭内测的招募规则同样被解读为生态信号:通过开发者深度实操捕捉极端边界问题,持续打磨系统稳定性、数据安全性与异常容错能力,为后续商业化落地筑牢根基。
四、客观看:高预期与待解问题
几点客观边界需要标注。其一,内测反馈中「宇宙最强」的评价缺乏可验证细节——受保密要求限制,具体表现一直没有明确说法,应视为市场情绪而非结论;其二,产品能力描述(自主解析代码库、批量修改源码、自动化测试与修复)目前主要来自媒体报道与官方口径,端到端成功率、长任务稳定性等关键指标行业暂未披露;其三,对标 Claude Code 意味着要直面 Anthropic 成熟的开发者生态与商业化体系,Harness 的定价策略、是否开源、与 V4 系列模型的绑定深度均未公布;其四,V4-Flash 评测中使用 Harness 框架与模型能力的贡献如何切分,也需要独立复现验证。总体而言,DeepSeek Harness 是「模型商转 Agent 商」的样本级案例——它的成败将检验一个判断:国产代码智能体的竞争,是否已经越过「谁跑分高」,进入「谁能把模型稳定地变成交付闭环」的新阶段。