行业里常说「Model + Harness = Agent」,但模型的能力天天被评测,Harness(执行系统)那一半从来没人给过定量答案。8 月底 Floatboat 公布了一组数据:同一款 DeepSeek-V4-Flash(混合价约 0.175 美元/百万 Token),在 DeepSeek 官方 Harness 上五项基准一项没赢 Claude Opus 4.8;接到 Floatboat Harness 上,五项全赢,而 Opus 4.8 贵 57.1 倍。增益随任务程长从 1.9% 单调涨到 23.6%。这篇教程帮你读懂这份评测:Harness 增益怎么测、HLR 怎么算、对选型意味着什么。
📊 本教程适合:做 Agent 选型的技术负责人、关心「模型之外那半个系统」的工程师,以及想看懂 Harness 评测报告的从业者。需要基本的数据敏感性,不需要编程。
Step 1:先看懂这场对比实验的设计
1 唯一变量是 Harness,不是模型
实验设计(为什么这次数据有说服力):
对照组 1:DeepSeek-V4-Flash + DeepSeek 官方 Harness
对照组 2:Claude Opus 4.8(闭源,自带官方环境)
实验组:DeepSeek-V4-Flash + Floatboat Harness
控制变量:
· 同一个模型底座(V4-Flash 0731)
· 推理大多走 DeepSeek 官方 API
· 独立沙箱隔离运行、输入参数一致
· 单位成本不变(模型没换、价格没变)
结果:
· 官方 Harness 上:DeepSWE 54.4,低于 Opus 4.8 的 58.0
——同厂系统下一项没赢
· Floatboat Harness 上:DeepSWE 67.25,五项全赢
成本对照(3:1 输入输出比的混合价):
· DeepSeek-V4-Flash:约 0.175 美元/M
· Claude Opus 4.8:约 10 美元/M,贵 57.1 倍
结论口径:唯一变量 = Harness
💡 关键不是「谁赢了」,而是「同一个模型换个执行系统能差出 23.6%」——这说明 Harness 不是「包装」,是真实的生产力变量。这正是《DeepSeek Harness 插件生态》「模型之外那半个系统」话题的第一次定量回答。
Step 2:增益随任务程长递增——最值得记住的规律
2 任务越长,Harness 越值钱
同一底座下,换 Harness 的增益(按任务程长排序):
短程任务:+1.9%
中程任务:+9.6% → +12.6% → +19.9%
长程任务(DeepSWE):+23.6%
规律:增益随任务程长单调递增(non-decreasing)
为什么?
· 短任务:模型答一步就完事,系统介入空间小
· 长任务:上下文怎么组织、工具返回怎么处理、
状态存在哪、循环怎么收敛——每一步都影响成败
· 真实工作恰恰是长程的:
跨文件、跨应用、跨权限、持续数小时甚至数天
同场对比(BrowseComp 榜单):
· Floatboat 87.80
· GPT-5.6 Terra 87.5 / Claude Sonnet 5 84.7 /
Claude Opus 4.8 84.3 / GPT-5.6 Luna 83.3
含义:衡量 Agent 别只看「模型多聪明」,
要看「长任务完成率 × 单位成本」。
这是厂商自报数据,不是独立评测:Floatboat 是参赛方也是裁判,榜单数字(BrowseComp 87.80)与自家基准口径需谨慎对待。可采信的是「同底座换 Harness 增益递增」的机制本身——这符合行业对长程任务执行系统价值的共识。
Step 3:HLR——换 Harness 与换模型,哪个更划算
3 Harness Leverage Ratio 杠杆率指标
HLR = 换 Harness 的增益 ÷ 换模型的增益
(Harness Leverage Ratio,Harness 杠杆率)
读法:
· HLR > 1:换执行系统比换模型更划算
· HLR < 1:换模型更有性价比
· HLR ≈ 1:两边投入回报相当
Floatboat 的边界定义:
「除了模型本身之外的所有工作,
都属于 Harness 的范畴」——
文件系统权限、工具调用、上下文组织、
状态持久化、循环收敛、沙箱边界
为什么 HLR 有用:
· 团队预算有限时,先投回报高的一侧
· 避免「模型焦虑」:
性能差 5 个点就急着换旗舰模型,
可能不如把执行系统做好
实操建议:
· 用 HLR 思维做季度复盘:
这季度模型和 Harness 各提升了多少?
· 长任务占比高的团队,HLR 通常 > 1
🚀 把 HLR 和《Agent 经济学》的「时薪/完成率×成本矩阵」合起来用:HLR 决定往哪投,经济学决定值不值——两个框架一横一纵,正好补全 Agent 投资决策。
Step 4:Floatboat 的设计哲学——为什么 Harness 能强
4 桌面运行时 + 非确定性才用 Agent
Floatboat Harness 的三个关键选择:
1. 桌面客户端做运行时
· 文件管理器、编辑器、浏览器直接当
Agent 运行环境
· 理由:Web 端 Agent 感知不到文件结构、
操作历史、跨应用流转——那些沉淀在
行为里的隐性知识
· 真实工作流是跨文件、跨应用、跨权限的
长程任务,需要「操作系统级入口」
2. 不确定才上 Agent(FloatSail 自适应进化)
· 能用 Workflow 或普通桌面操作完成的,
根本不让模型参与
· 只有出现不确定性时 Agent 才介入
· 「省不是优化出来的,是被设计出来的」
——不让模型做不需要做的事
3. 自研全栈
· Runtime / Agent Loop / Tools / Infra
· 与《Agent Lightning》「Harness 与训练引擎
解耦」的思路互为参照
💡 对我们普通团队最可迁移的一条:别让 Agent 处理确定性任务——能写死的工作流就写死,Agent 只留给真正需要判断的部分。这一条直接决定长任务的成本和成功率。
Step 5:落地自测——你的 Agent 系统 Harness 增益多大
5 一套能自己复现的评测方法
给团队自测 Harness 价值的四步法:
1. 选 3-5 个「真实长任务」做基准
· 别用教科书样例,用你们线上跑过的任务
· 记录:完成率、耗时、token 消耗、失败次数
2. 固定模型,换执行环境对比
· 同一模型跑「官方环境」vs「你的 Harness」
· 控制变量:同样任务、同样沙箱、同样输入
3. 计算自己的增益曲线
· 把任务按「程长」分组,看增益是否递增
· 如果短任务增益高 → 问题可能不在 Harness
在提示词/工具定义
4. 算 HLR 做投资决策
· 换 Harness 的增益 ÷ 换模型的增益
· 决定下季度预算投哪边
衡量单位变化(行业共识):
从「单次回答多聪明」→
「完成一项长任务花多少钱、多久、失败几次」
别直接抄别人的基准:Floatboat 用的是 BrowseComp、DeepSWE 等榜单,你的团队任务结构不一样,增益曲线必然不同。榜单用来理解趋势,自家任务才决定预算。
Step 6:给你的选型启示
6 模型焦虑可以停了,把注意力放回系统
三个可落地的判断:
1. 选模型时,把执行系统算进去
· 「V4-Flash + 好 Harness」可能胜过
「旗舰模型 + 裸跑」
· 参考《DeepSeek 峰谷定价》:
成本差 50 倍时,性能差 5 个点
不足以决定默认选择
2. 长任务团队优先优化 Harness
· 上下文组织、工具返回、状态持久化、
循环收敛——这些是长任务成败关键
· 每提升 1% 都是长期复利
3. 建立自己的 HLR 基线
· 每季度记录模型与 Harness 的增益
· 让「系统投资」从玄学变成可量化
一句话总结:模型决定上限,Harness 决定
你能摸到多高——而长任务里,后者的
杠杆常常更大。
🎉 行动项:下周找 3 个你线上真实跑过的长任务,按 Step 5 的方法跑一遍基线——你可能会第一次看清「模型之外那半个系统」在你团队里的真实价值。