高级 📋 6 个步骤 第 359 / 470 篇

「模型之外那半个系统」值多少钱?Floatboat Harness 评测与 HLR 指标

Floatboat 公布评测:同一款 DeepSeek-V4-Flash(约 0.175 美元/M)接自家 Harness 后五项基准全超贵 57.1 倍的 Claude Opus 4.8,增益随任务程长从 1.9% 递增到 23.6%。本教程讲清 Harness 增益怎么测、HLR 杠杆率怎么算、对选型意味着什么。

2026.08.31· 12 分钟阅读· 约 1872 字

行业里常说「Model + Harness = Agent」,但模型的能力天天被评测,Harness(执行系统)那一半从来没人给过定量答案。8 月底 Floatboat 公布了一组数据:同一款 DeepSeek-V4-Flash(混合价约 0.175 美元/百万 Token),在 DeepSeek 官方 Harness 上五项基准一项没赢 Claude Opus 4.8;接到 Floatboat Harness 上,五项全赢,而 Opus 4.8 贵 57.1 倍。增益随任务程长从 1.9% 单调涨到 23.6%。这篇教程帮你读懂这份评测:Harness 增益怎么测、HLR 怎么算、对选型意味着什么。

📊 本教程适合:做 Agent 选型的技术负责人、关心「模型之外那半个系统」的工程师,以及想看懂 Harness 评测报告的从业者。需要基本的数据敏感性,不需要编程。

Step 1:先看懂这场对比实验的设计

1 唯一变量是 Harness,不是模型
实验设计(为什么这次数据有说服力):

对照组 1:DeepSeek-V4-Flash + DeepSeek 官方 Harness
对照组 2:Claude Opus 4.8(闭源,自带官方环境)
实验组:DeepSeek-V4-Flash + Floatboat Harness

控制变量:
· 同一个模型底座(V4-Flash 0731)
· 推理大多走 DeepSeek 官方 API
· 独立沙箱隔离运行、输入参数一致
· 单位成本不变(模型没换、价格没变)

结果:
· 官方 Harness 上:DeepSWE 54.4,低于 Opus 4.8 的 58.0
  ——同厂系统下一项没赢
· Floatboat Harness 上:DeepSWE 67.25,五项全赢

成本对照(3:1 输入输出比的混合价):
· DeepSeek-V4-Flash:约 0.175 美元/M
· Claude Opus 4.8:约 10 美元/M,贵 57.1 倍

结论口径:唯一变量 = Harness
💡 关键不是「谁赢了」,而是「同一个模型换个执行系统能差出 23.6%」——这说明 Harness 不是「包装」,是真实的生产力变量。这正是《DeepSeek Harness 插件生态》「模型之外那半个系统」话题的第一次定量回答。

Step 2:增益随任务程长递增——最值得记住的规律

2 任务越长,Harness 越值钱
同一底座下,换 Harness 的增益(按任务程长排序):

短程任务:+1.9%
中程任务:+9.6% → +12.6% → +19.9%
长程任务(DeepSWE):+23.6%

规律:增益随任务程长单调递增(non-decreasing)

为什么?
· 短任务:模型答一步就完事,系统介入空间小
· 长任务:上下文怎么组织、工具返回怎么处理、
  状态存在哪、循环怎么收敛——每一步都影响成败
· 真实工作恰恰是长程的:
  跨文件、跨应用、跨权限、持续数小时甚至数天

同场对比(BrowseComp 榜单):
· Floatboat 87.80
· GPT-5.6 Terra 87.5 / Claude Sonnet 5 84.7 /
  Claude Opus 4.8 84.3 / GPT-5.6 Luna 83.3

含义:衡量 Agent 别只看「模型多聪明」,
要看「长任务完成率 × 单位成本」。

这是厂商自报数据,不是独立评测:Floatboat 是参赛方也是裁判,榜单数字(BrowseComp 87.80)与自家基准口径需谨慎对待。可采信的是「同底座换 Harness 增益递增」的机制本身——这符合行业对长程任务执行系统价值的共识。

Step 3:HLR——换 Harness 与换模型,哪个更划算

3 Harness Leverage Ratio 杠杆率指标
HLR = 换 Harness 的增益 ÷ 换模型的增益
(Harness Leverage Ratio,Harness 杠杆率)

读法:
· HLR > 1:换执行系统比换模型更划算
· HLR < 1:换模型更有性价比
· HLR ≈ 1:两边投入回报相当

Floatboat 的边界定义:
「除了模型本身之外的所有工作,
都属于 Harness 的范畴」——
文件系统权限、工具调用、上下文组织、
状态持久化、循环收敛、沙箱边界

为什么 HLR 有用:
· 团队预算有限时,先投回报高的一侧
· 避免「模型焦虑」:
  性能差 5 个点就急着换旗舰模型,
  可能不如把执行系统做好

实操建议:
· 用 HLR 思维做季度复盘:
  这季度模型和 Harness 各提升了多少?
· 长任务占比高的团队,HLR 通常 > 1
🚀 把 HLR 和《Agent 经济学》的「时薪/完成率×成本矩阵」合起来用:HLR 决定往哪投,经济学决定值不值——两个框架一横一纵,正好补全 Agent 投资决策。

Step 4:Floatboat 的设计哲学——为什么 Harness 能强

4 桌面运行时 + 非确定性才用 Agent
Floatboat Harness 的三个关键选择:

1. 桌面客户端做运行时
   · 文件管理器、编辑器、浏览器直接当
     Agent 运行环境
   · 理由:Web 端 Agent 感知不到文件结构、
     操作历史、跨应用流转——那些沉淀在
     行为里的隐性知识
   · 真实工作流是跨文件、跨应用、跨权限的
     长程任务,需要「操作系统级入口」

2. 不确定才上 Agent(FloatSail 自适应进化)
   · 能用 Workflow 或普通桌面操作完成的,
     根本不让模型参与
   · 只有出现不确定性时 Agent 才介入
   · 「省不是优化出来的,是被设计出来的」
     ——不让模型做不需要做的事

3. 自研全栈
   · Runtime / Agent Loop / Tools / Infra
   · 与《Agent Lightning》「Harness 与训练引擎
     解耦」的思路互为参照
💡 对我们普通团队最可迁移的一条:别让 Agent 处理确定性任务——能写死的工作流就写死,Agent 只留给真正需要判断的部分。这一条直接决定长任务的成本和成功率。

Step 5:落地自测——你的 Agent 系统 Harness 增益多大

5 一套能自己复现的评测方法
给团队自测 Harness 价值的四步法:

1. 选 3-5 个「真实长任务」做基准
   · 别用教科书样例,用你们线上跑过的任务
   · 记录:完成率、耗时、token 消耗、失败次数

2. 固定模型,换执行环境对比
   · 同一模型跑「官方环境」vs「你的 Harness」
   · 控制变量:同样任务、同样沙箱、同样输入

3. 计算自己的增益曲线
   · 把任务按「程长」分组,看增益是否递增
   · 如果短任务增益高 → 问题可能不在 Harness
     在提示词/工具定义

4. 算 HLR 做投资决策
   · 换 Harness 的增益 ÷ 换模型的增益
   · 决定下季度预算投哪边

衡量单位变化(行业共识):
从「单次回答多聪明」→
「完成一项长任务花多少钱、多久、失败几次」

别直接抄别人的基准:Floatboat 用的是 BrowseComp、DeepSWE 等榜单,你的团队任务结构不一样,增益曲线必然不同。榜单用来理解趋势,自家任务才决定预算。

Step 6:给你的选型启示

6 模型焦虑可以停了,把注意力放回系统
三个可落地的判断:

1. 选模型时,把执行系统算进去
   · 「V4-Flash + 好 Harness」可能胜过
     「旗舰模型 + 裸跑」
   · 参考《DeepSeek 峰谷定价》:
     成本差 50 倍时,性能差 5 个点
     不足以决定默认选择

2. 长任务团队优先优化 Harness
   · 上下文组织、工具返回、状态持久化、
     循环收敛——这些是长任务成败关键
   · 每提升 1% 都是长期复利

3. 建立自己的 HLR 基线
   · 每季度记录模型与 Harness 的增益
   · 让「系统投资」从玄学变成可量化

一句话总结:模型决定上限,Harness 决定
你能摸到多高——而长任务里,后者的
杠杆常常更大。
🎉 行动项:下周找 3 个你线上真实跑过的长任务,按 Step 5 的方法跑一遍基线——你可能会第一次看清「模型之外那半个系统」在你团队里的真实价值。
← 返回教程中心