Brett Adcock 的下一家公司
Hark 由 Brett Adcock 在 2025 年底创立,此人也是人形机器人公司 Figure 与电动垂直起降公司 Archer Aviation 的创始人。Handoff 于 2026 年 8 月 5 日以研究预览形态上线,官网开放候补名单。公司 2026 年 5 月完成 7 亿美元 A 轮、估值 60 亿美元,由 Parkway Venture Capital 领投,Nvidia、AMD Ventures、Intel Capital、Qualcomm Ventures、Salesforce Ventures 跟投,Adcock 本人据称先投了 1 亿美元。资金厚度让它在发布时就有底气把价格压到极低。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。
核心:预测动作而非预测 token
Handoff 与标准大模型的根本区别,是它不预测下一个词,而是预测下一个动作——屏幕上某个具体坐标的一次点击、一次滚动或一段键入。它不调用网站 API,而是像人一样看页面的布局与像素,然后去点按钮、填字段、滚页面。这一点之所以重要,是因为真正有用的网页大多没有值得调用的 API;那些没有 API 的站点,恰恰是智能体用「读界面」方式才能操作的盲区。Hark 给出的任务实例包括端到端在 DoorDash 或 Uber Eats 点餐、在 United/Delta/American 之间比价订票、去 LinkedIn 挖掘并私信候选人,以及报税、OpenTable 订位这类真表单、真流程的琐事。
成绩:OM2W 97.7%,但对比的是上一代
按 Hark 自己公布的 Online-Mind2Web(OM2W)结果,Handoff 拿到 97.7%,超过 OpenAI GPT-5.4 的 92.8、Anthropic Claude Opus 4.8 的 84.1、Google Gemini 2.5 Pro 的 69。这个分数被 Hark 称为「史上最高」。但必须点破的冷静事实是:OpenAI 的 GPT-5.6 与 Anthropic 的 Opus 5 这两款最新模型尚未公布 OM2W 分数,所以「史上最高」的参照系其实是上一代领跑者,而非当前前沿。Google、Anthropic、OpenAI 都在争同一块地,Browser Use、Perplexity 的 Comet 也是同赛道玩家——Hark 的领先地位能否在对手公布新分数后保住,要等实测而非通稿来答。
隔离执行:每个任务一台虚拟计算机
Handoff 的每一次请求都在一台独立的虚拟计算机里运行,里面自带浏览器、文件系统与终端,以此保证任务隔离与执行完整性。当前版本基于 post-trained 模型(用监督微调加 GRPO 异步强化学习训练),公司计划年内转向完整预训练以打磨数据管线与训练基础设施。这种「每任务起一台沙箱」的取向,和它在价格上敢打「可以一直开着」的卖点是一体的:便宜到能常驻后台,才谈得上真正替人跑腿。
价格:0.18 美元每百万输入 token
价格才是 Handoff 真正站住的地方。Hark 称其输入 token 0.18 美元、输出 token 2.37 美元每百万;按 VentureBeat 对发布的报道,GPT-5.5 同等价位分别是 5 美元与 30 美元——差距超过一个数量级。据称每轮模型延迟约 0.8 秒。这个价差意味着智能体可以从「只在真需要时跑一次」变成「可以常驻后台持续待命」。Hark 计划夏末更广泛地公开发布。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。
冷静看:前沿模型尚未同台
对工程团队与采购方,最该记牢的是那句 caveat:基准会被质疑,价格不会。Handoff 在成本与隔离架构上确实给出了可验证的差异化;但「97.7% 历史最高」的叙事建立在对手最新模型未参测的前提下。把它当作 computer-use 赛道一个有资金、有打法、价格激进的重要玩家是对的;把它当成已经锁定王座,则为时过早。等 OpenAI 与 Anthropic 公布各自最新分数,这块排行榜才会真正定型。
结语
Handoff 用「预测动作而非预测词」加隔离虚拟机加十倍低价,把浏览器智能体从演示推进到可常驻的成本区间。它的发布提醒行业:computer-use 的竞争不只在谁的分高,也在谁能让智能体便宜到一直替你点下去。至于王座,得等最新前沿模型同台后再论。