美东时间 8 月 12 日,马斯克旗下的 SpaceXAI 以「一天两发」的节奏向智能体市场投下重磅:先发布多智能体协作产品 Grok Bot 早期测试版,随后正式推出新一代旗舰模型 Grok 4.6——前者被外界视为 SpaceX 6 月以 600 亿美元全股票收购编程工具 Cursor 之后交出的第一份整合答卷,后者则延续 Grok 一贯的效率路线,把 API 定价压到竞品的一半。新模型叠加新 Agent 的组合拳,把行业目光再次拉回「长时程任务」「自主执行」与「单任务成本」三个关键词。

一、Grok Bot:云端虚拟机里的「AI 同事」,关机也不停

Grok Bot 的定位并非工具,而是「始终在线的智能体助手团队」:每个 Bot 背后是一台独立的云端 Linux 虚拟机,拥有自己的浏览器、文件系统与终端,能像人一样打开网页、点击按钮、填写表单、截取屏幕。你在 Gmail 登录一次,Bot 就能用你的会话处理邮件;在 Salesforce 登录一次,它就能更新客户信息、拉取报表、回答季度问题——而这一切都不需要你打开笔记本电脑。由于任务在云端执行,合上电脑后台工作照常推进,只有遇到登录、SSO 验证、支付确认等需要人类决策的关口时,Bot 才会主动把控制权「递」给你,操作完成后它接着干。这一设计直接回应了此前个人 Agent 的致命伤——过去任务依赖本机运行,一断网或关机就中断;一个月前 Claude Cowork 宣布上云解决同一问题,而 Grok Bot 从出生第一天就是云原生的。团队作战是其另一特色:用户可以同时开启多个 Bot 各司其职,由一名「首席 Bot」统筹,下设专项 Bot 分别负责邮件、销售数据、竞品监控、内容草稿等任务,多个 Bot 可被拉入群聊自主协调、分配任务、指定负责人,仅在需要最终判断时请求用户介入。目前 Grok Bot 处于早期测试阶段,支持 macOS、Windows、Linux 与 iOS,面向 SuperGrok Heavy、Cursor Ultra 与 Cursor Teams Premium 订阅用户开放,企业版可加入候补名单;SpaceXAI 表示已在内部的工程、增长与营销团队使用这款产品,例如销售团队借此寻找新客户账户、夜间自动起草邮件,财务团队则用它从邮件提取收据。

二、Grok 4.6:同一底座、纯后训练,冲着「长环路」而来

与 Grok Bot 同日亮相的 Grok 4.6,是 Grok 4.5 发布五周后的快速迭代。值得注意的是,4.6 与 4.5 共享同一 1.5 万亿参数基础模型,本轮升级全部发生在后训练阶段:更长周期的补充训练、经过筛选的模型生成推理数据与工程数据、改进的优化器,以及由 Grok 4.5 重新生成并过滤的 SFT 轨迹,再加上面向内核优化、网页开发、计算机辅助设计等领域环境的 Agentic 强化学习。厂商的卖点不是单点基准冲刺,而是长环路可靠性——多步研究、跨代码库作业、把一个模糊的产品想法变成可运行的应用雏形,且在更长的任务轨迹中开始出现更多自主测试与验证行为(在继续执行前检查此前的工作)。厂商公布的数据显示:Artificial Analysis Intelligence Index(九项基准综合)得 61 分,与 GPT-5.6 Sol Max 持平(Claude Fable 5 Max 为 62,Grok 4.5 High 为 56);知识工作基准 GDPVal-AA v2 达 1753 Elo,超过 GPT-5.6 Sol Max 的 1728 与 Fable 5 的 1741;软件工程基准 DeepSWE v1.1 为 65.9%(Grok 4.5 为 54%),Terminal-Bench v3.0 为 26%(Grok 4.5 为 15.7%)。需要客观标注的是,这些数字均为厂商自报,尚无独立评测确认。

三、一半的价格与双倍配额:用「单任务成本」打天下

Grok 4.6 最具可验证性的优势在定价与分发。API 起售价为 2 美元/百万输入 Token、6 美元/百万输出 Token(快速版翻倍),约为竞品的一半——对比 Claude Opus 4.8 的 5 美元/25 美元,输入低约 60%、输出低约 76%;模型支持 50 万 Token 上下文。上线首周,Cursor 与 Grok Build 用户还可享受双倍包含用量。分发方面,Grok 4.6 上线当天即进入 Cursor、Grok Build、SpaceXAI API,以及 OpenRouter、Vercel、Cloudflare 等合作伙伴渠道——收购 Cursor 带来的开发者分发红利开始兑现。对 Agent 工作负载而言,价格的意义被显著放大:一个经历四十次工具调用的 Agent 循环,每次都会重发不断增长的对话记录,Token 花费随循环长度近似平方级增长,直到缓存与压缩生效——因此「单任务成本」而非「单 Token 价格」才是决定 Agent 产品能否盈利的指标,而 Grok 的 Token 效率与低价正是其切入点。分析人士也指出一个缺口:Grok 4.6 文档未公布缓存输入价格,而 Agent 循环高度依赖缓存,真实成本对比仍不完整。

四、客观看:叙事可信,数字待验证

几点客观边界需要标注。其一,能力宣称均出自厂商自报,独立评测缺位——Grok 4.5 时代独立榜单就曾将其排在第一梯队之后,本次「与 GPT-5.6 Sol 持平」应视为营销口径而非结论,真实差距可能集中在长环路可靠性与安全护栏上;其二,Grok Bot 让 Agent 复用用户在各平台的登录会话并长时间自主运行,其权限模型、会话凭证管理与隐私边界仍有待观察,行业暂未披露详细的安全设计;其三,「首席 Bot 统筹 + 多 Bot 并行」的真实任务成功率缺乏公开数据,多智能体协作的可靠性仍是行业普遍难题;其四,SpaceXAI 的产能与稳定性(此前 Grok 高峰期曾出现排队)会直接影响其以低价换规模的策略。总体而言,Grok 4.6 是一次务实且方向明确的效率型迭代,Grok Bot 则是 SpaceXAI 完成 Cursor 收购后的生态整合首秀——两家公司的真正胜负手,不在发布日的榜单,而在「单任务成本」与「长环路可靠性」这两条更硬的标准上。