8 月 20 日,一个名为 OX Alpha(标注为「stealth / ox-alpha」)的匿名模型突然出现在 OpenRouter 上,以零定价、为期一周的预览姿态登场。它没有官网、没有发布博客,却在编程基准上逼近甚至超过多家闭源旗舰,并在 24 小时内被 Nous Research 的 Hermes Agent 与 Zed 编辑器接入。一个来历不明的模型,凭什么一上来就站到第一梯队?这场「空降」迅速演变成一场围绕身份、评测与信任的行业推理剧。

一、它到底有多强

公开可验证的数据相当扎眼:在 DeepSWE 编程基准的 Pass@1 上,OX Alpha 达到约 80%,而同口径下 GPT-5.6-sol 约 52%、Claude Fable 5 约 65%、GLM-5.3 约 62%。上下文窗口约 104.8 万 token、最大输出 13.1 万 token;支持文本、图像与原生视频理解,具备函数调用、结构化 JSON 输出与 Agent 工作流能力。更反常的是它的落地速度——匿名身份并未阻碍生态接纳,Nous Hermes Agent 与 Zed 在一天之内就完成了集成。在模型迭代如此密集的当下,这种「零存在感却零时差上车」的组合,本身就极不寻常。

二、身份之谜:技术指纹指向智谱

独立研究者 Ben Davis 对 OX Alpha 做了一轮技术指纹比对,结论是「约 99% 确信」它属于智谱 AI 尚未发布的 GLM-5.x 多模态旗舰。他列出的证据链包括:视频编码器的 token 消耗模式与 GLM-5V-Turbo 高度一致(约 147 tokens/秒、且与帧率无关);分词器(tokenizer)与 GLM-5.3 对齐,包裹差约 ±75 token;音频拒答行为吻合;输出 emoji 风格(每千字约 1.3 个)与 GLM/Qwen 系列趋同;架构估算为约 7440 亿总参数、约 400 亿激活的 MoE。需要说明:以上均属第三方研究者的推断,官方并未确认,模型真实归属与参数仍属「行业暂未披露」。

三、「影子模型」正在成为一门手艺

OX Alpha 并非孤例,它延续了中国实验室用匿名「stealth 模型」做发布前压测的既定模式。对厂商而言,匿名亮相有几重现实好处:在真实负载与社区使用中检验稳定性、收集反馈、并避开「发布即被对标」的舆论压力。代价同样清晰——评测数据脱离官方口径,能力归属模糊,榜单与采购方都难以据此形成可信判断。当「先匿名、后认领」成为默契,模型能力的比较基础就被悄悄掏空了一块。

⚡ 关键判断

匿名模型的真正争议,不在于「强不强」,而在于「强得能不能被验证」。能力可以惊艳,但身份若不可溯,评测、认证与采购决策的可信度都会被一并打折。

四、它暴露的信任缺口

更深层的信号是:当模型能力可以「匿名亮相」,行业对「模型身份」的验证机制几乎是缺位的。今天的评测榜单、能力认证、乃至企业选型,大多默认「报谁就是谁」。OX Alpha 这种案例提醒我们,评测体系需要补上身份可验证这一环——否则一场高分,可能既无法归属,也无法复核。这并非否定开源与开放测试的价值,而是说,开放应当伴随可追溯的标识。

五、对行业的三点启示

  1. 评测要补「身份层」:未来看榜,除了分数,还要问一句「这是谁、是否可验证」。
  2. 压测本身有价值,但需透明:匿名收集真实负载反馈可以接受,但发布前的归属披露应有底线。
  3. 中国开源/开放模型的「发布礼仪」正在成型:从 stealth 测试到正式认领,行业需要一套更清晰的预期,避免社区在猜测中消耗信任。

无论 OX Alpha 最终是否认领为 GLM-5.x,它都已经把「模型身份可信」这个本该前置的问题,摆到了台面上。对仍在高速演进的智能体行业来说,这或许比一次基准登顶更值得记录。