8 月 28 日,腾讯混元发布并开源新一代大语言模型 Hy4 preview。规格摆得相当直白:总参数 770B,激活参数 49B,上下文长度突破 1M。定价延续普惠路线——输入 6 元/百万 tokens,输出 18 元/百万 tokens,缓存命中 0.3 元/百万 tokens。模型已在 WorkBuddy、CodeBuddy(国内版与国际版)、元宝、ima 等腾讯产品同步首发,开发者也可通过腾讯云 Tokenhub 与 OpenRouter 接入 API。

一、770B 配 49B:把模型养大,按出勤结账

总参数 770B、激活 49B 的组合,延续了这一年主流的 MoE 选择:把模型整体养大,但每次推理只唤醒一部分专家。总参数量决定它「见过多少世面」,激活参数量决定算一个 token 花多少钱。相比稠密模型,相当于从全员上班改成按出勤结账,规模还能继续往上堆。

1M 上下文是另一件硬通货。这个长度意味着它可以一次吞下整个代码仓库、一整套项目文档或几十万字的资料合集,再开始动手。对长程开发任务而言,能不能「一次看完全貌」,往往直接决定 Agent 是帮你干活还是帮倒忙。

二、不刷榜,评的是「能不能交付」

腾讯给 Hy4 preview 的定位是「为生产力而生」。训练数据来自与软件工程、游戏、金融、安全等领域内部专家的高质量共建,并与 WorkBuddy 等产品做了深度协同(Co-Design)。

最能说明这套打法的,是官方披露的一场内部盲测:163 名内部专家、203 个工程任务,Hy4 preview 均分 2.99(满分 4),略优于 GLM-5.3 的 2.92 与 Kimi K3 的 2.94。分数咬得很紧——差距都在小数点后两位。

但需要如实标注:这是腾讯自行组织的内部盲测,不是第三方公开榜单。它的参考价值更多在于「任务类型选得对不对」——评委是自己人、任务是真活儿,水分挤得比较干净;但外部可验证性有限,不宜当作跨模型排名的依据。

三、四条场景线:软工、办公金融、游戏、科研

具体落点上,官方列了四个方向。软件工程侧,增强长程开发任务的理解、规划、调试与验证能力,并提升前端开发的视觉审美与交互质量;办公分析侧,提升复杂办公环境理解与金融分析能力,着重优化数据分析与跨文件协作,完成从信息处理到文档、表格与演示文稿交付的完整流程;游戏开发侧,增强一句需求直接生成可玩原型的能力,并能熟练使用游戏引擎,通过多轮交互持续完善复杂项目;科学研究侧,覆盖 AI 研发、分子动力学模拟、凝聚态物理与基础数学等场景。

这个组合很「腾讯」——不追通用榜单上的单点分数,而是往自家业务最强的几个方向压。

四、最值得琢磨的:它参与了造自己

这次发布里真正新鲜的部分,其实不在参数表上。腾讯披露,Hy4 preview 首次参与了自身研发的全链路:训练方法、数据策略、评估体系与底层算子的自动优化,它都插了一手。流程是它提方案、跑实验、根据结果继续迭代,实验产生的代码、日志与反馈进入下一轮探索。官方把这套机制称为「初步的递归自我改进闭环」。

更具体的一项成果落在推理基础设施上:模型自主分析推理系统的瓶颈,围绕算子融合、通信优化等方向开展多轮优化,端到端吞吐相较基线提升 31.8%,且在不同上下文长度与并发度下均取得稳定收益。

31.8% 这个数字值得单独拿出来说,因为它是可量化、可归因到具体工程动作的结果,而不是「模型更强了」这种模糊表述。

五、客观看:闭环是真的,但别急着叫「自我进化」

措辞上需要克制。所谓递归自我改进,目前仍停留在「在人类设定的搜索空间内做工程优化」这一层——优化算子融合、调整数据配比、迭代评估方案,这些都是有明确目标函数、可自动验证的任务。它离「模型自主提出新的架构范式」还有相当距离,官方用的也是「初步」二字。

但方向确实变了。过去模型是训练流程的产物,现在它开始成为训练流程的参与者。对 Agent 赛道而言,这意味着「AI 参与造 AI」不再是论文里的设想,而是已经进了大厂的研发流水线。

节奏上,自今年 2 月重建基础设施以来,混元采用 preview 先行、正式版跟进的方式,平均每两个月迭代一个大版本。按此节奏,Hy4 的下一版模型将在近期上线,具体时间官方尚未公布。另据官方信息,Hy4 preview 在 WorkBuddy 与 CodeBuddy 上提供为期两周的限时免费体验,Hy3 在这两个平台的免费使用期限延长至 9 月 30 日。