2026年6月25日,美团技术团队以罕见的密度集中发布了9项AI技术成果——从开源原生多模态模型到交互式视频世界模型基准、从语音克隆到数学定理证明、从具身动作表示到数字人模型。这是美团在AI领域迄今最大规模的一次技术集体亮相。

如果逐一来看这9项发布,它们并非零散的成果堆砌,而是指向同一个深层信号:美团正在系统性地构建从底层模型到上层应用、从能力建设到评估标准的AI全栈技术体系。具体发布项目如下:

一、LongCat-Next 原生多模态模型开源

美团 LongCat 团队正式开源了 LongCat-Next,一个面向物理世界AI感知的原生多模态模型。该模型将视觉和语音作为"原生语言"进行统一建模,弥合数字智能与现实交互之间的鸿沟。随模型一同发布的还有专用离散分词器 dNaViT。此前,LongCat 系列已开源了 LongCat-Video-Avatar 1.0、LongCat-Audio 等多个子项目,此次更新是对多模态基础能力的进一步夯实。

二、WBench:首个交互式视频世界模型基准

WBench 是首个面向交互式视频世界模型的系统性多轮评估基准。它被设计为 AI 的"CT 扫描仪",旨在精确定位当前世界模型在从"被动视频生成"转向"主动用户驱动交互"时的瓶颈所在。评估场景包括月球漫步、网络化城市环境等复杂交互场景,测试目标明确——识别模型在模拟响应环境过程中"卡住"的位置。

这一基准的发布恰逢其时。当前主流视频生成模型正从"单向生成"向"交互式模拟"演进,但缺乏统一的评估标准来衡量进展。WBench 恰好填补了这一空白。

三、General 365 推理基准测试:Gemini 3 Pro 最高仅 62.8%

General 365 是美团推出的用于评估大语言模型推理能力的严格基准,涉及 26 个主流 AI 模型。测试结果揭示了当前大模型推理能力的真实水平:表现最好的 Gemini 3 Pro 准确率仅为 62.8%,而绝大多数测试模型甚至未能达到 60% 的及格线。

这一结果与近期 UC Berkeley 发布的 Agents' Last Exam 基准测试结论一致——当前最先进的 AI 模型在复杂逻辑推理任务上仍面临系统性挑战。美团将 General 365 开源,为行业提供了一个更严格的推理能力"度量尺"。

四、LARYBench:具身动作表示的"ImageNet 时刻"

LARYBench(Latent Action Representation Yielding Benchmark)是美团技术团队发布的具身动作表示评估框架,被描述为具身智能领域的"ImageNet"。其核心发现具有突破性意义:通用视觉模型在动作泛化和控制精度上显著优于专用具身 AI 动作专家模型;复杂的具身动作表示可以从大规模人类视频数据中自然涌现。

这一发现颠覆了"具身智能需要专用动作模型"的行业共识。如果通用视觉模型确实能更好地学习具身动作表示,那么行业将可以大幅降低对专用具身训练数据的依赖——这对整个人形机器人产业的研发成本结构都是一个积极信号。

五、LongCat-Video-Avatar 1.5 数字人模型

LongCat-Video-Avatar 1.5 是美团开源的商业级数字人视频建模模型。相较 1.0 版本,1.5 在五大领域实现改进:唇形同步精度、物理合理性、长视频稳定性、多人交互能力和推理效率。从实验"排练"环境向真实世界多样化应用的转化,是这一版本的核心升级方向。

六、LongCat-AudioDiT 语音克隆模型

LongCat-AudioDiT 是面向零样本文本转语音(TTS)语音克隆的先进模型。其核心技术创新在于:摒弃传统的梅尔频谱中间表示,直接在波形潜在空间中运行,采用扩散框架。这种设计消除了多阶段数据转换中的级联错误,实现了从文字到语音的一步到位式高保真复制。

七、LongCat-Flash-Prover 数学定理证明模型

LongCat-Flash-Prover 专注于数学形式化和定理证明。其核心理念是从"猜测答案"转向"严格证明"——消除自然语言中的歧义,将数学推理过程形式化。这一模型与 DeepMind AlphaProof Nexus 等数学证明 AI 方向一致,反映了 AI 在数学领域从"模式匹配"走向"逻辑推理"的长期趋势。

八、AIGC 海报生成框架(商业已部署)

美团智能创作团队开源了一套完整的 AIGC 驱动海报生成技术系统,基于"生成-编辑-评估"闭环架构。目前已在美团外卖和品牌 IP 场景中大规模商用。这意味着这套系统不仅停留于论文阶段,已经经历了真实业务场景的验证和打磨。

九、ACL 2026 六篇论文被收录

美团技术团队有 6 篇研究论文被 ACL 2026(计算语言学顶级国际会议)录用,研究方向涵盖大规模模型评估、复杂过程推理、竞赛级数学思维优化、强化学习优化、生成式推荐系统等。6 篇论文的同时入选,也从一个侧面印证了美团在 NLP 和 AI 基础研究领域的积累深度。

深度观察:美团 AI 路线图的三个信号

9 项成果在同一天集中亮相,不可能是随机的。从战略层面分析,这次集中发布释放了三个明确的信号:

信号一:从"应用公司"走向"技术公司"。外界对美团的认知更多停留在"外卖平台"层面,但这次集中发布覆盖了多模态、推理、具身智能、数字人、定理证明等多个前沿方向,展示了美团在 AI 基础研究领域的真实投入和产出。

信号二:系统性布局"评估能力"。WBench、General 365、LARYBench 三款基准测试的同日发布,说明美团不仅要"做 AI",还要定义"如何衡量 AI"。这种评估体系建设能力是 AI 技术生态中极有价值但常被忽视的一环。

信号三:开源战略驱动生态影响力。多项成果选择全面开源——从 LongCat-Next 模型到各个基准测试工具——表明美团正通过开源建立自己的技术影响力,吸引社区贡献者围绕其技术栈构建生态。

对于整个 AI 行业来说,美团这一天的密集发布也表明:AI 基础研究的竞争正在从少数大模型公司扩展到更广泛的科技企业群体。当外卖平台都能在一天内拿出 9 项 AI 技术成果时,中国 AI 基础研究的"水深"可能比外界想象的要深得多。

← 上一篇:Anthropic 发布 Claude Tag 返回资讯首页 →