国内首个「既开源、又日调用十亿级」的多模态嵌入模型出现了。微信 AI 视觉团队近日正式开源通用多模态嵌入模型 WeMM-Embedding,提供 2B、4B、9B 三种参数版本,把「研究 SOTA」与「生产级吞吐」同时跑通。

一、统一语义空间,跨模态对比与检索

模型基于 Qwen3.5 多模态架构,支持文本、图像、视频、视觉文档以及任意交错的多模态输入,核心能力是把不同模态内容映射到同一语义空间,实现跨模态对比与检索。在国际权威评测 MMEB-v2 上,WeMM-Embedding 综合排名第一,超过所有已提交的开源与闭源模型。

二、真实业务负载即公开证据

朋友圈搜索、视频号推荐、公众号推荐、微信电商均已大规模接入,日均调用规模突破 10 亿次。完整技术资源同步公开:论文上 arXiv,代码在 GitHub Tencent/WeMM-Embedding,权重在 Hugging Face。用自家十亿级业务负载为技术背书,是国产多模态基础设施少见的「开源即生产」样本。

三、为什么嵌入模型是 Agent 的隐形地基

当下几乎所有 RAG、推荐、搜索系统都需要多模态嵌入,而行业方案长期被 CLIP、SigLIP 等海外模型主导。WeMM-Embedding 的出现,意味着智能体在做「检索记忆」「跨模态理解」「知识库对接」时,多了一层国产可控的语义底座。对 Agent 应用而言,嵌入质量直接决定检索准不准、记忆稳不稳。

四、客观看:开放权重 ≠ 免费替代

模型虽已开源,但要在自家场景达到微信级别的效果,仍需相应的工程与算力投入。它的价值更多在于把「多模态嵌入」这一关键层从海外依赖中拉回国内选项,并为微信 AI 从「功能插件」走向「对外开源标准基座」铺路。