9月7日前后,面壁智能(OpenBMB)联合清华 NLP 实验室发布 MiniCPM5-2B:一款总参数 25.17 亿(2.52B)的稠密因果语言模型,采用 42 层 Transformer 与分组查询注意力,原生上下文窗口达 131072 tokens。官方公布的 34 项基准平均得分 53.9,在同级 2B 开源模型里排名第一,甚至压过参与对比的 4B 级 Qwen3.5-4B(51.1 分)。
一、小模型凭什么「越级」
几个代表性成绩很能说明问题:LiveCodeBench v6 达 69.1 分、AIME 2026 达 86.5 分、MATH-500 达 94.6 分、τ²-Bench Telecom 达 97.1 分。拉开差距最大的,正是工具调用与代码智能体两项——这正是端侧 Agent 最吃香的能⼒。换言之,它不是「参数小、啥都弱」,而是在最该强的点上做了聚焦。
二、128K 与全开源意味着什么
原生 128K 上下文,让小模型也能吃下长文档、长对话、长代码库;权重走 Apache 2.0,支持 vLLM、SGLang、Ollama、MLX 等全套引擎,还同步开源了训练数据。对开发者而言,这意味着可以把它塞进手机、笔记本、车机,甚至离线环境跑起会调工具、会写代码的智能体,而不必每次都回云端。
三、端侧 Agent 的底座正在成形
过去端侧模型的尴尬在于:要么太弱用不了,要么太重带不动。MiniCPM5-2B 给出的答案是「小参数 + 强工具 + 全开源」。当一台普通设备就能跑起可调用本地工具的智能体,AI 的下沉速度会再快一档——隐私留在本地、成本趋近于零、响应不受网络制约。
四、仍需冷静看待
2B 级模型的天花板客观存在,复杂多步推理、超长程规划仍非其强项;所谓「同级第一」也受对比集合影响。但对「轻量、私密、低成本」的场景,它提供了一个极具诚意的选项。在云端模型越来越贵、越来越大的当下,端侧小模型的回归,本身就是一种平衡。