2026 年 5 月 25 日,OpenBMB(清华系团队)发布了 MiniCPM5-1B——1.08B 参数的稠密 Transformer。
1B 这个规模放在 2026 年听起来不大。但它的成绩单不像是 1B 该有的:Artificial Analysis 小模型榜单排名第一(17.9 分),超过了 Qwen3.5-2B 的 16.3 分。 INT4 量化后权重只有 0.5GB。手机、树莓派、十年前的老笔记本都能跑。
这是 MiniCPM 系列的第五代了。OpenBMB 从 MiniCPM-2B(2024 年 2 月)开始,一直在做一件事:把小模型做聪明。到 MiniCPM5-1B,这件事已经做得相当好了。
它在小模型里强在哪
在同一尺寸范围的对比中,MiniCPM5-1B 的优势最明显的在三个维度:
- Agentic 工具调用——小模型通常在这个维度上很弱,调用外部工具时经常输出格式错误或乱填参数,但 MiniCPM5-1B 在这块反而表现最好
- 代码生成——超过 Qwen3.5-2B 和 LFM2.5-1.2B-Thinking
- 高难推理——和 Qwen3.5-2B 相当,超过其他同尺寸模型
这三个维度恰恰是小型端侧模型通常最薄弱的环节。能把它们做成优势,说明训练方法和数据质量确实有东西。
怎么做到的:UltraData + OPD
MiniCPM5-1B 在架构上没有创新——它就是标准的稠密 Transformer。创新在训练方法。
OpenBMB 自研了一套叫 UltraData 的分级数据管理体系。粗看像营销词汇,细看其实挺扎实:他们把训练数据分成多个层级(L0-L4),每个层级负责不同的能力——底层基础语料建语言能力,高层 SFT 数据教推理和工具调用。
训练流程分三个阶段:
- Base Training——稳定训练 + 衰减训练,建核心语言能力
- Mid-Training——强化目标能力,适配分布
- Post-Training(SFT → RL → OPD)
OPD(On-Policy Distillation)是整个流程里最有意思的部分。不是用一个教师模型蒸馏——而是为数学、代码、闭卷问答、写作等领域分别训练专用的 RL 教师,然后把多个教师的知识蒸馏回一个模型。
效果:数学、代码和指令遵循任务上平均分提升 +16 分,因 token 预算耗尽而过长的回复占比下降了 29 个百分点。
训练数据也全部随模型开源:Ultra-FineWeb、Ultra-FineWeb-L3、UltraData-Math、UltraData-SFT-2605(1500 万样本)。如果你在做自己的小模型训练,这些数据集本身就是有价值的资源。
双模式推理:一份权重两种用法
和 Qwen3.5、DeepSeek-R1 系列一样,MiniCPM5-1B 支持思考/非思考模式切换,通过 enable_thinking 参数控制:
- 非思考模式:快速响应,适合日常对话、简单问答
- 思考模式:生成推理链,适合数学、代码、逻辑推理
能在 1B 参数规模下维持有质量的深度推理,是技术上最值得一提的突破。小模型做推理通常输出质量不稳定——有时候能推理出正确答案,有时候在简单问题上也会翻车。MiniCPM5-1B 在这个尺寸上做得相对可靠,虽然不是每次都准,但比同尺寸的其他模型稳定的多。
与其他 1B 级模型的简单对比
| 模型 | 参数量 | 内存(Q4) | 推理模式 | 工具调用 |
|---|---|---|---|---|
| MiniCPM5-1B | 1.08B | ~0.7GB | 双模式 | ✅ |
| Qwen3.5-0.8B | 0.8B | ~0.5GB | 无 | ❌ |
| LFM2.5-1.2B | 1.2B | <1GB | 单模式 | ❌ |
| Gemma 3 2B | 2B | ~1.7GB | 无 | ❌ |
MiniCPM5-1B 在 1B 级别是综合最强的,但如果你能接受略大一点的体积(2B、3B),Phi-4 Mini 或 Gemma 3 2B 在某些任务上表现可能更好。选择取决于你的硬件极限在哪里。
本地部署
INT4 量化后 0.5GB。你不需要 GPU,不需要大内存,不需要云计算。
官方提供了面向 vLLM、SGLang、Transformers 的 inference cookbook,以及 LLaMA-Factory、MS-Swift、Unsloth、XTuner 的微调教程。
FlagOS(智源研究院主导的多芯片适配平台)已经完成了在以下芯片上的适配:NVIDIA、Hygon、Metax、Iluvatar、Ascend、ARM-v9。这意味着你可以在国产芯片服务器上跑 MiniCPM5-1B。
OpenBMB 还附带做了一个桌宠应用——一个由 MiniCPM5-1B 本地驱动的桌面宠物,在桌面上跑来跑去,可以直接对话。看起来像玩具,但实际上是端侧部署的一个很好的 Demo:1B 模型跑在本机,不需要联网,不需要 GPU,普通电脑就能跑。对于想向非技术 audience 展示"本地 AI 能做什么"的人来说,这个桌宠比 benchmark 数字有说服力得多。
一句话
MiniCPM5-1B 的意义不在于参数规模——1B 在这个时代不算大——而在于它证明了 1B 参数的模型也能做好推理和工具调用,并且有完整的数据体系和方法论支撑。
对于需要本地部署、隐私保护、低成本推理的场景——手机应用、IoT 设备、边缘计算——它是目前最好的选择之一。INT4 0.5GB 的体量意味着它可以在几乎任何现代设备上运行。
当然,1B 模型的推理质量上限是客观存在的。它适合处理结构清晰、范围明确的任务。如果你需要复杂的长文档分析或多步 Agent 流程,还是需要更大的模型。
- GitHub:github.com/OpenBMB/MiniCPM
- ModelScope:modelscope.cn/models/openbmb/MiniCPM5-1B
- 技术博客:ultradata.openbmb.cn/news