OpenBMB 发布 MiniCPM5-2B,提供 Apache-2.0 权重与智能体训练数据
MiniCPM5-2B 将 128K 上下文窗口与可下载权重、量化版本、分阶段检查点及智能体训练数据集结合起来。
文章目录 · 12
OpenBMB 于 2026 年 9 月 7 日发布 MiniCPM5-2B,提供采用 Apache-2.0 许可的紧凑型语言模型权重、多种量化格式、中间检查点、部署文档,以及相当大一部分训练数据。
此次发布的亮点在于,将较小的部署占用与可衡量的智能体能力相结合。Artificial Analysis 目前在 4.2 版本下给予 MiniCPM5-2B 的 Intelligence Index 分数为 15,这是总参数低于 40 亿的开放权重模型中的最高成绩。这一独立结果使其领先 Granite 4.2 3B 四分,并与规模大得多的 Qwen3.5 9B 推理配置持平。
OpenBMB 的公告和原始 X 帖子中流传的 23 分,并非该模型当前的指数分数。该分数来自 Artificial Analysis Intelligence Index v4.1.1。此后,评测提供方在 v4.2 中调整了基准组合和权重,使 MiniCPM5-2B 的报告分数降至 15。两个版本的结果不能直接比较。
一、OpenBMB 发布了什么
MiniCPM5-2B 是一款基于标准 LlamaForCausalLM 架构的稠密型纯文本因果语言模型。尽管其产品名称如此,该检查点总计包含 2,516,756,480 个参数,其中 1,981,982,720 个为非嵌入参数。因此,Artificial Analysis 将其归类为 26 亿参数模型。
该架构拥有 42 层,采用分组查询注意力机制,具有 16 个查询头和两个键值头,原生上下文长度为 131,072 个 token。其标准的 Llama 兼容实现意味着,常见推理框架无需针对模型特定的架构分支或自定义内核即可加载它。
OpenBMB 发布的不止一个指令微调检查点。可用制品包括最终 BF16 模型、仅预训练基础检查点、中期训练检查点、强化学习和蒸馏前的仅 SFT 检查点、四比特 GPTQ 版本、面向 Apple Silicon 的四比特 MLX 版本,以及供 llama.cpp、Ollama 和 LM Studio 使用的 GGUF 文件。
官方 GGUF 仓库提供 5.04 GB 的 F16 文件、2.68 GB 的 Q8_0 量化版本,以及 1.56 GB 的 Q4_K_M 量化版本。这些体积使许多消费级系统能够进行完全本地化运行。OpenBMB 将该模型定位为适用于边缘和端侧使用,但发布材料未提供经过独立验证的手机专用速度、内存、电池或散热测量结果。模型文件能够装入手机存储空间,本身并不能证明其在不同设备或长上下文下具备可接受的移动端性能。
此外,还有一个用于推测解码的 DSpark 草稿模型。它通过 SGLang 与 MiniCPM5-2B 配合时,会提出由目标模型验证的 token 块,旨在不改变目标模型已接受输出的情况下加速生成。
截至发稿时,Hugging Face 未列出该主检查点的托管推理提供商。因此,立即可用的访问方式是下载并自行托管模型,而非购买官方 API 调用。
二、基准测试结果及重要的版本变更
OpenBMB 报告称,其在涵盖代码、数学、指令遵循、知识、长上下文理解、工具使用和多种智能体任务的 34 项评测中,平均得分为 53.9。在开发者的对比表中,所列规模更大的参考模型中最高平均分为 Qwen3.5-4B 的 51.1。
这项 53.9 的数据应被视为开发者报告的综合分数,而不是通用模型评级。它平均了不同基准测试,并包括许多由 OpenBMB 内部复现的结果。部分报告分数包括:LiveCodeBench v6 上的 69.1、AIME 2026 上的 86.5、BFCL v4 上的 66.6、SWE-bench Verified 上的 46.4、GAIA Text-103 子集上的 88.7,以及 τ³-Bench Banking 上的 20.8。OpenBMB 标明了哪些条目来自 Artificial Analysis,哪些通过其自身评测设置复现。
Artificial Analysis 为该模型在同等规模类别中的位置提供了最有力的独立确认。在 Intelligence Index v4.2 下,MiniCPM5-2B 得分为 15,而 Granite 4.2 3B 为 11,支持推理的 Qwen3.5-4B 估算为 14。Ling 3.0 Tiny 以 16 分高出一分,但其总参数量约为前者的三倍。
独立结果也界定了该模型的局限。MiniCPM5-2B 在 Humanity’s Last Exam 上得分 9%,在 Terminal-Bench v2.1 上得分 9%,在 CritPt 上得分 0%,在 SciCode 上得分 26%,在 Artificial Analysis 的长上下文推理评测中得分 59%。这些数据不支持将该模型视为大型前沿系统的通用替代品。
其智能体结果更具竞争力。MiniCPM5-2B 在 GDPval-AA v2 上取得 831 的 Elo 分数,其中 1,000 代表该评测使用的人类基线。它在 τ³-Banking 上得分 21%,在 AA-Briefcase 上取得 438 的 Elo 分数。Artificial Analysis 将其 Agentic Index 定义为这三项评测的加权平均值。
该模型每项 Intelligence Index 任务大约使用 19,000 个输出 token,其中包括约 11,000 个推理 token。这与 Granite 4.2 3B 并列为对比集合中输出 token 使用量最低的模型,约为 Ling 3.0 Tiny 的 56,000 个 token 的三分之一。Token 数量对于本地部署尤其重要,因为更长的推理轨迹会增加延迟、内存压力和能耗。
有一项不同寻常的结果需要谨慎看待:MiniCPM5-2B 相对较好的 AA-Omniscience 分数主要来自弃答。它仅尝试回答 29% 的问题,产生了 78% 的非幻觉率,但准确率仅为 8%。该结果表明它在该测试中采取了保守的回答行为,而非具有广泛的事实掌握能力。
三、为何智能体能力很重要
MiniCPM5-2B 明确针对工具使用、编程、搜索和多步骤智能体工作流进行训练,而不只是一个紧凑型聊天模型。它以 XML 风格格式输出工具调用。OpenBMB 推荐将 SGLang 用于函数调用,因为其 minicpm5 解析器会将这些输出转换为兼容 OpenAI 的 tool_calls。
发布的智能体指令微调数据集使这一重点尤为具体。UltraData-SFT-Agent-2609 包含 483,661 条轨迹:311,006 个通用智能体示例、82,760 个工具使用示例、69,895 个代码智能体示例,以及 20,000 个搜索智能体示例。
这些是多轮轨迹,而不是孤立的提示词与回答对。它们可以包含工具定义、调用、环境响应、验证步骤、错误、重试和最终结果。覆盖的任务从函数调用和数据库操作,到软件工程、网页检索、文件处理、办公工作流和多轮记忆。
该数据集并非可执行智能体环境的完整集合。OpenBMB 表示,它不包含原始环境、工具实现、测试或采样代码,并且轨迹中呈现的许多虚拟 API 并不存在于真实部署中。研究人员可以检查和复用交互记录,但不能仅凭发布文件自动重放每一条轨迹。
对开发者而言,实际变化在于,如今可以将小型本地模型作为智能体的决策组件进行评估,无需将提示词、源代码或工具结果发送给远程模型提供商。它是否足以可靠地用于特定工作流,仍取决于应用层测试、权限、验证和恢复逻辑。
四、训练发布超越了模型权重
OpenBMB 将 MiniCPM5-2B 的训练过程描述为三个大阶段:基础训练、中期训练和后训练。后训练随后经历监督微调、强化学习和在策略蒸馏。
发布的 UltraData-RL-2609 数据集包含 85,995 个可验证奖励样本。其四个类别分别为:数学 32,412 个样本、代码 23,665 个、长上下文任务 18,046 个,以及科学或知识推理 11,872 个。
奖励机制因类别而异。数学和知识任务使用可提取的参考答案;长上下文样本要求在提供的上下文中给出有依据的答案;代码提交则针对测试用例执行。OpenBMB 表示,标签通过多模型共识、答案比较和测试用例验证等方法进行检查,同时移除了已被初始化模型稳定解决的任务。
OpenBMB 为包括数学、代码、写作和智能体任务在内的领域训练了专门的强化学习教师模型。随后,它使用在策略蒸馏,将包括五个智能体专家在内的 16 个专家模型整合到发布的检查点中。在每个响应位置,该方法使用学生与教师 token 分布之间的反向 KL 散度作为优势信号。
根据 OpenBMB 的消融结果,与 SFT 检查点相比,强化学习加在策略蒸馏使推理和通用评测平均提升 10.96 分,使智能体评测提升 6.96 分。这些是开发者测量结果,但预 RL 和最终检查点的可用性,为外部研究人员检验这一提升声明提供了途径。
模型仓库和权重采用 Apache 2.0 许可。随附数据集需要额外谨慎对待:其文档说明上游许可持续适用,并包含禁止未经授权的原样镜像或商业再打包的限制。计划重新分发这些数据的组织,应审查各数据集的条款,而非假定模型权重许可适用于每一项训练制品。
五、对本地 AI 开发的改变
MiniCPM5-2B 延续了于 2026 年 5 月发布的 1B MiniCPM5 检查点,但在不脱离消费设备类别的前提下,提高了实用能力上限。1.56 GB 的四比特文件、标准架构、长上下文,以及对 llama.cpp、Ollama、LM Studio、MLX、Transformers、vLLM 和 SGLang 的文档化支持,减少了新模型家族通常需要的集成工作。
此次发布在数据本地性或间歇性连接很重要的场景尤其相关。下载后的检查点可以运行,而无需将后续提示词发送给 OpenBMB;与此同时,Apache-2.0 模型许可允许在遵守许可条件的前提下进行修改和商业使用。
最有力的已验证结论,并不是 2B 级模型如今能在每项任务上匹敌大型系统。它不能。证据反而显示,智能体工具使用、编程和结构化推理可以被压缩进一款拥有约 20 亿非嵌入参数的模型中,同时仍与数个更大的开放权重模型保持竞争力。可下载的中间检查点和训练数据集,也使这一结果比仅附着于最终权重的基准声明更易于检验。
常见问题
MiniCPM5-2B 真的是一款二十亿参数模型吗?
它拥有 2.52 亿总参数和 1.98 亿非嵌入参数。“2B”指的是其模型类别和非嵌入参数规模。
它当前的 Artificial Analysis 分数是多少?
MiniCPM5-2B 在 Intelligence Index v4.2 上得分为 15。被广泛引用的 23 分来自 v4.1.1,无法与更新后的指数直接比较。
它能在没有互联网连接的情况下运行吗?
可以。下载其权重和运行时后,可在本地运行 GGUF、MLX、GPTQ 或全精度版本。实际速度和内存需求取决于硬件、量化方式和上下文长度。
能否根据此次发布完整复现训练过程?
只能部分复现。OpenBMB 发布了分阶段检查点、配方以及大量 SFT 和 RL 数据集,但智能体数据集不包含全部环境、工具实现、测试或采样基础设施。
MiniCPM5-2B 支持函数调用吗?
支持。它生成 XML 风格的工具调用,OpenBMB 推荐使用 SGLang 的 minicpm5 解析器,将其转换为兼容 OpenAI 的工具调用对象。
参考来源
Share