2B小钢炮炸场!MiniCPM5吊打同级,智能体得分碾压9B大模型,这波啥水平?
- 时间:
- 浏览:175
- 来源:深圳市硝子荼弥网络科技有限公司
端侧AI终于熬出头了。当行业还在卷参数量时, MiniCPM5-2B靠着20分的Agentic Index成绩狠狠打了脸——同级的从2B直到4B的模型平均只有2分, 它直接翻了10倍。
更让人意外的是, 超比同级的模型它还碾压不说, 像Qwen3.5 9B、Gemma 4 12B这些参数量为它好几倍的选手都被它甩在了身后。面壁智能与OpenBMB这次没留一手, 直接把训练配方、RL框架和核心数据集全开源没有保留了。
01.密度定律的实证
将参数量和得分绘制在同一张坐标图上的话MiniCPM5-2B稳稳立在4B以下帕累托曲线的最顶端之前开源的MiniCPM5-1B版本也落在同一条线上两个尺寸各自占据住自身级别的性能天花板。
这正是面壁智能所说的"密度定律"最直观的印证。2B参数的模型跑出领先超过4B参数的智能水平, 说明单位参数的智能密度已经突破人们习以为常的常规认知。这绝不是简单粗暴任意的参数堆砌就能够做到的。
02.端侧Agent新可能
评测数据显示,MiniCPM5-2B在通用智能体、搜索智能体、工具调用、代码推理等关键维度上伽师新梅产业, 其实呢都拿到了最高分, 用实际结果来证明, 具有高智能密度特性端侧模型真确实实能做通用Agent呢!
这对行业意味着什么? Agent应用想规模化落地实施, 推理成本居然是它排在首位的最大拦路虎, 一个复杂类型的Agent任务呀动辄就能消耗掉数十万数量的token, 如果高密度、高精密端侧模型能兜住相当一部分这项环节的工作, 整个应用层体系以内的成本结构, 大概率就会发生一些不一样的实质性变化。
03.训练技术的突破
端侧设备硬约束参数规模, 底层数据治理和训练技术栈就成了决定模型上限的关键。做长思维链强化学习时, 分数不升反降是它的常态, 训练数据里的噪声和难度不匹会配让奖励信号带偏模型, 哦不, 是噪声与匹配不足让模型被奖励信号带偏, 对没错。
MiniCPM团队为此推出了JustRL II策略, 用三阶段流水线筛选校准训练数据, 行级精修的数据管线到自研轻量框架再到信用分配算法, 这些技术最终都会转化成了智能密度。
04.开源账怎么算
大多数模型只开放权重, 面壁智能这次将权重、数据集、RL框架、训练Recipe一并开源, 熟悉开源生态的人知晓这份清单的分量, 这在头部大模型团队里极其罕见。
厂商不公开数据的理由很简单: 模型架构半年内就会被消化, 但开放促进会2024年发布的开源AI定义曾引发激烈争论, 按严格标准市面上能称开源AI的模型寥寥无几"open weights"这个词越来越流行, 某种程度上就是对现状的妥协。
05.社区受益几何
面壁智能OpenBMB社区从2023年底至今已开源超过10个大模型训练数据集, 覆盖网页语料、数学、代码、对话、偏好对齐等大模型训练环节的几乎所有方面, 150万条合成多轮对话已被全球200多个大模型用于开展对齐训练, 月均下载量累计已然突破百万。
这般渔之予人的方式正切实式地降抑社区研究侧大模型之入门门栅。大模型开源馈予行业者成品, 数据治理开源馈予行业者造品本事效能。后者所生复利收益, 必需更久之时刻阶段方能辨清看透。
你觉得端侧智元代理会将云端代理赶下位置吗? 请到评论框说说你的观点, 可不要点爱心转推荐更多同圈中人哦!
猜你喜欢