首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

端侧模型太夯了!面壁智能开源2B「小钢炮」,通用Agent杀到端侧

2026-09-08 1 阅读 约10分钟阅读 机器之心
分享:
字号:
编辑|陈陈 过去几年,端侧大模型一直在不断突破能力边界。 最初,人们关注的是手机等设备能否运行一个基础语言模型;随后,长文本理解、数学推理、代码生成、多语言能力逐渐被压缩进更小的模型。如今,随着模型能力进一步提升,一个新的问题开始浮现:Agent 能力,是否也能从云端走向端侧? 这并不是简单地把一个聊天模型放进设备,一个 Agent,需要理解目标、拆解任务、调用工具、根据反馈调整策略,并在多轮交互中持续推进任务。 随着端侧模型能力不断提升,过去属于云端的复杂工作流,开始具备在设备侧独立运行的可能。 面壁智能正是在这一方向上的代表性机构。 9 月 8 日, 面壁智能开源新一代端侧语言基础模型 MiniCPM5-2B , 让端侧通用 Agent 能力开始具备雏形 。该模型将 工具调用、深度搜索、代码生成 等智能体核心能力引入端侧,为复杂任务在设备侧运行提供了新的可能。 另外,团队此次开放的不只是模型权重和算法,还包括部分 训练 Recipe(如 RL recipe)、自研强化学习框架 Meshy、基于奖励的强化学习策略 JustRL II ,以及一批 SFT 数据 。这在当前大模型开源生态中并不常见。 端侧模型轻装上阵,Agent 能力正在成形 MiniCPM5-2B 轻量但不代表能力弱。 根据 Artificial Analysis Intelligence Index 榜单,MiniCPM5-2B 在开源模型类别中排名第一。该榜单综合了 9 项评测,覆盖知识推理、代码能力以及 Agent 任务执行等多个维度。结果显示, MiniCPM5-2B 以 23 分领先 Gemma 4 12B、Qwen3.5 9B 等参数规模更大的模型 。 在衡量模型在 Agent 工作流中的榜单中, MiniCPM5-2B 以 20 分排名第一 ,领先于 Granite 4.2 8B(9 分)、Qwen3.5 9B(7 分)等参数规模更大的模型。 MiniCPM5-2B 在推理效率上也展现出优势 ,完成单个任务平均仅需要约 21K output tokens,与同规模模型相比处于较低水平。 值得注意的是,MiniCPM5-2B 在 真实工作任务评测中取得接近人类基准的成绩 ,这一结果表明,端侧模型的能力边界正在从简单问答进一步延伸到真实任务处理。 MiniCPM5-2B 也展现出 较高的智能密度 ,进入同级开源模型领先位置。 在 综合能力评测 中,根据多项 benchmark 测试,其平均分达到 53.9 分,领先于 Qwen3.5-2B 等模型。 评测覆盖代码推理、数学推理、工具调用、代码智能体、搜索智能体等多个维度,MiniCPM5-2B 在多个方向保持均衡,说明其提升并非来自单一能力,而是 整体能力的增强 。 这些榜单成绩背后值得关注的是端侧通用 Agent 能力已经有了雏形。 过去提到 Agent,大家默认的前提是云端大模型才玩得转。MiniCPM5-2B 的意义在于,它把端侧 + 通用 Agent 这两件事拼在了一起:模型原生支持工具调用、深度搜索、代码生成等智能体核心能力,并且从预训练阶段就开始为 Agent 能力铺路,一路贯穿到 SFT、大规模强化学习对齐,确保这些能力在实际使用中稳定可靠,而不是能跑但不好用的半成品。 而在强化学习阶段,MiniCPM5-2B 还采用了面壁智能 自研的强化学习框架 Meshy 与 基于奖励的强化学习策略 JustRL II 。 在训练框架侧 ,Meshy 彻底去掉了 RL 训练的中央控制器和 Ray 依赖,将训练、推理、奖励计算等全部建模到对等服务,利用 TransferQueue 中的数据就绪状态来驱动实际控制流,能够简单的在同步、异步、全异步三种训练模式中灵活切换,便于扩展。 在算法层面 ,端侧模型做长思维链强化学习,常常训练过程中分数不升反降:一方面训练数据里噪声多、难度不匹配,奖励信号容易带偏模型;另一方面 GRPO 信用分配太粗糙,面对上万词元的推理链,分不清哪步对、哪步错。为此,MiniCPM 团队提出 JustRL II :数据上,用三阶段流水线筛选校准训练数据;算法上,给 GRPO 装上 Critic,实现词元级信用分配。在 JustRL II 加持下,MiniCPM5-2B 在 RL 后训练中获得了显著的性能收益。 真实效果如何?我们上手测了一下。感兴趣的用户可以前往开源地址获取模型,并自行部署体验。 首先我们让 MiniCPM5-2B 在本地处理一篇长篇会议纪要(AI 生成)。测试中,我们连续提出多个问题,例如本次会议缺席人员是谁?Atlas V2.0 正式上线日期是哪一天? 结果显示,MiniCPM5-2B 能够从长文本中提取关键事实,并区分讨论过程与最终结论,给出正确答案,能够满足日常需求: 接下来我们让 MiniCPM5-2B 根据 5 份简历,提取每位候选人的姓名、年龄、工作年限、核心技能,并整理成结构化表格。 MiniCPM5-2B 能够从多份长文本简历中准确提取关键信息,并完成后续的匹配分析。整个过程无需将候选人资料上传云端,模型可以直接在本地完成文档理解和信息处理。 对企业而言,这类招聘筛选、资料整理等任务往往涉及大量敏感信息。端侧 Agent 的价值,就在于让模型具备处理真实业务流程的能力,同时降低数据离开本地带来的安全风险。 最后,我们还测试了模型的网页生成能力。MiniCPM5-2B 能够根据简单描述完成页面布局设计和代码生成,并生成包含多个功能模块的网页。 最终结果如下: 从以上案例可以看出,MiniCPM5-2B 已经开始具备理解任务、处理信息并生成结果的端侧 Agent 雏形。 公开数据治理、开源数据集 这在行业里很罕见 除了算法,数据质量正在成为决定模型能力的重要因素。尤其对于参数规模有限的端侧模型而言,如何从海量数据中筛选、提炼高价值信息,直接影响模型能力上限。 面壁智能此次进一步公开了支撑 MiniCPM5-2B 能力提升的数据体系,包括 全新的预训练数据处理工具 UltraX ,以及 三个最新开源的数据集 。 UltraX 是一个函数调用式的精炼框架,核心思路和过去用大模型端到端重写文本不同:它训练了一个仅 0.6B 参数的轻量模型,去预测一套结构化的编辑操作,包括 保留、删除、替换、插入 ,然后由确定性的执行器把这些操作实际应用在原始文本上。 传统的数据处理是文档级过滤:判断一篇网页文章质量好不好,差就整篇丢掉,但有价值的部分和垃圾内容往往交织在一起,整篇扔掉损失太大。 UltraX 做法是让模型像一个精细的编辑,逐行判断「这段留、那段删、这句换个说法」。这样做既避免了端到端重写容易带来的语义漂移和结构破坏,又因为编辑操作本身可保存、可审计,让整个精炼过程完全可追溯,数据被改了什么、为什么改,都有据可查。 UltraX 的整体工作流程,包括程序监督数据生成、精炼模型训练以及推理阶段的程序执行。 效果上 ,UltraX 在 FineWeb、RedPajama-v2、AICC 等五个主流语料上做了验证:用同样规模的 1B 模型从零预训练,UltraX 精炼后的语料在下游任务上全面优于原始语料,仅用 16B tok
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱