智能AI
morning
王云鹤创业后交出首个模型
摘要
王云鹤创业后交出首个模型 衡宇 2026-09-08 10:14:47 来源: 量子位 衡宇 发自 凹非寺 量子位 | 公众号 QbitAI 王云鹤创业后,首次交卷了大模型成果。 量子位获悉,华为诺亚方舟实验室前主任、盘古大模型负责人 王云鹤 创办的基元律动,发布首个Agent-Native模型NeoHorse。 该模型由无问芯穹提供算力支持与Infra优化,清华大学、北京大学团队参与算法和训练方...
量子位
王云鹤创业后交出首个模型
2026
凹非寺
公众号
QbitAI
王云鹤创业后
首次交卷了大模型成果
量子位获悉
华为诺亚方舟实验室前主任
2026-09-08
1 阅读
约9分钟阅读
衡宇
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 王云鹤创业后交出首个模型 衡宇 2026-09-08 10:14:47 来源: 量子位 衡宇 发自 凹非寺 量子位 | 公众号 QbitAI 王云鹤创业后,首次交卷了大模型成果。 量子位获悉,华为诺亚方舟实验室前主任、盘古大模型负责人 王云鹤 创办的基元律动,发布首个Agent-Native模型NeoHorse。 该模型由无问芯穹提供算力支持与Infra优化,清华大学、北京大学团队参与算法和训练方法研究,共同探索提升Agent后训练的数据利用效率和训练效果。 NeoHorse-1包含4B和9B两个版本 ,重点面向Agent工作过程中需要的一组能力,包括调用工具、读取环境反馈、发现错误、调整路径,并最终完成任务。 在覆盖Harness Agent、工具使用、代码和指令遵循等10项评测中,经过Agentic Post-Training后, 4B模型综合表现已经达到/略超9B基础模型。 一家一直强调多模型协作的公司,为什么又开始自己训练模型?基元律动准备加入基础模型牌桌了吗? 从NeoHorse给出的答案看,方向并没有发生这样的变化。 这款模型更像是基元律动过去积累的多模型执行经验,第一次进入了模型参数。 帮Agent挑模型的公司,也开始训练模型 一直以来,分数往往成为比较模型的主要依据。 但当模型开始被放进Agent系统、承担完整任务后,单一分数的解释力就会下降。 一项任务中,模型不仅要给出一个看似合理的答案,还要在执行过程中持续读取环境反馈,处理错误,并根据实际进展调整后续路径;不同环节对模型能力的要求也不一样。 由此,基元律动团队形成了一个判断。 模型不归一将是AI产业长期存在的一种结构。 模型越多、分工越细,价格和能力差异越明显,就越需要一套系统回答几个问题—— 这一步应该用哪个模型?哪些环节可以交给成本更低的模型?什么时候需要升级到推理和执行能力更强的模型?一条执行路径受阻后,应该换谁接手?多个模型能否并行给出方案,再把结果聚合起来? 王云鹤团队把这一层系统称为Routing Harness(旗下相关开源项目OpenSquilla已经接入多款模型,通过统一接口,在Agent运行过程中进行细粒度路由、模型切换和多模型协作)。 同样,基于这一思路,基元律动似乎没有太强的理由自己训练模型。市场上已经有足够丰富的模型供给,按需调用看起来更加灵活。 随着调度系统持续运行, 另一类资产开始沉淀 ,如“什么任务需要什么能力”“模型在哪一步容易失败”“什么样的修复路径有效”“怎样的结果能够通过环境验证”。 这些信息一方面可以提升路由判断,另一方面也开始具备训练价值。 这有点像一家连接大量品牌与消费者的平台。交易过程中积累的需求、评价和使用反馈,可以帮助商品找到更合适的用户,也可以进一步反馈给产品研发。 平台服务市场的过程由此成为下一轮产品改进的数据来源。 NeoHorse承担的就是把基元律动过去在Harness中积累的一部分执行经验,转化成模型能力。 把多模型走过的路,练进Agent-Native模型 NeoHorse的数据来源值得一提。 它的 核心语料是将Routing Harness产生的Agent执行信号与公开数据结合,构建面向Agent后训练的数据体系。 Agent在Harness里完成一次任务,会留下完整的执行记录。 输入任务 → 路由器判断需要什么能力 → 选择某个模型 → 模型进行推理和工具调用 → 环境返回结果 → 模型继续执行或发生错误 → 系统切换模型或调整路径 → 任务最终完成或失败 常见问答数据往往集中在“问题”和“答案”两端。 Routing Harness的数据中还包含另外几层信息 :任务需要什么能力,系统做出了什么执行决策,以及环境最终给出了什么反馈。 比如,路由器最初判断某项任务只需要普通模型,但执行过程中连续失败,随后升级到能力更强的模型,任务才被完成。 这条轨迹包含的信息远多于一次失败。 系统可以知道,最初的能力判断可能偏低,模型在哪一步出现问题,更强模型采用了怎样的策略,哪条执行路径最终通过环境验证,以及完成任务额外消耗了多少Token和时间。 更重要的一点在于,基元律动观察到的并非某个模型对自身能力的判断,而是多个模型面对相似任务时留下的横向表现。 其中既有成功路径,也有中途失败、随后被其他模型接手的执行记录。 从训练角度看,失败轨迹甚至可能提供更多信息。 最终答案能够告诉模型一条可行路径,失败与修复过程则补充了另外两类知识,哪里容易出错,以及出错以后如何调整。 “学习的除了多个模型给出的结果,还有多个模型在任务环境中实际走过的路径”,这也是NeoHorse比较有辨识度的一点。 Agent工作日志怎么变成模型能力? 把所有日志全部投入训练,并不会自然得到一个更强的Agent模型。 Agent轨迹通常很长,其中混有系统提示、用户请求、工具参数、执行结果、重复尝试、错误信息以及大量中间输出。 有些步骤具有训练价值,有些更接近噪声。还有一些轨迹流程完整,结果本身却并不正确。 基元律动 首先需要解决“哪些数据值得模型学习”这个问题 。 根据技术报告,每条轨迹都会经过结构检查,确认请求、模型回复、工具调用和环境结果之间能够对应。 随后,系统会 从六个维度评估执行质量 ,包括是否完成用户目标、是否遵守指令、工具使用是否合理、结论是否有证据支撑、发生错误后能否恢复,以及模型是否在合适的时机终止任务。 这里 还涉及Agent训练里容易被混在一起的问题 。 任务结束并不等于用户目标已经满足——模型输出“任务已经完成”只能说明执行流程停止了,无法证明交付物符合用户要求。 因此,完成状态、目标满足度、环境证据和用户反馈,需要作为不同信号分别记录。 数据完成筛选后,路由信号开始发挥另一项作用。 路由器会估计任务所需能力,并形成不同能力档位的信号。NeoHorse在训练过程中据此安排样本顺序,先学习能力需求较低的任务,再逐渐增加更加复杂的执行轨迹,同时保留基础任务覆盖。 这一方法被称为 Routing-Guided Curriculum ,也就是路由引导的课程学习。 通俗一点理解,路由信号在线上决定任务交给谁,在训练阶段还可以告诉模型,哪些任务更适合先学,哪些适合后学。 除了常规监督微调,NeoHorse还使用了 On-Policy Distillation 。 可以理解为先让学生按照自己的方式解题,再由老师针对学生实际走到的步骤给出指导。 这样一来,教师模型处理的是学生模型当前分布下会遇到的问题,而非预先准备的一套标准错误。 经过这些环节,多模型长期执行任务积累下来的经验,开始被用于NeoHorse的后训练。 后训练之后,提升的是什么? 从当前技术报告给出的结果看,Agentic Post-Training在4B和9B两个尺度上都带来了稳定提升。 其中,NeoHorse-1-4B的综合表现(宏平均得分从58.94提升到64.87)已经达到同规模SOTA——在
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱