首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

Agent驱动的模型训练,基元律动做了一次迈向RSI的实验

2026-09-09 1 阅读 约10分钟阅读 机器之心
分享:
字号:
编辑 | 泽南 Agent 完成任务后,学到的经验去了哪里? 一个 Agent 接到项目排期任务,它找到了工作目录里的文件,大致理解用户想要什么,却漏读了一封包含最新消息修改的邮件。随后,它沿着过时信息继续规划,生成了无效排期,最后还把文件写到了错误位置。 执行链在中途断掉,随后就全是基于错误推理的错误答案。看到之后,你显然会让 AI「重新审视问题」再生成一遍。问题在于,下一次怎么办? 今天的大多数系统中,Agent 的经验都留在日志里,模型每天在真实环境里产生的执行经验,几乎从不进入模型参数。这意味着模型下一次遇到相似任务,依旧可能踩一遍同样的坑。 基元律动最近发布的 NeoHorse-1 试图改变这件事。他们开源了 4B 与 9B 两个尺寸的模型,训练出来的思路听起来有点绕:让一个本来负责给模型「派活」的路由系统,顺便把所有模型走过的路记录下来,再把这些路教给一个小模型,让它自己就能走完一群模型走过的路。 论文链接:https://arxiv.org/abs/2609.08183 HuggingFace:https://huggingface.co/collections/TokenRhythm/neohorse-1 GitHub:https://github.com/TokenRhythm/NeoHorse 这件事, 被他们称为迈向 RSI 的第一次闭环验证 。 该模型由无问芯穹提供底层基础设施支撑与 Infra 优化技术能力,清华大学、北京大学团队参与算法和训练方法研究,共同探索提升 Agent 后训练的数据利用效率和训练效果。 大模型的终极目标:自我迭代 RSI(Recursive Self-Improvement,递归自我改进)是 2026 年 AI 领域一个炙手可热,也富有争议的词汇。它的愿景并不复杂:让 AI 把自己的产出作为经验重新喂回研发流程,参与设计更强的下一代自己,循环往复、自我升级。 今年 6 月,Anthropic 发布《When AI builds itself》,称在内部观察到了 RSI 的早期迹象。这个星期,OpenAI 发布博客首次公开了自己 RSI 的进展。OpenAI 称,其已经实现去年秋天定下的目标:在今年 9 月前造出一个「自动化研究实习生」。 但 Anthropic、OpenAI 自己也承认完整的 RSI 时代尚未到来,甚至不会必然发生。学术界今年涌现的一大批工作,从 Self-Harness、Continual Harness 到各类自我进化基准,大多还停留在「改进某个零件」的阶段。 人们争议的焦点很具体:AI 巨头口中的 RSI 目标很远大,实际操作起来却是个外界无法检查的黑箱。你既看不到训练数据如何流转,也复现不了那个闭环,最后只能选择相信或不相信。 在已经大规模应用的 AI Agent 上,工程层面的自我迭代也一直在进行中。对于 Harness 来说,决定表现的并不只在于底层模型。就像 DSH 之于 DeepSeek V4 Pro,一个设计得当的 Harness 才可以让模型发挥全部潜力。 当前,Agent 领域出现了两条并行演进路线。一条是在推理时更新外部系统,例如把成功经验写入 Memory、Skill 或 Harness;另一条则更进一步,让 Harness 框架直接参与模型训练。 NeoHorse-1 尝试用最简单的方式来实现训练的正循环,让我们看到了一个清晰可行的流程,它用的模型是 Qwen3.5 4B 和 9B,再把一个自我改进闭环拆成了四个可以逐环检查的零件,并全部开源。 要看懂它,得先从一个叫 OpenSquilla 的路由系统讲起。 Harness 框架,天然就是 AI 训练场 几个星期前,基元律动开源的 Harnes 框架 OpenSquilla 为这家公司基础设施层的创新开了个头。OpenSquilla 专注于通过高效率和低 Token 成本来运行和调度复杂的智能体任务,目标直指 Agent 落地的核心痛点。 一个复杂任务往往要跑数十轮,每一轮都调用最贵的旗舰模型,token 会顶不住。OpenSquilla 的做法是在 Harness 框架上装一个「路由器」,每执行一步之前先判断这一步需要多强的能力,再分派给够用且最便宜的那个模型或模型组合。按 benchmark 测试结果,这套机制可以省下 60% 到 80% 的 token 开支。 到这里,主要还是在想办法省钱。NeoHorse 的进一步洞察在于,路由器在派活的每一步都留下了三样东西:它预判了这一步需要什么能力、记录实际派遣的模型,还要观察这一步最终执行得怎么样。 换句话说,人与 AI 聊天的记录主要包含「问题 — 答案」,Routing Harness 产生的则是「需求预测 — 路由决策 — 执行过程 — 环境结果」。 这恰好就是一份完整的教学档案,基元律动决定拿它办学。NeoHorse 基于 Harness 训练 AI 模型的思路大致分为四步。 第一步是尽量保留 Agent 的「推理 — 行动 — 反馈」链条。 Agent 的真实能力藏在交错的推理、工具调用、环境复现、报错后的恢复动作和最终交付产品之间。NeoHorse 把每一次完整交互保存为一条轨迹,再按用户轮次切成训练单元,当前轮的推理与动作是模型要学习的目标,更早的历史作为可以查阅的上下文。主语料库包含十万到百万条脱敏任务轨迹,另加公开数据补齐覆盖面。 第二步是判断轨迹能不能用。 系统先用确定性规则检查工具调用是否有对应返回、事件顺序是否成立、是否缺少最终回复,以及执行分支能否闭合。结构完整的轨迹进入下一步;部分可恢复的记录只保留因果关系完整的片段;无法判断事件归属的轨迹则被隔离。 随后,系统从目标达成、指令遵循、工具使用、证据一致性、错误恢复和正确终止六个维度进行语义评估。NeoHorse 分别记录了通过、警告、失败或未评估几种状态,这样一来系统看到的不只是任务的执行情况,还能知道失败更可能发生在证据获取、工具选择还是终止判断上。 第三步,是用 Router 预测的能力需求进行课程学习 。 NeoHorse 直接借用 Routing Harness 的 C0 到 C3 分层作为难度信号:训练分三个阶段推进,先集中学低需求档任务,再逐步混入高需求档的硬任务,同时刻意把一部分简单样本留到最后阶段,防止模型到后期只会做难题。路由记录反映的是真实的用户覆盖、模型定价与可用性波动,比抽象的难度标签更贴近部署现场。 这里有一个容易被忽略的细节,系统并没有把「最终调用了哪个模型」直接当作难度标签。因为实际路由还可能受任务指定、服务可用性和系统策略影响。NeoHorse 使用的是回答发生之前,Router 根据请求及历史状态重新估计的能力需求。它决定样本什么时候出现,而不是简单告诉模型「这是一道难题」。 第四步,NeoHorse 还采用了路由引导的 On-Policy Distillation。 传统蒸馏更像让学生模仿教师已经写好的标准答案;而在 On-Policy Distillation 中,学生先生成自己的响应,教师再沿着学生实际走到的位置提供下一步监督。通俗来说,它是让学生先做题,若走进岔路再进行纠正。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱