首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

openJiuwen首发双维度RSI框架,AI自修改,落地办公智能体,算力亲和助力又快又省

2026-09-15 1 阅读 约10分钟阅读 机器之心
分享:
字号:
机器之心发布 让智能体完成一次任务已经不难,难的是让它从每一次任务中学会改进。当前多数智能体还是 "交付即定型":遇到失败,需要人工复盘日志、修改提示词、补充工具、再重新测试。调优成本高、周期长,有效经验也难以积累。 这正是 RSI(Recursive Self-Improvement,递归自我改进) 要解决的问题。 它不是让模型自己训练自己,而是让智能体从真实任务反馈中生成改进方案、执行验证、保留有效改进,帮助智能体持续优化。 早在今年 6 月,由华为 2012 实验室、华为云、终端、计算等团队联合构建的开源 AI Agent 平台 openJiuwen 即发布了 Auto Harness 能力,让智能体能够自动优化自己的一整套 "工作装备"。这一次, openJiuwen 把完整的 RSI 框架落地到了 WorkSwarm 蜂群办公智能体上,率先支持 "可插拔的 Harness + Artifacts" 双维度优化 ,Artifact 当前包含科研论文和算法程序两类交付产物优化,同时结合 openJiuwen 的算力亲和能力,把多轮优化的成本和耗时压了下来。 对于横跨文档、代码、数据和工具的办公任务,这意味着工作方法可以改进,交付物可以持续打磨,成功与失败的经验也能为后续任务所用。用户像创建普通任务一样发起实验,就能查看优化过程,获得经过验证的成果。 openJiuwen RSI 框架:让自我迭代真正跑起来的工程闭环 openJiuwen RSI 不是一套固定的优化算法,而是让不同自我迭代任务都能稳定运行的工程框架。它以 版本化优化对象、可验证的执行证据和可扩展的算法 为核心,通过四层协作,把任务目标转化为可执行、可评估的改进过程。 任务层定义 "优化什么、如何评价、能用多少资源";迭代优化层决定 "下一步试什么、哪些改进可以采纳";执行层负责 "真正跑起来并返回证据";基础框架层提供运行、模型与上下文、沙箱隔离、状态恢复和可观测性等统一能力。 整个流程串起了六阶段闭环: 评测与验证 建立基线; 分析与优化定位 从失败、轨迹和指标中找到原因; 提案与构建 生成候选,再按同一标准重新评测; 采纳与融合 消解冲突、组合有效改进,形成新版本; RSI 经验 沉淀 提炼方法及适用条件;最后通过 归档与停止 保存结果、判断是否结束。只要还有预算和改进空间,就会选择父版本继续迭代。 可靠性来自明确的分工。AgentLoop 负责单次任务的 “推理 — 行动 — 观察 — 反馈”,控制器负责跨版本优化,避免用生成者的主观判断代替验证。每份证据都绑定版本和评价上下文,候选经过过滤、融合或配置变更后必须重测;执行失败、证据无效和效果不佳也会分别记录。问题、假设、改进点及采纳或未采纳的原因都会保留,让下一轮既能借鉴成功,也能避开无效方向。 在统一的任务表达、阶段接口和生命周期下,不同对象可以采用各自的算法: 科研论文优化 接收研究目标、初稿或实验材料及评价标准,通过 Frontier 选择父版本,提出研究方案,构建包含研究内容和实验结果的论文,再经论文评测决定是否采纳。 科研算法程序优化 接收程序文件树、任务数据和标准,通过 PUCT 选择父版本、安排搜索,生成源码修改或修复方案。候选构建运行后,以脚本评测、规则匹配和指标聚合比较效果,指导下一轮搜索。 Harness 优化 先运行当前版本,依据任务结果和轨迹诊断,再装载候选重跑同一组任务。只有经过自身评测的改进才能被采纳,方法及适用条件也会随之沉淀。 这套框架已经做进 WorkSwarm:新增的 "实验" 模式下,用户可以像创建普通任务一样发起 Harness 优化或产物优化,查看每一轮的改进过程和搜索路径,最终拿到经过验证的 Harness 插件或论文、程序产物。下面分别看三类优化在 WorkSwarm 里的实战案例。 1、Harness 优化:四步把失败案例变成即装即用的新能力 Harness 是智能体的 “工作装备”:Prompt 决定如何理解任务,Skill 提供专业方法,Tool 负责实际操作,Rail 则约束执行过程。当问题出在这些环节时,WorkSwarm 可以直接从失败案例入手,帮助用户改进装备。 1)构建优化数据。 准备一份 JSON 评测集,每条用例包含用例标识、任务要求、评测方式,以及参考答案和评分规则。建议优先选真实失败过的任务。 [ { "id" : "case_001" , "input" : "需要 Agent 完成的任务" , "judge_method" : "llm" , "reference" : { "solution" : "参考答案" , "judge_rubrics" : "评分规则" } } ] 2)创建实验。 进入 WorkSwarm 的 "实验" 页面选择 "Harness 优化",填写实验名称,选择优化模型、测试模型和初始插件,再选择评测集、评测方式和最大迭代轮次,即可创建。 3)自动迭代。 WorkSwarm 先运行当前 Harness 建立基线,再从失败用例和执行轨迹中定位问题,围绕 Prompt、Skill、Tool 和 Rail 生成候选修改。候选先验证目标用例确实修好,再回放完整评测集确认整体有提升、没有改坏原本通过的任务。页面持续展示得分、迭代轮次、模型用量和搜索树,哪些方案试过、哪些被采纳,一目了然。 4)安装使用。 实验产出有效版本后,点击 "安装插件", 最优 Harness 即作为插件包导入并热加载 ,不用手工复制任何内容;版本信息保留,需要时可以回退。 在 DeepSeek-V4-Flash 任务模型、最多 5 个 Epoch 的配置下,Harness 优化在 SWE-bench Lite Dev 全部 23 道题上的通过率由 61.0% 提升至 87.0% ;冻结优化后的 Harness 后,在 Evo-Bench General 64 道独立评测题上的单次执行通过率由 60.9% 提升至 71.9% 。结果表明,优化收益不仅覆盖参与迭代的任务,也能泛化到未参与优化的任务。 2、科研论文产物优化:从研究构想到论文成稿,持续打磨 在 WorkSwarm 中,既可以从一个科研构想出发生成科研论文,也可以提交已有科研论文继续优化。 在 "实验" 页面依次选择 "产物优化" 和 "论文",填写优化指令(研究主题、目标问题或重点改进方向)或选择本地论文文件夹,设置最大迭代轮次,即可创建。 运行期间,详情页展示当前分数、最优论文、模型用量和迭代轮次;论文优化树记录每一轮产生的版本,点击节点可以看到本轮改动、评测结果以及未被采用的原因。实验完成后,预览当前最优产物,确认后一键下载完整论文。 3、科研算法程序产物优化:提交任务包,寻找更优版本 对于可以运行和评价的算法程序,WorkSwarm 支持从现有实现出发自动尝试多个版本,交付最优结果。 首先准备待优化的初始科研算法程序及其评价配置。推荐预先安装并调用 rsi-program-dataset-creator Skill,生成包含初始程序、scorecard 等运行和评价信息的任务包,再在 "实验" 页面依次选择 "产物优化" 和 "程序
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱