智能AI
morning
AI到底能不能自己造AI?别吵了,有人做出来了
摘要
RSI,可能是 AI 世界里最像科幻的一个词。 在最强的版本里,你只需要对一套系统说一句 “做一个更好的自己”,它就能提出新想法、搭建训练流程、验证结果,最终交付一个能力更强的继任者。随后,新模型再次重复这个过程,智能由此进入自我加速的循环。 这个图景还没有成为现实。但过去几个月,围绕递归自我改进(Recursive Self-Improvement,RSI)的讨论,已经从 “会不会发生” 转向一...
iCoder
Coding
27B
Agent
RTL
RSI
Recursive
SFT
github
huggingface
2026-09-02
1 阅读
约10分钟阅读
机器之心
字号:
RSI,可能是 AI 世界里最像科幻的一个词。 在最强的版本里,你只需要对一套系统说一句 “做一个更好的自己”,它就能提出新想法、搭建训练流程、验证结果,最终交付一个能力更强的继任者。随后,新模型再次重复这个过程,智能由此进入自我加速的循环。 这个图景还没有成为现实。但过去几个月,围绕递归自我改进(Recursive Self-Improvement,RSI)的讨论,已经从 “会不会发生” 转向一个更具体的问题: 今天的 AI,究竟已经接管了 AI 研发循环中的哪些部分? Anthropic 联合创始人 Jack Clark 在今年 5 月给出过一个激进判断:到 2028 年底,无人参与的 AI 研发有 60% 以上概率出现;他同时承认,近期更可能先看到非前沿模型层面的端到端训练样例。Allen Institute for AI 的 Nathan Lambert 则提出 “有损自我改进”:AI 会进入模型研发核心,但数据、算力、组织协调和系统复杂性会让飞轮持续损耗,很难形成无摩擦的指数爆发。 现在, 一支来自上海交通大学人工智能学院、深势科技、无尽前沿与新加坡国立大学的联合团队,给出了一个很适合放进这场争论的样本。 团队让 Agent(Codex GPT-5.6-Sol)主导一个 27B 工业 Coding 模型的开发:从数据演化、SFT 冷启动,到同策略自蒸馏和可验证奖励强化学习,Agent 负责选择实验、诊断失败,并反复修改训练策略。同时,人类专家提供目标、权限边界、训练 SOP 和可信验证器。最终得到了一个在工业 Coding 能力排名前列的模型,名为 iCoder-27B 。 论文标题: Recursive AI-Led Development of Frontier Industrial Coding Model 项目主页:liunanfu1992.github.io/iCoder-site 论文: huggingface.co/i-Coder/iCoder-27B/blob/main/Coder_Tech_Report.pdf GitHub:github.com/bingreeky/iCoder Hugging Face:huggingface.co/i-Coder 27B,先挤进工业 Coding 第一梯队 工业 Coding 与日常所说的代码生成,并不是同一类问题。 生成 RTL,模型需要把自然语言规格转换成满足时序、复位、状态迁移和层级约束的电路描述;生成 GPU Kernel,则不仅要保证数值正确、能够编译运行,还要真正利用硬件获得加速。代码 “看起来合理” 没有意义,只有通过仿真、编译、执行与性能测试才算完成任务。 这也是团队选择工业 Coding 作为试验场的原因:它足够难,又有真实工具链提供可验证反馈。模型不能靠语言流畅度蒙混过关。 图 1|iCoder 在四项核心工业 Coding 基准上的位置。各榜单独立排序,数据来自团队统一评测。 注:排名仅指技术报告所列模型及团队统一评测协议;不同评测设置不可直接横向外推。 与同尺寸的 Qwen3.6-27B 相比,iCoder 的 RTLLM 从 49.6 提升到 68.0,VerilogEval Spec-to-RTL 从 70.1 提升到 86.3,KernelBench L2 正确任务数则从 28 增加到 74,达到原来的 2.64 倍。 它并非每一项都领先。在 RealBench、ArchXBench 等复杂 RTL 任务上,iCoder 仍落后于部分闭源模型。但是也可以看到,团队的 AI 自进化系统可以交付一个 27B 模型,使其同时在芯片 RTL 和 GPU Kernel 两条技术栈上进入前沿模型的竞争区。 比成绩更重要: 这一次,被改进的是模型本身 今天很多 “自我进化” 系统,改进的其实不是模型。 第一类系统让固定模型反复提出和测试方案,最终得到更好的程序或算法;第二类系统会修改模型外部的提示词、工具、记忆与 Agent harness,让同一个底座表现得更好。它们都很有价值,但能力通常留在外部系统中。 更强的一步,是把经验写回模型参数,让获得的能力可以脱离原来的工作流持续存在。iCoder 属于这一层:iCoder 的 Agent 通过参与数据、SFT、OPSD 与 RLVR 等训练全阶段,让实验结论真正改变下一个 checkpoint。 项目把前沿模型开发当作一项长链路压力测试。数据选择会影响训练分布,训练策略会改变后续样本的难度,验证器漏洞会扭曲奖励,资源预算又会反过来限制哪些实验能够运行。任何一处错误,都可能沿着流水线传播。 人类没有消失, 角色却变了 图 2|人类提供 Research Skills、资源权限与模块操作;Agent 在边界内循环推进 Data、SFT、OPSD 与 RLVR。 团队采用的分工可以概括为八个字:高密度先验,低频率干预。 人类专家先把模型研发中最重要、也不适合靠昂贵试错学习的经验,写成一组可执行的 Research Skills:目标是什么,数据和评测集如何隔离,允许访问哪些资源,分布式任务怎样启动,验证器必须满足什么完整性要求,每一个 checkpoint 又怎样追溯到数据、代码和父模型。 这些 Skills 像一套研究操作系统:规定边界、提供工具、保留审计记录,但不提前决定实验结论。在这个空间内,Agent 根据真实实验结果,高频地选择、诊断和修正。比如,它可以决定数据如何变换、样本怎样筛选、教师上下文包含什么、采用哪种优化目标、奖励函数如何处理正确性与性能,以及什么时候继续、什么时候退回上一个阶段。 AI 在四个阶段自主设计数据和模型配方 1. Data:先让每一个任务都能被执行验证 RTL 与 GPU Kernel 的任务结构完全不同。前者关心模块接口、时钟、复位和行为 oracle,后者关心张量形状、数值语义与实现边界。Agent 将不同来源的种子任务统一为 “指令、参考实现、验证器” 三元组,再根据参考答案和契约状态选择不同的数据演化路线。 新任务只有经过接口检查、编译、执行、行为一致性验证、去重与难度平衡,才能进入后续训练。失败样本不会简单丢弃,它们会反过来改变下一轮的数据路线和重试预算。 2. SFT:只学基础模型完全不会、教师确实会的题 Agent 在此阶段瞄准基础模型的可验证能力缺口。Agent 先找到 Qwen3.6-27B 连续四次都失败、但 DeepSeek-V4-Pro 四次尝试中至少有一次能通过验证的任务,再保留第一条完整且验证成功的教师轨迹。最终,SFT 使用了 28,952 条验证通过的轨迹。 3. OPSD:把 “在反馈帮助下改对” 写回参数 SFT 之后,Agent 继续寻找一种更微妙的失败:模型裸答仍然错误,但如果给它修复方向、此前的错误回答和验证器反馈,它可以在后续轮次改对。共有 1,874 个任务进入这一阶段。 同一个模型由此拥有两个视角:学生只看原始问题;教师额外看到经过审计的计划、失败记录和粗粒度反馈,但看不到最终正确答案。目标是把临时上下文里出现的自我纠错能力,转化为裸上下文下也能调用的参数能力。 研究 Bet:OP
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱