首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

克劳德“主导”人类26%的AI研发、3万代理同时运行:当AI开始“造AI”时,头部AI公司的RSI线路正在挖矿

摘要

AI 开始越来越深地参与下一代 AI 的研发,而且速度可能比外界想象得更快。 当地时间 9 月 17 日,Anthropic 发布了一组罕见的内部数据,试图量化 AI 究竟已经在多大程度上参与自己的研发。结果显示,截至 2026 年 8 月,Claude 已经能够“主导”Anthropic 约 26% 的 AI 研发工作;超过 90% 的 AI 研发工作至少已经达到“AI 协作”水平。而在 Ant...

Anthropic Agent Claude 2026 AL5 2023 2025 开始越来越深地参与下一代 的研发 而且速度可能比外界想象得更快
2026-09-18 1 阅读 约10分钟阅读 褚杏娟
分享:
字号:
AI 开始越来越深地参与下一代 AI 的研发,而且速度可能比外界想象得更快。 当地时间 9 月 17 日,Anthropic 发布了一组罕见的内部数据,试图量化 AI 究竟已经在多大程度上参与自己的研发。结果显示,截至 2026 年 8 月,Claude 已经能够“主导”Anthropic 约 26% 的 AI 研发工作;超过 90% 的 AI 研发工作至少已经达到“AI 协作”水平。而在 Anthropic 使用最广泛的内部 Agent 平台上,大约有 3 万个 Agent 正在同时进行研究和工程任务。 更值得注意的是变化速度。Anthropic 公布的图表显示,今年 2 月,Claude 能够达到“主导”水平的模型研发任务占比还不到 1%,半年后已经上升到 26%。Anthropic 将这套衡量体系直接与RSI联系了起来,也就是一个 AI 系统最终能够自主构建自己的继任者。 这里的“主导”需要特别解释下。Anthropic 构建了一套内部的“R&D Automation Index(研发自动化指数)”。其采用了 Epoch AI 提出的六级自动化标准:从 AL0 到 AL5 衡量 AI 对一项工作的介入程度。其中,AL3 被称为“协作”:AI 可以在人类密切指导下承担大块工作;AL4 则是“主导”:工程师只需要给出一个高层目标,AI 就能够完成一项任务的大部分端到端工作,人类主要负责监督和最终决策;最高的 AL5 才意味着没有人类介入的完全自主运行。 所以,“26%”并不是“Anthropic 26%的研发已经完全无人化”,也不是“26%的研究员被 Claude 替代”。更准确地说,它意味着按照 Anthropic 大约四分之一的 AI 研发已经进入“人类定目标和监督,Claude 完成大部分执行”的阶段。 为了得到这一数字,Anthropic 首先抽取了参与模型研发循环的各部门员工。2026 年 7 月的每一周,公司随机抽取这些部门 20% 的员工,由 Claude Research Agent 阅读其 Slack 和内部文档,最终整理出约 1.5 万项细粒度模型研发任务。随后,Claude 又将这些工作整理成包含 542 个节点的任务树,其中有 378 个最终叶节点,涵盖预训练、强化学习、评测平台故障诊断、RL 沙箱网络策略和推理服务事故复盘等工作。Anthropic 再根据不同任务消耗的人力时间进行加权。 这套方法本身也存在局限。例如,用于评估 Claude 自动化程度的“裁判”同样是 Claude。Anthropic 还让负责相应工作领域的内部员工进行了交叉验证:模型与人的评级完全一致率为 59%,而不同人类评估者之间的完全一致率只有 35%;模型和人类评级在相差不超过一个等级时,一致率达到 97%。但 Anthropic 仍承认,“AI 协作”和“AI 主导”之间存在一定主观判断空间。 为了管理这3万个正在同时工作的“AI 员工”,Anthropic 给内部 Agent 引入了两项设计。 首先是独立身份,每一个 Agent 都拥有自己的身份,所有数据和行为记录都与这一身份绑定。即便底层模型升级,身份仍然可以继续存在;其次是开放通信,Agent 之间通过共享消息系统交流,而不是私下传递信息。每条消息都会绑定发送者身份,并链接到原始资料,其他 Agent 可以查看、纠错和协作。Anthropic 同时将这些消息与 Agent 的完整运行轨迹交叉关联,以便监控系统能够追踪跨 Agent 的协同行为。 之所以测试这个数据,是因为随着前沿 AI 实验室越来越多地使用 AI 构建未来的 AI 模型,Anthropic 希望通过这些指标判断,世界距离RSI究竟还有多远。 Anthropic 想自动化整个AI实验室 今年6月份时,Anthropic 就给出了演进路线:2021—2023 年主要还是人写代码;2023—2025 年开始使用 Chatbot 辅助;2025—2026 年进入 Coding Agent;今天则已经出现能够运行代码、把数小时工作继续委派给其他 Agent 的 Autonomous Agent。再往后的阶段,Agent 可能强到足以自己构建并训练模型,让未来版本的 Claude 由 Claude 持续改进。 当时,Anthropic 就表示“我们还没有达到”,并强调RSI并非必然出现。真正已经发生的,是通往这个闭环的若干中间步骤开始被工程化。 今年 5 月,Anthropic 称,合并进正式代码库、能够归因于 Claude 的代码已经超过 80%;第二季度,典型工程师每天合并的代码行数约为 2024 年的 8 倍。不过 Anthropic 随即提醒,代码行数只衡量数量、不衡量质量,因此“8 倍”几乎肯定高估了真实的生产力增幅。 在一个目标和成功标准都预先固定的小模型训练优化实验中,Opus 4 在去年 5 月平均只能把起始代码加速约 3 倍,今年4 月的 Mythos Preview 则已经达到约 52 倍;Anthropic用这个例子说明,在“目标明确、可以不断实验”的研究环节里,模型能力进步得非常快。 Anthropic认为,目前人类仍然拥有明显比较优势的地方,是研究品味和判断力,即决定什么问题值得研究、哪些结果可信,以及什么时候一条路线已经进入死胡同。 因此,Anthropic 如今披露的数据可以认为就是在试图衡量一家 AI 实验室中,必须由人完成的那部分工作,还剩多少? 放眼整个行业,Anthropic 并不是唯一一家开始认真回答这个问题的公司。 OpenAI 已经成立了专门的 RSI 团队;Google DeepMind 正式把RSI列为 AGI 通向 ASI 的潜在路径之一;今年刚刚公开亮相、由田渊栋等人联合创办的 Recursive,更直接把“递归自我进化的超级智能:让知识发现实现自动化”写在了官网首页。 虽然目标一致,但几家公司实际上没有在走完全相同的路。 OpenAI在Scale“AI研究员” OpenAI 与 Anthropic 路线很接近,但关注点并不完全一样。OpenAI现在的目标非常明确:建立自动化的AI研究员。 今年9月,OpenAI表示,公司已经达到此前设定的自动化“AI 研究实习生”目标。所谓AI 研究实习生,指的是一个可以在人类指导下完成定义明确的研究任务的系统,包括过去需要熟练研究员数天完成的工作。OpenAI下一阶段的目标,则是在2028年3月前进一步迈向自动化AI研究员。 这种变化已经开始反映在内部工作量上。今年6月以前,OpenAI研究组织里Agent总运行时长还少于人类工作量;到了8月中旬,如果按一个工作日8小时折算,人类每工作1天,AI Agent会并行运行约24.8小时。越来越多研究人员还在同时启动多个Agent。不过,OpenAI自己的数据也显示,高层规划目前仍只占Agent输出Token的很小一部分。 OpenAI同时强调,现在仍然是人来设定研究优先级,判断哪些想法和结果值得继续,以及决定一个系统应该Scale、暂停还是部署。这与 Anthropic 情况相似。 当下,OpenAI还在继续向前推。OpenAI正式的R
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱