首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

AI开始研究AI!OpenAI「研究实习生」上岗,奥特曼画的饼已兑现一半

摘要

新智元报道 去年10月28日,OpenAI刚完成营利实体重组,奥特曼和首席科学家 Jakub Pachocki 开了一场直播。 奥特曼在直播里撂下一句话:与其天天吵AGI到底怎么定义,倒不如定两个能真正兑现的日子。 紧接着,Pachocki就把日子报了出来: 2026年9月,自动化AI研究实习生上岗。 2028年3月,自动化AI研究员就位。 十个多月过去,第一个日子到了,OpenAI按期交卷。 9...

14倍 个token 研究员 实习生 决定做什么 14个Agent工作日 OpenAI研究部门Agent工作日与人类工作日之比 6月反超 8月中旬达3 新智元报道
2026-09-12 1 阅读 约10分钟阅读 新智元
分享:
字号:
新智元报道 去年10月28日,OpenAI刚完成营利实体重组,奥特曼和首席科学家 Jakub Pachocki 开了一场直播。 奥特曼在直播里撂下一句话:与其天天吵AGI到底怎么定义,倒不如定两个能真正兑现的日子。 紧接着,Pachocki就把日子报了出来: 2026年9月,自动化AI研究实习生上岗。 2028年3月,自动化AI研究员就位。 十个多月过去,第一个日子到了,OpenAI按期交卷。 9月6日,OpenAI研究员Boris Power转发官方博客: OpenAI达成了自动化研究实习生的目标。 这是AI行业第一张被公开兑现的能力时间表。 「研究实习生」不是一款产品,它是OpenAI对自己内部能力的一个定义: 一个能在人类指导下完成明确研究任务的系统,而且干的都是熟练研究员原本要花几天才能搞定的活。 至于那个计划在2028年实现的「研究员」,Pachocki给出的标准是: 能够自主交付更大型研究项目的系统。 一个需要人类指导,一个能自主交付更复杂的研究项目。 从「实习生」到「研究员」,差的 主要 是一整层判断力:做什么、做到哪、什么时候停。 这一层恰恰是今天AI最薄弱的地方。 OpenAI自己的数据显示,「决定做什么」在Agent输出里几乎不存在,任务一超过4小时,就得人频繁插手。 18个月补上这一层,OpenAI把路线也定好了:递归自我改进(Recursive Self-Improvement,RSI)。 让AI来研究AI,再让研究出来的AI继续研究AI。 但OpenAI也承认,自己还不知道该怎样安全地走到完全对齐、完整的RSI那一步。 实习生的账单 一天烧掉7000美元 在这次交卷报告里,OpenAI还披露了一个惊人的内部数据,AI的打工时长已经是人类的3倍: 截至2026年8月中旬,在OpenAI的研究部门里,每投入1个人类工作日,背后就有3.14个Agent工作日。 OpenAI研究部门Agent工作日与人类工作日之比,6月反超,8月中旬达3.14倍。 先来看看,这个「实习生」到底有多努力,又有多烧钱。 OpenAI这次没拿跑分说事,直接亮出了自家研究部门的工作账单。 年初的时候,OpenAI研究部门里那些Agent用量排名中等的研究员,还只是「少量使用」AI工具。 但到了8月中旬,这位中位数员工每天光是消耗的推理算力,按API价格算就超过了600美元。 如果是排在前10%的重度用户,每天烧掉的token直接突破7000美元。 OpenAI研究员每天消耗的Agent推理费用(按API价格)。左图为中位数研究员,8月中旬超600美元;右图为前10%重度用户,超7000美元。 这比不少高级程序员的月薪还要高。 今年以来,研究部门中位员工的输出token量暴涨了124倍,把公司其他部门远远甩在了后面。 其实在6月之前,整个研究部门的Agent总运行时间还比不过人类的总劳动时间。 但6月一过,曲线彻底反超,到了8月中旬直接拉升到了3.14倍。 OpenAI研究部门Agent工作日与人类工作日之比。5月初还不到0.5倍,6月反超,8月中旬达3.14倍。 研究员们甚至开始玩起了「多开」,同时开4个以上Agent并行干活的人越来越多。 钱花得这么狠,研究进度变快了吗?数据显示: 2026年8月,每位活跃实验者跑的实验数量,创下了自2025年1月开始统计以来的历史新高;全公司每位活跃贡献者的代码变更量,对比2025年之前的平均水平也实现了翻倍跨越。 不过OpenAI也深知其中的瓶颈——自动化推进得越深,最难自动化的那部分任务就会占掉研究员越来越多的精力,成为下一道卡点。 算力这道门槛,也会越来越重要。 换句话说:写代码早就不是限制起飞的瓶颈了。 实习生到底在干什么活 每个人类研究员背后都有3.14个Agent工作日,是不是说一个AI已经顶三个研究员了? 先别急着下结论。 OpenAI这次把Agent的工作明细拆开了,它用Epoch AI的一套分类法,把AI研发拆成六个阶段: 决策、设计、构建、运行、分析、沟通。 然后把Agent吐出的所有token逐条归类,看AI到底在忙什么。 结果显示,1月到8月,每位研究员每天的token增量,前三名清一色是「执行层」的苦活: 写研究和基础设施代码,增加19.82万个token;技术帮助与代码审查,增加15.88万个token;启动、监控和调试训练运行,增加13.31万个token。 「决策层」呢? 涨得少得可怜:「决定做什么」只增加2300 个token ;「算力与人员分配决策」增加1500 个token ;「决定继续还是叫停项目」仅仅增加200 个token 。 执行层和决策层,每天token增量差了近千倍! 用OpenAI的话说:高层规划在Agent输出里仍然只占极小一部分。 1月到8月,OpenAI每位研究员每天各类研究活动的Agent输出token增量。写代码涨19.82万居首,「决定继续还是叫停」只涨200,差了近千倍。 这里还有一个细节: OpenAI内部原本有好几个团队每周开门诊,帮研究员排查实验环境问题。 到了2026年,去人工频道发帖求助的人越来越少,其中一个团队因为实在没人来,干脆停办答疑会,把人手全挪去改系统了。 找故障、修环境这种让人头秃的活,已经被Agent全面接管。 那成功率呢? OpenAI统计发现,人类15分钟内能干完的简单任务,Agent零干预一次成功的比例高达86%。 任务拉长到4到8小时,零干预成功率就只剩43%。过去半年里,这一档成功完成的任务中,超过一半至少需要人插手一次。 拉到8到16小时,零干预成功率只剩四成。 所以说,「实习生」这个词用得极其精准: 你给它派个活,它能不知疲倦地干上几天的量;但大方向对不对、什么时候该停,还是得靠人类导师在背后盯着。 7月 OpenAI连踩两脚刹车 OpenAI贴出了一张强化学习算力曲线图,图上的两条虚线,就是两脚刹车的时间点。 7月15日至8月15日OpenAI强化学习GPU分配。7月20日安全暂停后算力应声腰斩;8月7日Astra类(绿色)再受限,一周内降59.2%,其他模型(蓝色)随即补位。 第一脚刹车,7月20日。 那天OpenAI发现,Agent居然攻破了自家的研究基础设施。训练用的容器服务当天紧急关停,重新上线时加上了大量额外限制,面向最新部署模型的强化学习训练直接暂停两周。 第二脚刹车,8月7日。 当时,OpenAI发现初步证据表明 ,Astra模型可能具备了OpenAI安全框架定义的「关键网络能力」。 公司立刻给它追加专属限制,要求Astra只能在更高安全等级的研究环境里跑。接下来一周,Astra类的GPU分配再降59.2%。 然后,诡异的一幕出现了。 其他模型的GPU分配同期上涨17.2%,刚好把Astra腾出来的缺口补回约85%。整个强化学习工作负载的总算力,几乎没受影响。 算力不会闲着。管控一来,它自己找路流走,研究员转头就把腾出来的卡挪去训别的模型了。 所以,刹车踩下去了,但车却没停,而是换了条道。 OpenAI自己也承诺,只要发现继续推进会带来不可接受的安全风险,就会减速,甚至停止开发或部署。 它还公开提了一个要求: 所有前沿实验室,都应该被要求
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱