首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS

2026-09-15 1 阅读 约10分钟阅读 新智元
分享:
字号:
新智元报道 大额免费Token Plan: https://discovery-home.intern-ai.org.cn/ , https://api.atria-asi.ai/, https://zenmux.ai/atria-asi/atria-dawn-preview 项目网站: https://atria-asi.ai/ 模型权重: https://huggingface.co/internlm/Atria-Dawn-Preview Paper链接: https://github.com/atria-asi/Atria-Dawn-Preview/blob/main/atria-dawn-preview.pdf 20 分钟,一个 MiniOS操作系统搭建了起来。 AI4AI 设计并训练一个超过 4 亿参数的天气预测模型,1 分钟,预测未来一周的全球天气。 这是智能体模型 Atria Dawn Preview 在此次展示中完成的两项任务。 上海人工智能实验室联合复旦大学、中科院软件所、中国人民大学、中科院自动化所、华东师范大学和哈尔滨工业大学等机构,共同发布了这一智能体新模型。 模型能做什么,自然是发布的看点。但这一次,团队还把目光转向了另一件事: 这个模型,究竟是怎么被研发出来的? 在 Atria 的后训练过程中,研发人员普遍使用编程智能体辅助工作。写代码、执行实验、分析结果,AI 已经参与其中。 于是,一个问题浮了出来:当 AI 开始帮忙「造 AI」,人类还在忙什么? 越来越多的操作交给 AI 之后,AI工程团队的劳动究竟减少了多少,又有多少转移到了不容易被看见的地方? Atria 团队收集了研发中的人机交互记录,尝试把这些分工拆开来看。 AI 连续执行的背后,谁在决定下一步? 回看模型研发,人类的工作一直在变。 早期,人们为模型标注数据。后来,通过偏好反馈告诉模型什么样的回答更好。如今,AI 开始参与代码编写、实验执行和结果分析。 人机协作的范围,就这样从训练数据的生产,延伸到了研发流程本身。 沿着数据、训练与评估三个环节,可以看到这一变化: 一些过去需要研究者一步步完成的操作,现在可以交给智能体连续推进。 但研发中,还有一类工作很难用代码行数来衡量。 问题该怎么定义?哪条技术路线值得尝试?实验结果究竟支持了什么判断?继续投入,还是及时换方向? 这些决定可能只需要几句话,却会影响后面一连串操作。 因此,想知道 AI 在研发中贡献了多少,就需要沿着过程往回看: 方案是谁提出的,选择是谁作出的,卡住之后又是谁把方向纠正过来的。 这也是 Atria 团队分析交互记录的出发点。 769 条任务记录,拆开 AI 研发背后的人类劳动 团队分析了 56 名参与者的 769 条任务记录 ,并结合智能体日志,观察研发中的人机分工。 其中,739 项任务明确回答了是否使用 AI,713 项涉及 AI,使用率达到 96.5% 。 在这批被调查的研发工作里,用 AI 已经相当普遍。 不过,96.5% 回答的是「有没有用」,还没有回答「承担了多少」,更没有回答「谁在作决定」。 真正值得展开的,是接下来几组数字。 约三分之一的已完成任务,参与者认为「没有 AI 就做不成」 在 455 项已完成、使用了 AI,且获得有效可行性回答的任务 中,151 项被参与者判断为:如果没有 AI,自己负责的部分就无法完成。 占比 33.2% 。 这里有一个明确前提: 任务范围、质量要求和其他资源保持不变。 也就是说,对这些参与者而言,AI 的作用已经延伸到任务是否可行。一部分原本受资源或个人能力限制的工作,有了 AI,才进入了能够完成的范围。 当然,这里的「做不成」,来自参与者对当时情况的回顾性判断。 这些任务可能确实超出了参与者在给定条件下、不借助 AI 所能完成的范围,也可能是 AI 的使用改变了他们对自身能力和任务可行性的判断。 参与者认为任务离不开 AI,并不意味着最终选择也由 AI 作出。要理解 AI 在工作中的作用,还需要进一步区分:谁提出方案,谁作出最终选择。 AI 经常出方案,多数最终选择仍由人作出 再看技术决策。 在执行岗位参与者报告的 567 项方法或参数决策 中,AI 提出方案的比例达到 64.6% 。 其中,最常见的协作方式是: AI 提出,人类选择。 这一组合占全部此类决策的 55.4% 。 如果把视线放到最终选择上,分工就更加清楚: 85.5% 的方法或路线决策由人类作出最终选择,AI 作出最终选择的比例为 9.2% 。 在目标或范围、验收标准两个环节,人类作出最终选择的比例,也分别达到 93.4% 和 81.9% 。 甚至在那 151 项被参与者认为「没有 AI 就无法完成」的任务中,仍有 144 项 由人类最终选择目标,占比 95.4% 。 两件事同时发生了。研究者依赖 AI 完成工作,AI 也经常参与技术方案的形成;与此同时,人类仍然承担着多数最终选择。 哪些方案值得采用,哪些结果符合要求,研究应该朝哪个方向推进,这些判断构成了人类工作的重要部分。 把整个任务简单标成「人做的」或「AI 做的」,很容易把中间的分工混淆。方案提出、最终选择和具体执行,需要分别看。 遇到困难,76.0% 经人类帮助继续推进,只有 0.7% 由人类接管 智能体卡住之后,会发生什么? 团队请参与者回顾了每项任务中最关键的一次困难。在记录了困难及应对方式的 588 项任务 中, 76.0% 经人类介入后继续推进 ,由人类接管主要工作的比例只有 0.7% 。 人类最常做的两件事,分别是: 补充背景或澄清需求:35.2%。 诊断问题或改变方法:34.7%。 另有 23.0% 的任务由 AI 自行恢复推进。 这让「人类介入」有了更具体的样子:研究者补上缺失的信息,判断问题出在哪里,或者调整方法,智能体随后继续执行。 修改产出时,也出现了类似的分工。 在明确记录主要 AI 产出去向的 627 项任务 中,354 项发生了实质性修改,占比 56.5% 。 而在这些需要实质性修改的任务中, 75.4% 由 AI 根据人类反馈完成修改 。 初稿是 AI 写的,修改稿也可能是 AI 写的。 但两版之间,人类指出了什么问题、提出了什么要求,同样影响着最终结果。 如果只统计生成内容、代码量或直接编辑次数,这部分通过反馈完成的工作,就很容易被低估。 8 项基准,两项第一、两项第二 研发过程之外,Atria Dawn Preview 本身的能力,也是此次发布的重点。 团队对模型进行了评测,并与其他基线模型展开对比。具体结果如下: 在团队给出的 8 项基准对比 中,Atria Dawn Preview 取得了 两项第一、两项第二 : AutomationBench、CyberGym:得分最高。 SkillsBench、Workspace-Bench-Lite:位列第二。 这组结果展现了它有竞争力的智能体能力。 分数之外,团队还给出了三个 Demo,分别对应模型训练、软件开发和网络安全。它们把模型组织工作、使用工具、根据反馈继续推进的过程,放到了具体任务里。 禁用网络搜索,训练一个超过 4 亿参数的天气模型 第一个任务,直接让 AI 参与全
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱