首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

OpenAI把AI推向物理世界,这家公司已造好引擎,下一站1000万小时人类经验

摘要

编辑|Sia 「 E gocentric data boom 」 9 月 3 日,OpenAI 正式发布 GPT-6 Astra。 在 ARC-AGI-3(一个考验 AI 能否在陌生环境中自主探索、理解规则并规划行动的 Benchmark),Astra 拿下 99.9% ,并在 96% 的关卡中达到或超过人类的行动效率基准。 一天后,Robocurve 将它接入真实双臂机器人,在「抓起积木并放进碗...

data Dyna egocentric Maxinsights Robotics 万小时 GENE boom Astra 100
2026-09-17 1 阅读 约10分钟阅读 机器之心
分享:
字号:
编辑|Sia 「 E gocentric data boom 」 9 月 3 日,OpenAI 正式发布 GPT-6 Astra。 在 ARC-AGI-3(一个考验 AI 能否在陌生环境中自主探索、理解规则并规划行动的 Benchmark),Astra 拿下 99.9% ,并在 96% 的关卡中达到或超过人类的行动效率基准。 一天后,Robocurve 将它接入真实双臂机器人,在「抓起积木并放进碗里」的任务中, 20 次成功 19 次 。 这两个结果释放出的信号是: 最前沿的大模型正在把能力边界从数字世界继续推向物理世界 。 当模型不再只是回答问题,而是需要观察环境、规划下一步并实际完成任务,它所面对的数据问题也随之发生变化。 今年八月,Dyna Robotics 第一次将人类经验( 第一人称视角数据,也叫做 egocentric data )相关的规模推到了 100 万小时 。 从 1000 小时逐档增加到 100 万小时,Dyna-2 的预测表现持续改善,没有明显吃饱的迹象。在预训练阶段没有见过的机器人任务中,Dyna-2 依然展现出更强的泛化能力。 Genesis AI 的首个机器人基础模型 GENE-26.5 也采用了 egocentric data,将真实人类活动中的视觉、动作与交互过程纳入模型训练。 这些实践共同指向一个变化:机器人训练正在开始吸收可以大规模的人类真实活动。 大模型曾经依靠互联网完成 Scaling,而机器人长期受限于真机数据——采集昂贵、积累缓慢,还往往绑定特定本体。 如今, 一条新的 Scaling 轴正在变得清晰:人类经验 。 《连线》写到,一场 「 egocentric data boom 」 正在兴起。越来越多机器人公司转向采集员佩戴摄像头产生的 egocentric video,甚至有投资人预计领先公司未来几年会购买数亿小时的 egocentric data。 问题是,谁能把这些视频里的经验,持续、高效地变成模型可用的训练数据? 在 Dyna-2 和 GENE-26.5 惊艳表现的背后,一个共同的「 卖水人」浮出水面: Maxinsights 。 它既是 Dyna-2 最大的数据合作伙伴,也是 GENE-26.5 的独家 egocentric data 合作伙伴 , Google DeepMind、Figure、1X 以及某头部大模型公司等也曾与其开展数据合作 。 这家 2024 年成立于旧金山湾区的 Physical AI 公司,已经将数据服务铺到六大洲,并于今年 3 月进入中国市场。 Maxinsights: 最早实现规模化、且累计交付量最大的 第一视角数据公司 Maxinsights 不仅是最早的 Ego data 公司,也是最早上量的一家 。 其团队核心成员来自 Waymo, Meta, Google, QCraft, XPENG, Bosch 等自动驾驶与 AI 领域公司,具备从数据采集、清洗、算法、标注到模型训练的完整工程经验。 这套曾支撑自动驾驶发展的数据闭环能力,正在被迁移到 Physical AI 领域。 随着与硅谷 Foundation Model 和 Robotics 团队合作不断深入,Maxinsights 逐渐扩展到大规模 egocentric human experience 数据,搭建覆盖数据采集、质量控制、理解、标注到模型训练交付的完整基础设施。 这一转变背后,是机器人学习对真实世界经验的需求。机器人采集的操作数据往往与具体硬件和任务环境相关,而人类每天都在不同场景中完成大量物理交互。拿起杯子、整理物品、打开抽屉、使用工具,这些日常动作记录了物体如何响应接触、双手如何协作,以及环境状态如何随着动作发生变化。 Dyna Robotics 也在 Dyna-2 技术报告中指出: 人类执行真实任务时产生的 sensorized recording,规模几乎没有上限,同时包含了机器人 manipulation policy 所需要学习的世界动态和手物交互信息。 换句话说,如果机器人想获得类似互联网数据规模的训练资源,未必需要等机器人自己工作几亿小时。它可以先学习已经在人类世界中运行了无数年的经验库。 对于 Maxinsights 而言,将这些人类经验转化为可用于训练的数据,已经进入规模化生产阶段。 截至目前,公司建立了覆盖六大洲的采集网络,累计积累 150 万+小时带手部追踪和语言标注、可直接用于训练的高质量数据, 历史累计向客户交付超过 200 万小时。 而 它 之所以能在具身智能数据链顶端站稳脚跟 ,靠的并不只是庞大的 「 视频仓库」,更 是一座 「 智能工厂」。 它配备了最前沿的模型算法和高度自动化的流水线,源源不断地将原始的人类视频,提纯、加工成行业亟需的 robot training-ready 训练数据。 精品 1 5 0 万小时数据,远离 「 盲目上量 」 当数据规模跨过百万小时的大关,单纯靠堆人、堆规模的边际效益已经开始递减。 具身智能的数据之战,底层逻辑变了。 这也正是 Maxinsights 最有远见的一步棋:他们真正在意的,不再是每个月还能多采多少小时,而是 如何 把人类数据与机器数据之间的 Embodiment Gap(跨本体差异),降维成一个可以通过流程和算法解决的工程问题 。 根据他们的观察,未来具身智能的数据能力,会沿着两个方向同时演进。 其中一个是 Experience Scale(经验规模) 。 机器人需要接触足够丰富的人类活动、环境、物体和任务,才能逐渐形成对物理世界的通用理解。 因此,数据规模仍然重要。行业会继续从百万小时走向千万小时,甚至更大规模,让人类经验成为训练通用机器人模型的重要基础。 但规模扩大之后,另一个问题也越来越突出:模型看到了更多视频,却没有看到更多新的世界。 如果新增的数据只是重复已有场景,那么数量增长并不会带来同等程度的能力增长。 这种对有效数据的高度需求,首先会传导到采集基础设施上。Maxinsights 给出的解法,是让数据采集本身具备主动规划能力,也就是 Coverage-aware Collection 。 当数据规模进入百万小时之后,传统的被动采集方式会越来越容易暴露问题:辛辛苦苦采回来的第 1000 万小时数据,大概率成为早期数据的低质复刻。 满屏都是固定环境下的简单搬运、桌面抓取,规模上去了,系统却免疫了。 盲目上量行不通,那就主动寻找数据缺口。 依托内部的 Agent 平台,Maxinsights 可以对现有的数据池进行反向诊断,像雷达一样锁定数据分布的盲区。一旦发现稀缺环境、罕见物体或是复杂的受力动作,Agent 会立刻下发指令,定向调度全球 5000 余名采集员和专业设备进行补采。 例如,缺少厨房环境中的长尾物体,就安排对应采集;缺少柔性物体操作,就补充相关任务;缺少复杂受力状态,就针对性设计采集流程。 这套流水线还自带数据清洗功能,能自动识别并剔除无效片段、刻意摆拍和摄像头视角偏移等低质数据。 自有模型才是数据公司的技术壁垒 除了 Experience Scale,Maxinsights 观察到的第二个关键趋势是 Experience Densi
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱