智能AI
morning
全球首个!10万小时人类数据全开源,Hugging Face罕见站台
摘要
新智元报道 上周,一家名叫Dyna Robotics的公司干了件让整个行业集体失眠的事。 他们训练了一个叫做DYNA-2的模型。独特之处在于,预训练阶段一条机器人动作数据都没喂。 取而代之的是,他们给模型灌进了超过 100 万个小时的人类第一视角视频。相当于一个人连续学习 170 年。 结果,从 1000 小时一路到 100 万小时,每翻 10 倍机器人都在变聪明。更准确地说,是一条持续上升、没有...
https
100
万小时
Open100K
Face
lightwheel
egosuite
open100k
Hub
更重要的是
2026-08-25
1 阅读
约10分钟阅读
新智元
字号:
新智元报道 上周,一家名叫Dyna Robotics的公司干了件让整个行业集体失眠的事。 他们训练了一个叫做DYNA-2的模型。独特之处在于,预训练阶段一条机器人动作数据都没喂。 取而代之的是,他们给模型灌进了超过 100 万个小时的人类第一视角视频。相当于一个人连续学习 170 年。 结果,从 1000 小时一路到 100 万小时,每翻 10 倍机器人都在变聪明。更准确地说,是一条持续上升、没有明显撞墙的幂律趋势。 可以说,物理AI终于有自己的Scaling Law! 消息一出,行业炸了。因为这等于宣告: 训练机器人最稀缺的资源,不是GPU、不是算法,而是高质量的人类行为视频数据。 谁手里有这批数据,谁就掌握了物理AI时代的石油。 但问题随之而来。这条曲线都看得见,但跑到关键拐点需要的那批数据,却都锁在各家公司自己的硬盘里。 直到这家公司把锁撬开了。 8月20日上午,在2026世界机器人大会(WRC 2026)上, 光轮智能宣布:10万小时全模态人类行为数据,全部开源! 数据集叫EgoSuite-Open100K,与Hugging Face联合发布,首批已上线Hugging Face Hub和AtomGit。学术研究能用,商业训练也能用。 开源网页:https://egosuite100k.lightwheel.ai/ 官方新闻稿:https://lightwheel.ai/media/egosuite-open100k HF 开源仓库:https://huggingface.co/collections/LightwheelAI/egosuite-open100k 迄今为止,全球规模最大的全标注开源第一人称人类数据集,具身智能最贵的资产,今天第一次被摆到了所有人都能够到的桌面上。 消息发布后,X 上迅速炸了。 最先炸的是 Hugging Face 自己。HF 官方账号直接转发了光轮智能的发布帖。 熟悉这个全球最大开源 AI 社区的都清楚,HF 官号几乎从不单独为某一个第三方项目公开站台。 翻遍 HF 官号的历史,能找到的类似操作屈指可数:IBM 和 NASA 联合发布的太阳物理模型 Surya;Databricks 的 CommonCanvas 图文数据集,官号称其为「Hub 上托管过的最大数据集」;图像生成模型 Flux.2-dev。每一个都是各自赛道的标志性开源事件。 EgoSuite-Open100K 这次拿到的待遇,跟它们一个级别。 不止官号。HF 旗下的机器人项目 LeRobot 更是直接发了一条长帖力挺,明确表态:「Always great to see a dataset at this scale released openly on the Hub.」 机器人领域大 v 博主 Lukas Ziegler 随后跟进,详细解读了数据集的多视角变体,称这是「训练灵巧操作不可多得的素材」。 新加坡国立大学助理教授Jiafei Duan表示:开源是新的护城河 为啥偏偏是10万小时? 这个数字背后是过去一年物理AI领域一系列硬碰硬的研究结论。 英伟达2026年发布的EgoScale框架,用20,854小时的第一视角人类视频训练VLA模型,第一次在具身智能领域画出了一条清晰的对数线性扩展曲线——人类数据小时数与验证损失呈对数线性关系,R² = 0.998,在 22 自由度灵巧手上平均成功率提升 54%。 物理AI的扩展规律正在变得越来越清楚: 人类示范越多、覆盖的真实场景越广,机器人的动作模型就越强;更重要的是,这种提升开始变得可以测量、可以预测。 Generalist AI拿270,000小时物理交互数据训出了GEN-0。Sunday Robotics(做出ALOHA的那个团队),证明人类示范数据的采集完全可以走出实验室、在真实家庭环境里大规模跑起来。 然后就是前面说的Dyna Robotics。DYNA-2最核心的发现不只是「人类视频能训机器人」。 更重要的是,他们把跨具身迁移的拐点定位在了1万到10万小时之间。简单说就是,你给一个六轴机械臂看人类切菜的视频,训完之后,换一台人形机器人,它也能切。 这件事在1万小时以下基本不会发生。你教它在A厨房用B刀切胡萝卜,它就只会在A厨房用B刀切胡萝卜,换个桌子都不行。 但过了1万小时,曲线开始拐弯。到了10万小时这个级别,跨具身迁移的信号变得明确而稳定。也就是说,1 万到 10 万小时,是机器人「开窍」的那道坎。 尴尬的是,绝大多数团队手里的数据量还远远不够。这就导致了一个局面——Scaling Law谁都知道,但只有极少数玩家有资格验证它。 光轮智能这次开源的 10 万小时数据集,正好砸在了这个拐点上。 如何给机器人打造高质量的 「言传身教百科全书」? 10万小时的数据,可不是把摄像头开着就能攒出来的。 数据采集这行,规模、多样性和标注质量就像是个不可能三角。 量做大了,覆盖面就窄。你雇一万个人但他们全在同一间厨房里切菜,10万小时和1万小时没啥区别。 覆盖面铺开了,标注深度跟不上。场景越复杂,每帧要标的东西越多,标注成本指数级上涨。标得足够细呢?规模又上不去,因为你一天也标不了几条。 光轮智能的做法是把多样性提前设计进采集环节。不是先拍一堆然后再筛,那样来不及,而且浪费的成本根本扛不住。 他们按同一套规范作业。去什么场景、做什么任务,每一环都照着覆盖目标严格控制。 最后采集到的数据是这样的: 15,000+个独立采集场景(每一个都是真实的物理空间,布局、物体、光线全不一样),15,000+项具体任务,7大类环境——家居、餐旅、零售、运动、物流、办公、工业,128种场景类型,18类任务大类。 覆盖了从厨房备菜到工业装配、从库存盘点到工具维修的真实操作。要知道,目前公开可用的第一人称数据绝大部分集中在家庭厨房和日常活动,独立场景数只有零头。EgoSuite-Open100K 直接把场景广度拉出了一个数量级的差距。 最难能可贵的是,这些都是机器人接下来真要去干活的地方,也是现有公开数据集里最大的空白。 10万小时是「量」,真正决定这套数据身价的,是「质」。全球最大的开源第一人称数据、最全的三层标注、最广的场景覆盖,三样凑齐的,目前只此一家。 EgoSuite-Open100K 每段视频带三层标注: 手部位姿教机器人手指关节怎么弯、怎么捏——21个关节点,逐帧标注; 身体位姿教它怎么伸手、怎么弯腰、怎么全身协调; 事件级语义标注告诉它这一步在干什么、动的是哪个物体。 三层叠在一起,模型才能既知道「手怎么动」,又知道「为什么这么动」。 整个数据集分成两条线。EgoStandard是主体,头戴视角,跟着人的眼睛学。 EgoPro则额外挂了腕部摄像头,贴在手腕上拍手指接触物体那一瞬间的细节。手指碰螺丝的角度、捏住袋口的力度、插入卡槽的时机,这些最精细的操作瞬间在头戴视角里恰好被手臂挡住。 腕部视角补的就是这一块,采集成本高,公开数据里几乎见不到。 真正最难啃的是标注本身。也是光轮智能这次开源数据集里最有「诚意」的地方。同类数据集到了这个量级,通常只放原始视频,因为标注成本太高了。 头戴视频一直在抖,人走路时晃、转头晃、蹲下站起来也晃。双手的关节
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱