首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

RoboPapers专访光轮智能谢晨:具身Scaling Law的两座金字塔

摘要

编辑|Panda 近日,机器人圈知名播客节目 RoboPapers 更新了一期专访,对象是 光轮智能创始人兼 CEO 谢晨博士 。这期节目的采访人是 RoboPapers 播客联合主持人 Michael Cho 和新加坡国立大学(NUS)助理教授 Jiafei Duan。后者是 MolmoAct 系列机器人模型的作者,研究方向正是机器人基础模型与可扩展数据采集。 这个由机器人研究者主持、邀请论文作...

Dyna RoboPapers Scaling Law 100 万小时 Jiafei Duan 人类数据 训练金字塔
2026-09-12 1 阅读 约10分钟阅读 机器之心
分享:
字号:
编辑|Panda 近日,机器人圈知名播客节目 RoboPapers 更新了一期专访,对象是 光轮智能创始人兼 CEO 谢晨博士 。这期节目的采访人是 RoboPapers 播客联合主持人 Michael Cho 和新加坡国立大学(NUS)助理教授 Jiafei Duan。后者是 MolmoAct 系列机器人模型的作者,研究方向正是机器人基础模型与可扩展数据采集。 这个由机器人研究者主持、邀请论文作者亲自讲解工作的深度技术访谈节目已然成为全球具身行业的风向标。节目邀请嘉宾大多为斯坦福、伯克利、英伟达、Dyna 等前沿实验室的研究人员。最近几个月,节目先后围绕 1X World Model、NVIDIA DreamZero、Ted Xiao 所总结的机器人学习三个阶段,以及 Dyna-2 的百万小时实验展开对谈,这也对应着具身行业的最前沿方向的几个成果:世界模型、人类数据、规模化。 这次的深度访谈主要围绕三个议题 :一家仿真的头部公司,如何成为全球首个具身数据独角兽公司?光轮智能如何打造数据管线,规模化生成高质量数据?开源 10 万小时高质量数据,光轮智能怎么实现商业价值、保持行业头部的位置? 这次访谈谢晨也给出了一个新的判断: 具身智能的 Scaling Law 需要 训练和评测 两座金字塔,训练金字塔的底座是人类数据,评测金字塔的底座是仿真。 一、机器人开始从人类经验中寻找 Scaling Law 8 月 10 日,位于加州红木城的 Dyna Robotics 发布了 D YN A-2 ,一个完全用人类第一视角视频做预训练的机器人基础模型,预训练数据量超过 100 万小时。 Dyna 把预训练数据量按 1000 小时、1 万小时、10 万小时、100 万小时搭成阶梯,在 14 个任务上用同一套后训练配方逐级测量。其归一化得分从 20% 上升到 53%;其中一个开锁任务在 10 万小时以下的成功率始终为 0,到 100 万小时上升到 90%。 但在谢晨看来,机器人 Scaling Law 并不只发生在训练数据一侧。当训练数据开始规模化,评测能力也必须同步规模化。因此,机器人需要两座金字塔: 训练金字塔 的核心是可规模化的人类数据, 评测金字塔 的核心是可规模化的仿真。前者解决机器人「从哪里学」,后者解决「如何知道它学会了什么、还缺什么」。 也正是在这个背景下,RoboPapers 把目光落在了光轮智能—— 人类数据交付达到全球第一,且刚刚开源了全球最大规模的高质量多模态人类视频数据 EgoSuite-Open100K 。 在 2026 世界机器人大会上,光轮智能开源了 EgoSuite-Open100K 。 这是一个 规模达 10 万小时的全模态人类行为数据集 ,覆盖 15,000 多个场景,包含 15,000+ 项任务,头部与腕部双视角,带手部与全身位姿、语义标注和深度信息。首批数据在 Hugging Face 与 AtomGit 开放,项目同步捐赠给开放原子开源基金会孵化。此次开源,还得到 Hugging Face 的首席科学官 Thomas Wolf 的罕见站台。 可以说,Dyna-2 给出了模型侧的证据,光轮智能则正在从数据供给侧去为行业解决这个难题。 二、训练金字塔:人类数据如何支撑规模化学习? Jiafei Duan 直言:「 很多时候,看到高质量的机器人仿真演示,我会立刻想到这很可能来自光轮智能。 」他的提出的第一个问题就是,一家在仿真取得巨大成功的公司,为什么还要做人类第一视角数据? 谢晨从供给侧给出了回答:自动驾驶有数以百万计的量产车在路上运行,司机的每一次操作都可能成为监督信号;机器人尚没有这样的基础设施。「全球人形机器人可能只有几万台,而且它们并不会一直采集数据。 机器人数据的出路,是 Robot-Agnostic Data(本体无关数据) 。 」 真机数据 依然重要,但无法满足规模化的需求:它质量高、物理真实,也负责把模型先验落到具体机器人的观察空间、动作空间和动力学约束上;但它通常绑定特定本体,采集成本高,本体与任务变化后,历史数据也很难直接复用。 因此,数据金字塔的底部,是 第一视角人类数据 ,用来解决规模化的问题:为模型提供跨任务、跨环境和跨本体的预训练经验。 少量高质量机器人数据 解决的是 Embodiment Grounding:把这些经验对齐具体本体。 仿真 解决的则是 Rollout 与 Verification:扩展长尾状态、支持强化学习,并以更低成本持续评测模型。 Robot-agnostic 并不意味着 robot-free。人类数据、机器人数据和仿真不是三条相互替代的路线,而是一个训练与验证闭环里的不同层次。 相较于绑定某一种机器人本体,人类数据具有更强的跨本体复用潜力,但仍需经过动作表示对齐和真机落地。谢晨有一个清晰的判断:「 人类数据可能是机器人基础模型最具规模化能力的来源。 」 三、真正的壁垒是如何生产高质量的数据 谢晨在访谈中透露, 开放这批数据的底气,来自光轮智能强大的数据引擎 —— 把采集、自动标注和质检都做成可规模化的 pipeline,从而实现高质量数据的规模化生产。 高质量数据可以总结成四个关键维度。 第一个关键维度是 视频质量 ,它是整条产线的门槛:有没有坏帧,双手是否始终在画面内,动作是不是自然。例如,采集者的动作需要保证是一个自然的任务状态,不能太快也不能太慢。光轮智能在采集端就采用了一套实时的 agentic 质检流程,一个片段采完立刻被自动质检,反馈直接回到采集者手上。谢晨认为这一步的价值还没有被行业认识到:「 让数据采集者在工作中学习、实时获得反馈并不断改进 ,本身就是数据质量体系非常重要的一部分。」 自动质检之后还有两轮人工复核。为什么已经用了 AI 还要留人?谢晨回答,「Agentic workflow 的 precision 和 recall 已经很高,但还没有到 100%,因此最终质量分数必须结合自动质检和人工质检。」更关键的是,人工复核捕捉到的失败样本还会反过来喂给自动化流程:「 我们正在建立一个持续反馈闭环,用人类反馈不断改进自动化流程。 」 第二个关键维度是 手部位姿 ,是决定数据质量的关键,手部标注的精度直接决定数据价值。光轮智能为此设有专门负责手部自动标注的团队,自研了一套完整的算法进行位姿的计算。 第三个关键维度 语义标注 则是当下真正的瓶颈。内部已经迭代了七个版本,从事件级做到动作级。难点不在于描述本身,而在于时间戳——动作从哪一帧开始、哪一帧结束,VLM 目前给不了足够准的答案。眼下的解法是组合拳:用已经积累的动作级标注数据去微调基础模型,让 VLM 更准,从而把人在回路的比例一点点压下去。 排在第四位的 全身位姿 被他归为相对早期的部分,因为头部实验室的机器人基础模型目前基本都从手开始。 除此之外,对客户来说还有一个更关键的维度: 多 样 性 。「真正难的是,在保证高质量数据生产的同时,做到任务多样性、场景多样性和采集者多样性」。为此,光轮智能将任务场景归成家居、酒店、零售、运动、物流、办公、工业七大类,每类之下再拆具体任务。为了管理这个组合空间,内部专门做了一个任务 agent,负责生成
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱