汽车
morning
170亿砸下去,100万小时采回来,具身智能最有价值的数据长什么样?
摘要
四位一线操盘手揭示:最不缺钱的具身智能,到底缺什么样的数据? 2026年的夏天,具身智能热得发烫: 钱多。 前7个月融资超750亿,超过2025年全年的4倍,约为2024年全年的22倍。 (据IT桔子数据统计) 热度高。 WAIC刚收官,世界机器人大会又将开幕:300家企业、2000件展品。 甚至部分卖铲子的人,比淘金者更快拿到钱。 25家数据公司半年融资170亿。 一切都在增长。 但恰恰在这烈火...
他代表
100万小时
预训练
联合创始人
他知道
他将揭示
四位一线操盘手揭示
最不缺钱的具身智能
到底缺什么样的数据
2026年的夏天
2026-08-12
1 阅读
约8分钟阅读
虎嗅
字号:
四位一线操盘手揭示:最不缺钱的具身智能,到底缺什么样的数据? 2026年的夏天,具身智能热得发烫: 钱多。 前7个月融资超750亿,超过2025年全年的4倍,约为2024年全年的22倍。 (据IT桔子数据统计) 热度高。 WAIC刚收官,世界机器人大会又将开幕:300家企业、2000件展品。 甚至部分卖铲子的人,比淘金者更快拿到钱。 25家数据公司半年融资170亿。 一切都在增长。 但恰恰在这烈火烹油的当口,一个最基础、最关键的缺口浮出水面—— 有效关键数据。 “100万小时”正在成为具身智能的新尺度。 但采集时长算的是“花了多少时间”,训练产量算的是“有多少真能用”。大多数数据在两者之间被丢掉了。 行业真正缺少的,不只是更多数据,而是 一套能够回答“什么算有效经验”的共同口径: 能否提升能力、能否跨任务/场景/本体复用、是否值得长期投入和持有。 所以这一次,我们把模型公司、真实部署方与数据基础设施方拉进同一张桌子,只讨论一件事: 什么样的数据,是具身智能界最有价值的资产? 四位一线操盘手,一场数据的价值对账 他们分别站在世界模型与真实部署、预训练、数据评测、真实数据生产与基础设施四条链路上,四种视角放在一起,才能把 “采什么、怎么练、如何验证、能否复用” 连成完整闭环。 彭湃 | 酷哇科技 联合创始人、世界模型算法负责人 他代表 世界模型与真实部署回流视角 。 曾任职于腾讯计算机视觉研发中心,主导多模态视觉技术研究,在CVPR、ICCV、NeurIPS等顶级会议发表多篇论文并担任领域主席,持有国内外技术发明专利近百项。 如今他主导酷哇科技世界动作模型、VLA与端到端自动驾驶的研发,直面真实场景中的失败、接管和纠偏——他知道,一条被认真标注过失败原因的轨迹,是否比一百条顺畅的重复动作更有价值。 他将回答: 真实部署中的“翻车”数据,如何变成下一轮模型训练的高价值经验? 郭俊良 | 千寻智能 预训练负责人 他代表 预训练与数据配方视角。 博士毕业于中国科学技术大学,曾任微软亚洲研究院高级研究员,主导多个生成模型、世界模型和具身智能项目研发,入选人工智能华人新星百强榜单。 他主导研发的Spirit v1.5、1.6系列具身基础模型,每天都在回答一个核心问题:人类视频、真机示教、仿真生成和部署回流,各自教会了模型什么?当数据预算有限,规模和质量的取舍天平该往哪边倾斜? 他将揭示: 预训练阶段,不同数据源的能力贡献如何量化,以及“数据配方”怎样决定模型的上限。 廉和|光轮智能 战略与生态副总裁 他代表 数据、仿真、评测与产业生态视角。 北京大学物理系学士、巴黎矿大工程硕士,兼具AI视频生成创业经历与腾讯技术工程事业群、广告技术团队的产品和战略管理经验。 作为具身仿真评测产品负责人和新一代仿真引擎Newton技术指导委员会委员,他长期参与构建连接真实人类行为数据、物理测量、仿真生成、工业级评测与真实场景部署的物理AI基础设施。 他将带来: 人类数据、物理测量与仿真数据如何形成闭环;评测如何连接模型训练与真实能力; 以及数据、模型、机器人企业与产业场景如何通过生态协作,共同推动物理AI基础设施化与规模化落地。 郑宇靖|刻行时空 联合创始人、CTO 他代表 真实数据生产与数据基础设施视角。 四川大学软件工程学士、普渡大学计算机科学硕士,曾在美国从事自动驾驶与机器人研发,长期深耕AI与数据基础设施的工程落地。 他主导搭建了面向跨本体、跨传感器的数据回流与管理系统, 让真实训练需求变成可生产、可评价、可理解、可筛选、可交付的多模态时空数据 ——他知道,数据不是采回来就够,能稳定进入训练流程的才叫“有效”。 他将揭示:跨本体数据的治理与评价,如何让第三方生产的数据获得模型公司的信任? 真实数据如何跨越工程、质量与合规三道门槛,稳定进入海内外模型训练流程? 我们不问“数据够不够多”,只追问三组真问题 01 |数据从哪里来:四种燃料分别解决什么问题? 如果只有1亿元数据预算,四条路线与数据处理应如何分配? 人类第一视角视频、真机遥操作、仿真生成和真实部署回流,分别适合学习语义、意图、动作先验、接触、受力、失败恢复还是安全边界? 02 | 100万小时,有用的有多少? 一小时采集数据中,多少能真正进入训练集? 被丢弃的数据为什么被丢弃? 数据成本应该按采集小时、有效轨迹、难例密度,还是模型能力增量计算? 03 | 数据会成为壁垒,还是公共基础设施? 本体变化后,过去的数据还剩多少价值? 甲方、机器人公司、模型公司和数据服务商共同产生的数据归谁?可复售的数据还能构成护城河吗? 参与直播,你将获得: 1.一线判断共识 : 世界模型 、预训练、真实部署与数据基础设施多视角交叉研判,直面“什么数据真正带来能力增量”的核心分水岭 2.有效数据的成本账 :围绕预算比例、有效率、废弃率、接管率和数据处理周期,把“多少采集时长”换算成“多少有效产量” 3.数据资产的边界 :数据归谁、能否复用、能否交易?跨本体、跨场景迁移后,数据还剩多少价值 4.关键行业链接 :对接模型公司、本体企业、数据服务商与投资机构,建立具身智能数据核心产业圈层与合作通道 如果你是: 具身模型、本体、数据采集、仿真、训练场与场景部署方向的 创业者和技术人 机器人、AI硬件、智能制造及相关 产业上下游从业者 科技 投资人、研究者 、媒体人与行业观察者 欢迎扫码报名 ,加入这场 具身智能 数据的价值对账。 时间 :8月17日(下周一)19:00-21:00 形式:腾讯会议 | 闭门直播,深度互动 新用户扫码即可报名,往期直播用户请扫码告知:我要报名 本内容来源于网络,观点仅代表作者本人,不代表虎嗅立场。 如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。 End 平台地址: http://www.jintiankansha.me/t/tlXEkKrbcU
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱