首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
汽车 morning

对话COCO Matrix高宇翔:难以提前穷举世界,不如「学习适应」世界

2026-08-31 1 阅读 约10分钟阅读 白鲸实验室
分享:
字号:
文|白鲸实验室,作者 | 刘培,编辑|柳嘉 8月20日,当国内诸多企业的机器人在2026年世界机器人大会上,忙着展示物流分拣、装卸、切菜、做早餐等任务时,太平洋的另一端,具身智能突然掀起一个技术新风向。 当天,美国机器人基础模型公司Generalist AI发布了最新模型GEN-1.5,展现出很好的In-Context Learning(上下文,ICL)能力。几天后,Skild AI也开始把ICL放到具身智能的核心叙事中。 ICL可以简单理解为,机器人应该像人类一样高效利用观察到的上下文,来适应和学习新的环境与任务。而现在流行的范式是,机器人每次学习一个任务,都要针对性地为这个任务提前采集数据并重新训练。这完全像刷题库取得高分的学生,一旦测试题超出题库的内容,就无法胜任了。 尽管现在两家公司展现的机器人长上下文学习能力仍处于早期,但他们在ICL上的展示成果,让高宇翔异常兴奋。他说,“机器人的ICL范式会成为主流共识”,就像当初 ICL 能力的出现,标志语言模型从“BERT时代”走向“GPT-3”,机器人现在也看到自己的GPT-3时刻的曙光。 早在2021年GPT-3展现出上下文学习能力时,仍在约翰斯·霍普金斯大学(JHU)读博的他,就开始思考怎样把这种学习能力迁移到具身智能中。5年后,具身智能的变化,更像是对他判断的回应。 95后高宇翔出身西交大少年班,现在是COCO Matrix可可矩阵的CEO。在具身行业,高宇翔一直隐身于聚光灯之外。他甚至都没有像绝大部分机器人的研究员,建一个展示个人履历的网站,也没有在社交平台上分享过任何对行业的看法。 实际上,很难给这位创业者分类。他看起来像是乖乖的学霸,却在过去五年,接连做了四次有些“叛逆”的选择,约翰斯·霍普金斯大学(JHU)博士辍学、回国创业、加入工业界、再次创业。如果不是具身大脑上的进化加速,高宇翔有可能会成为一名青年教授,在学术上一年发表几篇论文。而他的每一次跳出常规,也都是让自己离终局更近。 高宇翔是个学习天赋极高的学霸。2024年加入工业界后,一个人,两台机器,硬是花了3个月,成为业内最早跑通全尺寸人形机器人遥操数据采集工作的人之一,还因此拿到了和全球头部大厂的VLA模型上的合作。 2025年Q3,他仅花一百多万元,在全尺寸双足人形机器人上训练出具备一定泛化能力的世界模型。但是这些工程能力,在任何地方都鲜有报道。 决定创业前夕,傅利叶创始人顾捷听完高宇翔的想法,告诉他:"如果能从模型范式上有根本变化,这真的会改变行业,看到AGI机会" 。2026年春节后,高宇翔在连办公室都没有的阶段,仅凭In-Context Learning 这个技术理念和个人热情,陆续搭建好了主创团队。 创业以来,当团队有了超预期的进展后,他首次站出来,同步COCO Matrix在In-Context Learning上的进展。他的用词也非常谨慎,这算是“初步验证”。 “通过训练方式的改变和多样任务数据的构建,模型涌现出超预期的适应和上下文理解能力。”高宇翔说。如果这种能力能够在更大规模、更多任务和更多真实场景中稳定复现,意味着机器人学习新任务的方式可能发生变化:不再每遇到一个新任务,都依赖重新采集大量数据、重新训练模型,而是可以更多地利用现场提供的示范、纠正和历史经验完成适应。相应地,机器人的部署门槛和新任务适配成本,也有机会被显著降低。 目前,COCO Matrix是个20余人的小团队,成员基本来自海内外顶尖高校和实验室。核心成员有来自学术界ICL方向顶级研究员,也有来自top实验室的技术小天才们。 我们的对话,从下午两点持续到晚上八点,高宇翔首次全面复盘了他在具身科研及工业行业十余年的思考沉淀,也尝试用最直白的语言告诉大家他未来想做的事。 01 除了Scale数据,是否有更巧妙的解法? 白鲸实验室:现在具身行业给我的感受是大家都在往各个方向摸奖,不知道谁能摸中。咱们上一次聊,你讲了很多边界,在具身数据、模型探索以来,你觉得比较重要的一个边界或者反共识是什么? 高宇翔:单纯依靠现有具身数据Scaling非常困难。具身模型没办法照搬大语言模型经验,因为任务复杂度不一样、数据分布不一样。具身数据不仅少,分布是不均匀的(有些数据好收集,有些数据采集难度非常大),很难单纯在已有数据上完成内插(模型看到 A 轨迹、B 轨迹,直接猜中间状态),实现泛化。 大家很明显也都逐渐看到了这一点。前几天,我看到一个访谈,苏度科技的韩铮讲到,具身如果按照传统数据收集,大概需要100万亿美元的投入。 白鲸实验室:100万亿美元? 高宇翔:在单一任务上,具身数据需要规模差不多相当于自动驾驶的十几万倍,甚至更多。 具身会比大语言模型率先遭遇数据枯竭和探索效率的问题,会更快来到离线数据和RL(强化学习)能力提升的边际效应递减。我们要更早考虑之后模型迭代问题,这是我们所有思考的出发点。 白鲸实验室:今年世界模型其实很火,视觉生成领域、自动驾驶、3D仿真引擎都在加入世界模型行列。市场上也有一些理性声音认为,真正的世界模型,必须有数据Scaling或者大量的算力才能做,其他的世界模型都是假概念。你怎么看? 高宇翔:世界模型是个umbrella term(统称)。本质上,世界模型就是对世界状态的一个预测,是比较简单的定义。热门的原因,是大家在VLA做数据Scaling时遇到瓶颈。 因此我希望能找到更好的Scaling方式。目前还没有哪种数据Scaling方式,能把世界模型的能力(基于预测的能力)Scaling和机器人的泛化操作能力Scaling挂钩,哪种数据Scaling能实现这一点,现在依然是个未知数。不少人看到这一点,开始做新的尝试。 白鲸实验室:现在的Scaling方式都有哪几种? 高宇翔:现在Scaling主要三类,数据、参数和算力(测试时的算力)。在对延迟和pace都很敏感的物理世界中,算力Scaling和参数的Scaling带来的延迟和推理效率限制了它们的上限。 白鲸实验室:但是现在LLM的竞赛还都在往大参数上堆,我了解到,一些国产模型现在接近3t的参数,还要往10t规模训练,为什么? 高宇翔:大语言模型Scaling law是否会一直生效,至少学术界没有一个定论。 大语言模型的Scaling还可以在液冷服务器中推理,但是具身完全没办法这么搞。机器人不仅需要看,还要听、摸,这些都是连续、高频的信息,对带宽的频率要求也远超过LLM,如果不能达到最基础的十几赫兹,人就能感受到AI的反应很慢。在聊天框里对话,人可以等,如果机器人反应慢,端杯水,杯子可能就掉地上了。 白鲸实验室:这是通用Scaling的一些问题,在具身上只有数据可以Scaling,其他两项是失效的。 高宇翔:对, 具身上算力和参数 S caling失效 , 主要是因为物理规律的限制。 白鲸实验室:这让我想起梁文锋最近私下对投资人的分享,他觉得让语言智能实现自我迭代之后,让AI直接做具身智能,会更轻松,而在这之前做具身,会非常辛苦。 高宇翔:大语言模型展现出强大的能力,很多人可能会觉得只要等等,大语言模型会把所有的能力覆盖。我不确定这是有点技术乐观还是技术悲观。 因为技术本身是动态的,甚至还超乎预料的。它最终会在哪个方向产生突破
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱