首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

具身ICL来了创业玩家!上下文成Scaling新赛道

摘要

具身ICL来了创业玩家!上下文成Scaling新赛道 梦晨 2026-09-06 19:44:21 来源: 量子位 衡宇 发自 凹非寺 量子位 | 公众号 QbitAI 2020年,GPT-3靠“看几个示例就会新任务”震动了NLP界;六年后的今天,同样的故事正在具身智能领域上演。 没错,就是 In-Context Learning 。 8月中旬, Skild AI发布机器人基础模型S1 。只需要给...

Context 量子位 2020年 GPT Learning Shot 具身ICL来了创业玩家 上下文成Scaling新赛道 2026 凹非寺
2026-09-06 1 阅读 约9分钟阅读 梦晨
分享:
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 具身ICL来了创业玩家!上下文成Scaling新赛道 梦晨 2026-09-06 19:44:21 来源: 量子位 衡宇 发自 凹非寺 量子位 | 公众号 QbitAI 2020年,GPT-3靠“看几个示例就会新任务”震动了NLP界;六年后的今天,同样的故事正在具身智能领域上演。 没错,就是 In-Context Learning 。 8月中旬, Skild AI发布机器人基础模型S1 。只需要给机器人看一遍任务演示视频,它可以在不微调、不做额外post-training的情况下,尝试完成此前没有训练过的新任务。任务时长可达10分钟,包含几十个操作步骤。 Skild在(训练数据)见过的任务和未见过的任务上,对比了ICL视频Prompt和传统的语言Prompt VLA。 测试结果表明,当训练数据只有1000小时时,语言Prompt效果更好,而随着数据规模增加,ICL开始反超。对于未见任务,加入视频context后,模型表现相比只用语言指令提升约7倍。 S1发布的一周之前, Generalist AI发布GEN-1.5,同样把One-Shot Learning作为核心能力。 机器人只看一个示范,就能在数秒内学习新任务,无需梯度更新或微调,并支持人类示范到机器人执行、组合泛化和Sim-to-Real迁移。 这两项进展都是在尝试让机器人学会利用更长的多模态Context。 In-Context Learning(ICL)这条路径, 已经在LLM领域被验证、并成为至关重要的一环。 2020年,OpenAI在GPT-3的论文Language Models are Few‑Shot Learners中提出ICL,定义它是一种能力——不给模型做任何参数更新(没有微调、反向传播训练),仅在输入prompt中提供若干任务示例(demonstrations/examples),模型在单次前向推理过程中就能够识别并执行该新任务。 过去三年,上下文从4K扩展到1M,让模型能一口气处理一整本书、一个代码库,背后的主要引擎就是ICL。 与LLM不同,具身模型面对的是视觉观测、语言指令与动作序列交织的复合上下文,且真实任务是非马尔可夫的——“接下来做什么”取决于“几分钟前做过什么”。 简单来说,具身模型面对的上下文是每秒几十帧视觉观测,外加本体状态与动作序列,信息量高出几个数量级。 直到今年7月16日,才有李飞飞、Jim Fan、Yuke Zhu等合著的机器人长上下文策略模型与训练方案 RoboTTT,第一次系统地把“上下文 scaling”这条路线搬到机器人视觉运动策略上。 8月,Generalist和Skild发布成果。 虽然两家公司仅以成果发布形式展示模型效果,技术细节没有完整公开,但在具身领域,关于ICL讨论度随即骤升。 这条路能否在具身领域真正跑通,取决于一系列远未解决的技术问题。 也正因为如此,我们产生了更具体的好奇: 如果具身智能真的要沿着Long Context和ICL继续往前走,机器人究竟要怎样理解如此复杂的上下文? 示范、语言、历史动作甚至人的纠正,又该怎样进入模型? 于是,我们找到了 可可矩阵 (COCO Matrix),一家致力于把In-Context Learning做成具身智能的底层范式的国内创业公司。 这家公司成立于2026年4月。 不过创始人兼CEO高宇翔告诉我,今年1月深入讨论创业相关事宜时,他和自己的co-founder就一致认为是时候着手押注ICL了。 高宇翔 今年30岁,西安交大少年班出身,约翰斯·霍普金斯大学(JHU)博士辍学,在读期间做人机交互研究。 高宇翔说,GPT-3展现出上下文学习能力时,还在JHU读博的他就已经在琢磨,这种“不给参数更新、只看示例就会新任务”的能力能不能搬到机器人身上? 此后五年,他辍学、回国创业、加入工业界、再次创业。 这期间,高宇翔在傅利叶带队打通了全尺寸人形机器人从遥操作、数据采集到模型部署的完整链路,并在2025年5至8月用一百多万成本,在全尺寸双足人形上训练出具备一定泛化能力的世界模型。 https://about.yuxiang.io/ 今年4月,可可矩阵正式成立,开始把当年在学校里就开始接触的问题变成了创业方向。 与Generalist、Skild不一样,可可矩阵的思路是把后训练的ICL前置到预训练阶段。 于是,围绕具身ICL的技术进展、落地难题与行业争议等,我与高宇翔在上海进行了一场深度对谈。 (以下是对话实录,在不影响本意的前提下略有删改) 为什么具身智能需要换一条Scaling路线? 量子位 :过去很长一段时间,具身智能都沿着大模型的路线Scale数据。大家为什么相信,堆更多数据就能把机器人能力Scale起来? 高宇翔 :最开始整个行业的心态其实都比较乐观。 早期像ACT、Diffusion Policy这些方案跑通之后,基本解决了behavior cloning、模仿学习的很多核心问题。 当时大家很自然地延续大语言模型的成功逻辑 ,只要持续扩充数据,数据量积累到一定阈值,模型就能涌现出通用能力,最终实现全方位的任务适配。 放在当时的行业环境里这个思路本身没有问题,所以整个行业都开始全力规模化扩充数据。 量子位 :后来问题出在哪里? 高宇翔 :针对单一任务,现在采集两百条左右的数据,就可以把任务拟合得很好,一个新任务从演示到模型适配,大概十八个小时就能完成。 但 继续增加数据之后,模型一直没有出现大家期待的通用泛化能力。 同时,具身数据本身也很难Scale。遥操作数据的质量并不统一,物品和场景多样性有限,单纯依靠这类数据,很难提供足够丰富的感知覆盖。 量子位 :除了这个,还有哪些其它的问题呢? 高宇翔 :早期很多VLA沿用了LLM、VLM的预训练体系,但面向物理世界时,原有视觉表征很难同时覆盖机器人需要的不同层级信息,因此不少方案需要不断拼接不同的视觉模块。 这套路线在很多场景下依然有效,但过去一年多大家逐渐发现,继续沿着原有VLA范式叠数据、叠模块,后续能力提升会越来越困难。 具身智能Scaling路线的新尝试 量子位 :如果数据覆盖走不通,行业现在开始Scale什么? 高宇翔 :能明显感觉到大家开始关注机器人的学习能力和适应能力。 过去更关注模型在训练阶段见过多少数据、学会多少任务。现在大家开始问另一个问题,机器人到了一个从来没有见过的新环境、新任务里,能不能利用当前的Context快速学会。 今年已经出现了一些很明显的信号。 像 RoboTTT 这类工作,在尝试解决更长历史信息的编码、压缩和利用,让机器人能够持续参考更长时间的视觉和动作Context。 Generalist AI、Skild AI最近展示的One-Shot能力更进一步。给机器人看一次任务示范,它就可以基于这段Context快速适配新任务,不需要为每个任务重新做完整的微调或训练。 所以现在 具身智能的Scaling维度正在发生扩展 。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱