首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

自进化WAM来了!清华航空联手域转型提出了身在情境中的因果学习

摘要

自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning 思邈 2026-09-01 13:12:30 来源: 量子位 Zeva团队 投稿 量子位 | 公众号 QbitAI 模型不更新,能力却持续增长。 这是Zeva最反直觉的地方,也是 清华AIR 与 域变换 联手给出的新答案。 在多个典型具身基准任务上,将冻结模型的累计成功率从 26% 提升到 73% ...

Causal Context Interaction Zeva Learning 量子位 清华AIR 域变换 完成上下文内学习 提升任务精度
2026-09-01 1 阅读 约9分钟阅读 思邈
分享:
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning 思邈 2026-09-01 13:12:30 来源: 量子位 Zeva团队 投稿 量子位 | 公众号 QbitAI 模型不更新,能力却持续增长。 这是Zeva最反直觉的地方,也是 清华AIR 与 域变换 联手给出的新答案。 在多个典型具身基准任务上,将冻结模型的累计成功率从 26% 提升到 73% ;在真实化学实验室,机械臂在多次尝试中越用越稳。 更关键的是,一次人类演示就能让模型“学会”一个新操作。 Zeva 是 首个实现In-Context Causal Learning(ICCL)的具身WAM 。 它让模型可以在不更新权重的情况下,从自己的交互经验中持续学习。当这种能力逐步成熟, 具身智能 将迎来属于自己的 “GPT时刻” 。 项目信息 项目名称:Zeva 发布机构:清华AIR、域变换 论文题目:Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation 项目主页:https://air-embodied-brain.github.io/Zeva/ 具身模型的自进化,为什么过去很难? 具身智能的真正瓶颈,是“模型到了现场能不能越做越好”。 传统思路里,想让机器人适应新环境,通常要重新采集数据、微调模型或做test-time training。 但这些方法依赖梯度更新,速度慢、成本高,还可能在适应新任务时破坏已有能力。 另一类in-context learning方法可以让模型根据演示或任务描述调整行为,但主要解决“任务理解”,并没有让模型从自己的动作后果中学习物理因果。 从“任务泛化”到“因果迁移” 过去我们谈跨域,更多是sim-to-real、跨本体迁移、跨任务泛化。这些方法大多依赖数据对齐或表征对齐,本质上是在不同域之间搬运“任务经验”。 Zeva更进一步:它迁移的是“动作与状态变化之间的因果关系”。 同一个模型,在仿真里学到的物理因果,可以被带到真实机械臂;在一次尝试里积累的失败经验,可以指导另一个相似物理过程的尝试;人类的一次演示,也可以直接变成机器人的因果上下文。 这种跨域迁移通过上下文完成。模型在上下文中推断环境因果结构,并把因果知识用于下一次动作生成。这就是Zeva所定义的In-Context Causal Learning。 示例一:从放置称量纸的误操作中提取因果关系,完成上下文内学习,提升任务精度。 示例二:从称取试剂至称量纸的误操作中提取因果关系,完成上下文内学习,提升任务精度。 示例三:从一次人类演示中完成上下文内因果学习。 Zeva:把“因果学习”装进模型上下文 △Zeva总体框架。模型通过Causal Interaction Extraction、Dual-timescale Causal Memory、In-Context Policy Injection,在不更新权重的情况下实现部署中自进化。图片来源:论文 Zeva是一个模型。它的Causal Transition Encoder、Dual-timescale Causal Memory、In-Context Policy Injection,都属于模型推理链路的一部分。 在每个环境步,Zeva提取三类信号:视觉状态、动作编码、观察到的状态变化。 它们被递归编码为Causal Interaction State,并进一步投影为Phase Token和Causal Interaction Signal。 这些因果信号被组织成双时标上下文:Brief Interaction Trace负责当前尝试内的连贯执行,Persistent Interaction Memory跨尝试累积可复用经验。 决策时,Zeva检索与当前任务阶段匹配的交互证据,构造Causal Prompt,注入冻结的Cosmos3动作生成模型。整个过程零梯度更新。 技术拆解:Zeva如何“以小博大” 亮点一:Causal Transition Encoder,让模型看见“动作→结果”。 模型显式学习动作引起的状态变化。训练目标包括因果效果预测、任务聚类和阶段进度,让Causal Interaction Signal真正携带物理因果信息。 亮点二:双时标因果记忆,让模型可以跨尝试自我进化。 BIT保证当前执行的连贯性,PIM把一次失败、一次修正、一次成功沉淀为后续可检索的上下文。同一个模型在repeated attempts中越用越强。 亮点三:In-Context Policy Injection,让冻结模型直接消费因果上下文。 通过Causal Prompt把任务、阶段和交互证据注入生成模型,不加额外噪声、不参与flow loss,只作为条件影响后续动作。这是“不调权重也能进化”的关键设计。 和传统Test-Time Training相比,Zeva的差异很直接: 数据说话:自进化+One-Shot人类演示增强 在RoboCasa365-Atomic5上,Zeva平均成功率76.8%,效果最优。 更重要的是部署后的self-evolution曲线:累计成功率从Evolve 1的26%提升到Evolve 4的73%。 真实化学实验室ChemLab-Evo上,三个原子任务同样呈现单调增长:Pick Up Test Tube从65%到100%,Place Beaker从25%到70%,Pour Water从30%到80%。 Zeva还支持one-shot human demonstration enhancement:一次人类演示初始化PIM后,模型无需微调即可复现关键操作。 量化结果显示,人类warm-up在Place Beaker上最高带来20个百分点的提升,在Pour Water上带来15个百分点的提升。 △RoboCasa365上,Zeva在模型权重完全冻结的情况下,累计成功率从Evolve 1的26%提升到Evolve 4的73%。图片来源:论文 △真实化学实验室中,三个原子任务累计成功率随尝试里程碑提升。模型参数未更新。图片来源:论文 △One-shot人类演示warm-up对三个原子任务的影响。虚线为有人类演示初始化,实线为纯自进化。图片来源:论文 为什么Zeva是一个新范式? Zeva 的深层意义,是把具身模型的scaling从“参数空间”延伸到“上下文空间”。 传统scaling通过扩大数据、参数、算力来提升模型能力。 Zeva展示的另一种scaling是:在部署过程中不断增加可供模型消费的因果上下文。 每一次尝试都会产生新的interaction evidence,这些证据被压缩为Causal Interaction Signal并进入双时标记忆。 模型每多一次交互,就多一次对当前物理环境的“隐式系统辨识”。 这里的理
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱