汽车
morning
对话橡木果机器人姜峣:让机器人像人一样,凭“本能”干活
2026-08-11
1 阅读
约10分钟阅读
智客ZhiKer
字号:
智客ZhiKer获悉,具身智能企业橡木果 机器人 (Acorn Robot)已完成天使轮融资,领投方为招商局创投和 蔚来 资本,本轮融资将主要用于面向工业柔性生产的机器人产品研发、品牌体系构建与市场拓展。 2024年底,姜峣作为发起人,与其他8位清华大学机械工程系博士成立橡木果机器人公司。他是清华机械工程系博士、哈佛大学工程与应用科学学院博士后,深耕机器人操作领域近15年 。 同时,他也是清华唯一一个机械工程背景投身具身创业的人,与当前绝大多数来自计算机、软件、自动化和电子背景的具身创业者不同。在他看来,操作底层本质上是个接触力学问题行为,因此在2017年提出了"本能驱动"路线。 这是一条与主流VLA和世界模型路线完全差异化的技术路径。以触觉为感知底座,自下而上地让机器人通过本能反射"长"出操作能力。 具体而言,橡木果机器人将任务规划与操作执行解耦,上层大模型负责任务理解与分解,输出关键帧和语义约束;操作执行层则由橡木果自研的Natus本能模型和Magis技能模型承担,在物理世界中以毫秒级精度完成操作。这与主流VLA端到端方案把感知、决策、执行塞进一个黑箱模型的做法截然不同。 姜峣判断,操作的底层逻辑是交互行为,交互无穷无尽,跟语言不是一套逻辑。VLA本质是模仿,无法从底层理解操作。模型越大越脆弱,本体差异、接触特性一变就会崩。触觉是第一"目击者",视觉只是旁观者,VLA里连触觉数据都没有,只能照猫画虎。 2026年3月,公司完成近亿元种子轮融资。5月,完成首个柔性产线POC验证。6月,正式发布"本能驱动"技术路线。姜峣说,从提出本能驱动到现在,团队在这件事上投入了八年的时间。 在本轮融资发布之前,我们见到了他,聊到了"本能驱动"的神经科学起源、为什么VLA路线走不通、任务规划与操作执行为什么要解耦,以及一个做了15年机器人操作的人,为什么选择在2024年底才走出来创业。 橡木果机器人(Acorn Robot)发起人姜峣 ▎以下为与姜峣的对话全文,略有删减: 关于路线选择 智客ZhiKer: 你在机器人领域做了十五年,为什么到2024年底才成立公司? 姜峣:当时我们沿着这条技术路线已经探索了多年,创业是为了给这个技术找到一条最快的迭代路径。从2025年我们正式启动商业化,一年内就走完了从技术积累到落地的闭环。 智客ZhiKer: 2017年你就提出"本能驱动"这条路线了,最早是什么触发了您对这个方向的思考? 姜峣: 2016年我从清华机械工程系博士毕业,又去哈佛读博士后,方向是神经科学,研究人的操作行为和运动行为。课题里我发现了一个机器人领域长期忽略的事实,操作行为和语言行为,底层机制完全不同。 语言没有先天本能。一个人不经过语言训练,一辈子学不会说话,这是后天数据驱动习得的能力。操作行为不一样,它是本能,出生就有,不需要教。把一个新生儿放到陌生环境里,只要他能看见东西,就会伸手去抓。全世界所有人抓东西的行为模式基本一致,有信号刺激就有反射。 李飞飞最早不是做计算机视觉的。她先学物理,后来在加州理工学院读博研究人的视觉神经机制,发现人能在几十毫秒内识别物体,而且是从全局到局部。后来她构建ImageNet验证计算机能不能达到人的水平。 她说,生物进化是从0到1,真正进化出智能,我非常认同这个观点,本能驱动的底层逻辑,跟这个一脉相承。 智客ZhiKer: 怎么证明"本能驱动"用在机器人操作上,确实比走大脑决策那条路更好? 姜峣: 人的触觉信号传到大脑要200到250毫秒,大脑决策再传回来,就算决策本身无限快,往返也要差不多500毫秒。 我们设计了一个最简单的实验来验证这个数字,让机器人抓一个从来没见过的物体,力度必须刚好,力气大了捏扁,力气小了掉落。 传统方法无非两条路。要么物理建模,解质量、质心、摩擦系数,但现实中你不可能装配前先解方程,而且完全没有泛化性。要么数据驱动,数据量大、模型大,实时性和泛化性都不行。 在实验中,从扰动出现到响应的时间远低于500毫秒,说明信号根本没传回大脑,而是在手部就完成了类似肌肉反射的执行。这些证据证明本能反射的存在,不需要大量数据传回训练后再指导动作。 之后我们又花了4年时间,在2021年,我们发现触觉中有一个"滑移"通道,抓东西时要掉不掉的感觉,这是一个最底层的本能感觉。 智客ZhiKer: 当前主流的VLA端到端路线你怎么看? 姜峣: 主张VLA路线的人,大多来自大语言模型、自动驾驶、图像生成这些领域,认为数据能解决一切,把工具看得比事情本身更重,这是路径依赖。 但操作的底层逻辑是交互行为,交互的可能性无穷无尽,跟语言完全不是一套逻辑。VLA本质是模仿,没办法从底层理解操作。你看Figure AI做的动作,会有很多莫名其妙的小动作,比如无缘无故扶眼镜,因为训练数据里混入了这些行为,它只是在拟合数据,找不到最流畅的执行方式。 操作不存在所谓的通用大模型,本体差异、接触特性一变,模型就会崩。模型越大越脆弱。触觉是第一"目击者",视觉只是旁观者。VLA里连触觉数据都没有,只能照猫画虎。 智客ZhiKer: 为什么要把任务规划和操作执行解耦,背后的思考是什么? 姜峣: 任务泛化和硬件泛化的逻辑完全不同。乒乓球规则全世界都一样,这是任务;但每个选手的打法千差万别,这是硬件适配。 任务规划是人类社会定义的概念,什么叫叠衣服、什么叫衣服,这是自上而下的,通过大量数据驱动,见得多懂得多,能做到规则统一。操作执行是从本能出发、自下而上,解决的是怎么干,需要适配硬件、接触不同环境,可能性无穷无尽,靠本能去适应。 所以 对操作来说,没有最好的预训练模型,只有最适配硬件的模型 。它们不能在同一个黑箱里训练,必须各自独立演进,通过标准化接口协同。这是我们把任务规划和操作执行彻底解耦的根本原因。 智客ZhiKer: Natus和Magis是对应任务规划和操作执行吗? 姜峣: 不,两者都在操作执行层,但分属不同阶段。 Natus是端侧自主决策模型,它能做到"零数据冷启动",保证机器人一上来就会做。Magis是通用操作技能模型,依托Natus在真实物理世界探索产生的数据训练,实现一上来就熟练。 关系是Natus先通过本能催生行为涌现,让机器人自主"长"出操作能力,Magis再在此基础上积累技能,实现跨物体、跨场景的迁移。 举个例子,抓香蕉。Natus通过多次自主探索完成抓取,过程中不仅记录视觉图像,还通过触觉感知自动完成语义打标:香蕉重120克,质心偏左,表皮粗糙,硬度中等。这些力学语义被实时叠加到视频帧上,让Magis能真正理解物理世界的力学属性,而不只是外观。基于这个,机器人可以直接选最佳抓取位置、施加恰当抓力,高效完成任务,而且具备跨物体的泛化能力。 智客ZhiKer: Natus模型如何实现0数据启动? 姜峣: 模型里定义的不是具体动作,是本能规律。通过“信息感知”的刺激直接构建出“本能”,即感知的期望,继而驱动机器人自主探索、收敛于该期望,最终自发涌现出操作行为。本能给了机器人一种渴望收敛的终点状态。 拿叠衣服举例:先定向找到要叠的角,再探索怎么捏住,最后执行捏裤腿和折叠。不管从哪个环节出发,动作最终都会受本能支配回到期望状态。我们刻意不直接定义动作,因为动作无穷无尽,而是
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱