首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

不做硅谷follower:几个读博的年轻人,押注双足人形的一体化大脑

摘要

不做硅谷follower:几个读博的年轻人,押注双足人形的一体化大脑 衡宇 2026-08-23 17:29:59 来源: 量子位 乔不迟 发自 凹非寺 量子位 | 公众号 QbitAI 周末在家刷社交平台,一个视频惊艳到我了。 一个 机器人驾驶卡丁车 在赛道上飞驰,过弯、加速、打方向,一镜到底。 没想到我们的机器人现在已经可以在卡丁车赛道炫技了呢! 等等? 这和我在WRC看到的画风不一样啊! 展...

量子位 Best Paper 不做硅谷follower 几个读博的年轻人 押注双足人形的一体化大脑 2026 乔不迟 凹非寺 公众号
2026-08-23 1 阅读 约9分钟阅读 衡宇
分享:
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 不做硅谷follower:几个读博的年轻人,押注双足人形的一体化大脑 衡宇 2026-08-23 17:29:59 来源: 量子位 乔不迟 发自 凹非寺 量子位 | 公众号 QbitAI 周末在家刷社交平台,一个视频惊艳到我了。 一个 机器人驾驶卡丁车 在赛道上飞驰,过弯、加速、打方向,一镜到底。 没想到我们的机器人现在已经可以在卡丁车赛道炫技了呢! 等等? 这和我在WRC看到的画风不一样啊! 展会上的机器人跑步、还有火花加闪电,没想到视频里的机器人什么时候背着人类偷偷报名赛车培训班了? 它完全是个老司机,高速过弯、灵活避障,跑一圈下来一气呵成。 和以往那些机器人慢吞吞走过去、弯腰拿东西的demo相比,这段视频里的机器人真的自己坐进了车里, 手眼脚同步协同 ,在全速状态下完成 多接触点平衡和精细力控 。 我把视频放上来大家品品。 这种人形双足机器人能够眼、手、足,全身协同,在高速运动、复杂姿态的变化下的全身协调完成细节操作,在此前的人形机器人演示里几乎没出现过。 放出这段视频的,是一家叫共生知行的公司。 共生知行做的,是双足人形机器人的 端到端感控一体化「大脑」 ,也就是基座模型。 创始人丁鹏翔96年出生,核心团队其余成员 全是00后 ,全员 博士在读 ,公司成立刚满两个月。 对于这个看上去有点「不务正业」的Demo,丁鹏翔这样解释: 我希望机器人能更像人,而不是只去做一些很机械的服务功能。好比人能开卡丁车,机器人也能干。 一个问题随之而来:为什么一群连毕业证都还没拿到的年轻人,敢去碰具身智能里 最难、最前沿 的那条赛道? 押最难的路:研究过分层,现在要挑战端到端 「端到端」双足人形机器人模型这个赛道新到什么程度? 新到市面上 找不到现成的人才 。 按丁鹏翔的说法,这个方向近两年才热起来,懂技术的人还在读博士,他们几乎没办法从人才库里找到符合需求的人。 已毕业多年的跟不上节奏,没读到博士的,对底层的理解又差一口气。 最前沿的突破,就握在这一批顶尖博士生手里。 共生知行的团队就是这样一批年轻又前沿的人。 他们斩获了国内具身智能领域最具分量的学术荣誉——两项 Best Paper,并有一项入选 Best Paper Candidate;也打造了国内首个 GitHub Stars 突破 2K 的具身基座模型。 更重要的是,他们并非风口到来后的追随者,而是国内最早一批探索具身基座模型的先行者,也是这个赛道最坚定的长期主义者。团队累计发表40余篇顶会论文,技术版图覆盖感知、决策、控制、数据与系统全栈;从双系统、轻量化到多构型,一系列行业首创工作,都出自这支年轻团队。 他们的判断很明确:机器人最终最广泛进入人类生活的形态是双足; 按照自动驾驶和大模型的进化路径, 端到端是效率最高的技术模式 。 这个判断源自他们的一线研究经验。 早在2023年12月,丁鹏翔就开始给四足机器人装「大脑」 。 他以一作身份发布QUAR-VLA,是首个面向四足机器人的VLA任务范式,让上层模型(大脑)负责理解视觉、 语言和任务意图,再把决策交给底层运动系统(小脑)执行。 这套「大脑管理解决策、小脑管运动执行」的分层思路,就是行业里说的分层,今天 Figure这样的公司都在沿用方案。 在随后的研究中,他逐渐发现了问题。 他把分层描述为「理论上可行、但是不那么优雅的方案」: 大脑和小脑各做各的,每接一个新任务,都要对上游输出做定制化微调,才能把效果调好。 更深一层,是结构上的先天缺陷。 大脑和小脑分开训练,部署时再拼起来,每个局部更好,也不能保证整体最优; 两层之间每翻译一次,就增加一次级联误差和信息损失。 丁鹏翔判断,「只要分层,中间就有信息瓶颈,这种接口设计决定了分层架构 无法实现真正意义上的Scaling 。」 这一判断也来自他对自动驾驶和大模型发展的长期观察。 早期自动驾驶依赖感知、预测、规划、控制多个模块协同,后来开始探索让模型直接从数据中学习驾驶能力。 特斯拉FSD转向端到端后,性能大幅提升。 在丁鹏翔看来,机器人可能也会经历类似变化,让模型从数据中学习完整的「感知—理解—行动」过程。 他的逻辑是,从2023年开始已经把分层路线反复做过,如果判断未来的数据规模化最终会把系统推向端到端,就没有必要再绕一次弯。 这一步在2026年正在发生。 谷歌的Gemini Robotics 2已经用单一策略把从脚到指尖的全身动作统一进一个模型; RSS 2026的顶会共识却写明,端到端单模型无法覆盖全身复杂动态,分层模块化是现阶段最优落地方案。 共生知行押的 纯端到端 ,是一条更激进、更少人走的路。 为什么偏偏是双足?丁鹏翔的答案是 第一性原理 :人类社会的建筑、工具、环境, 全是照着人的身体构型造的 。 轮式只能固定在产线和商场里干活,双足能出门、上下楼、开车,还能跨场景完成不同任务。 通用性意味着成本摊薄,双足还有 拟人化的亲和感 。 时机同样关键。2026年4月之前,双足人形连通用遥操作模型都没有,没有数据来源就训不出基座。 直到英伟达Sonic开源,行业才有了大规模生产数据的基石。 这个方向已经不再处于「想训也没有数据」的早期阶段,又还没有成熟到路线完全收敛,共生知行赌的就是中间这个窗口。 技术分水岭:别人在学运动学,他们在啃动力学 先弄清一个分水岭:现在绝大多数机器人基座模型,学的其实是运动学。 运动学关心从A点到B点,手移动到哪里、抓没抓住,固定基座机械臂这么干没问题,因为它不会倒。 双足机器人伸手去够一个东西, 身体重心会同时发生变化 ; 下蹲拿物体时,腰部要前倾,踝关节和腿部要重新分配力度、保持平衡; 再叠加摩擦、碰撞、惯性和接触,模型面对的已经是 一套全身动力学 。 据丁鹏翔介绍,一台g1双足人形有 29个自由度 ,比机械臂的7个自由度复杂得多。 过去机器人学的是「动作轨迹」,人形机器人要学 「身体如何在物理世界中行动」 。 从运动学到动力学,从完成任务到保持稳定,这是双足机器人模型真正的技术分水岭。 这能解释共生知行为什么把模型一路做到Joint Target,也就是 关节目标层 。 分层方案里,大脑先输出运动学目标,下游小脑再解算成关节动作; 共生知行把这个中间环节拿掉, 让模型直接面对几十个关节的身体状态 。 问题随之而来:把小脑拿掉,机器人还站得稳吗? 光靠模仿学习,模型只学会标准动作,没见过执行中各种踉跄的身体状态,遇到陌生状态就可能直接摔倒。 它缺的是从失败里站稳的能力。 共生知行的核心,是一套「 任务行为建模—运动先验蒸馏 」的双域协同优化机制。 一条优化通路延续行为克隆,保证任务精度与动作拟合能力;另一条通过DriftDistill,将底层控制器积累的稳定性、抗扰动与Failure Recovery能力,转化为统一模型的内生运动先验。 它并非简单叠加两个Loss,而是将「准确完成任务」与「稳定控制身体」两类能力融入同一模型,让大模型 同时获得任务智能与身体智能 。 如果D
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱