医疗健康
morning
具身智能的大脑,200亿一张门票
摘要
文 | 光锥智能,作者|罗镇昊,编辑|刘俊宏 智平方和自变量又掐起来了。 前几天,彭博社刚曝出智平方准备明年赴港IPO的消息,紧接着,就传出自变量已经向港交所秘密提交了上市申请。 这不是巧合。就在一个月多前的6月29日,两家公司在同一天宣布完成新一轮融资,投后估值均超过200亿元。 200亿,这个数字放到往年还难以想象。如今已经变成了具身智能头部公司的新门槛。 按照公开口径披露,除去灵巧手类零部件...
200亿俱乐部
智平方
光锥智能
罗镇昊
刘俊宏
智平方和自变量又掐起来了
前几天
彭博社刚曝出智平方准备明年赴港IPO的消息
紧接着
就传出自变量已经向港交所秘密提交了上市申请
2026-08-10
1 阅读
约10分钟阅读
光锥智能
字号:
文 | 光锥智能,作者|罗镇昊,编辑|刘俊宏 智平方和自变量又掐起来了。 前几天,彭博社刚曝出智平方准备明年赴港IPO的消息,紧接着,就传出自变量已经向港交所秘密提交了上市申请。 这不是巧合。就在一个月多前的6月29日,两家公司在同一天宣布完成新一轮融资,投后估值均超过200亿元。 200亿,这个数字放到往年还难以想象。如今已经变成了具身智能头部公司的新门槛。 按照公开口径披露,除去灵巧手类零部件厂商,跻身具身智能“200亿俱乐部”的企业至少有五家:智平方、自变量、星海图、千寻智能和银河通用。 要知道,这200亿俱乐部可是在收缩中被选出来的。 据烯牛数据《2026年H1中国私募股权市场深度解析报告》 ,截止2026年7月5日,LP(私募基金出资人)出资降了32.65%,政府类LP直接腰斩,单笔均值五年缩水44.8%。同时报告还指出,具身智能融资事件却同比增长107%,并在新晋独角兽企业TOP10中独占4席。 在商业化路径还未被验证时,五家公司通过高密度融资迅速越过200亿估值线。这是目前一级市场能给到的最高一档价格。 再往上,就只能借助IPO了,比如宇树和智元。 专注本体的宇树拥有业界顶尖的运控技术和控本能力,2025年,宇树的人形机器人出货达5500台,营收约17亿;智元出货量不相上下,超5000台,营收则超10.5亿。 最近,宇树的发行价刚刚出炉,上市估值为609亿元。智元进入IPO阶段后的目标估值是363到433亿元。 和上面两家巨头相比,200亿俱乐部里的成员有所不同,出货量基本还刚摸到顶流的门槛。那凭什么撑起这个估值? 参考市场上“确定性的定价”。宇树610亿的发行价和智元的目标估值,根据营收算下来的市销率都是35-40倍这个区间。拿这把尺子去量“200亿俱乐部”,算下来就是要有5亿上下年收入。收入达不到,只能证明溢价客观存在。 不难发现,这五家公司都不约而同地把重心押在了大脑上。而资本市场对机器人大脑的偏好,正在成为投资机构的共同判断。 换句话说就是,市场普遍认为大脑更值钱。 这一点在海外市场表现得也很明显。比如不生产本体的Skild AI,核心产品是一套可适配机械臂、人形机器人和四足机器人的通用模型,今年估值飙到了140亿美元。Physical Intelligence同样专注跨本体、跨任务的具身基础模型,一年内估值从20亿美元涨到56亿美元。 和200亿区间之下的公司相比,这五家公司不只是选对了大脑这条正确的路,还在于他们拥有相对前沿的基座模型,扎实的数据闭环,以及清晰的落地场景。 资本正在以前所未有的速度给这个赛道重新定价。问题是,200亿这个价格,在具身智能行业中意味着什么?这200亿到底买的是什么? 五种大脑解决同一组问题 当商业化路径还没跑通,技术实力就成了衡量公司价值的另一把标尺。 表面看这200亿买的都是大脑,或者说是基座模型,实际上五家公司的技术栈都各不相同,但又互相渗透。 目前市面上在大脑侧的主流路线仍然是VLA,区别在于是在VLA的基础上强化,还是把世界模型和VLA融合。强化VLA主要是为了解决模型“理解慢、行动快”这个问题,加入世界模型,则是让模型多一层推演能力,用来应对陌生场景的泛化。 智平方、星海图和千寻智能走的都是强化VLA路线。 为解决模型推理速度和实时控制之间的冲突,智平方的FiS-VLA采用了快慢双系统结构。慢系统负责理解指令、拆解任务和高层推理,快系统负责生成动作。这不是把两个模型简单拼接,而是将快系统嵌入慢系统,共享部分参数,以不同频率异步运行。 一句话总结,就是既保留端到端的“快反应”,又借助L(语言模型)让整套系统能“思考”。 2026年,这套技术被进一步改造成了NeuroVLA大模型,变成“皮层—小脑—脊髓”的三层类脑结构。多出的小脑模块负责维持动作的稳定性,比如受到碰撞后能否快速反应。从架构上看,是进一步强化“快系统”的反应了。 同样是加快反应速度,星海图的解法是提高模型内部的信息传递方式。 早期VLA中,视觉、语言、动作之间的交流要依靠编码器来翻译,信息在传递中难免有压缩和丢失。因此,星海图的G0.5采用了一套统一自回归架构,去掉中间的编码器,把图像、推理和动作转化成统一的内部Token,放进同一序列生成。这样一来,推理就不只是动作模型的输入,而是成为动作生成的一部分,变得更丝滑。 相比前两个在架构上做文章,千寻智能就显得很“原教旨主义”,更相信VLA本身的Scaling能力。 千寻智能Spirit v1.5试图通过扩大数据规模和复杂度,让模型获得更强的跨场景泛化能力。尤其是未经高度筛选的“脏数据”,比如遮挡、停顿、失败的,以此避免模型只会模仿标准动作,而不理解复杂的长尾信息。 但强化VLA这条路线还是有局限。 因为具身模型更高层的目标还是对物理世界的理解和泛化。传统VLA能通过观察和指令做下一步动作,但不会根据环境预判,比如松开手杯子会落到哪里。将世界模型和VLA融合的路线,就是为了补齐这块短板。 自变量的WALL-B,就是把物理预测和视觉、语言、动作放到同一个网络联合训练,让机器人不单是模仿训练中的动作,还能在行动前预测动作可能造成的结果。 银河通用的模型架构最为复杂,因为他不是用一个模型包揽所有能力,而是把几个VLA模型放在一个基座上。其中包括负责上半身抓取的GALBOTVLA,负责下半身移动的TrackVLA,再加一个用来理解指令的人机交互层。合在一起称为GALBOT VLA。 到今年,GALBOT VLA基座又统一演化成了AstraBrain(银河星脑)。拆出来分别是:大脑(WAM 0.5)、小脑(WBC 0.5)、灵巧手神经控制(DexNDM)。是不是和智平方的类脑结构有点像?不仅如此,这个基座里大小脑的连接方式,同样采用了智平方同款的快慢双系统。 在作为大脑的WAM 0.5中,世界模型的作用不只是提供一个预测层,而是和VLA在一个模型里联合建模,直接参与动作规划。 总而言之,从架构上看,各家有各家的路线,但放到整个行业里,解决的其实是同一组问题:机器人能否从执行单个动作,走向完成几十个步骤组成的任务;能否从见过的物体,泛化到陌生物体;能否将一个本体学会的能力,迁移到另一种机器人上;能否在动作失败后自主恢复。 有意思的是,对比几家技术路线背后还有一层信号:路线之争打到最后,架构开始互相“抄作业”。这或许说明200亿之后,比拼的不再是谁选正确的路,而是谁在选定的路上跑得快。 要跑得更快,只从模型上下功夫还远远不够,更关键的瓶颈还在于数据。 数据,重塑模型的权力 模型架构决定了机器人如何思考,但模型能否持续进化,最终取决于它能接触到什么数据。 在数据类型的配比上,行业里大致分两种:更注重真实数据,还是更倾向仿真数据。 真实数据是行业的共同痛点,数量少,价格高,而且复杂的长尾数据很难大量采到。优势也很明显,就在字面上,真实,迁移到训练上误差更小。 仿真路线的优势在于规模大、成本低,还能主动制造真实世界中很难采集的失败案例。但问题也同样明显,仿真环境无法完整复现真实世界中质感,移到真机时面临“Sim-to-Real Gap”的问题。 目前业内仍以真实数据为主。但具体采集方式是偏向遥操、无本体采集,还是让机器人直接下场,各家
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱