游戏
morning
智元冲刺港股IPO,备战具身智能淘汰赛
2026-08-03
1 阅读
约10分钟阅读
光锥智能
字号:
文|光锥智能,作者 | 罗镇昊 ,编辑|刘俊宏 这是个创业公司?早期很多科技投资人表示看不懂智元。 成立三年,智元已经成了“航母战斗集群”,孵化5家子公司,直接投资20多家行业相关企业,成立至少17家合资公司,并拥有一座市值513亿的A股平台。 7月底,智元又传出上市的消息。有投资人透露,公司最快在今年8月挂牌。基石投资人给出的目标估值约363亿到433亿元。这个价格,基本和宇树的价格(420亿元)看齐。 放眼整个具身智能行业,智元就像是个特立独行的小孩。别人做单点,它全线铺开;别人抢融资,它去敲钟。 这不是智元第一次给自己定价。2025年7月,智元收购科创板上市公司上纬新材控股权。此后,上纬新材股价暴涨,市值从30亿元左右最高冲到891亿元。即便回落到今天的513亿元,也比智元港股IPO的目标估值高。 手握A股平台再闯港股,是智元缺钱吗?智元CTO彭志辉曾在4月的媒体群访中说的很明确,不缺。 “公司已经实现自我造血,不是很缺钱,对外部一级市场的资金需求没那么迫切”,彭志辉说。同一场合,董事长兼CEO邓泰华也提到,智元商业化非常顺利,2025年公司营收突破10.5亿,同比增长20倍。 或许,智元当下最缺的不是钱,而是时间。拆解智元这三年的所有动作,主线只有一条——在每一轮洗牌到来之前,确保自己手里还有牌。 就像智元CTO彭志辉说的:“我们也没想过短期就做成这件事……短期市场上会有各种正负反馈,但对一家初创公司,最重要的是留在牌桌上。” 把四分之三的资源换成不下牌桌的底气 外界看到的是智元四处出击,看不到的是这家公司在内部的极度集中。 邓泰华透露,智元约3/4的研发人力和超过3/4的研发费用,集中在大小脑AI上。这意味着,在母公司层面,绝大多数资源压在了最需要长期攻坚的方向上。 这种选择本身就是一种判断——在具身智能这个刚起步的赛道,本体可寻求合作、应用场景能够共建,但智能大脑必须掌握在自己手中。因为技术路线的对错要五年后才知道,但被踢下牌桌,一轮洗牌就够了。 代表机器人执行能力的作业智能,主线是GO系列模型。 2025年3月,智元发布GO-1(智元启元大模型,Genie Operator-1)模型,提出ViLLA架构。传统VLA模型把视觉、语言直接映射为动作,本质上是”看一眼、做一下”的直觉反射;GO-1则在”看懂”和”动手”之间加入了一个隐式规划器(Latent Planner),配合动作专家模块,让机器人先进行动作层面的”脑内预演”,再输出精细动作。两边区别,简单来说,前者像条件反射,后者则像人伸手之前,先在心里把动作比划一遍。 如果说GO-1解决的是“想清楚再动手”,GO-2解决的则是“边部署边进化”。前者是能力,后者是体系。 2026年4月,GO-2引入”动作思维链”和”异步双系统”架构。低频规划负责想清楚,高频跟随负责做稳定。更关键的是,GO-2依托Genie Studio平台实现了“预训练+后训练+数据闭环”的规模化部署,支持千台级机器人协同训练。换句话说,GO-2不再是一个静态模型:每部署一台机器人,就多一个替模型积累经验的”实习生”。 除了作业智能,交互智能是机器人的“人机接口层”,主要用来判断人的表情、语气、动作、情绪,针对的是展厅导览、政务大厅、博物馆讲解等场景。这一块则由WITA-Omni扛旗。 机器人交互长期是一条”流水线”,视觉模块先看,语音模块再听,大模型生成回答,最后运动模块才输出动作和表情,环节割裂、延迟明显,经常出现话说完了、手还没抬起来的尴尬。 WITA-Omni的思路,就是把以前的机器人”想完再说、说完再动”,改成”边想边说边动”。配合千万小时级多模态数据训练,它甚至学会了社交分寸,判断该不该回应、何时回应、回应谁。三季度,智元将推出WITA Omni 1.0,以云服务方式提供,交互时延据称已压缩到500毫秒以内。这个水平比人类简单反应稍慢,但已经可以接受了。 最新的一块拼图,是7月底与上海创智学院罗剑岚团队联合发布的τ(0)-VLA。为什么有了GO系列,还要再做这个新模型? 因为VLA的反应式决策范式,在长程任务上开始”不灵了”。真实世界的任务很少是”拿起杯子”这样的孤立动作,而是长达数分钟、数十个连续步骤的任务链。反应式模型缺乏对任务历史和进度的显式建模,会暴露三类系统性缺陷:误差逐步累积、步骤重复或遗漏、目标随时间漂移。 τ(0)-VLA的解法是”慢思考+快执行”双系统,低层系统负责高频稳定的动作执行;高层系统负责深度思考。这相当于给机器人配了一个参谋部,动手之前,先让几个候选方案在”想象”里各推演一遍未来,给结果打分,挑最靠谱的那个执行;简单任务直接快速决策,只有高难度节点才启动深度思考。 这套模型矩阵的演进方向,与行业大势一致。具身智能的竞争,正在从“谁的反应快”,变成谁“更会规划”。 今年WAIC上,长程任务展示几乎清一色走向”Agent调度+原子化技能”的分层架构,前两年的端到端叙事明显降温,智元算是这条路上布局最系统的玩家之一。 但问题同样明显。其一,榜单优秀不等于实际优秀:比起评分,真实场景更关注实际成功率。其二,数据缺口太大:智元合伙人姚卯青判断,达到高阶智能需要亿小时级的真实物理世界数据。其三,彭志辉自己也在群访中承认,作业智能与海外头部具身模型公司仍有差距。 这三道难题,同样也是具身智能行业共同的痛点。但正是因为全行业的“牌”都不多,谁的底牌厚一张,谁就多一轮容错。 当行业从会动走向会做事,技术底牌决定了谁能拿到下一阶段的入场券,这是”留在牌桌上”的第一层含义:在洗牌来临前,得先有资格被留下。 做生态矩阵智元赌每条路上都有自己 从去年4月开始,一年时间里,智元先后孵化了智鼎机器人、擎天租、临界点、觅蜂科技、智元酷拓5家子公司,业务分别覆盖清洁机器人、机器人租赁、灵巧手、数据采集和四足机器人。 也难怪早期有投资人表示”看不懂”,毕竟行业内多数企业都有自己主攻的方向,比如主打本体的宇树,主要做大脑的自变量、智平方,以及灵心巧手等一批专门做灵巧手的公司。而智元主打一个“大而全”。 这源于智元对行业特性的判断。彭志辉也在晚点的采访中说到:具身智能是个迅速迭代的大行业,最终都会收敛到头部企业,必须快速占领市场,小打小闹很难保持领先地位。 通过今年WAIC可以看到,从大脑架构、数据采集、本体设计以及针对不同场景的落地方式,可谓是百家争鸣,各有各的方法。 大脑侧有VLA、有世界模型、有两者融合,还有“皮层-小脑-脊髓”的类脑路线;数据上有的注重真机,有的侧重仿真,又如何配比;本体形态用轮足还是双腿,用夹爪还是灵巧手,多少自由度够用。 问题就在于,当下每个环节上都没达成统一的标准,还不断有新玩家带着新思路涌入。但多元化也意味着方向驳杂。 在这一前提下,智元不得不自建一套生态,干脆自己来干。在行业标准出现之前,等别人还不如先把每个点位变成自己的。 比如数据层面,具身行业的数据质量良莠不齐。一段数据拿过来并不代表直接能用,还要经过筛选、清洗、对齐、标注,最后能剩下多少有效数据,各家的标准都不一样。智元把这块业务单独孵化成了觅蜂科技,一边卖数据一边推出自己的采集工具,目的就是为了让数据在行业流通。 对于灵巧手这一零部件,各家都想把它做成行业的基础设
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱