汽车
morning
具身智能等不来自己的“ChatGPT时刻”
2026-09-06
1 阅读
约10分钟阅读
智讯智库
字号:
文 | 智讯智库,作者 | 陈宥文 8月22日,第二届世界人形机器人运动会百米大型组预赛,宇树跑出12.41秒的成绩,小组垫底[1]——一年前,这项赛事的400米冠军,正是宇树。就在此前两天,王兴兴刚在WRC主论坛上重申了他对具身智能“ChatGPT时刻”的预判:快则2到3年、慢则5到10年——届时,机器人的泛化能力将使其在80%的陌生场景中,通过语音或文字指令完成约80%的任务[2]。 愿景很大,但赛场表现的巨大落差,迅速将宇树科技推上了资本市场和公众舆论的风口浪尖[3]——“具身智能骗局论”再度升温:宇树还配不配“领衔者”的位置?大模型驱动的技术路线到底走不走得通?具身智能的“ChatGPT时刻”究竟会不会来? 层层追问,最终落在一个词上——“ChatGPT时刻”。 人们翘首以盼的,或许是一个划时代的机器人横空出世,或许是一个带着英雄光环、能一锤定音整个具身智能行业未来的“中国马斯克”。 但,事实真会如此吗? 本文要点速览: 定义偏差:所谓“ChatGPT时刻”,本质是能力涌现、成本骤降、病毒式传播三条曲线同时触达阈值的共振产物。具身智能的物理交互属性决定其难度远高于大语言模型,直接套用C端一夜爆红的叙事属于根本性范畴误判。 发展现状:具身智能的能力、成本和扩散三条曲线分别卡在不同节点。其中,能力卡在跨场景泛化与安全执行关,固定基准普遍逼近97%-99%,换场景后指标明显下滑,如RoboCasa成功率 53.9%、VLABench得分 47.4;成本卡在投入转化率关,合成数据与人类视频大幅拉低练习成本,但真机校准与上岗验证仍是不可移除的刚性锚点,全行业融资近千亿,远快于研发投入和验证转化速度;扩散卡在跨客户复制关,上半年出货量同比增长近300%,但生产级场景占比不足两成,可跨厂复制的标准化任务包尚未形成。 “时刻”形态:具身智能的“ChatGPT时刻”不会是单点爆发。慢力量(技术、成本、扩散三条曲线)决定真实进度,尽管推进缓慢且刚性,却是这一时刻的真正决定因素;快力量(资本定价、公众情绪、人才潮汐)制造短期波动与时刻幻觉,但不决定真实节点。产业发展的节点会分层落地——先形成开发者层的基座模型标准,再出现客户层的可复制任务包,最后才是公众层面的通用途径,整体是渐进式渗透而非一夜奇观。 风险提示:本文为产业阶段性观察分析,不构成针对任何具体标的的任何投资建议。具身智能整体处于技术验证向规模化落地过渡的早期阶段,跨场景泛化能力、规模化交付经济性、可复制商用扩散的成熟度可能不及市场预期;同时全球技术迭代、本体产能与场景落地均在持续推进,长期产业成长逻辑具备支撑,实际演进节奏需依据核心技术突破、成本曲线变化、行业标准落地及下游需求释放等多重变量综合判断。建议理性看待产业周期与技术规律,注意规避基于单一事件或局部数据的极端判断风险。 9月3日,OpenAI发布GPT‑6 Astra,将多模态理解、抽象推理与电脑操作进一步融入统一模型,并在ARC‑AGI‑3测试中取得99.9%的成绩。如果一次能力跃升就足以构成“ChatGPT时刻”,那么GPT‑6理应已经带来第二个这样的时刻——但这并没有发生。这恰好说明,只有当能力同时转化为足够低的使用成本、足够普适的产品接口,并触发大规模采用与认知同步,技术里程碑才会成为产业时刻。数字世界尚且如此,在本体、部署与安全成本更重的物理世界,具身智能更难以凭一次模型发布完成三条曲线的合取 [4]。 被误用的“ChatGPT时刻” 2022年11月ChatGPT的发布,重新定义了什么叫技术的“时刻”——48小时内全球讨论刷屏,约5天用户破百万[5],两个月后月活过亿,成为史上增长最快的消费级AI应用[6]——“取代论”“奇点论”“泡沫论”随之轮番上演。 然而,构建这个“ChatGPT时刻”的底层架构,并非OpenAI首创。2017年诞生的Transformer架构,摒弃了以RNN、GRU为代表的循环神经网络逐词递归的计算范式,转而以自注意力机制对整段序列做并行建模,再通过位置编码补入序列顺序信息[7]。GPT系列沿用这一架构开展大规模自监督预训练,再经指令微调、RLHF(基于人类反馈的强化学习)两步对齐,其作为自回归语言模型的核心训练目标始终是:给定上文,预测下一个词元(Token)。也正是这条技术路径,第一次让数亿普通人直观感受到:机器的对话自然度已经逼近真人。 从架构论文正式发表,到ChatGPT之作为产品真正击穿公众认知,隔了整整五年。 事实上,技术史上的“时刻”,也从来不是单一技术突破的自然结果,而是技术本身跨过奇点级成熟度,同时产业与公众集体确认“它来了”——“时间的刻度”本身就是一种社会认知的产物。由此看来,如果给“ChatGPT时刻”一个精确的标准,那可能就是三条曲线同时触及阈值:①能力涌现、②边际成本骤降、③病毒式传播扩散。三者是合取关系,缺一不可——GPT-3早在2020年6月就已具备粗糙可用的能力,可直到两年半后,三条曲线才完成共振[8]。 如果用这把尺子衡量具身智能(本文主要围绕人形机器人),王兴兴在WRC上提出的“双80%”是目前行业传播最广的量化标准之一,但它其实也只覆盖了“能力涌现”这一条曲线,边际成本与传播扩散两个维度仍在视野之外。 可即便只看能力这一条曲线,具身智能的难度也比ChatGPT所代表的大语言模型高出整整一个量级——概言之,一个是词元,一个是多维力矩:语言模型预测下一个词,离散、容错,说错了重生成即可;机器人输出每一个力矩,连续、零容错,错一个就摔碎杯子,代价是真实的物料、时间与安全风险。前者每秒输出几个词,后者每秒输出几十到上百次动作,频率与容错率差着几个数量级。 拆解来看,语言模型的任务本质上只有一个动作:预测下一个词元。具身智能则要跑通感知、理解、拆解、规划、执行的五步闭环,技术栈从VLM、VLN、VLA一路延伸到世界动作模型,每一级都要新增一个此前不存在的能力模块。 幸运的是,具身智能的技术推进,可以直接继承大语言模型五年的技术积淀——同一个Transformer骨架,同一条scaling路线。主流VLA架构更是把动作离散成词元,让机器人像“说”一句话一样输出动作序列——动作即语言,机器人控制就此转化为序列生成问题。除此之外,自动驾驶趟出的真机采集方法论、快速成熟的本体制造产能,也分别为数据回流和物理落地提供了基础——当然,这几者有一个共同点:没有一件是这四年里从零突破的。具身智能过去四年的加速,本质上依托的是人类上一个产业周期攒下的存量资产——模型、数据、本体三条线咬合转动,才是真正的加速飞轮。 也正因此,过去四年具身智能以极度压缩的节奏走完了语言模型从Transformer到ChatGPT的五年路径:2022年SayCan与RT-1范式奠基[9][10],2023年RT-2为VLA正名[11],2024年π0与OpenVLA完成开源与数据基建[12][13],2025年进入模型元年,2026年迎来路线融合与考场迁移。(“四年走完五年”是结构类比,非严格定量结论。) 这条时间线的首尾,刚好框定了一场贯穿四年的架构路线之争:2022年SayCan走分层路线(大模型思考、小模型执行),RT-1走端到端路线(单网络直接输出
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱