医疗健康
morning
走向场景落地,具身智能企业的下一步是什么
2026-08-28
1 阅读
约10分钟阅读
窄播
字号:
文| 窄播,作者|李威 2026世界机器人大会上,进入场景的能力成为各家企业展示的重头戏。 星海图复刻了一座前置仓,展示机器人如何把商品装到撑开的袋子里并完成打包;自变量则在传送带上让机械臂处理快递包裹,快速地将面单翻到最上面,并挑出不是包裹的物品;银河通用的G1在展示物品归置、床上叠衣、洗衣晾衣等操作;开普勒的大黄蜂则在工厂场景中做搬运,双臂单次能举起30公斤的重物。 这背后,具身智能企业更愿意分享自家的机器人能够连续工作多长时间、适配一个新任务需要多少数据、可能的投资回报是多少;来看展的人也不再只是看表演、问参数,而是开始询问价格、交付时间等更细节的采购信息。 很明显, 具身智能的故事已经从谈愿景进入到了讲落地的阶段 。但人们并没有在这场大会上看到行业期待的「GPT时刻」出现的迹象。统计显示,上半年国内具身智能融资935亿元、出货超4万台,但超过65%的机器人仍用于演示和研发,真正持续生产的不足35%。 机器人在一个特定场景中可以接近人工效率,却很难将能力复制到更多场景中;一台样机可以完成任务,也不意味着多台产品都能稳定执行任务。尽管模型、本体、数据和供应链都有进步,但这些进步还不能让机器人成为可规模化应用的生产力。 因此,2026世界机器人大会更多是拉开了具身智能真正走向场景落地的序幕,形成了一种共识:企业开始认真考虑,如何将一次部署积累的模型能力、数据、硬件方案和交付经验,带给不同的客户、不同的工位和不同的任务。 这意味着,在场景化落地的大前提下, 具身智能企业的下一步是要能产出可复制的生产力。 三类场景,三种难度 具体来看,2026世界机器人大会上各家企业的展示囊括了家庭、工业和商业三大领域的诸多场景。从边界明确的工厂和仓库,到人员与物品不断变化的酒店、零售和餐饮场所,再到高度非结构化的家庭,环境复杂度逐级上升,企业要解决的问题也随之变难。 首先,工业、物流和能源巡检大多属于封闭或半封闭环境,工作对象、活动范围和验收标准相对明确,最容易用节拍、稳定性和成本计算投资回报。这也是机器人最先从概念验证走向落地部署的场景。 在这个场景中,具身智能要做的不是全盘替代传统自动化。 传统机械臂擅长高频、标准化和固定的任务,具身智能更适合物料状态变化、多品类生产和快速换产留下的空白 。光象科技COO郑可表示,汽车工厂的自动化率已经很高,但小型件、异形件的上料,以及插接、卡接、拧紧等操作仍然高度依赖人工。这些往往是具身智能更擅长的。 其次,从工厂走向零售、酒店、餐饮和药店等商业场景,环境会进一步开放。机器人既要完成取送、清洁、制作饮品等具体工作,也要面对顾客、员工、障碍物和临时需求。因此,商业场景不仅要验证机器人会不会执行任务,还要求它能进入一个持续运转的服务系统。 擎朗在酒店洗衣场景中就没有让一台人形机器人包办所有工作,而是把流程拆开:配送机器人运送衣物,人形机器人负责投衣、启停设备、折叠和装篓,再由配送机器人送回房间。 机器人由此被嵌入现有业务,而不是孤立完成一次表演 。这种模式很像工业场景中传统机械臂与具身智能的配合。 复杂度最高的是家庭场景。在家庭里,物品没有固定位置,任务缺少统一流程,用户给出的往往也不是标准指令。机器人可能刚开始准备早餐,面包就被人拿走;正在倒水时,瓶口又被临时遮住。它需要更敏锐地感知环境、理解人的意图,并判断原来的任务还能否继续。 大会上,银河通用展示了机器人制作早餐的场景:面包被抽走、瓶口被遮挡后,机器人仍能重新判断并继续任务。千寻的机器人则能在用户发出「帮我整理客厅」的模糊指令后,将任务拆成:把碗放进洗碗机、将饮料归位、收起玩偶和处理垃圾等多个步骤,再自行规划执行顺序。 这些企业想要向家庭场景用户呈现的,是一个能够处理大量长尾任务的全能助手,但机器人的成本、安全性、泛化能力和隐私责任都尚未找到稳定答案。我们也能看到墨奇智能、未来不远等专注家庭场景的企业,星动纪元、自变量、银河通用等也在展示家庭场景应用。 在一段时间内,家庭场景仍可能是支撑具身智能第二条融资曲线的愿景主线。可这并不能改变家庭场景代表着具身智能的能力上限、短期内难以规模化落地的事实。陪伴类机器人也可能会成为进入家庭的先锋,就像心言机器人的巴布、青心意创的Amoo等。 从封闭工厂到开放家庭,具身智能正在沿着环境复杂度逐步推进。但无论场景难易, 如果每换一家客户都要重新采集数据、训练模型和改造本体,企业得到的仍然是一个个定制项目。场景越具体,复制问题反而越明显。 模型要具备更强的泛化能力 跨越场景需要模型把一次部署获得的经验,变成可以迁移的泛化能力。这种泛化并不是机器人立即获得什么都会的通用智能。现阶段更现实的标准是,当物品、指令和环境发生变化,进入一个新任务时,机器人能否用更少的数据和更短的训练完成适配。 这意味着,未来评估模型价值不能只看它在展台上完成了多少任务,还要看适配新任务需要多长时间、消耗多少新增数据,以及场景变化后能力可以保持多少。 泛化能力最终反映的是机器人进入下一个岗位的「培训成本」。 星海图将这种成本比作新员工上岗。其创始人高继扬称,目前机器人完成一项新任务大约需要10小时的后训练,下一步希望将门槛压缩到1小时,甚至只依赖少量样本。 为了降低这种培训成本,星海图采用统一自回归架构,希望用一个模型打通零样本指令、通用抓取和长程任务。其中,零样本解决未预训练过的指令,通用抓取处理物品变化,长程任务则支持机器人记住连续步骤及环境状态。三者共同支撑机器人从「拿起一个面包」走向完成前置仓履约这样的完整任务。 银河通用自研了银河星脑WAM-TTT技术,让客户只需要拍视频,无需遥操作数据采集即可完成模型后训练。「只需要视频数据,不需要任何标签,不需要任何动作标注就能完成后训练,这样模型在落地场景中的迭代速度非常快,门槛也非常低,千行百业都能把基模用起来。」银河通用创始人王鹤表示。 数据的价值在不断提升。与语言模型只处理数字世界中的文本关系不同,机器人面对的是重量、惯性、摩擦和碰撞。它不仅要识别眼前是一只杯子,还要判断从什么位置抓、需要多大力度,以及拿起之后杯子是否会滑落。 因此,自变量创始人王潜提出, 数据不是石油,而是工业品 。石油是一种等待开采的标准资源,具身智能数据却需要围绕任务被采集、筛选、加工和组合。同样是一小时机器人运行数据,成功完成任务、操作失败、人工纠正和异常状态的价值并不相同。 企业需要把每一次部署都变成数据生产过程。 场景由此不只是机器人创造收入的地方,也开始成为模型获得数据和反馈、识别失败和继续进化的关键。也因此,京东、凌迪这种掌握了大量场景数据的公司,如今开始为机器人提供训练数据,可能成为加速具身智能落地的重要助力。 本体在回归第一性原理 模型追求更强泛化能力的同时,具身智能的本体也不再追求一种形态覆盖所有任务,而是回到任务本身。 人形机器人曾经是具身智能最容易被理解的产品形态。人类设计的工厂、家庭和工具都天然适配人体结构,一台拥有双腿、双臂和五指的机器人,也最接近通用劳动力的想象。 但进入真实工位后,多一条腿、一只手或一个自由度,都意味着额外的成本、功耗和故障风险。企业开始重新回答一个更基本的问题: 完成这项工作,最少需要什么? 光象科技在汽车质检场景中的选择是,如果一条
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱