医疗健康
morning
对话蚂蚁灵波 CEO 朱兴:机器人还吃不了「粗粮」
2026-09-16
1 阅读
约10分钟阅读
李超凡
字号:
机器人打拳跳舞火了一年,它什么时候才能替我们上班? 前段时间宇树发布人形机器人格斗演示,称首次实现由世界模型实时驱动的全自主搏击。据其介绍,UnifoLM-X2-1.0 能实时预测未来状态,完成规划、决策和动态交互。 自主格斗让我们看到机器人临场反应的进步,但如果换成在药房里取放商品这样的场景,另一组难题又来了:包装各异的药品、有人走动的货架通道、长时间运行中不断出现的意外。 这些日常任务,需要机器人把一次次判断变成持续、可靠的工作。 APPSO 在 2026 外滩大会现场跟蚂蚁灵波 CEO 朱兴进行了交流。聊到机器人为什么连小卖部都还没大规模落地,他直言: 「小卖部其实也很难落地。我懂你的焦虑,今天还是能力和成本两个都有问题。」 与许多围绕整机产品展开研发的本体厂商不同,灵波把重心放在具身「大脑」上,希望同一套基础模型能够适配不同构型、不同任务,再通过后训练降低具体场景的使用门槛。重载作业和轻量分拣可以用不同的身体,智能则尽可能复用。 生成可交互世界的 LingBot-World 也是灵波技术探索的一部分。它还训练了面向具身的视频生成基座 LingBot-Video,并在此基础上训练动作模型 LingBot-VLA 2.0,同时建设数据管线、后训练和部署工具。 朱兴关心的是,这些投入能否让机器人用更少的数据学会干活。 我们在外滩大会上,也看到灵波大脑的机器人展示了药品拣选、物流分拣和工业上下料等操作。药房演示中的货架通道仅 80 厘米宽,相关方案已在国大药房零售门店部署。 灵波也保留了自己的 R 系列本体,用于研发和生活服务探索。 做具身大脑,仍然得与硬件、具体场景一起磨合 。 在现场交流中,朱兴谈了不少尚未解决的问题:小模型能完成特定任务,为什么还要花钱训练基模?数据越多,效果为什么可能越差?商业化又该推进到哪一步? 对于日常生活中产生的数据,他的判断很有意思: 今天的机器人还吃不了「粗粮」 。 以下内容整理自蚂蚁灵波 CEO 朱兴的媒体沟通会,APPSO 略经编辑。 一、小卖部,也没那么容易 Q:药房、上下料看起来都很普通。为什么不选一些更能体现技术水平的场景? 朱兴: 我们更在意的是跟生态合作伙伴一起,做一些实实在在的落地。今天要让它做一个很炫的事情,那也是一个 demo。我让团队搞两个月,可以让四个机器人打掼蛋,展示高精度、触觉等非常多的技术,也没太大意义。 我们看重的是真实应用、数据的产生。在这个过程中,让模型迭代循环起来,知道还有哪些不足,要提升什么。 产业也想搞既能规模化应用、又更帅的东西。做不了,模型能力还没到那一步,或者成本还没到那一步。 Q:连抓取、放置这样的简单操作,也很难做到 100% 成功吗? 朱兴: 要看场景、环境和任务本身操作序列的复杂度。 小卖部其实也很难落地。我懂你的焦虑,今天还是能力和成本两个都有问题。 模型能力、硬件稳定性,有些就是够不着。 今天整个模型还在冷启动阶段。基模干什么?是把小学生培养成初中生、高中生、本科生,现在可能还在比较早的阶段。 相对客观地说,现阶段想做一定规模的落地,环境不能太开放,任务不能太长程。任务太长,异常就多。今天主流可落地的产品基本还是模仿学习为主,最怕异常,因为没见过。还有成本约束,你创造的价值不够,自己又贵,长期也玩不转。 Q:既然如此,先把一个小模型训到能稳定干活,为什么还要投入通用基模? 朱兴: 如果阶段性只做一个非常特定的任务,也不追求规模化复制,直接怼一个小模型,也不是不能做。但你要看,规模化是不是意味着跨场景、跨任务、跨场所复制,这里面有泛化的挑战。 基模能力跟成功率不冲突。基模很大的价值,就是让后训练的少样本表现更好: 用更少的数据达到同样的效果,或者用同样的数据达到更好的效果。 这个效果就包含成功率。 基模提升是水涨船高,跟大语言模型的基模发展,带动生态应用是一样的道理。 Q:从一家门店复制到另一家,现在卡在哪儿? 朱兴: 我们过去一段时间把模型从实验室拿出来,跟很多伙伴做落地,确实会遇到一个门店和多个门店复制的问题。现在复制成本很高,本质上还是泛化性不足。不同药房、不同便利店,环境有很多不一样。 短期可以先选没那么开放的环境,压缩泛化的挑战;任务不要太长程,先偏单任务。模型可以先驱动一部分环节,再到更多地由模型主导,能力成长要有一个爬坡过程。 二、矿泉水不能跳着舞落到手上 Q:现在很多做视频、游戏的公司都在谈世界模型。它们的能力,能直接用来控制机器人吗? 朱兴: 有些词的概念很泛。具身的世界模型,跟数字世界、游戏里的模型,客观讲也不是一种生物。以视频生成路线为基础的这类世界模型,底层用的是视频生成的原理,但数字世界和物理世界差别比较大。 数字世界的模型,满足的是内容需求:丰富、好看、创新、特效、画质。只要好,用户可以接受延迟。 机器人需要什么?它不需要那么好看,也不需要特效,需要的是合理,符合物理规律,因为最终要变成动作,控制机器人。 比如我现在想喝这瓶矿泉水,矿泉水在天空中跳个舞,落到我手上,肯定好看,但不符合物理规律,没意义。 机器人第一在乎是否符合物理规律,第二需要高性能、实时。 它在物理世界里不断输入、输出,不可能等你帮它生成一个很好的故事。 Q:灵波也尝试过在通用视频模型上微调。为什么后来决定从头做? 朱兴: 1.0 系列的时候,我们也是基于数字世界的通用视频生成模型,比如 Wan,通过微调把它硬调到适合机器人。 一个问题是上限不高。另一个问题是,调到最后会破坏前面模型的先验和知识,副作用就是泛化性降低。 走到后期,我们真的是撞到南墙了。 所以我们很早就启动了更原生的研发。LingBot-Video 训练时加入了大量机器人真实数据,再基于它训练 LingBot-VLA 2.0。 我们相信物理智能需要基于物理真实数据,从 0 到 1 训练自己的基模。数字智能,包括多模态、大语言模型的发展,可能会给具身很多助力,但内核部分还要靠具身本身解决。 Q:从头训练基模,投入更大、风险也更高,为什么还要选? 朱兴: 因为我们希望长期发展,选择上限更高的路线。从 0 到 1 大规模训基模挺费钱的。 大语言模型兴起之后,有的选择基于别人的基模微调,有的冒更大风险投入预训练。选择后者也不见得跑得出来。今天具身也进入了「百模大战」初期, 你选一个更高上限的路线还不见得做得出来,但不选择的话,肯定做不大。 Q:LingBot-World 2.0 开放了 1.3B 小模型。模型小了,幻觉和效果损失怎么办? 朱兴: 不可能说幻觉完全没有。模型小了这么多,效果完全保持一致,也不现实。 我们之前说过会开放更小的版本,希望对高交互世界模型感兴趣的人能更多地玩起来,这是想给技术社区做的贡献。 这次也开放了一部分训练技术。比如怎样训练单向因果的能力,机器人的时间一定是单向的,在线预测要按时间顺序使用已经发生的观测,不能依赖未来的真实帧。从现在到未来,不可能穿越。这些技术本身也有门槛,希望能帮助开发者和学术界。 三、「炼丹」背后,是数据的配方 Q:行业总在谈百万、千万小时数据。你相信 Scaling Law 吗? 朱兴: 我也相信 Scaling Law。但不能这么机械地看数据量。 现在已经有这种现象:一个模型用的数据比另一个多
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱