首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

工业具身智能走进工厂,为什么还需要一层「底座」?

摘要

编辑|冷猫 一台复合机器人与一个 SPS 智能分拣工作站,已经在某主机厂产线上连续跑了很长时间。能够识别上百种不同规格的汽车零部件,10 秒完成一次分拣,抓取成功率超过 99%。 熟悉工业机器人领域的读者们很能理解这一场景有多么难能可贵。 具身智能的强大能力边界,和走进真正的工业生产,两者之间有着巨大的鸿沟。原因在于工业场景对智能的定义,从底层上就不一样。 工厂不需要某一项单项能力惊艳的机器人,它...

HALO HumanGPT 手部触觉 人类技能 一台复合机器人与一个 SPS 智能分拣工作站 已经在某主机厂产线上连续跑了很长时间 能够识别上百种不同规格的汽车零部件 秒完成一次分拣
2026-08-21 1 阅读 约10分钟阅读 机器之心
分享:
字号:
编辑|冷猫 一台复合机器人与一个 SPS 智能分拣工作站,已经在某主机厂产线上连续跑了很长时间。能够识别上百种不同规格的汽车零部件,10 秒完成一次分拣,抓取成功率超过 99%。 熟悉工业机器人领域的读者们很能理解这一场景有多么难能可贵。 具身智能的强大能力边界,和走进真正的工业生产,两者之间有着巨大的鸿沟。原因在于工业场景对智能的定义,从底层上就不一样。 工厂不需要某一项单项能力惊艳的机器人,它们的要求朴素到近乎苛刻:要足够「简单」。 这个「简单」是一套完整的工业标尺:建立在稳定完成作业任务的基础上,还要在产品换型、工件规格变化、多机协同调度的全流程里,持续守住精度、节拍与可靠性的底线。这份长链路的确定性,才是「简单」的真正内核。 通用化、易迁移、低成本部署,这恰恰具身智能工业化落地最大的的突破口。 具身智能领域的老朋友, 埃夫特机器人(688165.SH)与旗下启智 Openmind 共同研发的智能机器人 通用技术底 座 ,正在试图给出一个全新的解决方案。 「安卓方案」:打通链路的强大底座 工业具身智能为什么迟迟落不了地?总的来说,有三道鸿沟需要跨越。 第一层:数据 鸿沟 。 目前业界的数据来源主要有四类:真机遥操作、仿真数据、第一视角视频、互联网数据。成本高、模态缺失。 第 二 层:场景鸿 沟 。 中国拥有数百个工业门类,每个门类下工艺排列组合,产生的垂类场景数以万计。试图训练一个全能型智能体,通过单一大模型直接覆盖所有工业场景,不现实。 第三层:开发鸿 沟 。 面对海量垂类场景,若要覆盖海量场景,就需要雇佣庞大的工程师团队,供给侧和需求侧之间形成了一堵墙。 数据为先 工业具身智能的落地困境,首先是数据问题。 工业场景的精细操作、力控分寸、产线节拍,既无法通过公开数据集获得,也难以用规则穷举;而真实产线数据分散、非标程度高、采集门槛高,直接导致工业机器人的技能始终停留在「一案一议」,无法形成可迁移的通用能力。 为解决工业数据难题,行业目前主要走两条路径。一条是仿真生成路线,成本低、速度快,但工业场景对精度、触觉、物理交互的要求极高,仿真与真实产线的「现实鸿沟」始终难以弥合。另一条是机器人遥操作路线,由人远程操控机器人采数,但存在操作延迟、触觉维度缺失、效率低下,且数据与特定本体深度绑定、跨机型复用性差的问题。 启智打造「具身智能全行业解决方案」的过程中,在数据侧选择了一条更贴近本质的路径: 直接从人类操作者身上采集原生技能数据 。 新版 人类技能全模态数据采集系统 (HALO 技能服) 通过真人直采,同步记录视觉、深度、全身动作、手部触觉、肌电等多模态信息,把工人操作中难以用语言描述的手感、节奏、应变经验,直接转化为可训练的结构化技能数据。 具体来看,新款 HALO 技能服在硬件上 实现了 8 类完整数据模态的同步采集 :全景图像、第一人称可见光图像、第一人称深度图像、手部触觉、骨骼点及物体空间位姿 3D 信息、环境音频、操作人语音,以及 sEMG 肌电信号。27 节点 IMU 惯性动捕系统采用全有线连接板载采集架构,工作延迟控制在 10ms 以内。 HALO 技能服将数据维度从「动作层」扩展到了「意图层」,让模型训练不只学会「怎么动」,还能学到「为什么这样动」。 启智机器人副总工程师王鑫在光明网报道中说:「工厂无需高薪配备专职机器人程序员,一线喷漆老师傅操作数次,系统即可将工艺沉淀下来,适配同类工件。这本质上是将工业机器人部署门槛大幅降低,使企业可将人力聚焦于工艺优化而非程序调试。」 从「人类技能」出发的专用基础大模型 有了高质量的原生数据,下一个问题是如何把它沉淀为可复用的通用技能。 通用技术底座的「大脑」HumanGPT ,核心任务是把人类老师傅在真实工况中积累的操作经验,蒸馏为机器人能够训练和调用的数据。 HumanGPT 并非从通用语言或视觉大模型衍生而来,而是一套从底层围绕「人类技能」构建的专用基础大模型。 它从第一天起就围绕物理操作技能搭建:输入端是多模态的人体运动数据,输出端是可以迁移到机器人关节空间的控制策略。 它的训练逻辑是:先由人在真实场景中完成任务,HALO 技能服完整记录人类操作全流程,HumanGPT 从中学习、沉淀通用技能,最终通过 RobotGPTs 实现向不同机器人本体的迁移落地。 基础模型只能达到七八成的准确率,无法满足工厂落地所需的高精度要求。在垂类场景实际落地时,还需基于基础模型进行后训练和强化学习,让机器人从此成为「领域专家」。 启智的服务场景并不局限于工业。HumanGPT 的大模型能力已在工业制造、家庭服务、极端环境作业等多个领域沉淀数据并训练垂类技能模型,实现跨机型的技能迁移与部署。 技能可复用的全链路体系 数据与模型的单点突破,仍难以弥合场景与开发的鸿沟。 在工业化的场景下,行业普遍痛点是 链路碎片化 :数据采集、模型训练、应用开发、仿真验证、现场部署分属不同工具与团队,每一次场景切换、本体更换,都要在多个环节重复投入,这也是「定制化成本居高不下」的深层原因。 启智围绕 「技能可复用」 ,做了一套全链路闭环体系,把过去相对分散的几个环节接起来,减少机器人换本体、换任务之后大量重复的数据、算法和开发工作。 大衍数据平台 是后训练的全流程工具链:从数据清洗、标注到模型训练,封装为流程化的点选操作,让非 AI 背景的工程师也能自主完成。平台兼容英伟达与华为昇腾等主流算力芯片,实现「一次开发,多芯适配」,不被算力供应链锁定。 墨斗 IDE 是面向工业场景的一体化开发环境,提供图形化仿真界面,支持低代码、无代码及自然语言交互。焊接工艺工程师不需要懂机器人编程,通过墨斗 IDE 即可完成任务编排、离线仿真与部署,能够实现对主流品牌机型的兼容性,具备强大的编排实力。 Openmind OS 则向下连接工业机器人、复合机器人、人形机器人等不同构型,是通用技术底座的地基。向下适配多样化的硬件,向上为 AI 应用提供统一接口。由于神经网络在实时控制层面无法保证毫秒级确定性响应,运动控制必须由操作系统以传统控制理论实现。Openmind OS 集成了丰富的机器人专用中间件和通信协议栈,支持毫秒级实时控制,从根本上消除对外依赖,也让整套底座具备了「自主方案」的技术起点。 现在,行业内的每家企业都在各自搭建底层系统,每个场景都要从零开始,无法复用、无法共享、无法规模化。这才是工业具身智能「雷声大、雨点小」的根源所在。 这也是为什么我们无比期待具身智能的「安卓时刻」的到来。以统一的接口与开发环境拉低应用开发门槛,让已经沉淀的能力可以跨机器人、跨场景快速迁移复用。 启智将「真人采数据→模型学技能→技能向机器人迁移→应用开发→本体执行」这几个过去相对分散的环节,在这套通用技术底座体系中被完整串联,形成可复用的技术闭环。 他们真正打造了一个具身智能走进工业生产的「安卓方案」,让每一次落地都不必从零开始。 「通用」:本体、产线、工艺的验证 「通用」这个词其实是一种很高的要求,但大多数时候它指向的是一种愿景,缺少清晰的验证标准。 在埃夫特与启智的逻辑里,一套底座是否真的具备通用性,必须跨过三重行业公认的验证:跨机器人形态的适配能力,跨真实产线的落地能力,以及跨工业工艺的
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱