医疗健康
morning
机器人会干活了,但还没学会“别多管闲事”
2026-08-25
1 阅读
约10分钟阅读
Leading
字号:
文 | Leading 从L1到L3,自主交互正在成为具身智能最容易被低估的能力分水岭 过去一年,具身机器人最常见的进步,是动作越来越像人。 它们开始叠衣服、整理房间、端咖啡、分拣物品,也能在舞台上奔跑、跳舞甚至完成高难度动作。到了2026年,行业讨论的重心已经明显从“能不能动”转向“能不能干活”。在世界机器人大会等行业活动中,数据、VLA、世界模型、泛化能力和商业化,成为具身智能公司反复讨论的关键词。 但机器人真正进入家庭、校园和养老机构后,很快会碰到一个比“会不会干活”更麻烦的问题: 它什么时候应该主动? 孩子一个人坐在走廊里,机器人要不要靠近?老人一上午没有明显活动,系统是否应该询问?用户嘴上说“我没事”,但语气、表情和行为和平时不同,机器人应该继续追问、提供建议,还是保持安静? 太被动的机器人只是一个长了腿的智能音箱;过度主动的机器人,则可能成为一个没有边界感的陌生人。 具身智能下一阶段的难题,已经不只是让机器人学会行动,而是让它知道什么时候可以介入,介入到什么程度,以及什么时候必须把判断交还给人。 这意味着,行业需要补上长期缺失的一张能力表:自主交互分级。 行业给机器人的手脚分了级,却没有给“边界感”分级 目前,具身智能的大多数能力体系,都围绕感知、规划、控制和执行展开。 机器人能否识别物体,能否在动态环境中行走,能否完成长程任务,遇到失败后能否重新规划,决定了它在物理世界中的自主程度。2026年发布的人工智能终端智能化分级,也将终端能力划分为响应、工具、辅助和协同等不同阶段,说明AI终端正在从执行单一指令,走向理解上下文和跨设备协作。 但这些分级主要回答的是:机器人能独立完成多少任务。 进入人类生活以后,还需要回答另一个问题:机器人可以在多大程度上主动影响一个人? 移动、抓取和操作物体,属于任务自主;主动问候、提醒、安慰、追问和联系家属,则属于交互自主。前者影响物理环境,后者直接介入人的情绪、关系和决策。 过去,交互被看作机器人的附属界面:只要语音识别准确、回答自然、屏幕流畅,就算“会交互”。但当机器人拥有摄像头、麦克风、长期记忆和主动行动能力之后,交互本身已经成为一种行为。 机器人走向一个孩子、持续注视一个老人、主动提起一段过去的经历,和手机弹出一条消息并不是同一回事。具身存在会放大机器的在场感,也会放大每一次错误判断的影响。 所以,衡量自主交互不能只看“像不像人”,还要看它是否知道边界。 L1:被动响应,机器人仍是“有身体的工具” 自主交互的L1阶段,是被动响应。 用户说一句,机器人回答一句;用户发出明确指令,机器人完成相应动作。它可以回答问题、播放内容、完成测评、带领训练,也可以执行“把水拿过来”“打开灯”“提醒我吃药”等任务。 这一阶段的系统逻辑比较简单: 用户发起请求,机器人识别意图,调用相应能力,再返回结果。 L1的优势是可控。机器人的权限来自用户的明确指令,开发者只需重点解决识别准确率、响应速度和任务成功率。即使出现错误,影响范围通常也局限在一次交互中。 但它的局限同样明显。 老人没有主动说身体不舒服,机器人就不会询问;孩子遇到挫败却不愿开口,系统也无法提供帮助。机器人看似24小时在场,实际上仍然在等待人类按下一个看不见的按钮。 很多所谓“陪伴机器人”仍停留在这个阶段。它们能够说出温柔的话,却无法理解一句话为什么在此刻出现;能够记住用户名字,却不知道一段旧记忆是否已经失效。 L1解决的是“机器人能不能回应”,还没有解决“机器人是否理解正在发生什么”。 L2:理解上下文,但主动权仍然属于人 进入L2阶段,机器人开始具备情境理解能力。 它不再只处理一句话,而是把语言、表情、行为、事件和历史互动放在一起,判断用户当前处于什么状态,以及什么因素可能引起了这种变化。 例如,一个孩子在完成拼图任务时连续失败,动作速度变慢,回答变短,随后把拼图推到一旁。L1机器人可能只会等待下一条指令;L2系统则可以把这些变化组织成一个事件: 任务连续失败,参与度下降,用户暂时中止任务,建议降低难度或询问是否需要休息。 这里最重要的进步,不是机器人给孩子贴上了“焦虑”“厌学”或“性格内向”的标签,而是它开始理解状态如何随着事件变化。 观察和结论必须分开。 “用户沉默时间变长”是观察;“用户可能出现挫败感”是带有置信度的状态假设;“用户存在心理问题”则已经超出了普通机器人应有的判断边界。 因此,L2可以提供选项,但不应擅自替人作出高影响决定。 它可以问:“要不要休息一会儿?”也可以提供“继续尝试、降低难度、找老师帮忙”等选择,但最终的互动方向仍由用户、老师、家长或照护人员确认。 L2真正的技术门槛,不只是多模态识别,而是把事件、状态、记忆和策略连接起来,同时允许用户纠正模型。 如果机器人判断错了,用户能不能说“我不是难过,只是在想事情”?这次纠正会不会更新后续策略?过去的状态记录是否会随时间降低权重? 一个不能接受纠正的情感模型,只是在用更复杂的方式固化偏见。 L3:有限自主,机器人开始决定“是否介入” L3是自主交互真正发生质变的阶段。 这一阶段的机器人可以在特定条件下主动发起互动,并根据用户回应调整策略。它不必等待明确指令,但它的自主性受到场景、权限、风险等级和置信度约束。 比如,居家机器人发现老人长时间没有出现在常用区域,可以先进行一次温和询问;如果老人正常回应,事件被记录并结束;如果多次询问仍无回应,系统才将信息交给子女或照护人员。 在校园中,机器人发现学生在一次任务失败后明显减少互动,可以提供短暂休息或简单放松选项;如果状态持续变化,则把事件摘要交给老师,而不是自行进行所谓“心理干预”。 因此,L3并不意味着机器人什么都能自己决定。恰恰相反,真正成熟的L3必须同时具备四种能力: 发现变化,判断可信度,选择低风险策略,并在达到边界时完成人工接管。 这套逻辑的关键,不是“主动”,而是“有限自主”。 机器人可以主动问候,但不能无限追问;可以提示关注,但不能给出诊断;可以调用经过确认的历史记忆,但不能把一次偶然倾诉变成永久人格标签;可以通知老师或家属,但必须说明触发提醒的事件和依据。 L3的最高能力甚至不是更积极地采取行动,而是知道什么时候不行动。 这也是它与传统主动营销、推荐算法最大的区别。推荐系统猜错一次,用户可能只会看到一条不感兴趣的内容;家庭机器人判断错一次,却可能打扰真实关系,制造不必要的焦虑,甚至让用户产生被监视的感觉。 自主交互越深入,企业承担的责任就越重。 从L1到L3,增加的不是功能,而是责任 如果只从产品界面看,L1、L2和L3之间似乎只是功能越来越多。 但从产业角度看,这三级能力对应的是三种完全不同的责任结构。 L1的责任主要在任务执行:机器人有没有听懂,动作有没有完成。 L2增加了解释责任:系统为什么认为用户状态发生了变化,使用了哪些信息,判断是否允许被纠正。 L3则增加了介入责任:机器人为什么在此刻主动靠近,为什么发出提醒,为什么选择通知某个人,以及谁对后续行动负责。 这意味着,具身机器人不能只建立“感知—决策—执行”的技术闭环,还要建立“观察—判断—交互—确认—人工接管”的责任闭环。 近期钛媒体对陪伴机器人产业的观察提到,数据安全、真实亲密关系与工程成熟度,正在构
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱