智能AI
morning
ECCV 2026 | 智能助手何时该主动开口?Vinci2让第一视角AI助手从「有问必答」走向「主动服务」
2026-08-17
1 阅读
约10分钟阅读
机器之心
字号:
请想象这样一种居家场景:当你戴着 AI 眼镜在厨房准备晚饭,用刀切菜时,它会立刻提醒你注意安全;当你连续几天形成举着手机长时间录像的习惯时,它会主动建议你换一种更省力的记录方式。前者需要 AI 助手根据当前场景服务用户,后者则需要调用跨越数天的记忆,总结用户生活规律。 然而,当前的第一人称视频助手大多停留在两种范式: 被动响应式(Reactive) ——用户单次提问,模型单次作答; 半主动式(Semi-proactive) ——用户预先给定指令,模型监测预定义事件并触发回复。二者都无法基于用户的历史、习惯与当前活动,自主判断「此刻是否真的需要打扰用户」。「第一人称视频助手在何时、以何种方式主动开口?」的问题依然有待被解决。 针对这一研究空白,来自大连理工大学、Alaya Lab 与东京大学的团队联合提出 Vinci2 ,将 主动服务(Proactive Assistance) 形式化为一个基于持续视频流的「决策 + 生成」联合任务:智能体在每个时刻不仅要感知正在发生什么,还要基于长时程累积的上下文,决定当前是否介入、如何介入。Vinci2 包含两大核心组件:首个主动服务评测基准 EgoServe ,以及免训练的记忆增强智能体 EgoMemo 。 标题:Vinci2: Providing Proactive Assistance in Continuous Egocentric Videos 作者:龚思同、严天宇、康彩新、郑波、阮翔、卢湖川、张凯鹏、佐藤洋一、黄逸飞 机构:大连理工大学、Alaya Lab、东京大学 论文链接:https://arxiv.org/pdf/2607.11523 论文网页:https://sitonggong.github.io/EgoServe-page/ 目前,该工作已被计算机视觉顶级会议 ECCV 2026 接收,其代码和数据集标注均已开源。 EgoServe:首个第一人称流式视频主动服务评测基准 现有视频理解基准难以评测「主动性」:离线视频问答基准只考察对预分割片段的理解,流式视频理解基准不涉及长期记忆和介入决策,已有的主动对话基准则依赖于用户预先给定的显式指令。EgoServe 是首个同时具备第一视角、多天时间跨度、主动服务评测与流式推理协议的基准,构建于 EgoLife(多人多天连续日常记录)、HoloAssist(任务型交互)与 CaptainCook4D(含错误执行的烹饪记录)的基础上,覆盖超过 128 小时视频、超 3400 个服务实例。 EgoServe 的核心设计在于按照 服务所需的时间记忆跨度以及服务本身的应用场景 ,将主动服务组织为 4 个层级、10 个子类别: 即时服务: 仅需当前观察和即时性记忆,如安全警报、工具使用提醒; 短期服务: 需要最近几分钟的上下文,如错误检测和纠正、用户资源提醒、下一步动作引导; 情景服务: 需要贯穿当前任务(数十分钟到数小时),如未完成任务提醒、阶段记忆回溯; 长期服务: 需要跨会话、跨天的上下文,如用户习惯辅导、日程优化、长期记忆关联。 数据集的标注过程采用半自动流水线:以各数据集已有的人工标注为基础,用类别定制化提示驱动 LLM(如 Gemini)生成候选服务实例;针对长期服务引入「流式线索捕获」策略,让模型根据密集人工注释跨天累积事件线索,确保长期服务源于真实的多天行为模式。全部标注经人工校验。评测同时考察 时序精度 (介入是否落在真值触发窗口内、类别是否匹配,报告各类别 F1)与 回复质量 (LLM 评分)。 EgoMemo:免训练的记忆增强主动服务智能体 研究团队构造了免训练智能体 EgoMemo,持续处理第一人称视频,以流式方式对输入视频帧构建多模态记忆并进行检索增强推理。 在 流式记忆构造 阶段,EgoMemo 增量维护三种互补的记忆表征: (1)多尺度时序记忆: 首先对输入的视频片段进行均匀帧采样,并通过 VLM 生成带有时间标记的细粒度描述,而后将细粒度描述逐层组织为片段级—活动级—会话级三层摘要,兼顾细粒度感知细节与长时程行为规律。 (2)演化知识图谱: 利用 LLM 从片段级描述中提取实体与关系并增量合并,得到跨越视频整体的全局知识图谱,为跨时间的语义关联建立结构化索引。 (3)视觉嵌入档案: 为了对文本记忆中可能缺失的视觉线索进行补充,利用 ImageBind 对关键帧编码存储,补足文本难以描述的物体外观与空间布局信息。 在检索增强的推理阶段,EgoMemo 流式接收之前生成的片段级视频描述。在主动服务模式下,模型需要评估当前场景下是否需要进行主动干预。在被动响应模式下,模型则直接对某一时刻的用户问题作出响应。在两种模式下,推理模型均会判断是否需要调用深度检索,若需要,则生成检索查询并激活三重并行检索机制。 (1)多尺度时序检索: 直 接 将检索查询编码为密集嵌入,并查找 top-k 相似度的描述。 (2)基于图的语义检索: 先从检索查询中提取关键词,而后将关键词编码并在知识图谱中查找相似度高的节点,而后提取这些节点的相邻节点及中间关系,将节点中的实体映射为片段级描述。 (3)视觉相似度检索: 先利用 LLM 改写检索查询,使其包含视觉特性,而后通过 ImageBind 编码并获取相似度最高的关键帧特征,进而提取其对应的片段级描述。 (4)VLM 描述重构: 将基于图和视觉提取到的片段级描述及其对应的视频帧重新注入 VLM,提示其根据检索 query 重新生成新的描述,进而将原始偏离查询的描述整合为面向查询的连贯叙述。 最后,将重构的描述以及时序检索出的原始片段级描述作为上下文重新注入推理模型,并输出介入决策或问题回复。 EgoMemo 架构不仅可以同时支持主动服务与被动问答两种模式,还可通过「由粗到细粒度」的感知策略无缝迁移到离线视频理解任务,提供全局信息的同时保持对细节证据的访问。 实验验证:在主动服务与多项视频理解基准取得 SOTA 效果 研究团队分别在 EgoServe 和多个在线以及离线视频理解基准上评测了 EgoMemo,取得了多个 SOTA 结果。 在 EgoServe 上的实验结果表明: (1)EgoMemo 依靠其多尺度记忆和推理检索机制大幅超越闭源模型 Qwen3-VL-Plus 和 GPT-5-mini,其中情景服务和长期服务的提升最为显著(ML 达到了 4.9,RO 达到了 11.8)。这体现出在没有累积上下文的情况下,再强的 VLM 也无法提供有意义的主动服务。 (2)消融实验说明,描述重建与图谱检索的贡献最大,且三条检索通路互为补充,不可替代。 EgoMemo 的架构同样能很好地泛化到现有视频评测基准中:在 OVO-Bench 上,实时感知类问题的平均准确率为 75.15,大幅超越 GPT-4o(64.46);在 ESTP-Bench 显式主动任务上以 27.6 超过经过训练的 EyeWO(23.6);在离线基准 EgoSchema 上以 74.8 的准确率超越此前最佳 7.2 个点,QAEgo4D 上亦取得 68.0 的最佳成绩。 结语 Vinci2 首次将「是否介入、何时介入、如何介入」作为显式的推理问题引入第一人称视频助手,用 EgoServe
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱