首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

颜水成团队重磅发布VoiceMem,提出「流式双脑架构」打造下一代实时交互基础设施

摘要

科幻早就预演过这一天,而这两年 AI 的真实进展,正把它推成一个可讨论的命题:AI 或许不会停在「工具」上,而会成为与人类共生的存在 ——AGI Being。 共生的第一道门槛,是能跟人实时说话。这是 GPT-4o、全双工模型、Interaction Model 在做的事。 但用久一点,共同的短板就浮出来:它们没有记忆。听得懂你此刻在说什么,却不知道你是谁。认识始终是单向的 —— 你越来越熟悉它,...

VoiceMem Mem0 https AGI Being Interaction 在做的事 Agent xzf thu
2026-09-08 1 阅读 约10分钟阅读 机器之心
分享:
字号:
科幻早就预演过这一天,而这两年 AI 的真实进展,正把它推成一个可讨论的命题:AI 或许不会停在「工具」上,而会成为与人类共生的存在 ——AGI Being。 共生的第一道门槛,是能跟人实时说话。这是 GPT-4o、全双工模型、Interaction Model 在做的事。 但用久一点,共同的短板就浮出来:它们没有记忆。听得懂你此刻在说什么,却不知道你是谁。认识始终是单向的 —— 你越来越熟悉它,它对你永远停在第一天。 没有记忆的交互系统是没有灵魂的,再流畅的陪伴者也逃不掉工具的身份。每次打开都要重新问你是谁;说过不吃坚果,明天照样推荐给你。 代价有两个: 1. 信任 被 清零。 消耗掉的不是效率,是刚建立起来的那点连接。 2. 只会「答对」,学不会「懂你」。 现有记忆只记信息:你说过什么、涉及到谁;但交互的另一半是情感 —— 你说「我没事」时的语气,提到某个人时不自觉地停顿 xq。 这正是 VoiceMem 在做的事:面向多模态陪伴者的类脑记忆系统,补全 Digital Embodiment 的第三根支柱。 这项工作也延续了论文第一作者谢之非的研究主线:他是目前大音频语言模型、实时语音交互与多模态 AI 领域内非常活跃的研究者之一。 VoiceMem 不是炒概念讲故事,而是四家顶级高校与 Open Interaction Lab 联合发布的记忆框架,工程优化充分,一行代码就能跑。目标是实时交互版的「Mem0」。 目前,Qwen Audio Agent 也已将 VoiceMem 接入为可选的记忆系统,让语音助手的记忆不止于文本,还可以从真实世界中记住语音、说话人、声音事件、音乐等丰富信息。 论文标题: VOICEMEM: STREAMING DUAL-BRAIN MEMORYFOR REAL-TIME INTERACTION Project page: https://xzf-thu.github.io/VoiceMem Code: https://github.com/xzf-thu/VoiceMem Report: https://arxiv.org/pdf/2608.26005 为什么是 VoiceMem Mem0、Zep、MemOS 直接用不行吗? 不行,两个原因。 一、应用上,时间和信息输出都不可用。 语音留给「想一想」的时间太短。从你说完到 AI 开口,总预算约 400 毫秒,现有系统查一次要 2000 毫秒。而且文本 Agent 习惯一次返回上百条让模型自己挑,语音模型吃不下;少了,则有用信息锐减。 VoiceMem 把检索压到 VAD 后 134 毫秒(降低 65%),拆成四个子阶段执行,延迟几乎降到 0。左脑在 LongMemEval 上 Top-10 就能对应 Mem0 top-200 的精度,成本骤降 95%。 二、也是真正核心的,这些系统只管「信息」,接不住「情感」。 你是压力一大就闭口不谈的人,还是必须找人倾诉的人?这不是信息,这是「你」这个人本身。 VoiceMem 的解法是「流式双脑架构」。别害怕,原理很简单: 信息左脑|Informative Left Brain —— 双层图检索:上层联想层 + 下层检索层(兼容 Mem0 / Zep),节点是实体、人物、知识,毫秒级取回事实。 情感右脑|Emotional Right Brain —— Identity nodes 沉淀稳定人格,Joint nodes 把情绪与偏好绑定到左脑的每一条记忆之上。 两个脑并行处理、独立维护,再通过联合节点作为【桥梁】共享信息。 所以当 AI 想起「上周三你提过的那个项目」,它同时想起的是你当时的语气。事实和情绪一起被取回。 当 AI 记得住昨天,它才第一次真正「认识」你;当它记得住你的一生,它才可能成为你的另一个自己。记忆不是 AGI Being 的一个功能,而是它成立的前提。如果你在用语音助手,千万别错过。 下面分三章介绍:左脑、右脑的管理机制,以及 VoiceMem 为什么能「流起来」。 左脑:通过涌现机制控制信息密度 日常检索最容易翻车的地方,是 "搜得到但搜不对"。比如你问 "上次体检结果怎么样",系统按字面相似度捞回来几条记忆,结果一大半只是沾了 "体检" 这个词的边,真正有用的都被挤了出去。 问题不是排序不够聪明,是搜索的范围。 VoiceMem 的做法是先给记忆用簇 - 实体来组织,并建立内部的粗 - 细粒度关联。问题一来,先顺着多层联合搜索把范围收窄,再在这个小圈子里搜。 他们左脑最核心的算法,叫 涌现 。是专门用来适应长期信息积累的。涌现机制根据节点的被搜索情况建立内部关系子图,再用 LLM 对重要性,必要性和相关性和评估,做最适合长期的簇的划分。 效果很直接:在权威的长对话记忆测试 LoCoMo 上,左脑只用五条记忆就拿到 91.2 分,而 Mem0 就算给到上百条记忆,也只有 61.68 分。 右脑:记住你的情绪,更记住 “你” 究竟是谁 左脑记的是发生过什么,右脑记的是你是一个什么样的人:你的性格、你的情绪习惯,以及这些情绪是冲着谁、冲着哪件事去的。「他不喜欢每周的例会」和「他这个人容易焦虑」,是两种东西,得分开记。 VoiceMem 右脑的核心算法是长短期情绪归因。一边在短期对话里实时捕捉情绪,一边在长期维护中回头观察、归因、总结,把反复出现的情绪沉淀下来,变成对这个人的稳定认识。 时间一长,它才算是个懂你的陪伴者。 测试里有个现象值得说:有些冲突和用户偏好,答案其实全写在对话记录里,但普通模型并不在意。 VoiceMem 靠右脑把分数从一成多拉到七成以上。反过来,把右脑整个拿掉,纯信息类的题目分数也会跟着掉。情绪和人格里藏着事实库里没有的信息。 流式记忆架构 - 搜索机制协同设计 时间是记忆系统的核心挑战之一:用户期待记忆被即时调用,但真正的 “零延迟” 几乎是不可能完成的任务。 VoiceMem 从三个层面解决这个问题。前两点很直接:一方面将查询收敛到 Top-5,减少检索开销;另一方面控制返回信息量,让记忆读取足够快。 更关键的是第三点,从机制上打掉延迟:VoiceMem 的记忆架构本身就是围绕检索时延设计的。整个检索过程被拆成 listening、speech tail(0–200 ms)、anticipation(200–300 ms)和 searching(300–340 ms)四个阶段,在用户还没有说完时,就已经并行完成 ASR、实体与 schema 匹配以及图扩展,只把真正的后端搜索留到最后。 最终,完整的双脑检索过程被压缩到仅 134 ms,并进一步完全隐藏在标准 VAD 的 300 ms 静音等待窗口内,因此不会给对话增加可感知的额外延迟。 好玩的是,研究人员为了让 voicemem 更容易上说,还真把它的流式代码和 vad 做的完全一样,一行运行。 实验:更快,更准,更懂你。 除了在学术界经典 benchmark 上面进行跑分,我们更想知道它在真实场景里好不好用。为此,我们专门做了一套贴近真实生活的评测集,涵盖信息、人格、情感归因、副语言和环境等多个维度。 结语 VoiceMem,据我们所知是目前唯一的实时交互可用的记忆。但我
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱