智能AI
morning
大模型的下半场,拼的是记性
摘要
人类总是习惯用旧时代的地图,导航新时代的大陆,AI时代也不例外。 互联网时代,人类最重要的进步之一,就是借助网络访问千里之外服务器上的公开信息,我们自此有了从无限的信息中找到答案的能力。 到了AI时代,当我们试图为AI增加记忆与外部信息时,这条路径被刻舟求剑式地延伸成了 RAG (Retrieval-Augmented Generation,检索增强生成) ,并成为当下最主流的AI Memory范...
RAG
LLM
Wiki
人类总是习惯用旧时代的地图
导航新时代的大陆
AI时代也不例外
互联网时代
人类最重要的进步之一
就是借助网络访问千里之外服务器上的公开信息
我们自此有了从无限的信息中找到答案的能力
2026-08-04
1 阅读
约10分钟阅读
虎嗅
字号:
人类总是习惯用旧时代的地图,导航新时代的大陆,AI时代也不例外。 互联网时代,人类最重要的进步之一,就是借助网络访问千里之外服务器上的公开信息,我们自此有了从无限的信息中找到答案的能力。 到了AI时代,当我们试图为AI增加记忆与外部信息时,这条路径被刻舟求剑式地延伸成了 RAG (Retrieval-Augmented Generation,检索增强生成) ,并成为当下最主流的AI Memory范式。 为了方便理解,我们先解释一下RAG到底是什么。 简单来说,就是先把不同类型的信息,统一用向量的形式存起来,等用户提问时,再搜索、召回、拼接,交给模型生成答案。 它的本质还是一个 被动的搜索框 。只不过搜索结果从网页链接变成了文档切片,搜索框后面多接了一个大模型。 这是一项极为有效的工程技术。它让模型能够接触训练数据之外的信息,也在相当长一段时间里,成为企业接入大模型成本最低、风险最可控的方式。 问题在于,被动检索并不等于主动记忆。 当大模型演进至Agent的下半场,记忆已升级为与推理同等重要的认知能力。 我们对记忆的期望也随之改变——它应该能够 主动写入、主动判断、主动整理、主动更新,主动建立信息之间的关联,甚至主动遗忘错误的信息 ,并将这些记忆作为上下文提供给模型,提升任务完成效率。 而传统RAG,只有机械化的写和机械的读。中间那些关于理解、遗忘、关联的工作,全都被外包给了人类工程师。 什么是真正AI native记忆,逐渐成为了Agent 系统设计中的核心问题之一。 AI memory的昨天、今天与明天 沿着大模型记忆的发展脉络看,今天市场上的方案大致可以切割为三个代际版本。 2023年开始 , 行业出现了 第一代 外挂式记忆产品 。 这类方案会把用户的对话历史、业务日志或文档塞进向量数据库,在下一次提问时,可以通过关键词或混合检索召回相关片段。 为了让它看起来更像记忆,工程师们为其打满了 工程补丁 :用户画像、摘要压缩、时间过滤、长内容切分等技术依次登场。 但它的基本逻辑没有发生变化:写入是机械的,读取也是机械的。系统不知道一段信息是否可信、是否已经失效,也不知道两条记忆是否冲突、哪些应该被遗忘。 这直接导致了两种极端: 要么系统里什么都存。随着数据持续累积,记忆库越来越臃肿,召回噪声越来越大, Token 消耗越来越高。 要么系统依赖预先设定的规则只存一小部分信息,一旦越过规则边界,一些关键的上下文便永久丢失。 打个比方:RAG并没有赋予AI记忆,它只是给AI外接了一本极其笨重的字典。 2026年 ,著名 AI 专家安德烈·卡帕西(Andrej Karpathy)提出的 LLM Wiki 构想 ,在技术圈掀起了一场地震。 他观察到,传统 RAG 每次面对问题时,都要重新从原始资料中检索、拼接和推理。模型上一次完成的分析并不会真正留下来。下一次遇到相似问题,它仍然要从头检索,非常低效。 于是,LLM Wiki 试图让 AI 持续维护一套小型知识网络——新资料进入后,模型会主动总结、建立链接、更新页面并维护索引。知识不再是查询时临时拼凑的散料,而被沉淀为可被持续修订的中间层。 这是一次至关重要的跃迁,它让 “把思考结果沉淀下来、主动提供给模型” 成为行业共识。知识由此实现复利式进化。 但个人知识能够积累,并不意味着产品级记忆可以运行。个人场景中,我们可以接受页面偶尔出错,可以手动修订链接,也可以决定哪些资料被加入系统。 但进入企业场景后,问题变得复杂起来: 谁有权写入知识? 一条结论经过什么验证才能生效?两个部门的知识发生冲突时,以哪个版本为准?员工离职、权限变化或者业务规则调整后,哪些内容需要被删除?不同 Agent 之间应该共享多少信息? 一套由文件、索引和人工规则维护的Wiki,可以帮助AI积累知识,却未必能解决权限、时效、版本、一致性与责任归属问题。 不难发现,前两派玩家给出的答案,其实都是 先训练或接入一个通用大模型,再在模型外部添加RAG、知识库或者插件。 但记忆与智慧一定是分别独立的模块吗?不同场景需要的记忆方式是统一标准的吗? 沿着主动记忆与企业级产品能力这条路线,行业自2025年起出现了第三类玩家—— 分层主动记忆派 。 在他们看来,真正成熟的 AI 记忆,不该是一个静态数据库,而应是一套持续运转的认知架构。 它需要具备 主动性: 主动观察交互,判断什么值得记录;主动识别实体、时间与因果关系;主动更新旧结论,抹平新旧信息的冲突;主动降低低价值数据的权重,并在恰当的时候执行遗忘。 更关键的是,它必须像人类大脑一样,建立 分层架构 。 当前任务的即时指令,绝不能与沉淀数年的业务事实混为一谈;用户一句随口的吐槽,不该轻易推翻团队长期形成的工程规范。 更直白地说,真正的记忆系统需要建立 “ 瞬时记忆—工作记忆—长期记忆” 的分层体系,让不同信息以不同方式进入、停留、迁移和退出。 然后在此基础上,他们会进一步将记忆变成模型的原生能力,并针对不同场景做出不同的 agent 记忆方案。 如何打造记忆的三层存储体系 如何衡量一套 AI 系统是否真正拥有长期记忆? LoCoMo 和 LongMemEval 是目前行业中具有代表性的两类公开测试。 LoCoMo 通过横跨多轮、多个时间阶段的超长对话,考察模型对人物、事件和关系的记忆,以及对时间和因果链条的理解。研究显示,扩大上下文或引入常规 RAG 虽然可以改善表现,但模型依然明显落后于人类。 LongMemEval 则进一步把能力拆成信息提取、跨会话推理、时间推理、知识更新和拒绝回答等维度。 近期登顶这两项测试的 红熊AI ,及其自研的 MemoryBear ,为行业提供了一个鲜活的工程样本。 (评测结果与复现材料见文末附注) 严格来说,2024年底红熊AI立项研发记忆引擎时,"AI记忆"还不是一个单独赛道,只是大模型的附属话题。如今这个赛道已经挤满跟进者——大厂在模型里加记忆层,创业公司扎堆做记忆框架,而 此时 MemoryBear已经开源。 作为第三派AI记忆的代表性玩家,红熊 AI没有把记忆理解为一个数据库,而是构建了由工作记忆、短期记忆与长期记忆组成的分层动态体系。 其中:工作记忆处理当前任务所需要的信息。短期记忆保存近期重要内容,并进行初步提炼和结构化。长期记忆则沉淀经过验证、具备持续价值的事实、经验、技能与用户偏好。 当然,分层不是呆板和静态的归档——一条信息不会因为出现过,就自动成为记忆。 在分层之前,信息需要经历三步建模: 首先是萃取。 系统从大量交互中识别真正有价值的事实,过滤寒暄、重复表达、无效指令和临时噪声。 其次是关联。 信息会通过实体、事件、时间和语义关系形成动态网络(类似第二派的LLM Wiki )。一条客户投诉可以关联到具体产品、订单、服务记录和后续解决结果;一次技术选型可以关联到当时的约束、被放弃的方案和后来出现的问题。 最后是匹配。 系统根据当前任务,从不同层级的记忆中提取必要信息,避免了RAG式仅靠语义相似度的粗暴召回。 MemoryBear操作界面 在此基础上,MemoryBear 还加入自动遗忘和自我反思机制。 没有遗忘与反思,错误、过时、低价值的信息持续累积,记忆最终会沦为 污染每一次召回的垃圾
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱