首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

Agent走向长线协作的关键一战:AML首期揭榜,谁将引领下一代记忆范式革命

摘要

机器之心发布 2026 年 8 月 12 日,Agent Memory Leaderboard(AML,中文名 “记忆之巅排行榜”)首期榜单正式发布。据 AML 官方数据,MemoraX 系统以 58.0 的优异成绩高居榜首,并在文本类记忆 7 个能力维度下全部位列第一;InvMem 以 45.1 的成绩荣获开源方法榜单冠军。 当行业还在为大模型 200 万 token 的上下文窗口欢呼时,一线 ...

AML Agent Memory Leaderboard 2026 中文名 记忆之巅排行榜 Hugging Face Twitter
2026-08-14 1 阅读 约10分钟阅读 机器之心
分享:
字号:
机器之心发布 2026 年 8 月 12 日,Agent Memory Leaderboard(AML,中文名 “记忆之巅排行榜”)首期榜单正式发布。据 AML 官方数据,MemoraX 系统以 58.0 的优异成绩高居榜首,并在文本类记忆 7 个能力维度下全部位列第一;InvMem 以 45.1 的成绩荣获开源方法榜单冠军。 当行业还在为大模型 200 万 token 的上下文窗口欢呼时,一线 Agent 开发者已经撞上了现实的铁墙: 把庞大的历史记录全盘塞给模型,不仅带来呈指数级爆炸的 API 账单,更让大模型在冗长、充满噪音的信息海洋中产生严重幻觉。失效的规则被反复执行、早已过期的偏好无法被清除、上一轮会话踩过的坑在下一轮中重演…… 对 Agent 而言,长期记忆(Long-term Memory)是实现长期协作的基础,决定了它能否真正摆脱 “永远从头开始” 的西西弗斯困境。 2026 年 8 月 12 日,由牛津大学、清北等海内外近 30 所顶尖研究机构联合发起的 Agent Memory Leaderboard(AML,中文名:记忆之巅排行榜) 在 Hugging Face Space 正式揭榜。 首期榜单发布不到 48 小时,便已在 GitHub、Hugging Face 社区及 Twitter/X 等海内外技术社区引发爆发式讨论。这不仅是一次简单的成绩发布,更标志着 Agent 长期记忆赛道正式迎来了属于自己的 “ImageNet 时刻”。 现象级热度 一场席卷 Agent 圈的 “记忆大考” 过去两周,如果问大模型 Agent 领域备受开发者关注的评测是什么,答案毫无疑问是 Agent Memory Leaderboard (AML)。AML 致力于尽可能统一记忆系统之外的关键变量,使不同参评系统在一致条件下接受测试,从而公平、公正、公开地针对记忆系统进行评测 。 AML 在发布之初便引爆了全球开发者社区。 根据 AML 披露的数据,官方站点上线短短两周,点击量便迅速突破 20 万次,首届赛事更是累计收到超过 100 个团队的参赛申请。 8 月 12 日,AML 首期榜单在 HuggingFace 和官网同步揭晓,推动热度进一步向社区扩散:放榜不到 24 小时,微信公众号,Twitter/x 等海内外技术媒体上相关话题阅读量迅速冲破数十万,引发现象级关注。 图源 AML 官方社交媒体账号 值得关注的是,技术讨论的焦点不仅停留在分数与名次本身,更延伸至行业评测范式的建构逻辑 —— 评测契约的标准化、评测流程的公正性、评测数据的完整性等 。社区不再只是围观名次,而是在认真审视评测机制本身的长期价值。一个首期发布的榜单,能同时收获现象级流量与范式级讨论,印证了两点:其一,Agent 记忆已经走向舞台中央;其二,行业对一套可信、公正的记忆度量衡,已经渴求已久。 为什么是 AML 三重隔离,打造一把丈量记忆的权威标尺 AML 的诞生,源于一个日渐清晰的行业共识 —— 大模型的上下文窗口越开越大,但 Agent 的长期记忆能力并未随之水涨船高。 过去,行业评价一个 Agent 记性好不好,往往没有统一的数据集、回答模型、提示词(Prompt) 和判别模型(Judge)。最终的高分可能只是因为使用了更强的下游生成模型,或是针对特定 Prompt 做了过拟合优化,不同记忆系统之间极难进行直接、客观的横向对比。 为了解决这一真实痛点,AML 凭借三大硬核设计,建立了目前业界最为严苛且公正的记忆评测体系: 隔离接口边界,让记忆归记忆,生成归生成 :AML 将参评系统的职责严格收敛到 Add(写入)与 Search(检索)两类接口 —— 记忆系统只负责接收长周期历史,并在问题到来时返回相关记忆证据;Answer 与 Eval 则由平台以统一的模型、流程和聚合规则完成。只有固定了回答与评分的条件,成绩差异才能最大程度上归因于记忆系统本身。 隔离单一数据集的偶然性 —— 多源数据,能力重构 :AML 整合 PersonaMem、LoCoMo-Refined、BEAM 等 10 余个业界主流基准与平台私有测试集,覆盖超过 1500 个对话与任务、约 1.5 亿字符的长程历史、近 5000 道评测题目。更关键的是,所有题目经人工重构,被映射到统一的记忆能力维度。参评者最终得到的不只是一个名次,而是一张可诊断的能力剖面图。 隔离人为操作空间,可复核、可追溯的评测治理 :一个具有行业公信力的榜单,必须对评测契约的可复现性与防刷机制给出透明的工程答复。AML 评分环节采用多评审系统(Multi-Agent Judging System),以保证评测结果准确度和一致性;平台统一封装模型、参数与日志,完整保留检索证据、平台答案与评审记录,配合私有测试集与人工标注校准,刷榜与过拟合的空间被压至最低。 统一的接口链路保证 公平比较 ,多源的数据映射保证 完整剖面 ,透明的治理机制保证 长期可信 ——AML 正朝着成为全行业公认的 Agent 记忆能力统一标尺的方向迈进。 榜单深度解读 工业榜单:MemoraX 断层领跑,MemOS 稳居第二,网易 MEMORY-SMART 成为黑马 根据 AML 官网,在工业榜中,前十名中既有头部大模型厂商的闭源产品,也有多家记忆领域创业公司的 API 服务。 其中, MemoraX 以 58.0 分 的总成绩位列第一,在全部七个能力维度中均排名第一,写入、检索效率也稳居第一梯队 。公开报道显示,与传统向量数据库相似度检索的路线不同,MemoraX AI 构建了以 “可学习记忆策略引擎、记忆基模、自演进 Agent Harness” 为核心的 Agent 记忆技术体系。前者更像是给 Agent 配了一本可搜索的笔记本,而 MemoraX 强调的是记忆的持续自进化、动态更新和跨场景复用。这一技术体系的核心目标是解决大模型在长周期、海量级个性化碎片信息处理中的局限性,通过内化记忆能力,解决大模型失忆症痛点,为 AI 智能体提供原生长效记忆能力。 「Agent Memory Leaderboard」工业榜前十名 第二名 MemOS 在事实召回、多跳推理、时间推理和记忆治理方面表现稳定 ,但个性化与规则执行相对偏弱。 第三名,来自网易的 NTES-MEMORY-SMART 则成为一匹黑马,其个性化能力达到 57.0 分 ,事实召回、多跳推理和规则执行也均位居前列。它呈现出的并非绝对平均的能力结构,而是以 “理解和适应用户” 为核心优势,同时在主要基础能力上保持中上水平。这种能力结构,可能更适配长期陪伴、个性化客服、内容服务、虚拟角色和个人助理等需要持续理解用户的产品。 此外,最近很火的 TencentDB Agent Memory 虽以 41.5 分排名第八,但其规则与工作流执行能力达到 28.7 分,位列工业榜第二。这代表它返回的记忆更能还原并遵循历史规则、操作流程、组织约束与 SOP,因而可能更适合企业知识库、工单、审批和流程型 Agent。而海外平台热度较高的 Mem0、MemPalace、Supermemory 在工业榜仅分别位列第 9、10、15 名,在高阶记忆能力上暴露出明显短
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱