首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

TWIST:对话记忆干预质量的拟议基准,具有经过人类验证的草稿对齐

摘要

arXiv:2609.28575v1 Announce Type: new Abstract: Long-conversation memory benchmarks increasingly test recall and prompted knowledge updates, and recent work studies evolving user beliefs and memory st...

and recall memory the with system its surface detect matched
2026-09-25 1 阅读 约2分钟阅读 Subrat Panda
分享:
字号:
arXiv:2609.28575v1 公告类型:新 摘要:长对话记忆基准越来越多地测试回忆并提示知识更新,以及最近的工作研究不断发展的用户信念和记忆状态。 TWIST 是一个拟议的基准套件,用于补充、未测量的属性:干预质量——通过其自己的摄取/回忆/审查表面进行部署的记忆系统是否在信念改变点正确运行。四个轨道涵盖无提示的紧张检测、根据记录审查传出的草稿、在保留取代历史的同时用当前的信念进行回答以及管理敏感的回忆。该套件扩展了 LoCoMo 的语料库和工具,将每个检测/阻止指标与匹配的不过度检测控制配对:表面匹配的硬底片价格错误干预,因此无法通过标记所有内容来玩游戏。基准本身首先经过验证:独立的、金盲的双重注释与裁决、法官诱饵校准和可分离性审核。在人工验证的 Track B v1.0 密钥(161 个项目,裁决后 kappa = 0.85)上,没有任何测试配置能够同时实现高矛盾召回率、高硬阴性特异性和高归因:平坦 RAG 基线检测到 0.76-0.97 的真实矛盾,但根据后端错误地标记了 16-43% 的表面匹配安全草稿,而部署的面向一致性的系统几乎从不这样做过度标记(0.98-1.00 特异性)但捕获了 42% 的真实矛盾——这是仅召回分数无法看到的权衡。 13 个配置的基线阶梯定位了原因:每个黄金矛盾都可以仅从其证据中检测到(回忆 1.000),校准模型几乎解决了给定完整记录的轨迹 - 与实质性的检索覆盖差距一致 - 仅草稿的楼层揭示了依赖于模型的风格先验。系统的 TWIST 配置文件,除了其回忆分数之外,还衡量内存是否知道何时干预、何时不干预。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱