首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

RENDER:控制 LLM 内存评估中面向读者的证据

摘要

arXiv:2608.23568v1 Announce Type: new Abstract: Memory and RAG evaluations often treat the answering model's input as an implementation detail, even though systems may render the same history as a mem...

the and raw style model conversation entries models RAG evaluations
2026-08-26 1 阅读 约1分钟阅读 Yuan Si, Simeng Han, Daming Li, Jialu Zhang
分享:
字号:
arXiv:2608.23568v1 公告类型:新摘要:内存和 RAG 评估通常将应答模型的输入视为实现细节,即使系统可能呈现与内存条目、摘要、键入记录或原始摘录相同的历史记录。我们引入了 RENDER,这是一种基准控制,可以修复对话,同时改变面向读者的工件。 RENDER 结合了五级数据包阶梯,当包含答案的内容进入输入时进行本地化,并具有近似 ChatGPT 样式条目、LangChain 摘要、MemGPT 样式类型记录和原始对话的确定性模板。在 500 个 LongMemEval 问题和 9 个模型中,匹配预算的解析数据包比最近被截断的原始对话高出 42.4-72.6 分。在部署式模板中,每个模型的最佳与最差差距为 24.6-48.8 点;在主要评分器下,ChatGPT 风格的条目在 9 个模型中的 7 个上比原始对话具有更高的分数估计。法官重新评分保留了积极的总体效应,但模型特定的意义是复杂的。三个在正式账本数据包上得分为 0% 的模型回答了来自自然语言条目的相同事实,得分为 45.4-53.4%。该效应在检索噪音下持续存在并转移到 HotpotQA,这表明记忆/RAG 评估应该报告或控制面向读者的伪影。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱