首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

BudgetBench:用于本地大语言模型代理内存策略评估的预算分层协议和试点工具

摘要

arXiv:2609.13149v1 Announce Type: new Abstract: For local large language model agents, active context is a scarce resource: memory capacity, prefill latency, cache growth, and service objectives all c...

and the budget local model context memory protocol harness that
2026-09-15 1 阅读 约2分钟阅读 Aditya Karnam Gururaj Rao, Arjun Jaggi
分享:
字号:
arXiv:2609.13149v1 公告类型:新 摘要:对于本地大型语言模型代理来说,活动上下文是一种稀缺资源:内存容量、预填充延迟、缓存增长和服务目标都限制了每次调用可以承受的输入令牌数量。我们提出了 BudgetBench,一种主动预算协议和参考工具,在比较内存策略时将每次调用输入令牌预算视为自变量。在保持模型、任务、采样器和解码固定的情况下,它会扫描 2K、4K、8K、16K 和 32K 令牌的预算,并记录质量、预算利用率、延迟,以及作为一流结果的预算违反率。核心贡献是这个可重用的测量界面:可交换的 MemoryStrategy 合约、明确的预算执行、确定性或版本化评分器、提示审计元数据和可重复性工件,发布于 https://github.com/aviskaar/budgetbench。我们通过试点研究而不是最终排名来证实该协议。在本地 qwen2.5:1.5b 试点(SWE-bench Verified 和 LongBench v2 上各有 89 个项目)、具有精确标记化的托管 50 项 Qwen3 30B-A3B LongBench 复制以及由官方 GPT-4o 评估者评分的 500 项 LongMemEval 预言机研究中,该工具暴露了预算合规性失败、非单调质量曲线和操作点,单一预算评估隐藏。预算与完整上下文方向仍未解决:本地切片接近于零,而托管复制有利于点估计中的完整上下文。我们透明地报告结果,包括早期试点的标记器近似低估了一些服务模型提示,因此其违规行是标记器近似诊断,而不是声明承载结果;所有计时均为操作诊断。可重用的贡献是扩展固定预算内存策略评估所需的协议、工具和故障报告规则。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱