首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

Nexus:统一内存上代理 LLM 的深度自适应 KV 缓存拼接和检索解耦工具路由

2026-08-24 1 阅读 约2分钟阅读 Mustafa Arslan
分享:
字号:
arXiv:2608.20397v1 公告类型:新摘要:模型上下文协议 (MCP) 上的代理大型语言模型 (LLM) 每轮都会重新编码详细的工具模式,因此随着工具注册表的增长,预填充(序列长度的二次方)在首次标记时间 (TTFT) 中占据主导地位。 Nexus 的主要杠杆是将路由与模式预填充成本解耦:具有经过校准的交叉编码器边际门的 INT8 语义后备缓冲区 (SLB) 通过检索来选择工具,并通过压缩文本签名(中位数 19 个令牌)生成参数,而不是通过拼接键/值 (KV) 缓存生成参数。该路径与深度无关:当注册表扩展到 250 个工具时,路由准确性保持在 89% 左右(其中串联所有模式基线完全溢出上下文窗口),并且它达到第一个参数令牌的时间比全模式重新预填充快 1.66 倍,节省了约 80% 的主上下文令牌。作为辅助的、有界的杠杆,我们将编译后的模式 KV 块直接移植到实时上下文中。这从根本上受到旋转位置嵌入 (RoPE) 相位漂移的限制:锚定拼接是输出精确的,但离锚放置会破坏注意力,因此超过阈值 P=256 Nexus 会使用深度自适应后缀重新解码来修复接缝,并升级为完全重新预填充。由此产生的永不回归特性保证了输出保真度(top-1 协议,D_KL 约为 0),而不是延迟,在收敛到奇偶校验之前延迟可能会下降到 0.98 倍,同时在中等深度下实现 1.1-1.7 倍的 TTFT 加速,在深度上下文中缩小到奇偶校验。两个负面结果限制了设计:离锚 RoPE 保真度边界,以及无参考漂移门无法预测漂移 (Spearman rho = 0.193)。所有测量均来自 Apple 芯片统一内存上的一个模型元组 (Qwen2.5-14B-Instruct Q4_K_M);定性边界是概括性的,而定量包络是特定于元组的。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱