首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

超越静态 RAG:用于在商品 GPU 上进行高效长上下文推理的自适应三度量路由框架

摘要

arXiv:2609.17564v1 Announce Type: new Abstract: Deploying retrieval-augmented generation (RAG) on commodity GPUs such as the NVIDIA T4 (16 GB VRAM) exposes a practical failure mode we call the Compres...

and the VRAM compression generation failure can key latency that
2026-09-17 1 阅读 约1分钟阅读 Saipraveen Vabbilisetty, Ajay Kumar Boddepalli, Deep Narayan Mishra, Shashank Kapadia, Haoan Wang, Anupriya Sharma
分享:
字号:
arXiv:2609.17564v1 公告类型:新 摘要:在 NVIDIA T4(16 GB VRAM)等商用 GPU 上部署检索增强生成(RAG)会暴露出一种我们称之为压缩悖论的实际故障模式:神经提示压缩会增加键值(KV)缓存争用和预处理延迟,从而超过生成时间节省,而跳过压缩可能会导致长期内存不足(OOM)故障上下文。当 vLLM 服务的 LLM 和基于 PyTorch 的压缩器在内存预算紧张的情况下共同部署时,我们确定了两种不同的故障机制,并引入了 Tri-Metric Router,这是一种确定性、免训练的策略,可以在原始、神经 (LLMLingua-2) 和词法 (BM25) 管道之间进行选择。路由器使用三个 CPU 端信号:空间复杂度 ($L$)、句法密度 ($\rho_{key}$) 和类型标记比 (TTR)。与之前的仅语义适配不同,我们的调度信号是硬件物理的,基于 VRAM 余量和延迟交叉点。阈值根据 LongBench qasper 上的分析进行校准,在 T4 上产生接近 4,332 个字的操作交叉;我们的贡献是这种校准方法,而不是特定于硬件的常数。在分布外坚持时,该方法实现了 0% OOM 失败、88.5 $\pm$ 4.4% 预言对齐和 49.3% 组合 F1,比始终在线的词法压缩提高了 5.2 个点,而无需额外的 VRAM 或训练成本。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱