首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

用于分类 GPU 推理的拓扑感知数据移动

2026-08-03 1 阅读 约2分钟阅读 Sanjeev Rao Ganjihal
分享:
字号:
arXiv:2607.28633v1 公告类型:新 摘要:分类 LLM 推理会造成数据中心网络问题,现有系统无法正确解决该问题。当预填充和解码在不同的 GPU 池上运行时,必须在它们之间传输 KV 缓存。对于 70B 型号,每个请求为 2.6 GB,在生产规模上超过 100 GB/s 聚合。然而,DistServe、Splitwise 和 Mooncake 都使用统一的 RDMA,忽略了两个 GPU 之间的带宽根据其物理关系变化了 72 倍:域内通过 NVLink 实现 900 GB/s,跨节点通过 InfiniBand 实现 50 GB/s,跨数据中心通过 TCP 实现 12.5 GB/s。我们设计了一个拓扑感知的传输编排器,它在启动时发现互连层次结构,并为每次传输选择最佳传输。三种机制协同工作:(1) 管道式逐层传输,将传输与正在进行的预填充重叠,将 60% 到 85% 的延迟隐藏在计算后面; (2) NVLink 专家混合模型的域感知布局,可与 KV 缓存局部性共同优化专家调度; (3) CXL 3.0 内存扩展器作为共享溢出层,提供 6 倍的容量,同时延迟比 NVMe 低 86 倍。全面评估需要具有异构互连的多节点集群和 CXL 3.0 硬件,这超出了学术资源范围,并且尚未在 GPU 云中提供。我们展示了跨三种架构的分析带宽模型、组件实现和预测分析,显示比统一 RDMA 传输延迟减少了 3 至 18 倍。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱