开发者生态
morning
显存不够、内存太贵,KV Cache越堆越大:华为给出自己的新解法
摘要
过去被当作“临时缓存”的KV Cache,开始成为需要被长期保存、调度和复用的重要数据资产。 模型上下文越来越长,Agent任务持续时间越来越久,AI Coding等场景甚至需要跨天、跨周保留项目上下文,原本依赖显存、内存和本地SSD的三级缓存体系,容量、成本和寿命都开始触碰瓶颈。业内诸多厂商开始在这三层之外增加一层面向大规模推理的专业存储,其中也包括华为。 近日,华为正式发布了OceanStor...
OceanStor
M900
Cache
AI记忆存储
过去被当作
临时缓存
的KV
开始成为需要被长期保存
调度和复用的重要数据资产
模型上下文越来越长
2026-09-24
1 阅读
约10分钟阅读
褚杏娟
字号:
过去被当作“临时缓存”的KV Cache,开始成为需要被长期保存、调度和复用的重要数据资产。 模型上下文越来越长,Agent任务持续时间越来越久,AI Coding等场景甚至需要跨天、跨周保留项目上下文,原本依赖显存、内存和本地SSD的三级缓存体系,容量、成本和寿命都开始触碰瓶颈。业内诸多厂商开始在这三层之外增加一层面向大规模推理的专业存储,其中也包括华为。 近日,华为正式发布了OceanStor M900 AI记忆存储。OceanStor M900 M900并不是简单给AI服务器“再加一块盘”,而是希望把KV Cache从计算节点内的临时资源,变成可以在集群范围内共享、保存和复用的“记忆”。 这背后也是华为对当前AI产业阶段的判断:当模型能力和算力逐渐趋同时,决定企业AI落地效率的变量逐渐成为有没有高质量的数据、有没有足够的上下文记忆,以及能不能用更低成本把这些记忆反复利用起来。 KV Cache成为新基础设施层 传统大模型对话中,KV Cache往往只是一个短生命周期的临时数据。用户结束会话后,这部分缓存很快就可以释放。但Agent和AI Coding改变了这一逻辑。 普通问答通常以短时、单次会话为主,上下文时效性强,因此KV Cache可能只需要保留数小时,一旦对话结束就可以清除。但在AI Coding场景中,代码仓库、工程框架、此前生成结果以及项目上下文会被持续复用,KV Cache可能需要保留数天甚至数周。 也就是说,不同应用开始出现完全不同的“记忆周期”。企业需要根据具体业务定义哪些KV值得保存、保存多久、什么时候淘汰,而不是简单采用一套固定策略。 这也是华为将OceanStor M900直接称为“AI记忆存储”的原因。华为分布式存储领域总裁杨文道表示,“M”代表Memory,其核心目标就是把原本局限于显存和内存中的上下文记忆扩展出去,让更多Token对应的KV可以长期保存并重复命中。 华为内部测试和客户POC显示,通过专业KV Cache存储,可以让Token命中率提升约一倍,同时降低首Token时延(TTFT)。对企业而言,这不仅影响用户体验,也直接关系推理成本:如果历史上下文可以命中缓存,就不需要每次重新执行完整的Prefill。 目前,比较常见的推理缓存结构是:L1位于显存,L2位于内存,L3位于本地SSD。显存和内存访问时延在纳秒级,但容量有限、成本较高;本地SSD容量更大,但访问时延已经进入毫秒级。随着长上下文和大规模Agent任务增加,仅靠这三层已经越来越难容纳不断膨胀的KV Cache。 杨文道表示,OceanStor M900 AI记忆存储是聚焦L3.5层,L3.5并不是华为独创的概念,而是AI推理规模化之后,全行业面对容量和成本瓶颈自然演进出来的方向。华为选择在这一层推出专门产品,是因为传统三级缓存体系已经不足以承载未来的KV规模。 按照华为与客户的实际测算,如果真正按照生产要求保存大量上下文,最终需要的已经不是TB级,而是PB级存储。OceanStor M900将超节点中的KV Cache从显存、内存进一步扩展到SSD,单集群可提供64PB容量,单NPU可使用的KV Cache容量也从GB级提升到TB级。 从华为的判断来看,专业的KV上下文记忆存储并不是简单增加一个产品类别,而是可能成为大规模推理基础设施中新的固定层级。 从显存下沉到SSD,真正难的是做KV调度 把KV Cache从显存和内存下沉到SSD,看起来解决了容量和成本,但同时引入了一个新的问题:时延。 显存和内存的访问时延是纳秒级,而SSD已经进入毫秒级。如果模型每次需要Token时都临时从SSD读取,理论上完全可能因为数据访问变慢,抵消缓存复用带来的收益。因此,真正决定L3.5能否成立的是如何调度KV。 杨文道向InfoQ表示,华为在内部测试和客户POC中也遇到了这一问题。目前行业比较常用Mooncake推理框架,华为在这一框架基础上继续解决KV调度和预取问题。系统需要提前判断模型接下来可能使用哪些KV,并根据显存、内存和SSD不同介质的性能进行分层预取,在真正需要访问时尽量让数据已经进入更高速的上一层。 同时,传统使用分布式文件系统或者并行文件系统保存KV,往往需要先把KV转换成文件,再通过目录找到文件、读取文件,最后重新解析成KV交给模型。这中间经历了多次格式和协议转换。 OceanStor M900 AI记忆存储则希望把这一过程缩短成“一跳直通”。KV不再需要先转换成传统文件对象,而是直接按照KV语义进行访问,再通过昇腾超节点中的高速通信网络完成数据交换。其本质是让NPU尽可能把算力用于推理本身,而不是消耗资源进行数据转换和搬运。 当前,OceanStor M900采用“三芯合一”架构,将网络、CPU和盘控能力整合,并与灵衢网络及昇腾超节点协同。华为希望最终把计算、存储和网络视为一个整体,而不是过去意义上的“计算节点外挂存储”。 披露的数据显示,传统PCIe+RoCE架构中,GPU或NPU访问SSD池可能需要进行5次数据搬运,而OceanStor M900可以减少到1次,I/O时延和首Token时延降低超过50%。其访问时延约为10−15微秒,访问带宽可以达到40GB/s。 不过,这也带来了另一个关键问题:OceanStor M900是否只能运行在华为自己的生态中? 杨文道对此解释称,OceanStor M900当前定位配套昇腾超节点,通过UB协议完成超节点内部的数据交换,对上层应用而言并不需要感知这些底层通信方式。对于非昇腾、非超节点或者异构算力环境,华为已经提供OceanStor M800,通过标准网络和硬件适配不同算力平台。 OceanStor M900和OceanStor M800两款产品并非“高低配”关系,而是华为面向不同基础设施的不同产品形态。OceanStor M800先于OceanStor M900上市,已经与多家客户进行测试;OceanStor M900则进一步面向昇腾超节点,将计算、存储和网络做更深层次的一体化协同。 虽然主要面向超节点,但OceanStor M900不只在10万卡规模才有价值。杨文道表示,其价值会随着集群规模扩大而进一步放大。理论上,只要企业进入大规模AI推理,并开始遇到KV Cache容量、成本和共享问题,就可能产生专业记忆存储需求。 寿命和缓存淘汰成为新的工程难题 专业记忆存储另一个容易被忽略的问题,是SSD寿命。 普通企业级SSD通常使用DWPD(Drive Writes Per Day,每日全盘写入次数)衡量耐久度,一般在每天1—1.5次左右。对于传统存储业务,这一水平基本能够满足使用周期要求,但KV Cache的写入模式完全不同。 如果大量Agent和长上下文任务不断创建、更新和淘汰KV,SSD可能需要极高频率地重复写入。如果继续沿用传统模式,就只能通过不断增加SSD数量摊薄写入压力,最终成本会迅速上升。 杨文道举例,如果SSD每天只能完整写入一次,那么为了保存大量KV,就需要非常大的物理容量;但如果DWPD提升到24,相当于允许一个小时完成一次全盘级写入,那么大量只需要保存一小时的KV就可以快速写入、淘汰,再复用同一批介质。 因此,Oc
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱