首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

DAMP:衰减感知混合精度循环状态量化

摘要

arXiv:2608.27513v1 Announce Type: new Abstract: Softmax attention stores key and value vectors for every preceding token, causing inference memory to grow with sequence length. Recent language models ...

and the recurrent quantization channels state DAMP memory states these
2026-08-31 1 阅读 约2分钟阅读 Tao Zhang, Jianchao Tan, Pingwei Sun, Yanqi Yu, Zixu Jiang, Yuchen Xie, Xunliang Cai, Ziqian Zeng
分享:
字号:
arXiv:2608.27513v1 公告类型:新摘要:Softmax 注意力存储每个前面标记的键和值向量,导致推理内存随着序列长度而增长。最近结合了 Gated DeltaNet (GDN) 或 Kimi Delta Attention (KDA) 的语言模型通过用固定大小的循环状态替换大多数层中的 KV 缓存来降低这种成本。然而,这些循环状态通常存储在 FP32 中并消耗大量 GPU 内存;它们的更新受到内存带宽的限制,并且会显着增加解码延迟。据我们所知,我们是第一个研究基于 GDN 和 KDA 的语言模型中循环状态的训练后量化的人。我们发现统一量化的准确性较差——存储权衡:INT8 和 FP8 已经降低了复杂推理任务的准确性,而 INT4 和 NVFP4 将其降低到接近于零。我们进一步发现,大多数量化误差能量集中在一小部分通道中,并且状态通道的相对衰减强度在提示和任务中保持稳定。受这些发现的启发,DAMP 使用量化误差能量和基于衰减的持久性来识别离线校准期间的高风险通道。它以更高的精度存储这些通道,并将其余部分存储在 INT8 中。我们在 Qwen3.6-35B 和 Kimi-Linear-48B 上通过涵盖数学推理、一般推理和代码生成的六个基准测试来评估 DAMP。在每个状态值 9.9 位时,DAMP 保持接近 FP32 基线的平均精度。 DAMP 将循环状态存储减少 69.1%,将循环状态更新内核加速高达 2.01 倍,并将全模型 TPOT 降低高达 10.9%。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱