首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

REAL-Q:通过动态梯度下降进行 E2E LLM 量化

摘要

arXiv:2609.00049v1 Announce Type: new Abstract: Post-training quantization (PTQ) is essential for deploying large language models (LLMs) under strict resource constraints. State-of-the-art PTQ methods...

the loss and REAL end PTQ for layer with column
2026-09-02 1 阅读 约1分钟阅读 Qian Zhang, Yaoming Li, Zhewen Tan, Yanshu Wang, Heng Lu, Kun Su, Zongwei Lv, Wenhan Yu, Yongge Ma, Yinjun Han, Ruikuang Liu, Tong Yang
分享:
字号:
arXiv:2609.00049v1 公告类型:新 摘要:训练后量化(PTQ)对于在严格的资源限制下部署大型语言模型(LLM)至关重要。最先进的 PTQ 方法使用单个封闭式二阶求解器对每一层进行量化:为了保持分析上的易处理性,它们高度近似全局损失(丢弃跨通道耦合,将输出行汇集到组中),然后冻结整个层上生成的 Hessian 矩阵,当损失情况逐列移动时无法刷新它,这种现象我们称为信息错位。我们提出了 REAL-Q(实时 E2E 损失对齐 LLM 量化),这是一种打破这种妥协的新颖 PTQ 范式:REAL-Q 不是为了分析的易处理性而稀释目标,而是以全局损失的端到端对齐替代项为目标,并通过在每个列块(128 列)之后应用的细粒度、动态分块梯度下降对其进行细化。通过将这种细粒度校正与平滑跨层转换的滑动窗口机制相结合,REAL-Q 有效地减轻了网络中的错误传播。在 W4A16 的 LLaMA-3.1(8B 和 70B)和 Qwen3(0.6B-32B)上,相对于最先进的全局引导方法,REAL-Q 将端到端 KL 发散降低了约 49%。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱