智能AI
morning
FAMPWQ:Fisher 基于信息的自适应混合精度权重量化,用于有效的 LLM 推理
摘要
arXiv:2608.24945v1 Announce Type: new Abstract: Recent years have witnessed remarkable achievements of Large Language Models (LLMs) in multiple domains, while the excessive resource requirements of LL...
the
quantization
bit
width
sensitivity
propose
Fisher
information
based
FAMPWQ
2026-08-27
1 阅读
约1分钟阅读
Gongwei Lee, Ji Liu, Juncheng Jia, Ji Wu
字号:
arXiv:2608.24945v1 发布类型:新 摘要:近年来,大型语言模型(LLM)在多个领域取得了显着的成就,但 LLM 过多的资源需求阻碍了在资源受限设备上的部署。尽管模型量化是一种有效的方法,但传统的量化方法通常会由于统一的位宽或简单的启发式灵敏度评估而导致严重的性能下降。在本文中,我们提出了一种新颖的基于 Fisher 信息的自适应混合精度权重量化方法,即 FAMPWQ,它执行层自适应权重量化,以便在商用 GPU 上进行有效的 LLM 推理。首先,我们提出了一种具有新颖费舍尔信息度量的系统模型,以测量分层对量化的敏感性。其次,我们在 FAMPWQ 中提出了一种基于强化学习的位宽分配器,它生成基于 Fisher 信息敏感度度量的自适应位宽分配策略。对 7 个模型和 5 个基准进行的大量实验表明,FAMPWQ 在 PPL(最多小 3.39)、准确性(最多高 6.87%)和 LLM 作为法官比较(最多 76% 胜率)方面显着优于 7 个基线方法。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱