开发者生态
morning
AMD 矩阵核心的精确模型
摘要
[Submitted on 13 Sep 2026 ( v1 ), last revised 15 Sep 2026 (this version, v2)] Title: Accurate Models of AMD Matrix Cores View a PDF of the paper titled Accurate Models of AMD Matrix Cores, by Faizan ...
the
and
for
multipliers
matrix
numerical
test
AMD
Matrix
not
2026-09-17
1 阅读
约2分钟阅读
matt_d
字号:
[提交于 2026 年 9 月 13 日 ( v1 ),最后修订日期为 2026 年 9 月 15 日(本版本,v2)] 标题:AMD 矩阵核心的精确模型 查看由 Faizan A Khattak 和 Mantas Mikaitis 以及 Carlo J. Graziani 撰写的标题为 AMD 矩阵核心的精确模型的论文的 PDF 文件 查看 PDF HTML(实验性) 摘要:最新 GPU 上可用的矩阵乘法器不支持符合IEEE 754浮点标准。矩阵乘法器的特性因供应商和同一供应商的架构而异,例如累加器宽度、舍入行为、归一化点、中间下溢和溢出逻辑、次正规数的处理以及特殊输入的处理。因此,跨设备的小矩阵乘法器结果的再现性是不可能的,并且无法通过软件控制来实现。矩阵乘法器的实现细节没有记录,因此很难解释计算结果中的差异。我们分别使用 MI100、MI210/250 和 MI300A/300X GPU 描述了三种 AMD GPU 架构(CDNA 1、CDNA 2 和 CDNA 3)中矩阵乘法器的数值行为。我们设计测试向量以针对所有支持的输入格式的数字特征,并提供推导和推理,说明为什么每个向量允许根据设备的输出确定特定的数字特征。然后针对每种架构开发基于 MATLAB 的矩阵乘法器软件模型,并使用由 1000 万组随机输入向量组成的随机测试套件验证硬件的位级再现性。为了实现这一目标,我们应用了之前开发的技术,通过随机测试和测试细化,在循环中迭代地细化模型的准确性,直到模型与每个测试用例的硬件相匹配。最后,作为可以使用这些模型进行实验研究的概念证明,我们在两个演示性数值应用中使用了它们,量化了 AMD 矩阵核心和 NVIDIA 张量核心之间的应用级精度差异。提交历史来自: Faizan Ahmad Khattak [ 查看电子邮件 ] [v1] 2026 年 9 月 13 日星期日 23:34:01 UTC (1,297 KB) [v2] 2026 年 9 月 15 日星期二 10:33:08 UTC (1,297 KB)
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱