数码硬件
morning
稳定性翻车!RTX PRO 6000曝Linux驱动Bug:FP32频训练发GPU锁死
2026-09-02
1 阅读
约4分钟阅读
青山
字号:
快科技9月2日消息, 在NVIDIA开发者官方论坛,有用户反馈RTX PRO 6000 Blackwell(GB202,96GB)专业工作站显卡在Linux系统持续AI计算负载下会反复触发Xid-8 RC看门狗报错,GPU出现锁死现象,该问题同时复现于595.84、610.43.02两个开源内核驱动版本。 测试硬件平台为Raptor Lake桌面主机,系统Ubuntu 24.04,内核7.0.0-30-generic,开启Secure Boot,使用Canonical签名的NVIDIA开源GSP内核模块。 测试显卡为RTX PRO 6000 Blackwell,同时主机还搭载一块RTX 4090作为对照组,显卡功耗墙分别测试默认600W以及450W限制,两种功耗设置均会触发故障。 故障日志特征固定, RC看门狗检测GPU疑似锁死,超时7秒,抛出Xid 8错误,关联进程为llama-server或python3 AI计算进程,上层应用收到CUDA报错:launch timed out and was terminated。 比较幸运的是,该故障无需重启整机,显卡大约15秒就可以自动恢复,没有出现硬件损坏、数据损坏情况。 该故障最早在8月18日开始出现,累计复现13次, 主要两类工作负载会触发,一是llama.cpp长上下文多Token推理,启用CUDA Graph。二是PyTorch FP32精度4B/9B大Transformer模型纯Eager模式训练。 在GPU满载持续压测的条件下,大约每20-45分钟就会复现一次,FP32稠密训练是复现概率最高的场景。 与此同时用户做了大量隔离排查,排除多项诱因: 1、关闭CUDA Graph可以缓解llama.cpp推理场景的报错,但PyTorch训练场景本身没有使用CUDA Graph依旧会锁死,说明CUDA Graph只是放大问题的诱因,并非根源。 2、升级/降级驱动版本:595.84、610.43.02开源驱动,报错特征、故障频率没有变化。 3、ECC纠错全部归零,没有行重映射报错。 4、排除温度因素:故障发生时最高温度仅87℃,甚至从空闲升温到51℃就会触发故障。 5、排除显存不足:故障发生时剩余显存大于55GB。 6、功耗墙无关,450W、600W两种功耗限制均复现。 7、故障具备随机性,相同输入、干净重启后,崩溃发生位置不固定。 对比测试数据显示,同一台主机、完全相同驱动版本,RTX 4090(AD102)跑完全一样的FP32训练任务,连续26912步、合计5.35小时零报错。 而同机的RTX PRO 6000 Blackwell在相近负载下一晚上锁死5次,可以确定问题根源出在GB202这一代GPU上。 而且补充测试发现,BF16精度27B大模型训练、推理,连续8小时GPU满载没有复现故障。结合现象,该Bug和内核提交密度、单个Kernel执行时长存在关联,FP32高负载更容易触发。 发帖用户向NVIDIA反馈,怀疑是GB202平台GSP-RM内核、通道调度逻辑在高密度Kernel提交下存在已知缺陷,已经抓取故障发生一分钟内的完整nvidia-bug-report日志,可在一小时内稳定复现该问题。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱