资讯

稳定性翻车!RTX PRO 6000曝Linux驱动Bug:FP32训练频发GPU锁死

驱动之家·2026/9/2 07:00:00🔗 原文

📌 概要

NVIDIA开发者论坛有用户反馈,RTX PRO 6000 Blackwell专业卡在Linux系统下持续AI负载会反复触发Xid-8 RC看门狗错误,导致GPU锁死,595.84与610.43.02两个开源驱动版本均复现。测试平台为Ubuntu 24.04,无论600W还是450W功耗墙均触发,CUDA报launch timed out。

⚡ 关键要点

  • RTX PRO 6000 Blackwell在Linux持续FP32 AI计算负载下反复GPU锁死,抛出Xid-8看门狗错误
  • 595.84和610.43.02两个开源内核驱动版本均可复现,600W/450W功耗设置均触发
  • 关联进程为llama-server或python3,上层应用收到CUDA超时报错
  • 测试平台为Ubuntu 24.04,搭载RTX 4090对照组

快科技9月2日消息,在NVIDIA开发者官方论坛,有用户反馈RTX PRO 6000 Blackwell(GB202,96GB)专业工作站显卡在Linux系统持续AI计算负载下会反复触发Xid-8 RC看门狗报错,GPU出现锁死现象,该问题同时复现于595.84、610.43.02两个开源内核驱动版本。

测试硬件平台为Raptor Lake桌面主机,系统Ubuntu 24.04,内核7.0.0-30-generic,开启Secure Boot,使用Canonical签名的NVIDIA开源GSP内核模块。

测试显卡为RTX PRO 6000 Blackwell,同时主机还搭载一块RTX 4090作为对照组,显卡功耗墙分别测试默认600W以及450W限制,两种功耗设置均会触发故障。

稳定性翻车!RTX PRO 6000曝Linux驱动Bug:FP32训练频发GPU锁死

故障日志特征固定,RC看门狗检测GPU疑似锁死,超时7秒,抛出Xid 8错误,关联进程为llama-server或python3 AI计算进程,上层应用收到CUDA报错:launch timed out and was terminated。

比较幸运的是,该故障无需重启整机,显卡大约15秒就可以自动恢复,没有出现硬件损坏、数据损坏情况。

该故障最早在8月18日开始出现,累计复现13次,主要两类工作负载会触发,一是llama.cpp长上下文多Token推理,启用CUDA Graph。二是PyTorch FP32精度4B/9B大Transformer模型纯Eager模式训练。

在GPU满载持续压测的条件下,大约每20-45分钟就会复现一次,FP32稠密训练是复现概率最高的场景。

稳定性翻车!RTX PRO 6000曝Linux驱动Bug:FP32训练频发GPU锁死

与此同时用户做了大量隔离排查,排除多项诱因:

1、关闭CUDA Graph可以缓解llama.cpp推理场景的报错,但PyTorch训练场景本身没有使用CUDA Graph依旧会锁死,说明CUDA Graph只是放大问题的诱因,并非根源。

2、升级/降级驱动版本:595.84、610.43.02开源驱动,报错特征、故障频率没有变化。

3、ECC纠错全部归零,没有行重映射报错。

4、排除温度因素:故障发生时最高温度仅87℃,甚至从空闲升温到51℃就会触发故障。

5、排除显存不足:故障发生时剩余显存大于55GB。

6、功耗墙无关,450W、600W两种功耗限制均复现。

7、故障具备随机性,相同输入、干净重启后,崩溃发生位置不固定。

对比测试数据显示,同一台主机、完全相同驱动版本,RTX 4090(AD102)跑完全一样的FP32训练任务,连续26912步、合计5.35小时零报错。

而同机的RTX PRO 6000 Blackwell在相近负载下一晚上锁死5次,可以确定问题根源出在GB202这一代GPU上。

稳定性翻车!RTX PRO 6000曝Linux驱动Bug:FP32训练频发GPU锁死

而且补充测试发现,BF16精度27B大模型训练、推理,连续8小时GPU满载没有复现故障。结合现象,该Bug和内核提交密度、单个Kernel执行时长存在关联,FP32高负载更容易触发。

发帖用户向NVIDIA反馈,怀疑是GB202平台GSP-RM内核、通道调度逻辑在高密度Kernel提交下存在已知缺陷,已经抓取故障发生一分钟内的完整nvidia-bug-report日志,可在一小时内稳定复现该问题。