[Problem feedback] [Deepin 25] i7-14700核显i915HANG 后 GuC 引擎重置失败导致卡死
Tofloor
poster avatar
coldlook
deepin
4 hours ago
Author

环境信息

项目 内容
系统 Deepin 25(crimson),内核 6.6.143-amd64-desktop-hwe
CPU Intel i7-14700(Raptor Lake-S)
显卡 核显 UHD Graphics 770,i915 驱动(modesetting + X11/kwin_x11)
内存 32GB
机型 Dell 台式机

问题现象

系统连续运行 6 天 20 小时后,于 8月28日 14:11 左右整机卡死(画面冻结、无响应),只能长按电源键强制重启。重启后功能正常。

故障时间线(journalctl)

14:10:59  kwin_x11 报 XCB BadDamage / BadWindow 错误
14:11:20  内核报 GPU HANG(见下方内核日志),GuC 引擎重置失败、
          整芯片重置失败、rcs0 reset request 超时
14:11:20  Xorg 与应用上下文被强制重置;Edge GPU 进程两次崩溃:
          "SharedContextState context lost via EXT_robustness"
          "GPU process exited unexpectedly"
14:11:30  kwin_x11 提交的显示更新持续超时:
          "Asynchronous wait on fence ... (hint:intel_atomic_commit_ready)"
14:15:35  全系统日志中断,之后彻底无响应直至强制重启

另外背景信息:卡死前几天,用户态每天有 20~40 次 Edge/Electron 应用 GPU 进程崩溃(无内核 reset 记录伴随),图形栈整体不太稳定。

内核日志(关键证据,journalctl -b -1 -k)

8月 28 14:11:20 deepin kernel: i915 0000:00:02.0: [drm] *ERROR* GT0: GUC: Engine reset failed on 0:0 (rcs0) because 0x00000000
8月 28 14:11:20 deepin kernel: i915 0000:00:02.0: [drm] GPU HANG: ecode 12:1:84dffffb, in eadedCompositor [3376853]
8月 28 14:11:20 deepin kernel: i915 0000:00:02.0: [drm] GT0: Resetting chip for GuC failed to reset engine mask=0x1
8月 28 14:11:20 deepin kernel: i915 0000:00:02.0: [drm] *ERROR* GT0: rcs0 reset request timed out: {request: 00000001, RESET_CTL: 00000001}
8月 28 14:11:20 deepin kernel: i915 0000:00:02.0: [drm] *ERROR* GT0: rcs0 reset request timed out: {request: 00000001, RESET_CTL: 00000001}
8月 28 14:11:20 deepin kernel: i915 0000:00:02.0: [drm] Xorg[4383] context reset due to GPU hang
8月 28 14:11:20 deepin kernel: i915 0000:00:02.0: [drm] eadedCompositor[3376853 context reset due to GPU hang
8月 28 14:11:20 deepin kernel: i915 0000:00:02.0: [drm] GT0: GuC firmware i915/tgl_guc_70.bin version 70.36.0
8月 28 14:11:20 deepin kernel: i915 0000:00:02.0: [drm] GT0: HuC firmware i915/tgl_huc.bin version 7.9.3
8月 28 14:11:20 deepin kernel: i915 0000:00:02.0: [drm] GT0: GUC: submission enabled / SLPC enabled
8月 28 14:11:30 deepin kernel: Asynchronous wait on fence 0000:00:02.0:kwin_x11[6072]:c4708a timed out (hint:intel_atomic_commit_ready [i915])

开机时 GuC/HuC 正常加载(i915/tgl_guc_70.bin v70.36.0,submission enabled)。

AI的分析

  1. rcs0 渲染引擎挂起后,GuC 引擎级重置和整芯片重置全部失败,rcs0 重置请求超时说明 GPU 硬件已无响应;
  2. 重置后 kwin 的显示提交(atomic commit)持续超时,图形管线死锁,最终整机冻结、日志中断;
  3. 已排除 OOM(无 oom-killer 记录)、磁盘错误、应用 coredump;
  4. 此前 6.8 天内内核层无其他 GPU HANG 记录,这是首次且致命的一次。

想请教/求助

  1. 6.6.143 内核上这个 "GuC failed to reset engine" 的 RPL-S 核显问题是否已知?后续内核版本是否合入了相关修复?
  2. 是否建议我尝试 i915.enable_guc=0 回退 execlist 模式来提高重置成功率?
  3. 如果需要更完整的日志(error_state 等)我可以补充。
Reply Favorite View the author
All Replies
avatar
deepin流云
Super Moderator
Community OP
3 hours ago
#1

内核研发建议用6.18内核并同步更新mesa试试,14代U比较新建议用6.18能更好的发挥性能:

sudo apt install linux-headers-deepin-amd64 linux-image-deepin-amd64

更新引导并重启sudo update-grub

sudo reboot

装完之后在启动后的grub界面高级里面切换内核

换完6.18后升级mesa,见官网安装指南3.6部分:https://www.deepin.org/zh/deepin-25-installation/

Reply View the author
avatar
coldlook
deepin
3 hours ago
#2
deepin流云

内核研发建议用6.18内核并同步更新mesa试试,14代U比较新建议用6.18能更好的发挥性能:

sudo apt install linux-headers-deepin-amd64 linux-image-deepin-amd64

更新引导并重启sudo update-grub

sudo reboot

装完之后在启动后的grub界面高级里面切换内核

换完6.18后升级mesa,见官网安装指南3.6部分:https://www.deepin.org/zh/deepin-25-installation/

感谢, 我升下内核试试

Reply View the author