ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Ubuntu 24.04 双系统 GPU 环境搭建:Nvidia 驱动、CUDA 与 cuDNN 全链路指南

Ubuntu 24.04 双系统 GPU 环境搭建:Nvidia 驱动、CUDA 与 cuDNN 全链路指南 简介这份PDF资料面向需要在Windows 11基础上搭建Ubuntu 24.04双系统的开发者与深度学习入门者重点解决从系统安装到GPU开发环境配置的完整链路问题。内容覆盖Ubuntu 24.04安装、Nvidia驱动、CUDA、cuDNN、Anaconda、Python虚拟环境以及VS Code与PyCharm专业版等环节并附有新手可参考的延伸链接方便不同经验层级的读者按需取用。资源包共1个PDF文件大小约1.74MB以图文步骤形式呈现便于对照操作与快速检索。目前已有17606人学习下载说明该流程在社区中具有较高的实用参考价值。读者可借此获得一套经过实测的安装顺序与配置思路减少驱动与CUDA版本匹配、环境变量设置等常见环节的试错成本适合希望快速完成双系统与深度学习环境部署的技术人员。1. 双系统不是终点而是把 Windows 11 和 Ubuntu 24.04 的算力接上 GPU 的起点很多人装完 Windows 11 Ubuntu 24.04 双系统后卡在第一步Ubuntu 里nvidia-smi报command not found或者装完驱动重启直接黑屏。问题不在 Ubuntu 24.04 本身而在于它默认启用了开源的 nouveau 驱动和 Nvidia 官方驱动冲突。这篇内容面向需要在 Ubuntu 24.04 上跑深度学习、CUDA 编译、cuDNN 推理的开发者从分区、驱动、CUDA 到 cuDNN 一条链路走通。Windows 11 那边只需要负责分区和引导真正吃 GPU 的活在 Ubuntu 24.04 里干。下面按「装系统 → 装驱动 → 装 CUDA → 装 cuDNN → 验证与排错」的顺序展开每一步都给可复制的命令和参数说明。2. Ubuntu 24.04 安装与 Windows 11 双系统分区实操2.1 安装介质制作与 BIOS 关键设置Ubuntu 24.04 LTS 桌面版镜像建议从官方渠道获取用 Rufus 或 balenaEtcher 写入 U 盘。Windows 11 下用 Rufus 时分区类型选 GPT目标系统选 UEFI文件系统 FAT32。写入完成后重启进 BIOS需要确认三件事Secure Boot 关闭或设为 Other OS、SATA 模式为 AHCI、启动顺序里 U 盘优先。提示Windows 11 的快速启动Fast Startup会锁住 NTFS 分区安装 Ubuntu 前在「控制面板 → 电源选项 → 选择电源按钮的功能」里取消勾选「启用快速启动」否则 Ubuntu 安装器可能看不到 Windows 分区。2.2 分区方案与安装类型选择在 Windows 11 的「磁盘管理」里压缩出一个未分配空间建议至少 100GB。安装 Ubuntu 24.04 时选择「其他选项」手动分区常见做法是挂载点建议大小文件系统说明/boot/efi512MBFAT32与 Windows 共用已有 EFI 分区即可不要新建/60GBext4系统和软件/home剩余空间ext4数据和 conda 环境swap16GBswap内存 32GB 以下建议保留如果已有 Windows 的 EFI 分区直接挂载到/boot/efi不要格式化。安装器会识别 Windows Boot Manager 并写入 GRUB重启后出现系统选择菜单。2.3 首次进入 Ubuntu 24.04 的必做配置进入系统后先换源再更新否则后续装驱动会卡在下载。编辑/etc/apt/sources.list.d/ubuntu.sources把archive.ubuntu.com替换为国内镜像地址然后执行sudo apt update sudo apt upgrade -y sudo apt install -y build-essential linux-headers-$(uname -r) dkmslinux-headers-$(uname -r)是编译 Nvidia 内核模块的前提dkms负责在内核升级后自动重编驱动。这两步不做后面装驱动大概率报Unable to find the kernel source tree。3. Nvidia 驱动安装从 nouveau 屏蔽到 nvidia-smi 出结果3.1 先屏蔽 nouveau再谈装驱动Ubuntu 24.04 默认加载 nouveau直接装 Nvidia 驱动会冲突。先创建屏蔽文件sudo tee /etc/modprobe.d/blacklist-nouveau.conf EOF blacklist nouveau options nouveau modeset0 EOF sudo update-initramfs -u sudo reboot重启后执行lsmod | grep nouveau没有任何输出说明屏蔽成功。这一步是后面所有操作的地基跳过它就会出现「装完驱动重启黑屏」的经典问题。3.2 用 ubuntu-drivers 自动选版本Ubuntu 24.04 自带ubuntu-drivers工具能根据显卡型号推荐驱动版本sudo apt install -y ubuntu-drivers-common ubuntu-drivers devices输出里带recommended的那一行就是推荐版本比如 RTX 4060 笔记本常见推荐nvidia-driver-550。直接安装sudo ubuntu-drivers autoinstall sudo reboot重启后运行nvidia-smi能看到显卡型号、驱动版本、CUDA Version 就说明驱动层通了。注意这里的 CUDA Version 是驱动支持的最高 CUDA 版本不是你已安装的 CUDA 版本。3.3 手动安装 runfile 的适用场景与坑有些场景必须用官方.run文件比如需要特定旧版本驱动、或ubuntu-drivers推荐版本不满足要求。手动安装前必须停掉图形界面sudo systemctl isolate multi-user.target sudo sh NVIDIA-Linux-x86_64-*.run --dkms --no-opengl-files--dkms让驱动随内核升级自动重编--no-opengl-files避免覆盖系统 OpenGL 库导致桌面起不来。安装过程中如果提示是否更新 X 配置选否。装完sudo systemctl set-default graphical.target再重启。注意手动 runfile 安装后apt upgrade升级内核可能导致驱动失效需要重新运行安装文件。生产环境更推荐ubuntu-drivers或apt方式。4. CUDA 与 cuDNN 安装版本匹配是唯一真理4.1 先查驱动支持的 CUDA 上限nvidia-smi右上角的 CUDA Version 是驱动能支持的最高版本。比如显示 12.4那你可以装 CUDA 12.4 及以下装 12.6 会报CUDA driver version is insufficient。查完再决定装哪个版本不要盲目追新。4.2 用官方仓库装 CUDA Toolkit以 CUDA 12.4 为例先下载并安装 keyring 和仓库配置wget https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2404/x86_64/cuda-keyring_1.1-1_all.deb sudo dpkg -i cuda-keyring_1.1-1_all.deb sudo apt update sudo apt install -y cuda-toolkit-12-4装完配置环境变量编辑~/.bashrc追加export PATH/usr/local/cuda-12.4/bin:$PATH export LD_LIBRARY_PATH/usr/local/cuda-12.4/lib64:$LD_LIBRARY_PATHsource ~/.bashrc后执行nvcc -V输出release 12.4即成功。PATH决定nvcc命令能否找到LD_LIBRARY_PATH决定运行时能否加载libcudart.so两个都不能少。4.3 cuDNN 安装与版本对应关系cuDNN 必须和 CUDA 版本严格对应。CUDA 12.4 对应 cuDNN 9.x。用 apt 安装最省事sudo apt install -y cudnn9-cuda-12如果下载的是 tar 包解压后手动拷贝tar -xvf cudnn-linux-x86_64-9.x.x.x_cuda12-archive.tar.xz sudo cp cudnn-*-archive/include/cudnn*.h /usr/local/cuda-12.4/include/ sudo cp cudnn-*-archive/lib/libcudnn* /usr/local/cuda-12.4/lib64/ sudo chmod ar /usr/local/cuda-12.4/include/cudnn*.h /usr/local/cuda-12.4/lib64/libcudnn*验证 cuDNN 版本cat /usr/local/cuda-12.4/include/cudnn_version.h | grep CUDNN_MAJOR -A 2提示热词里常出现的「cudnn 和 cuda13.0」这类组合务必先确认驱动是否支持 CUDA 13。驱动版本不够时降 CUDA 比升驱动更稳妥。4.4 conda 环境下的 CUDA 与系统 CUDA 共存很多人用 conda 装 PyTorch 时会自带一份 CUDA runtime和系统 CUDA 并存。原则是系统 CUDA 负责nvcc编译conda 里的cudatoolkit负责运行时。用conda install pytorch pytorch-cuda12.4 -c pytorch -c nvidia时conda 会拉取匹配的 runtime不需要和系统版本完全一致但大版本要对齐。5. 验证、排错与多版本 CUDA 切换技巧5.1 三层验证驱动、CUDA、cuDNN装完不要只看nvidia-smi。按下面三层依次验证# 第一层驱动 nvidia-smi # 第二层CUDA 编译器 nvcc -V # 第三层cuDNN 运行时 python -c import torch; print(torch.cuda.is_available(), torch.backends.cudnn.version())torch.cuda.is_available()返回True且 cuDNN 版本号非空才算整条链路打通。如果nvidia-smi正常但 PyTorch 报False多半是 conda 里的 CUDA runtime 和驱动不匹配。5.2 常见报错对照表报错信息原因处理command not found: nvidia-smi驱动未装或 nouveau 未屏蔽回第 3 章重装重启后黑屏nouveau 冲突或 OpenGL 被覆盖进 recovery 模式卸载重装CUDA driver version is insufficientCUDA 版本高于驱动支持降 CUDA 或升驱动libcudnn.so not foundLD_LIBRARY_PATH 未配检查环境变量gzip: stdin: invalid compressed data下载包损坏重新下载并校验 md55.3 多版本 CUDA 切换的软链接方案同时装 CUDA 11.8 和 12.4 时用软链接切换默认版本sudo rm -rf /usr/local/cuda sudo ln -s /usr/local/cuda-12.4 /usr/local/cuda需要切回 11.8 时把链接指向cuda-11.8再更新~/.bashrc里的PATH和LD_LIBRARY_PATH。这样不同项目可以按需切换不用反复卸载重装。切换后记得source ~/.bashrc并重新验证nvcc -V。5.4 内核升级后驱动失效的预防Ubuntu 24.04 的apt upgrade可能升级内核导致 Nvidia 模块加载失败。用 DKMS 安装的驱动会自动重编但手动 runfile 安装的不会。预防办法是锁定内核版本sudo apt-mark hold linux-image-$(uname -r) linux-headers-$(uname -r)需要升级内核时先unhold升级后重新装驱动再hold。这个习惯能省掉很多「昨天还好好的今天开机黑屏」的排查时间。本文还有配套的精品资源点击获取
返回列表