自用 怕哪天遇到这些问题我忘记了 调试一晚上要崩溃了

问题1:更新cuda驱动的时候发现他的驱动不匹配

(base) *****@*****:/# cat /proc/driver/nvidia/version 
NVRM version: NVIDIA UNIX Open Kernel Module for x86_64 550.120 
Release Build (dvs-builder@U16-I2-C03-38-2) Fri Sep 13 10:19:29 UTC 2024 
GCC version: gcc version 12.3.0 (Ubuntu 12.3.0-1ubuntu1~22.04)

于是重新安装驱动

sudo apt purge nvidia-* libnvidia-*   # 移除所有NVIDIA驱动
sudo apt autoremove                   # 清理依赖

但是突然出现了一个问题,在网上找了很多办法,都没啥用,后面求助ai就好了

正在设置 libc6:amd64 (2.35-0ubuntu3.10) ...
dpkg: 处理软件包 libc6:amd64 (--configure)时出错:
 已安装 libc6:amd64 软件包 post-installation 脚本 子进程返回错误状态 1
dpkg: 依赖关系问题使得 libc-bin 的配置工作不能继续:
 libc-bin 依赖于 libc6 (>> 2.35);然而:
  软件包 libc6:amd64 尚未配置。
 libc-bin 依赖于 libc6 (<< 2.36);然而:
  软件包 libc6:amd64 尚未配置。

dpkg: 处理软件包 libc-bin (--configure)时出错:
 依赖关系问题 - 仍未被配置
因为错误消息指示这是由于上一个问题导致的错误,没有写入 apport 报告。
                                                                    在处理时有错误发生:
 libc6:amd64
 libc-bin
E: Sub-process /usr/bin/dpkg returned an error code (1)

全是错误 干啥都不行

(正在读取数据库 ... 系统当前共安装有 246317 个文件和目录。)
准备解压 .../systemd_249.11-0ubuntu3.16_amd64.deb  ...
正在解压 systemd (249.11-0ubuntu3.16) 并覆盖 (249.11-0ubuntu3.12) ...
dpkg: 处理归档 /var/cache/apt/archives/systemd_249.11-0ubuntu3.16_amd64.deb (--unpack)时出错:
 无法在安装新的版本前,为 ./bin/systemctl 做一个符号链接备份: 不允许的操作
dpkg-deb: 错误: 粘贴 子进程被信号(断开的管道) 终止了
在处理时有错误发生:
 /var/cache/apt/archives/systemd_249.11-0ubuntu3.16_amd64.deb
E: Sub-process /usr/bin/dpkg returned an error code (1)

解决办法:最后通过easybox移除systemctl文件权限  进行强制安装 后面有类似问题也一样 哪个文件夹出问题对哪个文件夹进行操作

#手动绕过损坏的chattr
# 获取静态编译的busybox(不依赖系统库)
wget https://www.busybox.net/downloads/binaries/1.35.0-x86_64-linux-musl/busybox
chmod +x busybox

# 使用busybox移除危险属性
./busybox chattr -ia /bin/systemctl

#强制安装并覆盖锁定文件​
sudo dpkg -i --force-overwrite --force-configure-any /var/cache/apt/archives/systemd_249.11-0ubuntu3.16_amd64.deb

然后更新内核驱动

#清除旧版驱动
# 移除所有550版本残留组件
sudo apt purge *nvidia*550* 

# 清除所有残留配置文件
sudo apt autoremove --purge
sudo apt purge $(dpkg -l | grep '^rc' | awk '{print $2}')



#重建驱动
# 重新安装核心组件
sudo apt install --reinstall \
    nvidia-kernel-source-575 \
    nvidia-dkms-575 \
    nvidia-driver-575

# 重建内核模块
sudo dpkg-reconfigure nvidia-dkms-575
sudo dkms install -m nvidia -v 575.57.08

# 更新启动镜像
sudo update-initramfs -u



# 检查驱动状态
sudo modprobe nvidia
dmesg | grep nvidia  # 应无错误信息

# 必须重启生效!
sudo reboot


#重启后验证
nvidia-smi  # 应显示575.57版本
watch -n 1 nvidia-smi  # 实时监控状态

问题2:执行llmbox项目 运行download.sh发现问题

2025-07-23 06:48:35 (11.4 MB/s) - 已保存 ‘data/raw_train/flanv2/flan_v2_resampled_50k.jsonl’ [123625934/123625934])

Processing...
Traceback (most recent call last):
  File "/work/LLMBox/training/utils/process.py", line 23, in <module>
    content2 = json.load(open(os.path.join(subdir_path, files[1]), "r"))
               ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
  File "/work/anaconda3/lib/python3.12/json/__init__.py", line 293, in load
    return loads(fp.read(),
           ^^^^^^^^^^^^^^^^
  File "/work/anaconda3/lib/python3.12/json/__init__.py", line 346, in loads
    return _default_decoder.decode(s)
           ^^^^^^^^^^^^^^^^^^^^^^^^^^
  File "/work/anaconda3/lib/python3.12/json/decoder.py", line 337, in decode
    obj, end = self.raw_decode(s, idx=_w(s, 0).end())
               ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
  File "/work/anaconda3/lib/python3.12/json/decoder.py", line 353, in raw_decode
    obj, end = self.scan_once(s, idx)
               ^^^^^^^^^^^^^^^^^^^^^^
json.decoder.JSONDecodeError: Invalid \uXXXX escape: line 14713 column 2351 (char 3259711)

解决办法:首先下载的时候断断续续的 需要设立镜像源 可能下不完整 会出现这个问题 可以把下载的文件删掉重新下 这个算是比较简单的了

问题3:ImportError: /work/.conda/envs/llmbox/lib/python3.10/site-packages/torch/lib/libtorch_cuda.so: undefined symbol: ncclCommInitRankScalable

没有适配的nccl包 不管是conda库里还是apt里面的都不行

解决办法:首先查看nccl包

(llmbox) ***@****:/work/LLMBox$ conda list | grep nccl
nccl                      2.21.5.1             ha515578_0  
nvidia-nccl-cu11          2.21.5                   pypi_0    pypi
nvidia-nccl-cu12          2.26.2                   pypi_0    pypi

 ok 都不适配 需要都卸载掉 执行

conda uninstall nccl -y
pip uninstall nvidia-nccl-cu11 nvidia-nccl-cu12 -y

然后直接去官网找适配版本的nccl https://developer.nvidia.com/nccl/nccl-legacy-downloads

以12.8驱动为例:For Ubuntu: sudo apt install libnccl2=2.25.1-1+cuda12.8 libnccl-dev=2.25.1-1+cuda12.8 然后等待安装就好了 

先写到这里 还有很多问题 但是很容易就解决了

Logo

分享最新的 NVIDIA AI Software 资源以及活动/会议信息,精选收录AI相关技术内容,欢迎大家加入社区并参与讨论。

更多推荐