Compute Labs Logo

GPU 监控与验证器

专业级 GPU 监控和验证工具

GPU 监控与验证器

最新版本:3.1.9

GPU 监控与验证器是一款专业级工具,用于确保生产环境中 NVIDIA 和 AMD GPU 的最佳性能和健康状况。

概述

GPU 监控与验证器提供:

  • 多供应商支持:NVIDIA(CUDA)和 AMD(ROCm)GPU
  • 增强的多 GPU 支持:改进了具有多个 GPU 的系统的身份验证和验证
  • 实时性能监控
  • 根据制造商规格进行硬件验证
  • 使用 PyTorch 压力测试进行全面基准测试
  • 自动异常检测
  • 持续健康监控
  • 性能回归检测
  • 热管理验证
  • 内存完整性验证
  • 供应商无关的统一接口

版本 3.1.9 的新功能

  • 驱动程序无关安装:软件包不再干扰现有的 NVIDIA/AMD 驱动程序
  • 动态 PyTorch 检测:自动检测 CUDA/ROCm 版本并安装兼容的 PyTorch
  • CUDA 13.0 支持:完全支持包括 CUDA 13.0 在内的最新 NVIDIA 驱动程序
  • 修复权限问题:解决了安装期间的 venv 权限错误
  • 更好的错误可见性:安装错误现在可以正确显示,便于故障排除

系统要求

操作系统

  • Ubuntu 22.04 LTS (Jammy) 或更新版本
  • Ubuntu 24.04 LTS (Noble)
  • Ubuntu 24.10 (Oracular)
  • Debian 11 (Bullseye) 或更新版本
  • Debian 12 (Bookworm)

硬件要求

  • NVIDIA GPU:计算能力 7.0+(V100、T4、A100、H100、RTX 系列)
  • AMD GPU:ROCm 兼容(MI100、MI200、MI300 系列、Radeon Pro VII、W7900)
  • 2MB 可用磁盘空间(加上依赖项)

软件要求

  • Python 3.10 或更新版本
  • 初始设置需要互联网连接
  • 对于 NVIDIA:任何 NVIDIA 驱动程序版本(软件包与驱动程序无关)
  • 对于 AMD:任何 ROCm 版本(软件包与驱动程序无关)
  • 注意:该软件包不会安装或修改 GPU 驱动程序

安装

选项 1:Ubuntu PPA(推荐用于 Ubuntu)

# 添加 PPA 仓库(非交互式)
sudo add-apt-repository ppa:cl-ax/gpu-validator -y
sudo apt update

# 安装 GPU 代理(非交互式)
sudo apt install cl-gpu-agent -y

选项 2:APT 仓库(Debian/Ubuntu)

# 添加仓库
echo 'deb [trusted=yes] https://storage.googleapis.com/gpu_validator/apt-repo stable main' | \
  sudo tee /etc/apt/sources.list.d/computelabs-gpu-agent.list

# 更新软件包列表
sudo apt update

# 安装 GPU 代理
sudo apt install cl-gpu-agent

选项 3:手动安装

对于不满足要求或需要自定义配置的系统:

# 克隆仓库
git clone https://github.com/compute-labs-dev/gpu_validator_monitor.git
cd gpu_validator_monitor

# 运行安装脚本
sudo ./scripts/install.sh

操作模式

GPU 验证器支持四种主要操作模式:

1. 验证模式

cl-gpu-agent --mode validate

执行:

  • 硬件规格验证
  • 内存完整性测试
  • CUDA 功能检查
  • 驱动程序兼容性验证

2. 基准测试模式

cl-gpu-agent --mode benchmark

测试:

  • 内存带宽
  • CUDA 核心性能
  • Tensor 核心能力
  • PCIe 吞吐量
  • 功率效率

3. 监控模式(默认服务)

# 启动监控服务
sudo systemctl start cl-gpu-agent

# 启用自动启动
sudo systemctl enable cl-gpu-agent

跟踪:

  • 实时温度
  • 功耗
  • 内存使用
  • GPU 利用率
  • 错误率
  • 性能指标

4. 检测模式

cl-gpu-agent --mode detect

检测并显示:

  • 可用 GPU
  • GPU 型号和规格
  • 驱动程序版本
  • CUDA/ROCm 能力

使用方法

服务管理

# 检查服务状态
sudo systemctl status cl-gpu-agent

# 启动服务
sudo systemctl start cl-gpu-agent

# 停止服务
sudo systemctl stop cl-gpu-agent

# 启用自动启动
sudo systemctl enable cl-gpu-agent

# 查看实时日志
journalctl -u cl-gpu-agent -f

直接命令使用

# 显示帮助和可用选项
cl-gpu-agent --help

# 运行全面验证
cl-gpu-agent --mode validate

# 运行性能基准测试
cl-gpu-agent --mode benchmark

# 运行监控(前台)
cl-gpu-agent --mode monitor

理解结果

验证器提供三个关键指标:

  1. 验证状态:硬件规格的 PASS/FAIL
  2. 性能分数:与参考基准测试的比较
  3. 健康指标:温度/功率趋势

NVIDIA GPU 成功输出示例:

GPU 0 (NVIDIA H100 80GB HBM3):
- Validation: PASS
- Memory Bandwidth: 3.1 TB/s
- Temperature: 42°C (Max: 85°C)
- Power Draw: 119W/700W
- CUDA Cores: 100% functional
- Memory Test: PASS
- Driver Status: Optimal

支持的 GPU 型号

NVIDIA GPU

  • 数据中心:H100、H200
  • RTX 40 系列:RTX 4090、4080
  • RTX 50 系列:RTX 5090、5080

AMD GPU

  • 已测试和验证:MI300X
  • 其他 ROCm 支持的 GPU 可能可以工作但未经测试

故障排除

常见问题

安装期间权限被拒绝

如果在安装期间看到 [Errno 13] Permission denied

# 删除旧安装
sudo rm -rf /opt/cl-gpu-agent

# 重新安装
sudo apt install --reinstall cl-gpu-agent

NVIDIA 驱动程序版本不匹配

从 v3.1.3+ 开始,该软件包不再安装或修改 GPU 驱动程序。如果您遇到驱动程序问题:

# 检查您当前的驱动程序
nvidia-smi

# 软件包将检测并使用您现有的驱动程序
# 不会进行驱动程序更改

CUDA 13.0 或更新版本支持

如果您有 CUDA 13.0 或更新版本(如驱动程序 580.x):

  • 软件包将自动检测此情况
  • PyTorch 将安装 CUDA 12.4 支持(向后兼容)
  • 您的 CUDA 13.0 驱动程序将与 PyTorch cu124 完美配合

软件包版本未更新

如果 apt 未获取最新版本:

# 清除缓存并强制更新
sudo apt clean
sudo apt update

# 检查可用版本
apt policy cl-gpu-agent

# 强制重新安装
sudo apt install --reinstall cl-gpu-agent

How is this guide?