# GPU 监控与验证器
> 专业级 GPU 监控和验证工具
Source: https://help.computelabs.ai/zh/docs/gpu-monitor
Language: zh

> **最新版本**：3.1.9

GPU 监控与验证器是一款专业级工具，用于确保生产环境中 NVIDIA 和 AMD GPU 的最佳性能和健康状况。

## 概述

GPU 监控与验证器提供：

- **多供应商支持**：NVIDIA（CUDA）和 AMD（ROCm）GPU
- **增强的多 GPU 支持**：改进了具有多个 GPU 的系统的身份验证和验证
- 实时性能监控
- 根据制造商规格进行硬件验证
- 使用 PyTorch 压力测试进行全面基准测试
- 自动异常检测
- 持续健康监控
- 性能回归检测
- 热管理验证
- 内存完整性验证
- 供应商无关的统一接口

### 版本 3.1.9 的新功能

- **驱动程序无关安装**：软件包不再干扰现有的 NVIDIA/AMD 驱动程序
- **动态 PyTorch 检测**：自动检测 CUDA/ROCm 版本并安装兼容的 PyTorch
- **CUDA 13.0 支持**：完全支持包括 CUDA 13.0 在内的最新 NVIDIA 驱动程序
- **修复权限问题**：解决了安装期间的 venv 权限错误
- **更好的错误可见性**：安装错误现在可以正确显示，便于故障排除

## 系统要求

### 操作系统
- Ubuntu 22.04 LTS (Jammy) 或更新版本
- Ubuntu 24.04 LTS (Noble)
- Ubuntu 24.10 (Oracular)
- Debian 11 (Bullseye) 或更新版本
- Debian 12 (Bookworm)

### 硬件要求
- **NVIDIA GPU**：计算能力 7.0+（V100、T4、A100、H100、RTX 系列）
- **AMD GPU**：ROCm 兼容（MI100、MI200、MI300 系列、Radeon Pro VII、W7900）
- 2MB 可用磁盘空间（加上依赖项）

### 软件要求
- Python 3.10 或更新版本
- 初始设置需要互联网连接
- **对于 NVIDIA**：任何 NVIDIA 驱动程序版本（软件包与驱动程序无关）
- **对于 AMD**：任何 ROCm 版本（软件包与驱动程序无关）
- **注意**：该软件包不会安装或修改 GPU 驱动程序

## 安装

### 选项 1：Ubuntu PPA（推荐用于 Ubuntu）

```bash
# 添加 PPA 仓库（非交互式）
sudo add-apt-repository ppa:cl-ax/gpu-validator -y
sudo apt update

# 安装 GPU 代理（非交互式）
sudo apt install cl-gpu-agent -y
```

### 选项 2：APT 仓库（Debian/Ubuntu）

```bash
# 添加仓库
echo 'deb [trusted=yes] https://storage.googleapis.com/gpu_validator/apt-repo stable main' | \
  sudo tee /etc/apt/sources.list.d/computelabs-gpu-agent.list

# 更新软件包列表
sudo apt update

# 安装 GPU 代理
sudo apt install cl-gpu-agent
```

### 选项 3：手动安装

对于不满足要求或需要自定义配置的系统：

```bash
# 克隆仓库
git clone https://github.com/compute-labs-dev/gpu_validator_monitor.git
cd gpu_validator_monitor

# 运行安装脚本
sudo ./scripts/install.sh
```

## 操作模式

GPU 验证器支持四种主要操作模式：

### 1. 验证模式

```bash
cl-gpu-agent --mode validate
```

执行：
- 硬件规格验证
- 内存完整性测试
- CUDA 功能检查
- 驱动程序兼容性验证

### 2. 基准测试模式

```bash
cl-gpu-agent --mode benchmark
```

测试：
- 内存带宽
- CUDA 核心性能
- Tensor 核心能力
- PCIe 吞吐量
- 功率效率

### 3. 监控模式（默认服务）

```bash
# 启动监控服务
sudo systemctl start cl-gpu-agent

# 启用自动启动
sudo systemctl enable cl-gpu-agent
```

跟踪：
- 实时温度
- 功耗
- 内存使用
- GPU 利用率
- 错误率
- 性能指标

### 4. 检测模式

```bash
cl-gpu-agent --mode detect
```

检测并显示：
- 可用 GPU
- GPU 型号和规格
- 驱动程序版本
- CUDA/ROCm 能力

## 使用方法

### 服务管理

```bash
# 检查服务状态
sudo systemctl status cl-gpu-agent

# 启动服务
sudo systemctl start cl-gpu-agent

# 停止服务
sudo systemctl stop cl-gpu-agent

# 启用自动启动
sudo systemctl enable cl-gpu-agent

# 查看实时日志
journalctl -u cl-gpu-agent -f
```

### 直接命令使用

```bash
# 显示帮助和可用选项
cl-gpu-agent --help

# 运行全面验证
cl-gpu-agent --mode validate

# 运行性能基准测试
cl-gpu-agent --mode benchmark

# 运行监控（前台）
cl-gpu-agent --mode monitor
```

## 理解结果

验证器提供三个关键指标：

1. **验证状态**：硬件规格的 PASS/FAIL
2. **性能分数**：与参考基准测试的比较
3. **健康指标**：温度/功率趋势

NVIDIA GPU 成功输出示例：
```
GPU 0 (NVIDIA H100 80GB HBM3):
- Validation: PASS
- Memory Bandwidth: 3.1 TB/s
- Temperature: 42°C (Max: 85°C)
- Power Draw: 119W/700W
- CUDA Cores: 100% functional
- Memory Test: PASS
- Driver Status: Optimal
```

## 支持的 GPU 型号

### NVIDIA GPU
- **数据中心**：H100、H200
- **RTX 40 系列**：RTX 4090、4080
- **RTX 50 系列**：RTX 5090、5080

### AMD GPU
- **已测试和验证**：MI300X
- 其他 ROCm 支持的 GPU 可能可以工作但未经测试

## 故障排除

### 常见问题

#### 安装期间权限被拒绝
如果在安装期间看到 `[Errno 13] Permission denied`：

```bash
# 删除旧安装
sudo rm -rf /opt/cl-gpu-agent

# 重新安装
sudo apt install --reinstall cl-gpu-agent
```

#### NVIDIA 驱动程序版本不匹配
从 v3.1.3+ 开始，该软件包不再安装或修改 GPU 驱动程序。如果您遇到驱动程序问题：

```bash
# 检查您当前的驱动程序
nvidia-smi

# 软件包将检测并使用您现有的驱动程序
# 不会进行驱动程序更改
```

#### CUDA 13.0 或更新版本支持
如果您有 CUDA 13.0 或更新版本（如驱动程序 580.x）：
- 软件包将自动检测此情况
- PyTorch 将安装 CUDA 12.4 支持（向后兼容）
- 您的 CUDA 13.0 驱动程序将与 PyTorch cu124 完美配合

#### 软件包版本未更新
如果 apt 未获取最新版本：

```bash
# 清除缓存并强制更新
sudo apt clean
sudo apt update

# 检查可用版本
apt policy cl-gpu-agent

# 强制重新安装
sudo apt install --reinstall cl-gpu-agent
```
