# GPU Monitor & Validator
> Professionelles GPU-Überwachungs- und Validierungstool
Source: https://help.computelabs.ai/de/docs/gpu-monitor
Language: de

> **Neueste Version**: 3.1.9

Der GPU Monitor & Validator ist ein professionelles Tool zur Sicherstellung optimaler Leistung und Gesundheit von NVIDIA- und AMD-GPUs in Produktionsumgebungen.

## Übersicht

Der GPU Monitor & Validator bietet:

- **Multi-Vendor-Unterstützung**: NVIDIA (CUDA) und AMD (ROCm) GPUs
- **Erweiterte Multi-GPU-Unterstützung**: Verbesserte Authentifizierung und Validierung für Systeme mit mehreren GPUs
- Echtzeit-Leistungsüberwachung
- Hardware-Validierung gegen Herstellerspezifikationen
- Umfassendes Benchmarking mit PyTorch-Stresstests
- Automatisierte Anomalieerkennung
- Kontinuierliche Gesundheitsüberwachung
- Erkennung von Leistungsregressionen
- Validierung des Wärmemanagements
- Verifizierung der Speicherintegrität
- Herstellerunabhängige einheitliche Schnittstelle

### Neuerungen in Version 3.1.9

- **Treiberunabhängige Installation**: Das Paket interferiert nicht mehr mit vorhandenen NVIDIA/AMD-Treibern
- **Dynamische PyTorch-Erkennung**: Erkennt automatisch CUDA/ROCm-Versionen und installiert kompatibles PyTorch
- **CUDA 13.0-Unterstützung**: Vollständige Unterstützung für die neuesten NVIDIA-Treiber einschließlich CUDA 13.0
- **Behobene Berechtigungsprobleme**: Behobene venv-Berechtigungsfehler während der Installation
- **Bessere Fehlersichtbarkeit**: Installationsfehler werden jetzt korrekt angezeigt für einfachere Fehlerbehebung

## Systemanforderungen

### Betriebssysteme
- Ubuntu 22.04 LTS (Jammy) oder neuer
- Ubuntu 24.04 LTS (Noble)
- Ubuntu 24.10 (Oracular)
- Debian 11 (Bullseye) oder neuer
- Debian 12 (Bookworm)

### Hardware-Anforderungen
- **NVIDIA GPUs**: Compute Capability 7.0+ (V100, T4, A100, H100, RTX-Serie)
- **AMD GPUs**: ROCm-kompatibel (MI100, MI200, MI300-Serie, Radeon Pro VII, W7900)
- 2MB freier Festplattenspeicher (plus Abhängigkeiten)

### Software-Anforderungen
- Python 3.10 oder neuer
- Internetverbindung für initiale Einrichtung
- **Für NVIDIA**: Beliebige NVIDIA-Treiberversion (Paket ist treiberunabhängig)
- **Für AMD**: Beliebige ROCm-Version (Paket ist treiberunabhängig)
- **Hinweis**: Das Paket wird GPU-Treiber NICHT installieren oder ändern

## Installation

### Option 1: Ubuntu PPA (Empfohlen für Ubuntu)

```bash
# PPA-Repository hinzufügen (nicht-interaktiv)
sudo add-apt-repository ppa:cl-ax/gpu-validator -y
sudo apt update

# GPU Agent installieren (nicht-interaktiv)
sudo apt install cl-gpu-agent -y
```

### Option 2: APT-Repository (Debian/Ubuntu)

```bash
# Repository hinzufügen
echo 'deb [trusted=yes] https://storage.googleapis.com/gpu_validator/apt-repo stable main' | \
  sudo tee /etc/apt/sources.list.d/computelabs-gpu-agent.list

# Paketliste aktualisieren
sudo apt update

# GPU Agent installieren
sudo apt install cl-gpu-agent
```

### Option 3: Manuelle Installation

Für Systeme, die die Anforderungen nicht erfüllen oder eine benutzerdefinierte Konfiguration benötigen:

```bash
# Repository klonen
git clone https://github.com/compute-labs-dev/gpu_validator_monitor.git
cd gpu_validator_monitor

# Installationsskript ausführen
sudo ./scripts/install.sh
```

## Betriebsmodi

Der GPU Validator unterstützt vier primäre Betriebsmodi:

### 1. Validierungsmodus

```bash
cl-gpu-agent --mode validate
```

Führt durch:
- Verifizierung der Hardware-Spezifikationen
- Speicherintegritätstests
- CUDA-Funktionalitätsprüfungen
- Treiberkompatibilitätsvalidierung

### 2. Benchmark-Modus

```bash
cl-gpu-agent --mode benchmark
```

Testet:
- Speicherbandbreite
- CUDA-Core-Leistung
- Tensor-Core-Fähigkeiten
- PCIe-Durchsatz
- Energieeffizienz

### 3. Überwachungsmodus (Standard-Dienst)

```bash
# Überwachungsdienst starten
sudo systemctl start cl-gpu-agent

# Automatischen Start aktivieren
sudo systemctl enable cl-gpu-agent
```

Verfolgt:
- Echtzeit-Temperatur
- Stromverbrauch
- Speichernutzung
- GPU-Auslastung
- Fehlerraten
- Leistungsmetriken

### 4. Erkennungsmodus

```bash
cl-gpu-agent --mode detect
```

Erkennt und zeigt:
- Verfügbare GPUs
- GPU-Modelle und Spezifikationen
- Treiberversionen
- CUDA/ROCm-Fähigkeiten

## Verwendung

### Dienstverwaltung

```bash
# Dienststatus prüfen
sudo systemctl status cl-gpu-agent

# Dienst starten
sudo systemctl start cl-gpu-agent

# Dienst stoppen
sudo systemctl stop cl-gpu-agent

# Automatischen Start aktivieren
sudo systemctl enable cl-gpu-agent

# Echtzeit-Logs anzeigen
journalctl -u cl-gpu-agent -f
```

### Direkte Befehlsverwendung

```bash
# Hilfe und verfügbare Optionen anzeigen
cl-gpu-agent --help

# Umfassende Validierung ausführen
cl-gpu-agent --mode validate

# Leistungs-Benchmark ausführen
cl-gpu-agent --mode benchmark

# Überwachung ausführen (Vordergrund)
cl-gpu-agent --mode monitor
```

## Ergebnisse verstehen

Der Validator liefert drei Schlüsselmetriken:

1. **Validierungsstatus**: PASS/FAIL für Hardware-Spezifikationen
2. **Leistungswerte**: Verglichen mit Referenz-Benchmarks
3. **Gesundheitsindikatoren**: Temperatur-/Leistungstrends

Beispiel für erfolgreiche Ausgabe bei NVIDIA-GPU:
```
GPU 0 (NVIDIA H100 80GB HBM3):
- Validation: PASS
- Memory Bandwidth: 3.1 TB/s
- Temperature: 42°C (Max: 85°C)
- Power Draw: 119W/700W
- CUDA Cores: 100% functional
- Memory Test: PASS
- Driver Status: Optimal
```

## Unterstützte GPU-Modelle

### NVIDIA GPUs
- **Rechenzentrum**: H100, H200
- **RTX 40-Serie**: RTX 4090, 4080
- **RTX 50-Serie**: RTX 5090, 5080

### AMD GPUs
- **Getestet und verifiziert**: MI300X
- Andere ROCm-unterstützte GPUs können funktionieren, sind aber ungetestet

## Fehlerbehebung

### Häufige Probleme

#### Zugriff verweigert während der Installation
Wenn Sie `[Errno 13] Permission denied` während der Installation sehen:

```bash
# Alte Installation entfernen
sudo rm -rf /opt/cl-gpu-agent

# Neu installieren
sudo apt install --reinstall cl-gpu-agent
```

#### NVIDIA-Treiber-Versionskonflikt
Das Paket installiert oder modifiziert ab v3.1.3+ keine GPU-Treiber mehr. Bei Treiberproblemen:

```bash
# Aktuellen Treiber prüfen
nvidia-smi

# Das Paket erkennt und verwendet Ihren vorhandenen Treiber
# Es werden keine Treiberänderungen vorgenommen
```

#### CUDA 13.0 oder neuer Unterstützung
Wenn Sie CUDA 13.0 oder neuer haben (wie Treiber 580.x):
- Das Paket erkennt dies automatisch
- PyTorch wird mit CUDA 12.4-Unterstützung installiert (abwärtskompatibel)
- Ihre CUDA 13.0-Treiber funktionieren perfekt mit PyTorch cu124

#### Paketversion wird nicht aktualisiert
Wenn apt die neueste Version nicht erhält:

```bash
# Cache leeren und Update erzwingen
sudo apt clean
sudo apt update

# Verfügbare Versionen prüfen
apt policy cl-gpu-agent

# Neuinstallation erzwingen
sudo apt install --reinstall cl-gpu-agent
```
