Compute Labs Logo

GPU Monitor & Validator

Professionelles GPU-Überwachungs- und Validierungstool

GPU Monitor & Validator

Neueste Version: 3.1.9

Der GPU Monitor & Validator ist ein professionelles Tool zur Sicherstellung optimaler Leistung und Gesundheit von NVIDIA- und AMD-GPUs in Produktionsumgebungen.

Übersicht

Der GPU Monitor & Validator bietet:

  • Multi-Vendor-Unterstützung: NVIDIA (CUDA) und AMD (ROCm) GPUs
  • Erweiterte Multi-GPU-Unterstützung: Verbesserte Authentifizierung und Validierung für Systeme mit mehreren GPUs
  • Echtzeit-Leistungsüberwachung
  • Hardware-Validierung gegen Herstellerspezifikationen
  • Umfassendes Benchmarking mit PyTorch-Stresstests
  • Automatisierte Anomalieerkennung
  • Kontinuierliche Gesundheitsüberwachung
  • Erkennung von Leistungsregressionen
  • Validierung des Wärmemanagements
  • Verifizierung der Speicherintegrität
  • Herstellerunabhängige einheitliche Schnittstelle

Neuerungen in Version 3.1.9

  • Treiberunabhängige Installation: Das Paket interferiert nicht mehr mit vorhandenen NVIDIA/AMD-Treibern
  • Dynamische PyTorch-Erkennung: Erkennt automatisch CUDA/ROCm-Versionen und installiert kompatibles PyTorch
  • CUDA 13.0-Unterstützung: Vollständige Unterstützung für die neuesten NVIDIA-Treiber einschließlich CUDA 13.0
  • Behobene Berechtigungsprobleme: Behobene venv-Berechtigungsfehler während der Installation
  • Bessere Fehlersichtbarkeit: Installationsfehler werden jetzt korrekt angezeigt für einfachere Fehlerbehebung

Systemanforderungen

Betriebssysteme

  • Ubuntu 22.04 LTS (Jammy) oder neuer
  • Ubuntu 24.04 LTS (Noble)
  • Ubuntu 24.10 (Oracular)
  • Debian 11 (Bullseye) oder neuer
  • Debian 12 (Bookworm)

Hardware-Anforderungen

  • NVIDIA GPUs: Compute Capability 7.0+ (V100, T4, A100, H100, RTX-Serie)
  • AMD GPUs: ROCm-kompatibel (MI100, MI200, MI300-Serie, Radeon Pro VII, W7900)
  • 2MB freier Festplattenspeicher (plus Abhängigkeiten)

Software-Anforderungen

  • Python 3.10 oder neuer
  • Internetverbindung für initiale Einrichtung
  • Für NVIDIA: Beliebige NVIDIA-Treiberversion (Paket ist treiberunabhängig)
  • Für AMD: Beliebige ROCm-Version (Paket ist treiberunabhängig)
  • Hinweis: Das Paket wird GPU-Treiber NICHT installieren oder ändern

Installation

Option 1: Ubuntu PPA (Empfohlen für Ubuntu)

# PPA-Repository hinzufügen (nicht-interaktiv)
sudo add-apt-repository ppa:cl-ax/gpu-validator -y
sudo apt update

# GPU Agent installieren (nicht-interaktiv)
sudo apt install cl-gpu-agent -y

Option 2: APT-Repository (Debian/Ubuntu)

# Repository hinzufügen
echo 'deb [trusted=yes] https://storage.googleapis.com/gpu_validator/apt-repo stable main' | \
  sudo tee /etc/apt/sources.list.d/computelabs-gpu-agent.list

# Paketliste aktualisieren
sudo apt update

# GPU Agent installieren
sudo apt install cl-gpu-agent

Option 3: Manuelle Installation

Für Systeme, die die Anforderungen nicht erfüllen oder eine benutzerdefinierte Konfiguration benötigen:

# Repository klonen
git clone https://github.com/compute-labs-dev/gpu_validator_monitor.git
cd gpu_validator_monitor

# Installationsskript ausführen
sudo ./scripts/install.sh

Betriebsmodi

Der GPU Validator unterstützt vier primäre Betriebsmodi:

1. Validierungsmodus

cl-gpu-agent --mode validate

Führt durch:

  • Verifizierung der Hardware-Spezifikationen
  • Speicherintegritätstests
  • CUDA-Funktionalitätsprüfungen
  • Treiberkompatibilitätsvalidierung

2. Benchmark-Modus

cl-gpu-agent --mode benchmark

Testet:

  • Speicherbandbreite
  • CUDA-Core-Leistung
  • Tensor-Core-Fähigkeiten
  • PCIe-Durchsatz
  • Energieeffizienz

3. Überwachungsmodus (Standard-Dienst)

# Überwachungsdienst starten
sudo systemctl start cl-gpu-agent

# Automatischen Start aktivieren
sudo systemctl enable cl-gpu-agent

Verfolgt:

  • Echtzeit-Temperatur
  • Stromverbrauch
  • Speichernutzung
  • GPU-Auslastung
  • Fehlerraten
  • Leistungsmetriken

4. Erkennungsmodus

cl-gpu-agent --mode detect

Erkennt und zeigt:

  • Verfügbare GPUs
  • GPU-Modelle und Spezifikationen
  • Treiberversionen
  • CUDA/ROCm-Fähigkeiten

Verwendung

Dienstverwaltung

# Dienststatus prüfen
sudo systemctl status cl-gpu-agent

# Dienst starten
sudo systemctl start cl-gpu-agent

# Dienst stoppen
sudo systemctl stop cl-gpu-agent

# Automatischen Start aktivieren
sudo systemctl enable cl-gpu-agent

# Echtzeit-Logs anzeigen
journalctl -u cl-gpu-agent -f

Direkte Befehlsverwendung

# Hilfe und verfügbare Optionen anzeigen
cl-gpu-agent --help

# Umfassende Validierung ausführen
cl-gpu-agent --mode validate

# Leistungs-Benchmark ausführen
cl-gpu-agent --mode benchmark

# Überwachung ausführen (Vordergrund)
cl-gpu-agent --mode monitor

Ergebnisse verstehen

Der Validator liefert drei Schlüsselmetriken:

  1. Validierungsstatus: PASS/FAIL für Hardware-Spezifikationen
  2. Leistungswerte: Verglichen mit Referenz-Benchmarks
  3. Gesundheitsindikatoren: Temperatur-/Leistungstrends

Beispiel für erfolgreiche Ausgabe bei NVIDIA-GPU:

GPU 0 (NVIDIA H100 80GB HBM3):
- Validation: PASS
- Memory Bandwidth: 3.1 TB/s
- Temperature: 42°C (Max: 85°C)
- Power Draw: 119W/700W
- CUDA Cores: 100% functional
- Memory Test: PASS
- Driver Status: Optimal

Unterstützte GPU-Modelle

NVIDIA GPUs

  • Rechenzentrum: H100, H200
  • RTX 40-Serie: RTX 4090, 4080
  • RTX 50-Serie: RTX 5090, 5080

AMD GPUs

  • Getestet und verifiziert: MI300X
  • Andere ROCm-unterstützte GPUs können funktionieren, sind aber ungetestet

Fehlerbehebung

Häufige Probleme

Zugriff verweigert während der Installation

Wenn Sie [Errno 13] Permission denied während der Installation sehen:

# Alte Installation entfernen
sudo rm -rf /opt/cl-gpu-agent

# Neu installieren
sudo apt install --reinstall cl-gpu-agent

NVIDIA-Treiber-Versionskonflikt

Das Paket installiert oder modifiziert ab v3.1.3+ keine GPU-Treiber mehr. Bei Treiberproblemen:

# Aktuellen Treiber prüfen
nvidia-smi

# Das Paket erkennt und verwendet Ihren vorhandenen Treiber
# Es werden keine Treiberänderungen vorgenommen

CUDA 13.0 oder neuer Unterstützung

Wenn Sie CUDA 13.0 oder neuer haben (wie Treiber 580.x):

  • Das Paket erkennt dies automatisch
  • PyTorch wird mit CUDA 12.4-Unterstützung installiert (abwärtskompatibel)
  • Ihre CUDA 13.0-Treiber funktionieren perfekt mit PyTorch cu124

Paketversion wird nicht aktualisiert

Wenn apt die neueste Version nicht erhält:

# Cache leeren und Update erzwingen
sudo apt clean
sudo apt update

# Verfügbare Versionen prüfen
apt policy cl-gpu-agent

# Neuinstallation erzwingen
sudo apt install --reinstall cl-gpu-agent

How is this guide?