- Teams, die GPU-Familien vergleichen
- LLM-Piloten vor einer Kapazitätsanfrage
- Budgetplanung mit expliziten Annahmen
- Erklärung einer Hardware-Wahl gegenüber Prüfern
GPU-Auswahlleitfaden
So wählen Sie eine Cloud-GPU für ein LLM.
Wählen Sie eine LLM-GPU in dieser Reihenfolge: Definieren Sie die Aufgabe, berechnen Sie Gewichts- und Laufzeitspeicher, fügen Sie KV-Cache oder Trainingszustand hinzu, setzen Sie Latenz- oder Fristziele, und benchmarken Sie dann die kleinste kompatible GPU. Vergleichen Sie die Gesamtkosten pro akzeptiertem Ergebnis. Die neueste oder schnellste GPU ist nicht automatisch die wirtschaftlichste.
Überprüft vom GPURento-Infrastrukturteam · 1. September 2026
| Schritt 1 | Aufgabe definieren | Inferenz, LoRA, vollständiges Tuning und Training unterscheiden sich. |
|---|---|---|
| Schritt 2 | Spitzenspeicher schätzen | Laufzeitzustand und Puffer einbeziehen. |
| Schritt 3 | Dienstziel festlegen | Latenz, Durchsatz, Frist und Qualität. |
| Schritt 4 | Benchmarken Sie die Gesamtkosten | Ein akzeptiertes Ergebnis Ende-zu-Ende messen. |
- Ersetzt einen End-to-End-Benchmark
- Annahme, dass Parameteranzahl dem Gesamtspeicher entspricht
- Auswahl allein anhand der Spitzen-FLOPS
Entscheidungsmethode
Was Sie vor der Bereitstellung von Kapazität überprüfen sollten.
Der folgende Inhalt trennt veröffentlichte Spezifikationen, GPURento-Katalogreferenzen und Entscheidungen, die noch einen Workload-Benchmark erfordern.
1. Beginnen Sie mit dem Workload-Modus
Inferenz speichert Gewichte und Laufzeitzustand; Training fügt Gradienten, Optimizer-Zustände und Aktivierungen hinzu; parameter-effizientes Tuning liegt dazwischen. Notieren Sie Modellrevision, Präzision, Kontext- oder Sequenzlänge, Batch und Parallelität, bevor Sie Hardware vergleichen.
2. Speicherbudget erstellen
Eine grobe Gewichtsschätzung ist Parameter multipliziert mit Bytes pro Parameter, aber Kernel, Quantisierungs-Metadaten, KV-Cache, Aktivierungen und Fragmentierung fügen Overhead hinzu. Behandeln Sie jeden Rechner als Shortlist und validieren Sie dann die Spitzenzuweisung.
- Fügen Sie 10–20 % operativen Puffer als Ausgangsannahme hinzu
- Mischen Sie dezimale GB und binäre GiB nicht stillschweigend
- Nach Änderung von Kontext, Batch oder Laufzeit erneut testen
3. Ergebnisse vergleichen, nicht Spezifikationen
Vergleichen Sie für Inferenz Latenz und Dollar pro Million akzeptierter Tokens. Vergleichen Sie für Training Zeit und Dollar pro akzeptiertem Checkpoint. Vergleichen Sie für visuelle Arbeit Kosten pro akzeptiertem Bild, Clip oder Frame.
Katalog-Shortlist
Relevante GPU-Optionen.
NVIDIA RTX 4090
24 GB GDDR6X · $0,34/Std.
Bild, Video und mittelgroße Inferenz
NVIDIA RTX 5090
32 GB GDDR7 · $0,69/Std.
Schnelle Single-GPU-Inferenz und Medien
NVIDIA A100 80GB
80 GB HBM2e · $1,19/Std.
Training, Fine-Tuning und HPC
NVIDIA H100 SXM
80 GB HBM3 · $2,69/Std.
Intensives Training und FP8-Inferenz
NVIDIA H200 SXM
141 GB HBM3e · $3,59/Std.
Inferenz großer Modelle und HPC
Fragen
Klare Antworten, einschließlich der Grenzen.
Wie viel GPU-Speicher benötigt ein LLM?+
Mindestens müssen Gewichte in der gewählten Präzision passen. Fügen Sie Laufzeit-Arbeitsbereich und KV-Cache für Inferenz hinzu, oder Gradienten, Optimizer-Zustand und Aktivierungen für Training.
Sollte ich immer die GPU mit dem meisten VRAM wählen?+
Nein. Zusätzlicher Speicher ist nur wertvoll, wenn er eine tatsächliche Einschränkung vermeidet. Eine kleinere GPU kann günstiger sein, wenn der Workload passt und das Leistungsziel erfüllt.
Kann ein Selektor Kompatibilität garantieren?+
Nein. Es kann eine Shortlist aus transparenten Annahmen erstellen, aber das genaue Modell, die Laufzeit und der Container müssen getestet werden.
- NVIDIA A100-ProduktseiteA100-Architektur und 80-GB-Konfiguration vom Hersteller.
- NVIDIA-H100-ProduktseiteArchitektur- und Speicherspezifikationen vom Hersteller.
- NVIDIA-H200-ProduktseiteH200-Speicherkapazität und -bandbreite vom Hersteller.
Zuletzt überprüft am 1. September 2026. GPURento-Tarife sind aktuelle Katalogreferenzen; der Bereitstellungsstatus bleibt im Workspace sichtbar, und Herstellerspezifikationen ersetzen keine Workload-Benchmarks.
Recherche fortsetzen
Bereitstellungsplan
Verwenden Sie die Shortlist und führen Sie dann einen Piloten durch.
Der Selektor grenzt den Katalog ein; eine finanzierte Arbeitsbereichsanfrage verwandelt die gewählte Konfiguration in einen testbaren Plan.