- Teams die GPU-families vergelijken
- LLM-pilots vóór een capaciteitsverzoek
- Budgetplanning met expliciete aannames
- Een hardwarekeuze uitleggen aan reviewers
GPU-selectiegids
Hoe kies je een cloud GPU voor een LLM.
Kies een LLM-GPU in deze volgorde: definieer de taak, bereken gewichts- en runtime-geheugen, voeg KV-cache of trainingsstatus toe, stel latentie- of deadline-doelen in en benchmark vervolgens de kleinste compatibele GPU. Vergelijk totale kosten per geaccepteerd resultaat. De nieuwste of snelste GPU is niet automatisch de meest economische.
Beoordeeld door het GPURento-infrastructuream · 1 september 2026
| Stap 1 | Definieer de taak | Inferentie, LoRA, volledige tuning en training verschillen. |
|---|---|---|
| Stap 2 | Piekgeheugen schatten | Inclusief runtime-status en headroom. |
| Stap 3 | Servicedoel instellen | Latentie, doorvoer, deadline en kwaliteit. |
| Stap 4 | Benchmark totale kosten | Meet een geaccepteerd resultaat end-to-end. |
- Een end-to-end-benchmark vervangen
- Aannemen dat parameteraantal gelijk is aan totaal geheugen
- Selecteren op basis van piek-FLOPS alleen
Beslissingsmethode
Wat u moet verifiëren voordat u capaciteit implementeert.
De inhoud hieronder scheidt gepubliceerde specificaties, GPURento-catalogusreferenties en beslissingen die nog steeds een workloadbenchmark vereisen.
1. Begin met de workloadmodus
Inferentie slaat gewichten en runtime-status op; training voegt gradiënten, optimizerstatussen en activaties toe; parameter-efficiënte tuning zit daartussenin. Schrijf modelrevisie, precisie, context- of sequentielengte, batch en gelijktijdigheid op voordat u hardware vergelijkt.
2. Stel een geheugenbudget op
Een ruwe gewichtsschatting is parameters vermenigvuldigd met bytes per parameter, maar kernels, kwantisatie-metadata, KV-cache, activaties en fragmentatie voegen overhead toe. Beschouw elke calculator als een shortlist en valideer vervolgens de piekallocatie.
- Voeg 10–20% operationele ruimte toe als startaanname
- Meng decimale GB en binaire GiB niet stilzwijgend
- Test opnieuw na het wijzigen van context, batch of runtime
3. Vergelijk resultaten, niet specificaties
Voor inferentie vergelijkt u latentie en dollars per miljoen geaccepteerde tokens. Voor training vergelijkt u tijd en dollars per geaccepteerd checkpoint. Voor visueel werk vergelijkt u kosten per geaccepteerde afbeelding, clip of frame.
Catalogus-shortlist
Relevante GPU-opties.
NVIDIA RTX 4090
24 GB GDDR6X · $0,34/uur
Afbeelding, video en middelgrote inferentie
NVIDIA RTX 5090
32 GB GDDR7 · $0,69/uur
Snelle single-GPU-inferentie en media
NVIDIA A100 80GB
80 GB HBM2e · $1,19/uur
Training, fine-tuning en HPC
NVIDIA H100 SXM
80 GB HBM3 · $2,69/uur
Intensieve training en FP8-inferentie
NVIDIA H200 SXM
141 GB HBM3e · $3,59/uur
Grootschalige modelinferentie en HPC
Vragen
Duidelijke antwoorden, inclusief de beperkingen.
Hoeveel GPU-geheugen heeft een LLM nodig?+
Op zijn minst moeten gewichten passen op de geselecteerde precisie. Voeg runtime-werkruimte en KV-cache toe voor inferentie, of gradients, optimizer-state en activaties voor training.
Moet ik altijd de GPU met de meeste VRAM kiezen?+
Nee. Extra geheugen is alleen waardevol wanneer het een daadwerkelijke beperking vermijdt. Een kleinere GPU kan goedkoper zijn wanneer de workload past en het prestatiedoel haalt.
Kan een selector compatibiliteit garanderen?+
Nee. Het kan een shortlist produceren op basis van transparante aannames, maar het exacte model, de runtime en de container moeten worden getest.
- NVIDIA A100-productpaginaA100-architectuur en 80 GB-configuratie van de fabrikant.
- NVIDIA H100-productpaginaArchitectuur- en geheugenspecificaties van de fabrikant.
- NVIDIA H200-productpaginaH200 geheugencapaciteit en bandbreedte van de fabrikant.
Laatst beoordeeld op 1 september 2026. GPURento-tarieven zijn huidige catalogusreferenties; provisioningstatus blijft zichtbaar in de workspace, en fabrikantspecificaties vervangen geen workload-benchmarks.
Ga verder met het onderzoek
Implementatieplan
Gebruik de shortlist en voer vervolgens een pilot uit.
De selector verkleint de catalogus; een gefinancierd workspace-verzoek verandert de gekozen configuratie in een testbaar plan.