- Équipes comparant les familles de GPU
- Projets pilotes LLM avant une demande de capacité
- Planification budgétaire avec des hypothèses explicites
- Expliquer un choix matériel aux réviseurs
Guide de sélection GPU
Comment choisir un GPU cloud pour un LLM.
Choisissez un GPU LLM dans cet ordre : définissez la tâche, calculez la mémoire des poids et de l'exécution, ajoutez le cache KV ou l'état d'entraînement, définissez les objectifs de latence ou de délai, puis comparez le plus petit GPU compatible. Comparez le coût total par résultat accepté. Le GPU le plus récent ou le plus rapide n'est pas automatiquement le plus économique.
Examiné par l'équipe d'infrastructure GPURento · 1er septembre 2026
| Étape 1 | Définissez la tâche | L'inférence, LoRA, le réglage complet et l'entraînement diffèrent. |
|---|---|---|
| Étape 2 | Estimer la mémoire de pointe | Inclure l'état d'exécution et la marge. |
| Étape 3 | Définir la cible de service | Latence, débit, délai et qualité. |
| Étape 4 | Comparez le coût total | Mesurez un résultat accepté de bout en bout. |
- Remplacer un benchmark de bout en bout
- Supposer que le nombre de paramètres équivaut à la mémoire totale
- Sélectionner uniquement à partir des FLOPS de pointe
Méthode de décision
Que vérifier avant de déployer la capacité.
Le contenu ci-dessous sépare les spécifications publiées, les références du catalogue GPURento et les décisions qui nécessitent encore un benchmark de charge de travail.
1. Commencez par le mode de charge de travail
L'inférence stocke les poids et l'état d'exécution ; l'entraînement ajoute les gradients, les états d'optimiseur et les activations ; le réglage efficace des paramètres se situe entre les deux. Notez la révision du modèle, la précision, le contexte ou la longueur de séquence, le lot et la concurrence avant de comparer le matériel.
2. Établir un budget mémoire
Une estimation approximative du poids est le nombre de paramètres multiplié par les octets par paramètre, mais les kernels, les métadonnées de quantification, le cache KV, les activations et la fragmentation ajoutent des frais généraux. Traitez tout calculateur comme une liste restreinte, puis validez l'allocation de pointe.
- Ajoutez 10 à 20 % de marge opérationnelle comme hypothèse de départ
- Ne mélangez pas silencieusement les Go décimaux et les GiB binaires
- Retestez après avoir changé le contexte, le lot ou le runtime
3. Comparez les résultats, pas les spécifications
Pour l'inférence, comparez la latence et les dollars par million de jetons acceptés. Pour l'entraînement, comparez le temps et les dollars par checkpoint accepté. Pour le travail visuel, comparez le coût par image, clip ou frame accepté.
Liste restreinte du catalogue
Options GPU pertinentes.
NVIDIA RTX 4090
24 Go GDDR6X · $0,34/h
Images, vidéos et inférence de taille moyenne
NVIDIA RTX 5090
32 Go GDDR7 · $0,69/h
Inférence et médias rapides sur GPU unique
NVIDIA A100 80 Go
80 Go HBM2e · $1,19/h
Entraînement, fine-tuning et HPC
NVIDIA H100 SXM
80 Go HBM3 · $2,69/h
Entraînement intensif et inférence FP8
NVIDIA H200 SXM
141 Go HBM3e · $3,59/h
Inférence de grands modèles et HPC
Questions
Des réponses claires, y compris les limites.
De quelle mémoire GPU un LLM a-t-il besoin ?+
Au minimum, les poids doivent tenir à la précision sélectionnée. Ajoutez l'espace de travail d'exécution et le cache KV pour l'inférence, ou les gradients, l'état de l'optimiseur et les activations pour l'entraînement.
Dois-je toujours choisir le GPU avec le plus de VRAM ?+
Non. La mémoire supplémentaire n'est précieuse que lorsqu'elle évite une contrainte réelle. Un GPU plus petit peut être moins cher lorsque la charge de travail tient et atteint la cible de performance.
Un sélecteur peut-il garantir la compatibilité ?+
Non. Il peut produire une liste restreinte à partir d'hypothèses transparentes, mais le modèle exact, l'exécution et le conteneur doivent être testés.
- Page produit NVIDIA A100Architecture A100 et configuration 80 Go du fabricant.
- Page produit NVIDIA H100Spécifications d'architecture et de mémoire du fabricant.
- Page produit NVIDIA H200Capacité mémoire et bande passante du H200 selon le fabricant.
Dernière révision le 1er septembre 2026. Les tarifs GPURento sont des références de catalogue actuelles ; l'état de provisionnement reste visible dans l'espace de travail, et les spécifications du fabricant ne remplacent pas les benchmarks de charge de travail.
Continuer la recherche
Plan de déploiement
Utilisez la présélection, puis exécutez un pilote.
Le sélecteur réduit le catalogue ; une demande d'espace de travail financé transforme la configuration choisie en un plan testable.