Une session de travail
$5.52
1 GPU × 8h · calcul uniquement
Inférence de production et par lots
Dimensionnez l'inférence LLM à partir de la précision des poids, des frais généraux d'exécution, du cache KV, de la longueur du contexte et des séquences simultanées. Comparez le temps jusqu'au premier token, la latence inter-tokens, la latence p95 et le coût par million de tokens acceptés avant de sélectionner RTX 5090, L40S, H100 ou H200.
Examiné par l'équipe d'infrastructure GPURento · 1er septembre 2026
Fenêtres de planification transparentes
Ce sont des fenêtres de location de calcul, pas des prédictions de durée de travail ou de performance. Remplacez les heures par un pilote mesuré et ajoutez le stockage dans le calculateur.
Une session de travail
$5.52
1 GPU × 8h · calcul uniquement
Fenêtre de quarante heures
$27.60
1 GPU × 40h · calcul uniquement
Cent vingt heures
$82.80
1 GPU × 120h · calcul uniquement
| Pilotes mémoire | Poids + cache KV | Le contexte et la concurrence peuvent dominer après les poids. |
|---|---|---|
| Métriques de latence | TTFT · TPOT · p95 | La latence moyenne masque la file d'attente et le comportement de la queue. |
| Métrique économique | $ / 1M tokens | Maintenez le modèle, la qualité et la forme du trafic constants. |
| Choix d'exécution | Dédié ou serverless | Dépend de l'utilisation et de la tolérance au démarrage à froid. |
Méthode de décision
Le contenu ci-dessous sépare les spécifications publiées, les références du catalogue GPURento et les décisions qui nécessitent encore un benchmark de charge de travail.
La mémoire des poids n'est que le point de départ. Ajoutez les métadonnées de quantification, l'espace de travail d'exécution et le cache KV pour la longueur de contexte souhaitée, la taille du lot et les séquences simultanées. Laissez de la marge pour qu'un pic bref ne provoque pas un redémarrage par manque de mémoire.
Un GPU dédié convient à une utilisation stable et à une latence à chaud prévisible. Le serverless convient au trafic en rafales lorsque les économies de mise à l'échelle à zéro dépassent les frais généraux de démarrage à froid et par requête. Évaluez les deux avec la même trace de trafic.
Un GPU plus grand est justifié lorsqu'il réduit la file d'attente, augmente la concurrence ou évite le sharding multi-GPU suffisamment pour réduire le coût total. Sinon, une carte de 24 à 48 Go peut être un meilleur choix économique.
Liste restreinte du catalogue
32 Go GDDR7 · $0,69/h
Inférence et médias rapides sur GPU unique
48 Go GDDR6 ECC · $0,79/h
Inférence de production, fine-tuning et vidéo
80 Go HBM3 · $2,69/h
Entraînement intensif et inférence FP8
141 Go HBM3e · $3,59/h
Inférence de grands modèles et HPC
Questions
Cela dépend du nombre de paramètres, de la précision, de l'exécution, du contexte et de la concurrence. Calculez d'abord les poids du modèle, puis ajoutez le cache KV et au moins une marge d'exécution pratique.
Cela peut être le cas pour un trafic intermittent car les travailleurs inactifs peuvent être réduits. Un endpoint continuellement occupé peut être moins cher et plus prévisible sur une instance dédiée.
Utilisez le coût par million de tokens acceptés avec le temps jusqu'au premier token et la latence p95. Le débit seul peut cacher une mauvaise expérience utilisateur.
Dernière révision le 1er septembre 2026. Les tarifs GPURento sont des références de catalogue actuelles ; l'état de provisionnement reste visible dans l'espace de travail, et les spécifications du fabricant ne remplacent pas les benchmarks de charge de travail.
Continuer la recherche
Plan de déploiement
Apportez le modèle, la précision, le contexte, la concurrence et l'objectif de latence à la configuration de l'espace de travail.