Une session de travail
$1.28
1 GPU × 8h · calcul uniquement
Inférence de vision, d'audio et d'embedding
Utilisez ce guide pour l'inférence d'images, d'audio, d'embeddings, de classement et multimodale. Comparez la forme d'entrée, le prétraitement, la taille du lot, la latence à chaud et à froid, le débit et le coût par prédiction acceptée ; utilisez le guide d'inférence LLM pour la génération de tokens, le contexte et le cache KV.
Examiné par l'équipe d'infrastructure GPURento · 1er septembre 2026
Fenêtres de planification transparentes
Ce sont des fenêtres de location de calcul, pas des prédictions de durée de travail ou de performance. Remplacez les heures par un pilote mesuré et ajoutez le stockage dans le calculateur.
Une session de travail
$1.28
1 GPU × 8h · calcul uniquement
Fenêtre de quarante heures
$6.40
1 GPU × 40h · calcul uniquement
Cent vingt heures
$19.20
1 GPU × 120h · calcul uniquement
| Contrainte d'entrée | Forme + lot | Les espaces de travail de prétraitement et d'exécution contribuent à la mémoire de pointe. |
|---|---|---|
| Métrique de service | latence p95 | La latence moyenne peut masquer la file d'attente et le comportement de la queue. |
| Métrique économique | Coût par prédiction | Maintenez la qualité et la forme du trafic constantes lors de la comparaison des GPU. |
| Taux d'entrée du catalogue | À partir de 0,16 $ / GPU-heure | Calcul à la demande avant stockage persistant. |
Méthode de décision
Le contenu ci-dessous sépare les spécifications publiées, les références du catalogue GPURento et les décisions qui nécessitent encore un benchmark de charge de travail.
Mesurez le décodage, le redimensionnement, l'extraction de caractéristiques, la mémoire du modèle chargé, l'espace de travail du framework et les allocations temporaires au lot et à la distribution d'entrée prévus. Gardez le prétraitement identique lors de la comparaison des GPU.
Capturez le prétraitement, le temps de file d'attente, la latence p50 et p95, le débit et le taux d'erreur. Pour les travaux par lots, enregistrez les prédictions acceptées par heure. Comparez les candidats à la même qualité de modèle plutôt que de vous fier aux spécifications matérielles de pointe.
Un GPU dédié convient à une utilisation prévisible ou soutenue. Le trafic en rafales peut favoriser les workers pilotés par les requêtes lorsque les économies de mise à l'échelle dépassent les frais généraux de démarrage à froid. Utilisez une trace de trafic représentative et incluez le temps d'inactivité dans la comparaison.
Liste restreinte du catalogue
24 Go GDDR6 ECC · $0,16/h
ML général, Stable Diffusion et LoRA
24 Go GDDR6X · $0,34/h
Images, vidéos et inférence de taille moyenne
24 Go GDDR6 · $0,44/h
Inférence, vidéo et points de terminaison efficaces
48 Go GDDR6 ECC · $0,79/h
Inférence de production, fine-tuning et vidéo
Questions
C'est un accès horaire à un GPU cloud utilisé pour exécuter un modèle entraîné pour des prédictions, la génération, des embeddings ou un traitement par lots sans acheter le matériel.
Le catalogue GPURento actuel commence à 0,16 $ par heure GPU. La comparaison utile est le coût total de calcul et de stockage divisé par les sorties acceptées à la qualité et à la latence requises.
Utilisez le plus petit GPU qui convient au modèle et qui atteint la cible de latence et de débit. Les cartes RTX peuvent être économiques pour les charges de travail légères, L4 favorise un service efficace, et L40S fournit 48 Go de mémoire ECC pour les pipelines IA et médias plus grands ou mixtes.
Choisissez un actif et un réseau affichés sur la facture Paymento en cours. Les versements sur le portefeuille commencent à $50 ; les commandes mensuelles ont leur propre montant de facture.
Dernière révision le 1er septembre 2026. Les tarifs GPURento sont des références de catalogue actuelles ; l'état de provisionnement reste visible dans l'espace de travail, et les spécifications du fabricant ne remplacent pas les benchmarks de charge de travail.
Continuer la recherche
Plan de déploiement
Créez un espace de travail, financez le portefeuille et déployez la configuration GPU la plus petite qui répond au niveau de service mesuré.