Démarrages rapides par conception
La mise en cache consciente du modèle et les couches préconstruites réduisent le coût de démarrage sans forcer une capacité toujours active.
Transformez un conteneur ou un dépôt en point de terminaison de production avec routage GPU intelligent, pools chauds, files d'attente intégrées et une économie de mise à l'échelle à zéro.
Référence transparente
$0 inactif
les workers flex se réduisent à zéro entre les requêtes
<250 ms
Démarrage à froid cible
0→500
Workers
P98
Vues de latence
4
Déployer les sources
Pourquoi GPURento
La mise en cache consciente du modèle et les couches préconstruites réduisent le coût de démarrage sans forcer une capacité toujours active.
Priorisez les familles d'accélérateurs et les régions, puis basculez en cas de contrainte de pool.
Suivez le délai de file d'attente, le temps d'exécution, les démarrages à froid, la santé des workers, les versions et les dépenses à partir d'une seule vue.
Du code à la capacité
Connecter la source
Choisissez un modèle de déploiement, un dépôt GitHub ou une image Docker.
Définir la politique de mise à l'échelle
Définissez les priorités GPU, la concurrence, le plancher et le plafond des workers.
Appelez votre endpoint
Utilisez une API de file d'attente, une route synchrone ou une interface compatible OpenAI.
from gpurento import serverless
@serverless.endpoint(
gpu=["L40S", "A100-80GB"],
min_workers=0,
max_workers=24,
concurrency=8,
)
def generate(prompt: str):
return model(prompt)Inclus
Chaque charge de travail obtient la même couche d'API, d'identité, de facturation et d'observabilité.
Lorsqu'aucune requête ne reste et que la fenêtre d'inactivité expire, les workers flex s'arrêtent. La requête suivante démarre un worker compatible et la file d'attente préserve le travail.
Oui. Définissez un nombre minimum de workers pour un trafic stable ou utilisez la capacité planifiée pour les pics prévisibles. L'estimation des coûts est mise à jour avant l'enregistrement de la politique.
Le flux produit prend en charge GitHub, les registres de conteneurs, les modèles de modèles organisés et un flux de travail de fonctions distantes axé sur Python.
Les jobs exposent des états clairs : en file d'attente, en cours, terminé, réessayé et échoué. La politique de nouvelle tentative, le délai d'expiration, la durée de vie du job et le comportement du webhook restent configurables.
Prêt quand vous l'êtes