GPU serverless

Inférence qui évolue avec la demande, pas avec la supposition.

Transformez un conteneur ou un dépôt en point de terminaison de production avec routage GPU intelligent, pools chauds, files d'attente intégrées et une économie de mise à l'échelle à zéro.

Référence transparente

$0 inactif

les workers flex se réduisent à zéro entre les requêtes

En libre-service

<250 ms

Démarrage à froid cible

0→500

Workers

P98

Vues de latence

4

Déployer les sources

Régions UE, stockage chiffré et options d'isolation réseau

Pourquoi GPURento

Moins de travail d'infrastructure. Plus de progrès de modèle.

Démarrages rapides par conception

La mise en cache consciente du modèle et les couches préconstruites réduisent le coût de démarrage sans forcer une capacité toujours active.

Acheminez vers le bon GPU

Priorisez les familles d'accélérateurs et les régions, puis basculez en cas de contrainte de pool.

Observez chaque requête

Suivez le délai de file d'attente, le temps d'exécution, les démarrages à froid, la santé des workers, les versions et les dépenses à partir d'une seule vue.

Du code à la capacité

Un chemin clair vers la production.

1

Connecter la source

Choisissez un modèle de déploiement, un dépôt GitHub ou une image Docker.

2

Définir la politique de mise à l'échelle

Définissez les priorités GPU, la concurrence, le plancher et le plafond des workers.

3

Appelez votre endpoint

Utilisez une API de file d'attente, une route synchrone ou une interface compatible OpenAI.

deploy.py
from gpurento import serverless

@serverless.endpoint(
  gpu=["L40S", "A100-80GB"],
  min_workers=0,
  max_workers=24,
  concurrency=8,
)
def generate(prompt: str):
  return model(prompt)
✓ Configuration enregistrée dans l'espace de travail · état de provisionnement visible

Inclus

Une plateforme sérieuse, pas une simple surcouche.

Chaque charge de travail obtient la même couche d'API, d'identité, de facturation et d'observabilité.

Modes de workers flex et actifs
Endpoints de file d'attente et d'équilibreur de charge
Priorité GPU et routage régional
Cache de modèle et stockage persistant
Journaux de requêtes et états de workers en direct
Versions et rollback
Livraison et nouvelles tentatives de webhook
Routes de modèles compatibles OpenAI

FAQ

Des réponses directes.

Lire la documentation
Comment fonctionne la mise à l'échelle à zéro ?+

Lorsqu'aucune requête ne reste et que la fenêtre d'inactivité expire, les workers flex s'arrêtent. La requête suivante démarre un worker compatible et la file d'attente préserve le travail.

Puis-je garder les workers à chaud ?+

Oui. Définissez un nombre minimum de workers pour un trafic stable ou utilisez la capacité planifiée pour les pics prévisibles. L'estimation des coûts est mise à jour avant l'enregistrement de la politique.

Puis-je déployer depuis GitHub ?+

Le flux produit prend en charge GitHub, les registres de conteneurs, les modèles de modèles organisés et un flux de travail de fonctions distantes axé sur Python.

Comment les échecs sont-ils gérés ?+

Les jobs exposent des états clairs : en file d'attente, en cours, terminé, réessayé et échoué. La politique de nouvelle tentative, le délai d'expiration, la durée de vie du job et le comportement du webhook restent configurables.

Prêt quand vous l'êtes

Livrez la charge de travail, pas l'attente.

Créer un compte