Serverless GPU

Inferentie die schaalt met het verzoek, niet met de gok.

Zet een container of repository om in een productie-endpoint met slimme GPU-routing, warme pools, ingebouwde wachtrijen en scale-to-zero-economie.

Transparante basislijn

$0 bij inactiviteit

flex-workers schalen naar nul tussen verzoeken

Selfservice

<250 ms

Doel cold start

0→500

Workers

P98

Latentieweergaven

4

Bronnen implementeren

EU-regio's, versleutelde opslag en netwerkisolatie-opties

Waarom GPURento

Minder infrastructuurwerk. Meer modelvooruitgang.

Snelle starts door ontwerp

Modelbewuste caching en vooraf gebouwde lagen verminderen de opstartstraf zonder altijd-aan capaciteit te forceren.

Route naar de juiste GPU

Prioriteer acceleratorfamilies en regio's en fail-over wanneer een pool beperkt is.

Observeer elk verzoek

Volg wachtrijvertraging, uitvoeringstijd, cold starts, workerstatus, releases en uitgaven vanuit één weergave.

Van code naar capaciteit

Eén schone weg naar productie.

1

Bron verbinden

Kies een modelsjabloon, GitHub-repository of Docker-image.

2

Schaalbeleid instellen

Definieer GPU-prioriteiten, gelijktijdigheid, worker-minimum en -maximum.

3

Roep uw endpoint aan

Gebruik een wachtrij-API, synchrone route of OpenAI-compatibele interface.

deploy.py
from gpurento import serverless

@serverless.endpoint(
  gpu=["L40S", "A100-80GB"],
  min_workers=0,
  max_workers=24,
  concurrency=8,
)
def generate(prompt: str):
  return model(prompt)
✓ Configuratie opgeslagen in de werkruimte · provisioningstatus zichtbaar

Inbegrepen

Een serieus platform, geen dunne wrapper.

Elke workload krijgt dezelfde API, identiteit, facturering en observeerbaarheidslaag.

Flex- en actieve workermodi
Queue- en load-balancer-endpoints
GPU-prioriteit en regionale routering
Modelcache en persistente opslag
Verzoeklogs en live worker-statussen
Versiebeheerde releases en rollback
Webhook-levering en -pogingen
OpenAI-compatibele modelroutes

FAQ

Directe antwoorden.

Lees de documentatie
Hoe werkt scale-to-zero?+

Wanneer er geen verzoeken meer zijn en het inactieve venster verloopt, worden flex-workers afgesloten. Het volgende verzoek start een compatibele worker en de wachtrij behoudt de taak.

Kan ik workers warm houden?+

Ja. Stel een minimum aantal workers in voor stabiel verkeer of gebruik geplande capaciteit voor voorspelbare pieken. De kostenraming wordt bijgewerkt voordat het beleid wordt opgeslagen.

Kan ik vanuit GitHub implementeren?+

De productworkflow ondersteunt GitHub, containerregistries, samengestelde modelsjablonen en een Python-first remote function-workflow.

Hoe worden fouten afgehandeld?+

Jobs tonen duidelijke statussen: in wachtrij, actief, voltooid, opnieuw geprobeerd en mislukt. Retry-beleid, timeout, job-TTL en webhook-gedrag blijven configureerbaar.

Klaar wanneer jij dat bent

Lever de workload, niet het wachten.

Account aanmaken