GPU serverless

Inferenza che scala con la richiesta, non con la supposizione.

Trasforma un container o repository in un endpoint di produzione con routing GPU intelligente, pool caldi, code integrate ed economia scale-to-zero.

Baseline trasparente

$0 quando inattivo

i worker flex scalano a zero tra le richieste

Self-service

<250 ms

Cold start target

0→500

Worker

P98

Viste di latenza

4

Distribuisci sorgenti

Regioni UE, storage crittografato e opzioni di isolamento di rete

Perché GPURento

Meno lavoro infrastrutturale. Più progresso del modello.

Avvii rapidi by design

Cache model-aware e layer predefiniti riducono la penalità di avvio senza forzare capacità sempre attiva.

Instrada verso la GPU giusta

Dai priorità a famiglie di acceleratori e regioni, poi fai failover quando un pool è vincolato.

Osserva ogni richiesta

Traccia ritardo coda, tempo di esecuzione, cold start, salute dei worker, release e spesa da un'unica vista.

Dal codice alla capacità

Un percorso pulito verso la produzione.

1

Collega sorgente

Scegli un modello template, repository GitHub o immagine Docker.

2

Imposta policy di scalabilità

Definisci priorità GPU, concorrenza, minimo e massimo di worker.

3

Chiama il tuo endpoint

Usa una API a coda, route sincrona o interfaccia compatibile OpenAI.

deploy.py
from gpurento import serverless

@serverless.endpoint(
  gpu=["L40S", "A100-80GB"],
  min_workers=0,
  max_workers=24,
  concurrency=8,
)
def generate(prompt: str):
  return model(prompt)
✓ Configurazione salvata nell'area di lavoro · stato di provisioning visibile

Incluso

Una piattaforma seria, non un wrapper sottile.

Ogni carico di lavoro ottiene la stessa API, identità, fatturazione e livello di osservabilità.

Modalità Flex e worker attivi
Endpoint coda e bilanciatore di carico
Priorità GPU e routing regionale
Cache del modello e storage persistente
Log delle richieste e stati live dei worker
Release versionate e rollback
Consegna e retry webhook
Rotte modello compatibili OpenAI

FAQ

Risposte dirette.

Leggi i documenti
Come funziona lo scale-to-zero?+

Quando non rimangono richieste e la finestra di inattività scade, i worker flex si spengono. La prossima richiesta avvia un worker compatibile e la coda preserva il lavoro.

Posso mantenere i worker caldi?+

Sì. Imposta un numero minimo di worker per il traffico costante o usa capacità pianificata per picchi prevedibili. La stima dei costi si aggiorna prima che la politica venga salvata.

Posso eseguire il deployment da GitHub?+

Il flusso di prodotto supporta GitHub, registry di container, template di modelli curati e un flusso di lavoro di funzioni remote Python-first.

Come vengono gestiti i guasti?+

I job espongono stati chiari: in coda, in esecuzione, completati, riprovati e falliti. La policy di retry, il timeout, il TTL del job e il comportamento del webhook rimangono configurabili.

Pronto quando lo sei

Consegna il carico di lavoro, non l'attesa.

Crea account