GPU serverless

Inferência que escala com o pedido, não com a suposição.

Transforme um contentor ou repositório num endpoint de produção com encaminhamento inteligente de GPU, pools ativos, filas incorporadas e economia de escala para zero.

Linha de base transparente

$0 inativo

workers flex escalam para zero entre pedidos

Self-service

<250 ms

Arranque a frio alvo

0→500

Workers

P98

Vistas de latência

4

Implementar fontes

Regiões da UE, armazenamento encriptado e opções de isolamento de rede

Porquê GPURento

Menos trabalho de infraestrutura. Mais progresso no modelo.

Inícios rápidos por design

Caching com conhecimento do modelo e camadas pré-construídas reduzem a penalidade de arranque sem forçar capacidade sempre ligada.

Encaminhe para a GPU certa

Priorize famílias de aceleradores e regiões, depois faça failover quando um pool estiver limitado.

Observe cada pedido

Acompanhe o atraso na fila, o tempo de execução, os arranques a frio, a saúde dos trabalhadores, os lançamentos e os gastos numa única vista.

Do código à capacidade

Um caminho limpo para produção.

1

Ligar fonte

Escolha um template de modelo, repositório GitHub ou imagem Docker.

2

Definir política de escalonamento

Defina prioridades de GPU, concorrência, piso e teto de workers.

3

Chame o seu endpoint

Use uma API de fila, rota síncrona ou interface compatível com OpenAI.

deploy.py
from gpurento import serverless

@serverless.endpoint(
  gpu=["L40S", "A100-80GB"],
  min_workers=0,
  max_workers=24,
  concurrency=8,
)
def generate(prompt: str):
  return model(prompt)
✓ Configuração guardada no espaço de trabalho · estado de provisionamento visível

Incluído

Uma plataforma séria, não um wrapper fino.

Cada carga de trabalho obtém a mesma camada de API, identidade, faturação e observabilidade.

Modos flex e worker ativo
Endpoints de fila e balanceador de carga
Prioridade de GPU e roteamento regional
Cache de modelo e armazenamento persistente
Registos de pedidos e estados de worker ao vivo
Lançamentos com versão e reversão
Entrega e repetições de webhook
Rotas de modelo compatíveis com OpenAI

FAQ

Respostas diretas.

Leia a documentação
Como funciona o scale-to-zero?+

Quando não restam pedidos e a janela de inatividade expira, os trabalhadores flex são encerrados. O próximo pedido inicia um trabalhador compatível e a fila preserva o trabalho.

Posso manter workers quentes?+

Sim. Defina um número mínimo de workers para tráfego estável ou use capacidade agendada para picos previsíveis. A estimativa de custo é atualizada antes de a política ser guardada.

Posso implementar a partir do GitHub?+

O fluxo do produto suporta GitHub, registos de contentores, templates de modelos selecionados e um fluxo de trabalho de função remota com prioridade Python.

Como são tratadas as falhas?+

Os trabalhos expõem estados claros de fila, em execução, concluídos, repetidos e falhados. A política de repetição, tempo limite, TTL do trabalho e comportamento de webhook permanecem configuráveis.

Pronto quando você estiver

Entregue a carga de trabalho, não a espera.

Criar conta