Inícios rápidos por design
Caching com conhecimento do modelo e camadas pré-construídas reduzem a penalidade de arranque sem forçar capacidade sempre ligada.
Transforme um contentor ou repositório num endpoint de produção com encaminhamento inteligente de GPU, pools ativos, filas incorporadas e economia de escala para zero.
Linha de base transparente
$0 inativo
workers flex escalam para zero entre pedidos
<250 ms
Arranque a frio alvo
0→500
Workers
P98
Vistas de latência
4
Implementar fontes
Porquê GPURento
Caching com conhecimento do modelo e camadas pré-construídas reduzem a penalidade de arranque sem forçar capacidade sempre ligada.
Priorize famílias de aceleradores e regiões, depois faça failover quando um pool estiver limitado.
Acompanhe o atraso na fila, o tempo de execução, os arranques a frio, a saúde dos trabalhadores, os lançamentos e os gastos numa única vista.
Do código à capacidade
Ligar fonte
Escolha um template de modelo, repositório GitHub ou imagem Docker.
Definir política de escalonamento
Defina prioridades de GPU, concorrência, piso e teto de workers.
Chame o seu endpoint
Use uma API de fila, rota síncrona ou interface compatível com OpenAI.
from gpurento import serverless
@serverless.endpoint(
gpu=["L40S", "A100-80GB"],
min_workers=0,
max_workers=24,
concurrency=8,
)
def generate(prompt: str):
return model(prompt)Incluído
Cada carga de trabalho obtém a mesma camada de API, identidade, faturação e observabilidade.
Quando não restam pedidos e a janela de inatividade expira, os trabalhadores flex são encerrados. O próximo pedido inicia um trabalhador compatível e a fila preserva o trabalho.
Sim. Defina um número mínimo de workers para tráfego estável ou use capacidade agendada para picos previsíveis. A estimativa de custo é atualizada antes de a política ser guardada.
O fluxo do produto suporta GitHub, registos de contentores, templates de modelos selecionados e um fluxo de trabalho de função remota com prioridade Python.
Os trabalhos expõem estados claros de fila, em execução, concluídos, repetidos e falhados. A política de repetição, tempo limite, TTL do trabalho e comportamento de webhook permanecem configuráveis.
Pronto quando você estiver