Inicios rápidos por diseño
El almacenamiento en caché consciente del modelo y las capas preconstruidas reducen la penalización de arranque sin forzar capacidad siempre activa.
Convierte un contenedor o repositorio en un endpoint de producción con enrutamiento inteligente de GPU, pools cálidos, colas integradas y economía de escala a cero.
Línea base transparente
$0 inactivo
los workers flex escalan a cero entre solicitudes
<250 ms
Arranque en frío objetivo
0→500
Trabajadores
P98
Vistas de latencia
4
Desplegar fuentes
Por qué GPURento
El almacenamiento en caché consciente del modelo y las capas preconstruidas reducen la penalización de arranque sin forzar capacidad siempre activa.
Prioriza familias de aceleradores y regiones, luego cambia a otro cuando un pool esté restringido.
Sigue el retraso de la cola, el tiempo de ejecución, los arranques en frío, la salud de los trabajadores, los lanzamientos y el gasto desde una sola vista.
Del código a la capacidad
Conectar fuente
Elija una plantilla de modelo, repositorio GitHub o imagen Docker.
Establecer política de escalado
Define prioridades de GPU, concurrencia, mínimo y máximo de workers.
Llame a su endpoint
Usa una API de cola, una ruta síncrona o una interfaz compatible con OpenAI.
from gpurento import serverless
@serverless.endpoint(
gpu=["L40S", "A100-80GB"],
min_workers=0,
max_workers=24,
concurrency=8,
)
def generate(prompt: str):
return model(prompt)Incluido
Cada carga de trabajo obtiene la misma capa de API, identidad, facturación y observabilidad.
Cuando no quedan solicitudes y la ventana de inactividad expira, los trabajadores flex se apagan. La siguiente solicitud inicia un trabajador compatible y la cola preserva el trabajo.
Sí. Establece un número mínimo de workers para tráfico constante o usa capacidad programada para picos predecibles. La estimación de costos se actualiza antes de guardar la política.
El flujo de producto soporta GitHub, registros de contenedores, plantillas de modelos curadas y un flujo de trabajo de funciones remotas centrado en Python.
Los trabajos exponen estados claros de en cola, ejecutándose, completados, reintentados y fallidos. La política de reintentos, el tiempo de espera, el TTL del trabajo y el comportamiento del webhook siguen siendo configurables.
Listo cuando lo estés