GPU sin servidor

Inferencia que escala con la solicitud, no con la suposición.

Convierte un contenedor o repositorio en un endpoint de producción con enrutamiento inteligente de GPU, pools cálidos, colas integradas y economía de escala a cero.

Línea base transparente

$0 inactivo

los workers flex escalan a cero entre solicitudes

Autoservicio

<250 ms

Arranque en frío objetivo

0→500

Trabajadores

P98

Vistas de latencia

4

Desplegar fuentes

Regiones de la UE, almacenamiento cifrado y opciones de aislamiento de red

Por qué GPURento

Menos trabajo de infraestructura. Más progreso de modelos.

Inicios rápidos por diseño

El almacenamiento en caché consciente del modelo y las capas preconstruidas reducen la penalización de arranque sin forzar capacidad siempre activa.

Enruta a la GPU correcta

Prioriza familias de aceleradores y regiones, luego cambia a otro cuando un pool esté restringido.

Observa cada solicitud

Sigue el retraso de la cola, el tiempo de ejecución, los arranques en frío, la salud de los trabajadores, los lanzamientos y el gasto desde una sola vista.

Del código a la capacidad

Un camino limpio hacia producción.

1

Conectar fuente

Elija una plantilla de modelo, repositorio GitHub o imagen Docker.

2

Establecer política de escalado

Define prioridades de GPU, concurrencia, mínimo y máximo de workers.

3

Llame a su endpoint

Usa una API de cola, una ruta síncrona o una interfaz compatible con OpenAI.

deploy.py
from gpurento import serverless

@serverless.endpoint(
  gpu=["L40S", "A100-80GB"],
  min_workers=0,
  max_workers=24,
  concurrency=8,
)
def generate(prompt: str):
  return model(prompt)
✓ Configuración guardada en el espacio de trabajo · estado de aprovisionamiento visible

Incluido

Una plataforma seria, no un envoltorio delgado.

Cada carga de trabajo obtiene la misma capa de API, identidad, facturación y observabilidad.

Modos de worker flex y activo
Endpoints de cola y balanceador de carga
Prioridad de GPU y enrutamiento regional
Caché de modelos y almacenamiento persistente
Registros de solicitudes y estados de workers en vivo
Lanzamientos versionados y rollback
Entrega y reintentos de webhook
Rutas de modelo compatibles con OpenAI

FAQ

Respuestas directas.

Lee los documentos
¿Cómo funciona el escalado a cero?+

Cuando no quedan solicitudes y la ventana de inactividad expira, los trabajadores flex se apagan. La siguiente solicitud inicia un trabajador compatible y la cola preserva el trabajo.

¿Puedo mantener los trabajadores calientes?+

Sí. Establece un número mínimo de workers para tráfico constante o usa capacidad programada para picos predecibles. La estimación de costos se actualiza antes de guardar la política.

¿Puedo desplegar desde GitHub?+

El flujo de producto soporta GitHub, registros de contenedores, plantillas de modelos curadas y un flujo de trabajo de funciones remotas centrado en Python.

¿Cómo se gestionan los fallos?+

Los trabajos exponen estados claros de en cola, ejecutándose, completados, reintentados y fallidos. La política de reintentos, el tiempo de espera, el TTL del trabajo y el comportamiento del webhook siguen siendo configurables.

Listo cuando lo estés

Entrega la carga de trabajo, no la espera.

Crear cuenta