Una sesión de trabajo
$5.52
1 GPU × 8h · solo computación
Inferencia de producción y por lotes
Dimensiona la inferencia de LLM según la precisión de los pesos, la sobrecarga del runtime, la caché KV, la longitud de contexto y las secuencias simultáneas. Compara el tiempo hasta el primer token, la latencia entre tokens, la latencia p95 y el costo por millón de tokens aceptados antes de seleccionar RTX 5090, L40S, H100 o H200.
Revisado por el equipo de infraestructura de GPURento · 1 de septiembre de 2026
Ventanas de planificación transparentes
Estas son ventanas de alquiler de cómputo, no predicciones de duración o rendimiento del trabajo. Reemplaza las horas con un piloto medido y agrega almacenamiento en la calculadora.
Una sesión de trabajo
$5.52
1 GPU × 8h · solo computación
Ventana de cuarenta horas
$27.60
1 GPU × 40h · solo computación
Ciento veinte horas
$82.80
1 GPU × 120h · solo computación
| Controladores de memoria | Pesos + caché KV | El contexto y la concurrencia pueden dominar después de los pesos. |
|---|---|---|
| Métricas de latencia | TTFT · TPOT · p95 | La latencia promedio oculta el comportamiento de cola y cola. |
| Métrica económica | $ / 1M tokens | Mantén constantes el modelo, la calidad y la forma del tráfico. |
| Elección de ejecución | Dedicado o serverless | Depende de la utilización y la tolerancia al arranque en frío. |
Método de decisión
El contenido a continuación separa las especificaciones publicadas, las referencias del catálogo de GPURento y las decisiones que aún requieren un benchmark de carga de trabajo.
La memoria de pesos es solo el punto de partida. Agrega metadatos de cuantización, espacio de trabajo del runtime y caché KV para la longitud de contexto deseada, el tamaño del lote y las secuencias simultáneas. Deja margen para que un pico breve no cause un reinicio por falta de memoria.
Una GPU dedicada es adecuada para utilización constante y latencia cálida predecible. Serverless se adapta al tráfico ráfaga cuando los ahorros de escala a cero superan la sobrecarga de arranque en frío y por solicitud. Evalúe ambos con el mismo rastro de tráfico.
Una GPU más grande se justifica cuando reduce la cola, aumenta la concurrencia o evita el fragmentación multi-GPU lo suficiente como para reducir el costo total. De lo contrario, una tarjeta de 24–48 GB puede ser un mejor ajuste económico.
Lista corta de catálogo
32 GB GDDR7 · $0.69/h
Inferencia y medios rápidos de una sola GPU
48 GB GDDR6 ECC · $0.79/h
Inferencia de producción, ajuste fino y video
80 GB HBM3 · $2.69/h
Entrenamiento intensivo e inferencia FP8
141 GB HBM3e · $3.59/h
Inferencia de modelos grandes y HPC
Preguntas
Depende del número de parámetros, la precisión, el runtime, el contexto y la concurrencia. Calcula primero los pesos del modelo, luego añade la caché KV y al menos un margen práctico de runtime.
Puede ser para tráfico intermitente porque los trabajadores inactivos pueden reducirse. Un endpoint continuamente ocupado puede ser más barato y predecible en una instancia dedicada.
Usa el costo por millón de tokens aceptados junto con el tiempo hasta el primer token y la latencia p95. El rendimiento solo puede ocultar una mala experiencia de usuario.
Última revisión el 1 de septiembre de 2026. Las tarifas de GPURento son referencias de catálogo actuales; el estado de aprovisionamiento sigue siendo visible en el espacio de trabajo, y las especificaciones del fabricante no sustituyen a los benchmarks de carga de trabajo.
Continúa la investigación
Plan de despliegue
Traiga el modelo, precisión, contexto, concurrencia y objetivo de latencia a la configuración del espacio de trabajo.