- Equipos que comparan familias de GPU
- Pilotos de LLM antes de una solicitud de capacidad
- Planificación de presupuesto con supuestos explícitos
- Explicar una elección de hardware a revisores
Guía de selección de GPU
Cómo elegir una GPU en la nube para un LLM.
Elija una GPU LLM en este orden: defina la tarea, calcule la memoria de pesos y ejecución, añada caché KV o estado de entrenamiento, establezca objetivos de latencia o plazo, luego compare la GPU compatible más pequeña. Compare el costo total por resultado aceptado. La GPU más nueva o rápida no es automáticamente la más económica.
Revisado por el equipo de infraestructura de GPURento · 1 de septiembre de 2026
| Paso 1 | Define la tarea | La inferencia, LoRA, el ajuste completo y el entrenamiento difieren. |
|---|---|---|
| Paso 2 | Estimar memoria máxima | Incluye el estado del runtime y el margen. |
| Paso 3 | Establecer objetivo de servicio | Latencia, rendimiento, plazo y calidad. |
| Paso 4 | Compare el costo total | Mide un resultado aceptado de extremo a extremo. |
- Reemplazando un benchmark de extremo a extremo
- Asumir que el recuento de parámetros equivale a la memoria total
- Seleccionar solo por FLOPS máximos
Método de decisión
Qué verificar antes de desplegar capacidad.
El contenido a continuación separa las especificaciones publicadas, las referencias del catálogo de GPURento y las decisiones que aún requieren un benchmark de carga de trabajo.
1. Comience con el modo de carga de trabajo
La inferencia almacena pesos y estado del runtime; el entrenamiento añade gradientes, estados de optimizador y activaciones; el ajuste eficiente de parámetros se sitúa entre ambos. Anota la revisión del modelo, la precisión, el contexto o la longitud de secuencia, el lote y la concurrencia antes de comparar hardware.
2. Construir un presupuesto de memoria
Una estimación aproximada de peso es parámetros multiplicados por bytes por parámetro, pero los kernels, metadatos de cuantización, caché KV, activaciones y fragmentación añaden sobrecarga. Trate cualquier calculadora como una lista corta, luego valide la asignación máxima.
- Añada 10–20% de margen operativo como suposición inicial
- No mezcles GB decimales y GiB binarios en silencio
- Vuelve a probar después de cambiar contexto, lote o tiempo de ejecución
3. Comparar resultados, no especificaciones
Para inferencia, compara latencia y dólares por millón de tokens aceptados. Para entrenamiento, compara tiempo y dólares por checkpoint aceptado. Para trabajo visual, compara coste por imagen, clip o fotograma aceptado.
Lista corta de catálogo
Opciones de GPU relevantes.
NVIDIA RTX 4090
24 GB GDDR6X · $0.34/h
Imagen, vídeo e inferencia de tamaño medio
NVIDIA RTX 5090
32 GB GDDR7 · $0.69/h
Inferencia y medios rápidos de una sola GPU
NVIDIA A100 80GB
80 GB HBM2e · $1.19/h
Entrenamiento, fine-tuning y HPC
NVIDIA H100 SXM
80 GB HBM3 · $2.69/h
Entrenamiento intensivo e inferencia FP8
NVIDIA H200 SXM
141 GB HBM3e · $3.59/h
Inferencia de modelos grandes y HPC
Preguntas
Respuestas claras, incluidos los límites.
¿Cuánta memoria de GPU necesita un LLM?+
Como mínimo, los pesos deben caber en la precisión seleccionada. Añada espacio de trabajo de ejecución y caché KV para inferencia, o gradientes, estado de optimizador y activaciones para entrenamiento.
¿Debo elegir siempre la GPU con más VRAM?+
No. La memoria adicional es valiosa solo cuando evita una restricción real. Una GPU más pequeña puede ser más barata cuando la carga de trabajo cabe y cumple el objetivo de rendimiento.
¿Puede un selector garantizar compatibilidad?+
No. Puede producir una lista corta a partir de suposiciones transparentes, pero el modelo, el runtime y el contenedor exactos deben probarse.
- Página de producto de NVIDIA A100Arquitectura A100 y configuración de 80 GB del fabricante.
- Página de producto de NVIDIA H100Especificaciones de arquitectura y memoria del fabricante.
- Página de producto de NVIDIA H200Capacidad de memoria y ancho de banda de H200 según el fabricante.
Última revisión el 1 de septiembre de 2026. Las tarifas de GPURento son referencias de catálogo actuales; el estado de aprovisionamiento sigue siendo visible en el espacio de trabajo, y las especificaciones del fabricante no sustituyen a los benchmarks de carga de trabajo.
Continúa la investigación
Plan de despliegue
Usa la preselección y luego ejecuta un piloto.
El selector reduce el catálogo; una solicitud de espacio de trabajo financiado convierte la configuración elegida en un plan comprobable.