- Equipas a comparar famílias de GPU
- Pilotos de LLM antes de um pedido de capacidade
- Planeamento de orçamento com suposições explícitas
- Explicar uma escolha de hardware a revisores
Guia de seleção de GPU
Como escolher uma GPU cloud para um LLM.
Escolha uma GPU de LLM nesta ordem: defina a tarefa, calcule a memória de pesos e tempo de execução, adicione cache KV ou estado de treino, defina alvos de latência ou prazo e depois faça benchmark da menor GPU compatível. Compare o custo total por resultado aceite. A GPU mais recente ou rápida não é automaticamente a mais económica.
Revisto pela equipa de infraestrutura GPURento · 1 de setembro de 2026
| Passo 1 | Defina a tarefa | Inferência, LoRA, ajuste completo e treino diferem. |
|---|---|---|
| Passo 2 | Estimar pico de memória | Inclua estado de runtime e margem. |
| Passo 3 | Definir alvo de serviço | Latência, débito, prazo e qualidade. |
| Passo 4 | Faça benchmark do custo total | Meça um resultado aceite de ponta a ponta. |
- Substituindo um benchmark de ponta a ponta
- Assumir que a contagem de parâmetros é igual à memória total
- Selecionar apenas a partir de FLOPS de pico
Método de decisão
O que verificar antes de implementar capacidade.
O conteúdo abaixo separa especificações publicadas, referências de catálogo GPURento e decisões que ainda requerem um benchmark de carga de trabalho.
1. Comece pelo modo de carga de trabalho
A inferência armazena pesos e estado de runtime; o treino adiciona gradientes, estados de otimizador e ativações; o ajuste eficiente de parâmetros fica entre os dois. Anote a revisão do modelo, precisão, contexto ou comprimento de sequência, lote e concorrência antes de comparar hardware.
2. Construir um orçamento de memória
Uma estimativa aproximada de peso é parâmetros multiplicados por bytes por parâmetro, mas kernels, metadados de quantização, cache KV, ativações e fragmentação adicionam sobrecarga. Trate qualquer calculadora como uma lista curta e depois valide a alocação de pico.
- Adicione 10–20% de margem operacional como suposição inicial
- Não misture GB decimais e GiB binários silenciosamente
- Teste novamente após alterar contexto, batch ou runtime
3. Comparar resultados, não especificações
Para inferência, compare latência e dólares por milhão de tokens aceites. Para treino, compare tempo e dólares por checkpoint aceite. Para trabalho visual, compare custo por imagem, clipe ou frame aceite.
Lista curta do catálogo
Opções de GPU relevantes.
NVIDIA RTX 4090
24 GB GDDR6X · $0.34/h
Imagem, vídeo e inferência de tamanho médio
NVIDIA RTX 5090
32 GB GDDR7 · $0.69/h
Inferência e mídia rápidas de GPU única
NVIDIA A100 80GB
80 GB HBM2e · $1.19/h
Treino, fine-tuning e HPC
NVIDIA H100 SXM
80 GB HBM3 · $2.69/h
Treino intensivo e inferência FP8
NVIDIA H200 SXM
141 GB HBM3e · $3.59/h
Inferência de modelos grandes e HPC
Perguntas
Respostas claras, incluindo os limites.
De quanta memória GPU um LLM precisa?+
No mínimo, os pesos devem caber na precisão selecionada. Adicione espaço de trabalho de tempo de execução e cache KV para inferência, ou gradientes, estado do otimizador e ativações para treino.
Devo escolher sempre a GPU com mais VRAM?+
Não. Memória extra é valiosa apenas quando evita uma restrição real. Uma GPU mais pequena pode ser mais barata quando a carga de trabalho cabe e atinge o alvo de desempenho.
Um seletor pode garantir compatibilidade?+
Não. Pode produzir uma lista curta a partir de suposições transparentes, mas o modelo exato, runtime e contentor devem ser testados.
- Página de produto NVIDIA A100Arquitetura A100 e configuração de 80 GB do fabricante.
- Página de produto NVIDIA H100Especificações de arquitetura e memória do fabricante.
- Página de produto NVIDIA H200Capacidade e largura de banda de memória do H200, de acordo com o fabricante.
Última revisão em 1 de setembro de 2026. As taxas da GPURento são referências atuais do catálogo; o estado de provisionamento permanece visível no espaço de trabalho, e as especificações do fabricante não substituem benchmarks de carga de trabalho.
Continuar a pesquisa
Plano de implementação
Use a lista e, em seguida, execute um piloto.
O seletor restringe o catálogo; um pedido de espaço de trabalho financiado transforma a configuração escolhida num plano testável.