Uma sessão de trabalho
$5.52
1 GPU × 8h · apenas computação
Inferência de produção e batch
Dimensione a inferência de LLM a partir da precisão dos pesos, sobrecarga de tempo de execução, cache KV, comprimento do contexto e sequências simultâneas. Compare o tempo até ao primeiro token, latência entre tokens, latência p95 e custo por milhão de tokens aceites antes de selecionar RTX 5090, L40S, H100 ou H200.
Revisto pela equipa de infraestrutura GPURento · 1 de setembro de 2026
Janelas de planeamento transparentes
Estas são janelas de aluguer de computação, não previsões de duração ou desempenho do trabalho. Substitua as horas por um piloto medido e adicione armazenamento na calculadora.
Uma sessão de trabalho
$5.52
1 GPU × 8h · apenas computação
Janela de quarenta horas
$27.60
1 GPU × 40h · apenas computação
Cento e vinte horas
$82.80
1 GPU × 120h · apenas computação
| Motores de memória | Pesos + cache KV | Contexto e concorrência podem dominar após os pesos. |
|---|---|---|
| Métricas de latência | TTFT · TPOT · p95 | A latência média esconde filas e comportamento de cauda. |
| Métrica económica | $ / 1M tokens | Mantenha o modelo, a qualidade e a forma do tráfego constantes. |
| Escolha de execução | Dedicado ou serverless | Depende da utilização e da tolerância ao arranque a frio. |
Método de decisão
O conteúdo abaixo separa especificações publicadas, referências de catálogo GPURento e decisões que ainda requerem um benchmark de carga de trabalho.
A memória dos pesos é apenas o ponto de partida. Adicione metadados de quantização, espaço de trabalho de tempo de execução e cache KV para o comprimento de contexto, tamanho de lote e sequências simultâneas pretendidos. Deixe margem para que um pico breve não cause um reinício por falta de memória.
Uma GPU dedicada é adequada para utilização estável e latência quente previsível. Serverless é adequado para tráfego irregular quando as poupanças de escala para zero excedem a sobrecarga de arranque a frio e por pedido. Avalie ambos com o mesmo traço de tráfego.
Uma GPU maior é justificada quando reduz filas, aumenta concorrência ou evita sharding multi-GPU o suficiente para reduzir o custo total. Caso contrário, uma placa de 24–48 GB pode ser um ajuste económico melhor.
Lista curta do catálogo
32 GB GDDR7 · $0.69/h
Inferência e mídia rápidas de GPU única
48 GB GDDR6 ECC · $0.79/h
Inferência de produção, fine-tuning e vídeo
80 GB HBM3 · $2.69/h
Treino intensivo e inferência FP8
141 GB HBM3e · $3.59/h
Inferência de modelos grandes e HPC
Perguntas
Depende da contagem de parâmetros, precisão, runtime, contexto e concorrência. Calcule primeiro os pesos do modelo, depois adicione a cache KV e pelo menos uma margem prática de runtime.
Pode ser para tráfego intermitente porque os workers inativos podem reduzir a escala. Um endpoint continuamente ocupado pode ser mais barato e mais previsível numa instância dedicada.
Use o custo por milhão de tokens aceites juntamente com o tempo até ao primeiro token e a latência p95. O débito sozinho pode esconder uma má experiência do utilizador.
Última revisão em 1 de setembro de 2026. As taxas da GPURento são referências atuais do catálogo; o estado de provisionamento permanece visível no espaço de trabalho, e as especificações do fabricante não substituem benchmarks de carga de trabalho.
Continuar a pesquisa
Plano de implementação
Traga o modelo, precisão, contexto, concorrência e alvo de latência para a configuração do espaço de trabalho.