Una sessione di lavoro
$5.52
1 GPU × 8h · solo calcolo
Inferenza di produzione e batch
Dimensiona l'inferenza LLM da precisione dei pesi, overhead runtime, cache KV, lunghezza del contesto e sequenze simultanee. Confronta tempo al primo token, latenza inter-token, latenza p95 e costo per milione di token accettati prima di selezionare RTX 5090, L40S, H100 o H200.
Revisionato dal team infrastruttura GPURento · 1 settembre 2026
Finestre di pianificazione trasparenti
Queste sono finestre di noleggio di calcolo, non previsioni di durata o prestazioni del lavoro. Sostituisci le ore con un pilota misurato e aggiungi archiviazione nella calcolatrice.
Una sessione di lavoro
$5.52
1 GPU × 8h · solo calcolo
Finestra di quaranta ore
$27.60
1 GPU × 40h · solo calcolo
Centoventi ore
$82.80
1 GPU × 120h · solo calcolo
| Driver di memoria | Pesi + cache KV | Contesto e concorrenza possono dominare dopo i pesi. |
|---|---|---|
| Metriche di latenza | TTFT · TPOT · p95 | La latenza media nasconde accodamento e comportamento di coda. |
| Metrica economica | $ / 1M token | Mantieni costanti modello, qualità e forma del traffico. |
| Scelta di esecuzione | Dedicato o serverless | Dipende dall'utilizzo e dalla tolleranza al cold start. |
Metodo decisionale
Il contenuto seguente separa specifiche pubblicate, riferimenti di catalogo GPURento e decisioni che richiedono ancora un benchmark del carico di lavoro.
La memoria dei pesi è solo il punto di partenza. Aggiungi metadati di quantizzazione, workspace runtime e cache KV per la lunghezza del contesto desiderata, dimensione batch e sequenze simultanee. Lascia margine così un picco breve non causi un riavvio per out-of-memory.
Una GPU dedicata è adatta a utilizzo costante e latenza calda prevedibile. Il serverless si adatta al traffico a raffica quando i risparmi di scale-to-zero superano i costi di cold start e per richiesta. Valuta entrambi con la stessa traccia di traffico.
Una GPU più grande è giustificata quando riduce l'accodamento, aumenta la concorrenza o evita lo sharding multi-GPU abbastanza da ridurre il costo totale. Altrimenti, una scheda da 24–48 GB può essere una scelta economica migliore.
Shortlist catalogo
32 GB GDDR7 · $0,69/ora
Inferenza e media rapidi su singola GPU
48 GB GDDR6 ECC · $0,79/ora
Inferenza di produzione, fine-tuning e video
80 GB HBM3 · $2,69/ora
Training intensivo e inferenza FP8
141 GB HBM3e · $3,59/ora
Inferenza di modelli grandi e HPC
Domande
Dipende dal numero di parametri, precisione, runtime, contesto e concorrenza. Calcola prima i pesi del modello, poi aggiungi la cache KV e almeno un margine pratico di runtime.
Può essere adatto per traffico intermittente perché i worker inattivi possono scalare a zero. Un endpoint continuamente occupato può essere più economico e prevedibile su un'istanza dedicata.
Usa il costo per milione di token accettati insieme al tempo al primo token e alla latenza p95. Il solo throughput può nascondere una scarsa esperienza utente.
Ultima revisione: 1 settembre 2026. Le tariffe GPURento sono riferimenti di catalogo correnti; lo stato di provisioning rimane visibile nel workspace e le specifiche del produttore non sostituiscono i benchmark del carico di lavoro.
Continua la ricerca
Piano di distribuzione
Porta modello, precisione, contesto, concorrenza e obiettivo di latenza alla configurazione dello spazio di lavoro.