Eén werksessie
$5.52
1 GPU × 8u · alleen compute
Productie- en batchinferentie
Formaat LLM-inferentie op basis van gewichtsprecisie, runtime-overhead, KV-cache, contextlengte en gelijktijdige sequenties. Vergelijk tijd tot eerste token, inter-tokenlatentie, p95-latentie en kosten per miljoen geaccepteerde tokens voordat u RTX 5090, L40S, H100 of H200 selecteert.
Beoordeeld door het GPURento-infrastructuream · 1 september 2026
Transparante planningsvensters
Dit zijn compute-huurvensters, geen voorspellingen van taakduur of prestaties. Vervang de uren door een gemeten pilot en voeg opslag toe in de calculator.
Eén werksessie
$5.52
1 GPU × 8u · alleen compute
Veertig uur venster
$27.60
1 GPU × 40u · alleen compute
Honderdtwintig uur
$82.80
1 GPU × 120u · alleen compute
| Geheugendrivers | Gewichten + KV-cache | Context en gelijktijdigheid kunnen domineren na gewichten. |
|---|---|---|
| Latentie-statistieken | TTFT · TPOT · p95 | Gemiddelde latentie verbergt wachtrij- en staartgedrag. |
| Economische metriek | $ / 1M tokens | Houd model, kwaliteit en verkeersvorm constant. |
| Uitvoeringskeuze | Toegewijd of serverless | Afhankelijk van gebruik en koude-starttolerantie. |
Beslissingsmethode
De inhoud hieronder scheidt gepubliceerde specificaties, GPURento-catalogusreferenties en beslissingen die nog steeds een workloadbenchmark vereisen.
Gewichtgeheugen is slechts het startpunt. Voeg kwantiseringsmetadata, runtime-werkruimte en KV-cache toe voor de gewenste contextlengte, batchgrootte en gelijktijdige sequenties. Laat headroom zodat een korte piek geen out-of-memory-herstart veroorzaakt.
Een dedicated GPU is geschikt voor stabiele belasting en voorspelbare warme latentie. Serverless past bij piekerig verkeer wanneer scale-to-zero-besparingen opwegen tegen cold-start- en per-request-overhead. Evalueer beide met dezelfde verkeerstrace.
Een grotere GPU is gerechtvaardigd wanneer deze wachtrijen vermindert, concurrency verhoogt of multi-GPU-sharding voldoende vermindert om de totale kosten te verlagen. Anders kan een 24–48 GB-kaart economisch beter passen.
Catalogus-shortlist
32 GB GDDR7 · $0,69/uur
Snelle single-GPU-inferentie en media
48 GB GDDR6 ECC · $0,79/uur
Productie-inferentie, fine-tuning en video
80 GB HBM3 · $2,69/uur
Intensieve training en FP8-inferentie
141 GB HBM3e · $3,59/uur
Grootschalige modelinferentie en HPC
Vragen
Het hangt af van het aantal parameters, precisie, runtime, context en gelijktijdigheid. Bereken eerst modelgewichten, voeg dan KV-cache en ten minste een praktische runtimemarge toe.
Het kan zijn voor intermitterend verkeer omdat inactieve workers kunnen afschalen. Een continu druk endpoint kan goedkoper en voorspelbaarder zijn op een dedicated instantie.
Gebruik kosten per miljoen geaccepteerde tokens samen met tijd tot eerste token en p95-latentie. Alleen doorvoer kan een slechte gebruikerservaring verbergen.
Laatst beoordeeld op 1 september 2026. GPURento-tarieven zijn huidige catalogusreferenties; provisioningstatus blijft zichtbaar in de workspace, en fabrikantspecificaties vervangen geen workload-benchmarks.
Ga verder met het onderzoek
Implementatieplan
Breng het model, de precisie, context, concurrency en latentiedoelstelling naar de werkruimteconfiguratie.