Jedna pracovná relácia
$5.52
1 GPU × 8h · iba výpočtový výkon
Produkčná a dávková inferencia
Veľkosť LLM inferencie podľa presnosti váh, réžie runtime, KV cache, dĺžky kontextu a súbežných sekvencií. Porovnajte čas do prvého tokenu, inter-token latenciu, p95 latenciu a náklady na milión akceptovaných tokenov pred výberom RTX 5090, L40S, H100 alebo H200.
Preskúmané tímom infraštruktúry GPURento · 1. september 2026
Transparentné plánovacie okná
Toto sú okná na prenájom výpočtov, nie predpovede trvania úlohy alebo výkonu. Nahraďte hodiny meraným pilotom a pridajte úložisko do kalkulačky.
Jedna pracovná relácia
$5.52
1 GPU × 8h · iba výpočtový výkon
Štyridsaťhodinové okno
$27.60
1 GPU × 40h · iba výpočtový výkon
Stodvadsať hodín
$82.80
1 GPU × 120h · iba výpočtový výkon
| Pamäťové ovládače | Váhy + KV cache | Kontext a súbežnosť môžu dominovať po váhach. |
|---|---|---|
| Metriky latencie | TTFT · TPOT · p95 | Priemerná latencia skrýva správanie frontu a chvosta. |
| Ekonomická metrika | $ / 1M tokenov | Držte model, kvalitu a tvar prevádzky konštantné. |
| Voľba vykonávania | Vyhradené alebo serverless | Závisí od využitia a tolerancie studeného štartu. |
Metóda rozhodovania
Obsah nižšie oddeľuje publikované špecifikácie, referencie katalógu GPURento a rozhodnutia, ktoré stále vyžadujú benchmark záťaže.
Pamäť váh je len východiskový bod. Pridajte metadáta kvantizácie, runtime workspace a KV cache pre požadovanú dĺžku kontextu, veľkosť dávky a súbežné sekvencie. Nechajte rezervu, aby krátky špička nespôsobila reštart kvôli nedostatku pamäte.
Vyhradené GPU je vhodné pre stabilné využitie a predvídateľnú teplú latenciu. Serverless sa hodí pre nárazovú prevádzku, keď úspory zo škálovania na nulu prevýšia réžiu studeného štartu a réžiu na požiadavku. Vyhodnoťte obe s rovnakou stopou prevádzky.
Väčšie GPU je opodstatnené, keď znižuje čakanie, zvyšuje súbežnosť alebo sa vyhýba multi-GPU shardingu natoľko, že znižuje celkové náklady. V opačnom prípade môže byť karta s 24–48 GB lepšou ekonomickou voľbou.
Katalógový užší výber
32 GB GDDR7 · $0.69/hod
Rýchla inferencia a médiá na jednom GPU
48 GB GDDR6 ECC · $0.79/hod
Produkčná inferencia, dolaďovanie a video
80 GB HBM3 · $2.69/hod
Intenzívny tréning a FP8 inferencia
141 GB HBM3e · $3.59/hod
Inferencia veľkých modelov a HPC
Otázky
Závisí od počtu parametrov, presnosti, runtime, kontextu a súbežnosti. Najprv vypočítajte váhy modelu, potom pridajte KV cache a aspoň praktickú runtime rezervu.
Môže byť vhodný pre prerušovanú prevádzku, pretože nečinné pracovníky sa môžu škálovať nadol. Neustále zaneprázdnený endpoint môže byť lacnejší a predvídateľnejší na vyhradenej inštancii.
Použite náklady na milión akceptovaných tokenov spolu s časom do prvého tokenu a p95 latenciou. Samotná priepustnosť môže skryť zlú používateľskú skúsenosť.
Naposledy skontrolované 1. septembra 2026. Sadzby GPURento sú aktuálne katalógové referencie; stav poskytovania zostáva viditeľný v pracovnom priestore a špecifikácie výrobcu nenahrádzajú benchmarky pracovného zaťaženia.
Pokračovať vo výskume
Plán nasadenia
Prineste model, presnosť, kontext, súbežnosť a cieľ latencie do konfigurácie pracovného priestoru.