Jedna pracovní relace
$5.52
1 GPU × 8h · pouze výpočet
Produkční a dávková inference
Velikost LLM inference z preciznosti vah, runtime režie, KV cache, délky kontextu a souběžných sekvencí. Porovnejte čas do prvního tokenu, inter-token latenci, p95 latenci a náklady na milion přijatých tokenů před výběrem RTX 5090, L40S, H100 nebo H200.
Zkontrolováno týmem infrastruktury GPURento · 1. září 2026
Transparentní plánovací okna
Toto jsou okna pronájmu výpočetního výkonu, nikoli předpovědi doby trvání úlohy nebo výkonu. Nahraďte hodiny měřeným pilotem a přidejte úložiště do kalkulačky.
Jedna pracovní relace
$5.52
1 GPU × 8h · pouze výpočet
Čtyřicetihodinové okno
$27.60
1 GPU × 40h · pouze výpočet
Sto dvacet hodin
$82.80
1 GPU × 120h · pouze výpočet
| Ovladače paměti | Váhy + KV cache | Kontext a souběžnost mohou dominovat po vahách. |
|---|---|---|
| Metriky latence | TTFT · TPOT · p95 | Průměrná latence skrývá chování front a konců. |
| Ekonomická metrika | $ / 1M tokenů | Udržujte konstantní model, kvalitu a tvar provozu. |
| Volba provádění | Vyhrazené nebo serverless | Záleží na využití a toleranci studeného startu. |
Metoda rozhodování
Obsah níže odděluje publikované specifikace, odkazy na katalog GPURento a rozhodnutí, která stále vyžadují benchmark pracovního zatížení.
Paměť vah je pouze výchozí bod. Přidejte metadata kvantizace, runtime pracovní prostor a KV cache pro požadovanou délku kontextu, velikost dávky a souběžné sekvence. Nechte rezervu, aby krátký špička nezpůsobila restart kvůli nedostatku paměti.
Vyhrazený GPU se hodí pro stabilní využití a předvídatelnou teplou latenci. Serverless se hodí pro nárazový provoz, když úspory ze škálování na nulu převýší režii studeného startu a náklady na požadavek. Vyhodnoťte oba se stejnou provozní stopou.
Větší GPU je opodstatněný, když snižuje fronty, zvyšuje souběžnost nebo se vyhne multi-GPU shardingu natolik, že sníží celkové náklady. Jinak může být karta s 24–48 GB ekonomicky výhodnější.
Užší výběr z katalogu
32 GB GDDR7 · $0.69/hod
Rychlá inference a média na jednom GPU
48 GB GDDR6 ECC · $0.79/hod
Produkční inference, doladění a video
80 GB HBM3 · $2.69/hod
Intenzivní trénování a inference FP8
141 GB HBM3e · $3.59/hod
Inference velkých modelů a HPC
Otázky
Záleží na počtu parametrů, přesnosti, běhovém prostředí, kontextu a souběžnosti. Nejprve vypočítejte váhy modelu, poté přidejte KV cache a alespoň praktickou rezervu běhového prostředí.
Může být vhodné pro přerušovaný provoz, protože nečinné pracovníky lze škálovat dolů. Neustále vytížený endpoint může být levnější a předvídatelnější na vyhrazené instanci.
Použijte cenu za milion přijatých tokenů spolu s časem do prvního tokenu a latencí p95. Samotná propustnost může skrýt špatnou uživatelskou zkušenost.
Naposledy zkontrolováno 1. září 2026. Sazby GPURento jsou aktuální katalogové reference; stav zřizování zůstává viditelný v pracovním prostoru a specifikace výrobce nenahrazují benchmarky pracovní zátěže.
Pokračovat ve výzkumu
Plán nasazení
Přineste model, přesnost, kontext, souběžnost a cíl latence do konfigurace pracovního prostoru.