Jedna sesja robocza
$5.52
1 GPU × 8h · tylko obliczenia
Inferencja produkcyjna i wsadowa
Dopasuj rozmiar wnioskowania LLM na podstawie precyzji wag, narzutu środowiska uruchomieniowego, pamięci podręcznej KV, długości kontekstu i równoczesnych sekwencji. Porównaj czas do pierwszego tokena, opóźnienie między tokenami, opóźnienie p95 i koszt za milion zaakceptowanych tokenów przed wyborem RTX 5090, L40S, H100 lub H200.
Przejrzane przez zespół infrastruktury GPURento · 1 września 2026
Przejrzyste okna planowania
To okna wynajmu obliczeń, a nie prognozy czasu trwania zadania lub wydajności. Zastąp godziny zmierzonym pilotażem i dodaj przechowywanie w kalkulatorze.
Jedna sesja robocza
$5.52
1 GPU × 8h · tylko obliczenia
Okno czterdziestu godzin
$27.60
1 GPU × 40h · tylko obliczenia
Sto dwadzieścia godzin
$82.80
1 GPU × 120h · tylko obliczenia
| Sterowniki pamięci | Wagi + pamięć podręczna KV | Kontekst i współbieżność mogą dominować po wagach. |
|---|---|---|
| Metryki opóźnienia | TTFT · TPOT · p95 | Średnie opóźnienie ukrywa zachowanie kolejki i ogona. |
| Metryka ekonomiczna | $ / 1M tokenów | Utrzymaj stały model, jakość i kształt ruchu. |
| Wybór wykonania | Dedykowane lub serverless | Zależy od wykorzystania i tolerancji na zimny start. |
Metoda decyzyjna
Poniższa treść oddziela opublikowane specyfikacje, referencje katalogowe GPURento i decyzje, które nadal wymagają benchmarku obciążenia.
Pamięć wag to tylko punkt wyjścia. Dodaj metadane kwantyzacji, przestrzeń roboczą środowiska uruchomieniowego i pamięć podręczną KV dla pożądanej długości kontekstu, rozmiaru partii i równoczesnych sekwencji. Zostaw zapas, aby krótki szczyt nie spowodował ponownego uruchomienia z powodu braku pamięci.
Dedykowane GPU pasuje do stałego wykorzystania i przewidywalnego ciepłego opóźnienia. Serverless pasuje do ruchu skokowego, gdy oszczędności ze skalowania do zera przewyższają narzut zimnego startu i narzut na żądanie. Oceń oba przy użyciu tego samego śladu ruchu.
Większe GPU jest uzasadnione, gdy zmniejsza kolejkowanie, zwiększa współbieżność lub unika dzielenia na wiele GPU na tyle, aby obniżyć całkowity koszt. W przeciwnym razie karta 24–48 GB może być lepszym wyborem ekonomicznym.
Lista wstępna katalogu
32 GB GDDR7 · $0.69/godz.
Szybkie wnioskowanie i media na jednym GPU
48 GB GDDR6 ECC · $0.79/godz.
Inferencja produkcyjna, dostrajanie i wideo
80 GB HBM3 · $2.69/godz.
Intensywne trenowanie i inferencja FP8
141 GB HBM3e · $3.59/godz.
Inferencja dużych modeli i HPC
Pytania
Zależy od liczby parametrów, precyzji, środowiska uruchomieniowego, kontekstu i współbieżności. Najpierw oblicz wagi modelu, następnie dodaj pamięć podręczną KV i co najmniej praktyczny margines środowiska uruchomieniowego.
Może być dla ruchu przerywanego, ponieważ bezczynne pracowniki mogą się skalować w dół. Ciągle zajęty endpoint może być tańszy i bardziej przewidywalny na dedykowanej instancji.
Użyj kosztu za milion zaakceptowanych tokenów wraz z czasem do pierwszego tokena i opóźnieniem p95. Sama przepustowość może ukryć złe doświadczenie użytkownika.
Ostatnia weryfikacja 1 września 2026. Stawki GPURento są bieżącymi odniesieniami katalogowymi; stan udostępniania pozostaje widoczny w obszarze roboczym, a specyfikacje producenta nie zastępują benchmarków obciążenia.
Kontynuuj badania
Plan wdrożenia
Przynieś model, precyzję, kontekst, współbieżność i cel opóźnienia do konfiguracji obszaru roboczego.