1つの作業セッション
$5.52
1 GPU × 8h · コンピュートのみ
本番およびバッチ推論
重み精度、ランタイムオーバーヘッド、KVキャッシュ、コンテキスト長、同時シーケンスからLLM推論をサイズ設定します。RTX 5090、L40S、H100、H200を選択する前に、最初のトークンまでの時間、トークン間レイテンシ、p95レイテンシ、100万トークンあたりのコストを比較してください。
GPURentoインフラストラクチャチームによるレビュー · 2026年9月1日
透明な計画ウィンドウ
これらはコンピュートレンタルウィンドウであり、ジョブ期間やパフォーマンスの予測ではありません。時間を測定されたパイロットに置き換え、計算機にストレージを追加してください。
1つの作業セッション
$5.52
1 GPU × 8h · コンピュートのみ
40時間ウィンドウ
$27.60
1 GPU × 40h · コンピュートのみ
120時間
$82.80
1 GPU × 120h · コンピュートのみ
| メモリドライバー | 重み + KVキャッシュ | コンテキストと並行性は、重みの後に支配的になる可能性があります。 |
|---|---|---|
| レイテンシーメトリクス | TTFT · TPOT · p95 | 平均レイテンシはキューとテールの動作を隠します。 |
| 経済的指標 | $ / 100万トークン | モデル、品質、トラフィック形状を一定に保ちます。 |
| 実行の選択 | 専用またはサーバーレス | 使用率とコールドスタート許容度に依存します。 |
決定方法
以下のコンテンツは、公開された仕様、GPURentoカタログ参照、およびワークロードベンチマークをまだ必要とする決定を分離しています。
重みメモリは出発点にすぎません。量子化メタデータ、ランタイムワークスペース、目的のコンテキスト長、バッチサイズ、同時シーケンスのKVキャッシュを追加してください。一時的なピークがメモリ不足による再起動を引き起こさないように余裕を残してください。
専用GPUは、安定した使用率と予測可能なウォームレイテンシに適しています。サーバーレスは、スケール・トゥ・ゼロによる節約がコールドスタートとリクエストごとのオーバーヘッドを上回る場合、バースト的なトラフィックに適しています。同じトラフィックトレースで両方を評価してください。
より大きなGPUは、キューイングを減らし、並行性を高め、またはマルチGPUシャーディングを回避して総コストを下げる場合に正当化されます。それ以外の場合、24〜48 GBのカードが経済的に適している可能性があります。
カタログショートリスト
32 GB GDDR7 · $0.69/時間
高速シングルGPU推論とメディア
48 GB GDDR6 ECC · $0.79/時間
本番推論、ファインチューニング、ビデオ
80 GB HBM3 · $2.69/時間
集中的なトレーニングとFP8推論
141 GB HBM3e · $3.59/時間
大規模モデル推論とHPC
質問
パラメータ数、精度、ランタイム、コンテキスト、同時実行数に依存します。最初にモデルの重みを計算し、次にKVキャッシュと少なくとも実用的なランタイムマージンを追加します。
アイドルワーカーはスケールダウンできるため、断続的なトラフィックに適しています。継続的にビジーなエンドポイントは、専用インスタンスの方が安くて予測可能な場合があります。
100万トークンあたりのコストを、最初のトークンまでの時間とp95レイテンシと一緒に使用します。スループットだけでは、ユーザーエクスペリエンスの悪さを隠すことができます。
最終確認日: 2026年9月1日。GPURentoレートは現在のカタログ参照です。プロビジョニング状態はワークスペースで表示されたままです。メーカー仕様はワークロードベンチマークの代わりにはなりません。
調査を続ける
デプロイ計画
モデル、精度、コンテキスト、並行性、レイテンシターゲットをワークスペース構成に持ち込みます。