1つの作業セッション
$1.28
1 GPU × 8h · コンピュートのみ
ビジョン、オーディオ、埋め込み推論
このガイドを画像、オーディオ、埋め込み、ランキング、マルチモーダル推論に使用してください。入力形状、前処理、バッチサイズ、ウォームおよびコールドレイテンシ、スループット、受け入れられた予測あたりのコストを比較します。トークン生成、コンテキスト、KVキャッシュにはLLM推論ガイドを使用してください。
GPURentoインフラストラクチャチームによるレビュー · 2026年9月1日
透明な計画ウィンドウ
これらはコンピュートレンタルウィンドウであり、ジョブ期間やパフォーマンスの予測ではありません。時間を測定されたパイロットに置き換え、計算機にストレージを追加してください。
1つの作業セッション
$1.28
1 GPU × 8h · コンピュートのみ
40時間ウィンドウ
$6.40
1 GPU × 40h · コンピュートのみ
120時間
$19.20
1 GPU × 120h · コンピュートのみ
| 入力制約 | 形状 + バッチ | 前処理とランタイムワークスペースはピークメモリに貢献します。 |
|---|---|---|
| サービスメトリック | p95レイテンシ | 平均レイテンシはキューイングとテール動作を隠すことができます。 |
| 経済的指標 | 予測あたりのコスト | GPUを比較するときは、品質とトラフィック形状を一定に保ちます。 |
| カタログエントリレート | $0.16 / GPU時間から | 永続ストレージの前のオンデマンドコンピュート。 |
決定方法
以下のコンテンツは、公開された仕様、GPURentoカタログ参照、およびワークロードベンチマークをまだ必要とする決定を分離しています。
意図したバッチと入力分布で、デコード、リサイズ、特徴抽出、ロードされたモデルメモリ、フレームワークワークスペース、一時割り当てを測定します。GPUを比較するときは前処理を同一に保ちます。
前処理、キュー時間、p50およびp95レイテンシ、スループット、エラーレートをキャプチャします。バッチジョブの場合は、1時間あたりの承認済み予測を記録します。ピークハードウェア仕様ではなく、同じモデル品質で候補を比較します。
専用GPUは、予測可能または持続的な使用に適しています。バースト的なトラフィックは、スケールダウンによる節約がコールドスタートのオーバーヘッドを上回る場合、リクエスト駆動型ワーカーを好む場合があります。代表的なトラフィックトレースを使用し、比較にアイドル時間を含めてください。
カタログショートリスト
24 GB GDDR6 ECC · $0.16/時間
一般的なML、Stable Diffusion、LoRA
24 GB GDDR6X · $0.34/時間
画像、動画、中規模推論
24 GB GDDR6 · $0.44/時間
効率的な推論、ビデオ、エンドポイント
48 GB GDDR6 ECC · $0.79/時間
本番推論、ファインチューニング、ビデオ
質問
ハードウェアを購入せずに、トレーニング済みモデルを予測、生成、エンベディング、バッチ処理に使用するためのクラウドGPUへの時間単位のアクセスです。
現在のGPURentoカタログは、GPU時間あたり$0.16から始まります。有用な比較は、必要な品質とレイテンシで受け入れられた出力で割った総コンピュートおよびストレージコストです。
モデルに適合し、レイテンシとスループットのターゲットを満たす最小のGPUを使用します。RTXカードはリーンなワークロードに経済的であり、L4は効率的なサービングに適しており、L40Sはより大きなまたは混合AIおよびメディアパイプラインに48 GB ECCメモリを提供します。
現在のPaymento請求書に表示されている暗号資産とネットワークを選択してください。ウォレットには$50から入金でき、月額注文には個別の請求額が設定されます。
最終確認日: 2026年9月1日。GPURentoレートは現在のカタログ参照です。プロビジョニング状態はワークスペースで表示されたままです。メーカー仕様はワークロードベンチマークの代わりにはなりません。
調査を続ける
デプロイ計画
ワークスペースを作成し、ウォレットに資金を供給し、測定されたサービスレベルを満たす最小のGPU構成をデプロイします。