- GPUファミリーを比較しているチーム
- キャパシティリクエスト前のLLMパイロット
- 明示的な仮定による予算計画
- レビュー担当者にハードウェアの選択を説明する
GPU選択ガイド
LLM用のクラウドGPUの選び方。
LLM GPUを次の順序で選択します:タスクを定義し、重みとランタイムメモリを計算し、KVキャッシュまたはトレーニング状態を追加し、レイテンシまたは期限ターゲットを設定し、最小の互換性のあるGPUをベンチマークします。承認された成果物あたりの総コストを比較します。最新または最速のGPUが自動的に最も経済的であるとは限りません。
GPURentoインフラストラクチャチームによるレビュー · 2026年9月1日
| ステップ1 | タスクを定義 | 推論、LoRA、フルチューニング、トレーニングは異なります。 |
|---|---|---|
| ステップ2 | ピークメモリを見積もる | ランタイム状態とヘッドルームを含めます。 |
| ステップ3 | サービスターゲットを設定 | レイテンシー、スループット、期限、品質。 |
| ステップ4 | 総コストをベンチマーク | 受け入れられた結果をエンドツーエンドで測定します。 |
- エンドツーエンドのベンチマークの置き換え
- パラメータ数が総メモリと等しいと仮定
- ピークFLOPSのみから選択
決定方法
キャパシティをデプロイする前に確認すべきこと。
以下のコンテンツは、公開された仕様、GPURentoカタログ参照、およびワークロードベンチマークをまだ必要とする決定を分離しています。
1. ワークロードモードから始める
推論は重みとランタイム状態を保存します。トレーニングは勾配、オプティマイザ状態、アクティベーションを追加します。パラメータ効率的チューニングはその中間にあります。ハードウェアを比較する前に、モデルリビジョン、精度、コンテキストまたはシーケンス長、バッチ、同時実行数を書き留めてください。
2. メモリ予算を立てる
大まかな重量見積もりは、パラメータ数にパラメータあたりのバイト数を掛けたものですが、カーネル、量子化メタデータ、KVキャッシュ、アクティベーション、断片化がオーバーヘッドを追加します。計算機はショートリストとして扱い、ピーク割り当てを検証してください。
- 開始時の仮定として10〜20%の運用ヘッドルームを追加
- 10進GBと2進GiBを暗黙的に混在させないでください
- コンテキスト、バッチ、またはランタイムを変更した後に再テスト
3. 結果を比較する(仕様ではなく)
推論では、レイテンシと100万受け入れトークンあたりのドルを比較します。トレーニングでは、受け入れられたチェックポイントまでの時間とドルを比較します。ビジュアル作業では、受け入れられた画像、クリップ、またはフレームあたりのコストを比較します。
カタログショートリスト
関連するGPUオプション。
NVIDIA RTX 4090
24 GB GDDR6X · $0.34/時間
画像、動画、中規模推論
NVIDIA RTX 5090
32 GB GDDR7 · $0.69/時間
高速シングルGPU推論とメディア
NVIDIA A100 80GB
80 GB HBM2e · $1.19/時間
トレーニング、ファインチューニング、HPC
NVIDIA H100 SXM
80 GB HBM3 · $2.69/時間
集中的なトレーニングとFP8推論
NVIDIA H200 SXM
141 GB HBM3e · $3.59/時間
大規模モデル推論とHPC
質問
限界を含む明確な回答。
LLMにはどのくらいのGPUメモリが必要ですか?+
少なくとも、重みは選択した精度で収まる必要があります。推論用のランタイムワークスペースとKVキャッシュ、またはトレーニング用の勾配、オプティマイザ状態、アクティベーションを追加します。
常に最もVRAMが多いGPUを選ぶべきですか?+
いいえ。追加メモリは、実際の制約を回避する場合にのみ価値があります。ワークロードが適合し、パフォーマンスターゲットを満たす場合、小さいGPUの方が安価な場合があります。
セレクターは互換性を保証できますか?+
いいえ。透明な仮定からショートリストを生成できますが、正確なモデル、ランタイム、コンテナをテストする必要があります。
- NVIDIA A100製品ページメーカーによるA100アーキテクチャと80 GB構成。
- NVIDIA H100製品ページメーカーによるアーキテクチャとメモリ仕様。
- NVIDIA H200製品ページメーカーによるH200のメモリ容量と帯域幅。
最終確認日: 2026年9月1日。GPURentoレートは現在のカタログ参照です。プロビジョニング状態はワークスペースで表示されたままです。メーカー仕様はワークロードベンチマークの代わりにはなりません。
調査を続ける
デプロイ計画
候補リストを使用してから、パイロットを実行します。
セレクターはカタログを絞り込みます。資金提供されたワークスペースリクエストは、選択した構成をテスト可能な計画に変えます。