- 比较 GPU 系列的团队
- 容量请求前的LLM试点
- 具有明确假设的预算规划
- 向审查者解释硬件选择
GPU选择指南
如何为LLM选择云GPU。
按此顺序选择LLM GPU:定义任务,计算权重和运行时内存,添加KV缓存或训练状态,设置延迟或截止日期目标,然后基准最小的兼容GPU。比较每个接受结果的总体成本。最新或最快的GPU不一定最经济。
由 GPURento 基础设施团队审核 · 2026 年 9 月 1 日
| 步骤 1 | 定义任务 | 推理、LoRA、全量微调和训练不同。 |
|---|---|---|
| 步骤 2 | 估算峰值内存 | 包括运行时状态和余量。 |
| 步骤 3 | 设置服务目标 | 延迟、吞吐量、截止时间和质量。 |
| 步骤 4 | 基准总成本 | 端到端测量已接受的结果。 |
- 替代端到端基准测试
- 假设参数数量等于总内存
- 仅根据峰值 FLOPS 选择
决策方法
部署容量前需验证的事项。
以下内容区分了已发布的规格、GPURento 目录参考和仍需工作负载基准测试的决策。
1. 从工作负载模式开始
推理存储权重和运行时状态;训练增加梯度、优化器状态和激活;参数高效微调介于两者之间。在比较硬件之前,写下模型修订、精度、上下文或序列长度、批和并发。
2. 构建内存预算
粗略的权重估计是参数乘以每参数字节数,但内核、量化元数据、KV缓存、激活和碎片化会增加开销。将任何计算器视为候选清单,然后验证峰值分配。
- 添加10–20%的运营余量作为起始假设
- 不要静默混合十进制GB和二进制GiB
- 更改上下文、批次或运行时后重新测试
3. 比较结果,而非规格
对于推理,比较延迟和每百万可接受token的美元。对于训练,比较每个可接受检查点的时间和美元。对于视觉工作,比较每个可接受图像、片段或帧的成本。
目录候选清单
相关的 GPU 选项。
NVIDIA RTX 4090
24 GB GDDR6X · $0.34/小时
图像、视频和中型推理
NVIDIA RTX 5090
32 GB GDDR7 · $0.69/小时
快速单GPU推理和媒体
NVIDIA A100 80GB
80 GB HBM2e · $1.19/小时
训练、微调和 HPC
NVIDIA H100 SXM
80 GB HBM3 · $2.69/小时
密集训练和FP8推理
NVIDIA H200 SXM
141 GB HBM3e · $3.59/小时
大型模型推理和HPC
问题
清晰的答案,包括限制。
LLM需要多少GPU内存?+
至少,权重必须以所选精度适配。为推理添加运行时工作空间和KV缓存,或为训练添加梯度、优化器状态和激活。
我应该总是选择 VRAM 最多的 GPU 吗?+
否。额外内存仅在避免实际约束时有价值。当工作负载适合并满足性能目标时,较小的GPU可能更便宜。
选择器能保证兼容性吗?+
否。它可以从透明的假设中产生候选列表,但必须测试确切的模型、运行时和容器。
最后审核于2026年9月1日。GPURento费率是当前目录参考;预配状态在工作区中保持可见,制造商规格不能替代工作负载基准测试。
继续研究