GPU选择指南

如何为LLM选择云GPU。

直接回答

按此顺序选择LLM GPU:定义任务,计算权重和运行时内存,添加KV缓存或训练状态,设置延迟或截止日期目标,然后基准最小的兼容GPU。比较每个接受结果的总体成本。最新或最快的GPU不一定最经济。

由 GPURento 基础设施团队审核 · 2026 年 9 月 1 日

关键事实 如何为LLM选择云GPU。
步骤 1定义任务推理、LoRA、全量微调和训练不同。
步骤 2估算峰值内存包括运行时状态和余量。
步骤 3设置服务目标延迟、吞吐量、截止时间和质量。
步骤 4基准总成本端到端测量已接受的结果。
最适合
  • 比较 GPU 系列的团队
  • 容量请求前的LLM试点
  • 具有明确假设的预算规划
  • 向审查者解释硬件选择
不适合当
  • 替代端到端基准测试
  • 假设参数数量等于总内存
  • 仅根据峰值 FLOPS 选择

决策方法

部署容量前需验证的事项。

以下内容区分了已发布的规格、GPURento 目录参考和仍需工作负载基准测试的决策。

01

1. 从工作负载模式开始

推理存储权重和运行时状态;训练增加梯度、优化器状态和激活;参数高效微调介于两者之间。在比较硬件之前,写下模型修订、精度、上下文或序列长度、批和并发。

02

2. 构建内存预算

粗略的权重估计是参数乘以每参数字节数,但内核、量化元数据、KV缓存、激活和碎片化会增加开销。将任何计算器视为候选清单,然后验证峰值分配。

  • 添加10–20%的运营余量作为起始假设
  • 不要静默混合十进制GB和二进制GiB
  • 更改上下文、批次或运行时后重新测试
03

3. 比较结果,而非规格

对于推理,比较延迟和每百万可接受token的美元。对于训练,比较每个可接受检查点的时间和美元。对于视觉工作,比较每个可接受图像、片段或帧的成本。

问题

清晰的答案,包括限制。

LLM需要多少GPU内存?+

至少,权重必须以所选精度适配。为推理添加运行时工作空间和KV缓存,或为训练添加梯度、优化器状态和激活。

我应该总是选择 VRAM 最多的 GPU 吗?+

否。额外内存仅在避免实际约束时有价值。当工作负载适合并满足性能目标时,较小的GPU可能更便宜。

选择器能保证兼容性吗?+

否。它可以从透明的假设中产生候选列表,但必须测试确切的模型、运行时和容器。

部署计划

使用候选列表,然后运行试点。

选择器缩小目录范围;资金充足的工作区请求将所选配置转化为可测试的计划。