一个工作会话
$5.52
1 GPU × 8小时 · 仅计算
生产和批量推理
根据权重精度、运行时开销、KV 缓存、上下文长度和并发序列调整 LLM 推理大小。在选择 RTX 5090、L40S、H100 或 H200 之前,比较首令牌时间、令牌间延迟、p95 延迟和每百万接受令牌的成本。
由 GPURento 基础设施团队审核 · 2026 年 9 月 1 日
透明规划窗口
这些是计算租赁窗口,不是作业持续时间或性能的预测。用测量的试点替换小时数,并在计算器中添加存储。
一个工作会话
$5.52
1 GPU × 8小时 · 仅计算
四十小时窗口
$27.60
1 GPU × 40小时 · 仅计算
一百二十小时
$82.80
1 GPU × 120小时 · 仅计算
| 内存驱动因素 | 权重 + KV缓存 | 上下文和并发可能在权重之后占主导地位。 |
|---|---|---|
| 延迟指标 | TTFT · TPOT · p95 | 平均延迟隐藏队列和尾部行为。 |
| 经济指标 | $ / 1M tokens | 保持模型、质量和流量形态不变。 |
| 执行选择 | 专用或Serverless | 取决于利用率和冷启动容忍度。 |
决策方法
以下内容区分了已发布的规格、GPURento 目录参考和仍需工作负载基准测试的决策。
权重内存只是起点。添加量化元数据、运行时工作空间和所需上下文长度、批次大小和并发序列的KV缓存。留出余量,以免短暂峰值导致内存不足重启。
专用GPU适合稳定的利用率和可预测的温延迟。Serverless适合突发流量,当缩容到零的节省超过冷启动和每请求开销时。使用相同的流量轨迹评估两者。
更大的GPU是合理的,当它减少排队、提高并发或避免多GPU分片足以降低总成本时。否则,24–48 GB的卡可能是更好的经济选择。
目录候选清单
32 GB GDDR7 · $0.69/小时
快速单GPU推理和媒体
48 GB GDDR6 ECC · $0.79/小时
生产推理、微调和视频
80 GB HBM3 · $2.69/小时
密集训练和FP8推理
141 GB HBM3e · $3.59/小时
大型模型推理和HPC
问题
取决于参数数量、精度、运行时、上下文和并发。首先计算模型权重,然后添加KV缓存和至少实际运行时余量。
对于间歇性流量,它可能适用,因为空闲工作器可以缩减。持续繁忙的端点可能在专用实例上更便宜且更可预测。
使用每百万接受令牌的成本以及首令牌时间和 p95 延迟。仅吞吐量可能隐藏糟糕的用户体验。
最后审核于2026年9月1日。GPURento费率是当前目录参考;预配状态在工作区中保持可见,制造商规格不能替代工作负载基准测试。
继续研究