一个工作会话
$1.28
1 GPU × 8小时 · 仅计算
视觉、音频和嵌入推理
使用本指南进行图像、音频、嵌入、排序和多模态推理。比较输入形状、预处理、批次大小、热和冷延迟、吞吐量和每个接受预测的成本;使用 LLM 推理指南进行令牌生成、上下文和 KV 缓存。
由 GPURento 基础设施团队审核 · 2026 年 9 月 1 日
透明规划窗口
这些是计算租赁窗口,不是作业持续时间或性能的预测。用测量的试点替换小时数,并在计算器中添加存储。
一个工作会话
$1.28
1 GPU × 8小时 · 仅计算
四十小时窗口
$6.40
1 GPU × 40小时 · 仅计算
一百二十小时
$19.20
1 GPU × 120小时 · 仅计算
| 输入约束 | 形状 + 批次 | 预处理和运行时工作区会影响峰值内存。 |
|---|---|---|
| 服务指标 | p95 延迟 | 平均延迟可能隐藏排队和尾部行为。 |
| 经济指标 | 每个预测的成本 | 比较GPU时保持质量和流量形态不变。 |
| 目录条目费率 | 起价$0.16 / GPU小时 | 按需计算,先于持久存储。 |
决策方法
以下内容区分了已发布的规格、GPURento 目录参考和仍需工作负载基准测试的决策。
在预期的批和输入分布下测量解码、调整大小、特征提取、加载的模型内存、框架工作区和临时分配。比较GPU时保持预处理相同。
捕获预处理、排队时间、p50和p95延迟、吞吐量和错误率。对于批处理作业,记录每小时接受的预测。在相同的模型质量下比较候选,而不是依赖峰值硬件规格。
专用GPU适合可预测或持续的使用。突发流量可能更倾向于请求驱动的worker,当缩容节省超过冷启动开销时。使用代表性的流量轨迹,并在比较中包含空闲时间。
目录候选清单
24 GB GDDR6 ECC · $0.16/小时
通用ML、Stable Diffusion和LoRA
24 GB GDDR6X · $0.34/小时
图像、视频和中型推理
24 GB GDDR6 · $0.44/小时
高效推理、视频和端点
48 GB GDDR6 ECC · $0.79/小时
生产推理、微调和视频
问题
这是按小时访问云GPU,用于运行训练好的模型进行预测、生成、嵌入或批处理,而无需购买硬件。
当前 GPURento 目录从每 GPU 小时 $0.16 起。有用的比较是总计算和存储成本除以在所需质量和延迟下接受的输出。
使用适合模型并满足延迟和吞吐量目标的最小 GPU。RTX 卡对于精简工作负载可能经济,L4 有利于高效服务,L40S 为更大或混合 AI 和媒体流水线提供 48 GB ECC 内存。
请选择当前 Paymento 发票上显示的资产和网络。钱包充值最低为 $50;包月订单有各自的发票金额。
最后审核于2026年9月1日。GPURento费率是当前目录参考;预配状态在工作区中保持可见,制造商规格不能替代工作负载基准测试。
继续研究