1. 将模型适配到VRAM中
模型权重只是基线。为框架、激活、KV缓存和您实际需要的批大小留出空间。
GPU规格和费率
VRAM回答“能否容纳?”内存带宽和支持的精度有助于解释吞吐量。唯一可靠的性能测试仍然是您的模型、批次、框架和输出目标。
模型权重只是基线。为框架、激活、KV缓存和您实际需要的批大小留出空间。
当权重和缓存移动更快时,LLM解码和其他内存密集型作业可以受益。容量本身不能预测吞吐量。
FP16、BF16、FP8和FP4峰值测量不同的操作模式。使用您的模型和软件堆栈可以安全运行的精度。
最便宜的每小时 GPU 并不总是最便宜的结果。一起测量运行时间、接受的输出、存储和重试成本。
| GPU | 内存 | 内存带宽 | 官方峰值指标 | 按需 | 决策适配 | 来源 |
|---|---|---|---|---|---|---|
| RTX A5000Ampere | 24 GB GDDR6 ECC | 768 GB/s | 222.2 TFLOPS Tensor* 带稀疏性的有效Tensor峰值 | US$0.16/hrUS$3.84/24h | 低成本LoRA、扩散和通用CUDA开发。 | NVIDIA RTX A5000 数据表 |
| RTX 4090Ada | 24 GB GDDR6X | 1,008 GB/s | 1,321 AI TOPS* Ada供应商AI峰值(稀疏) | US$0.34/hrUS$8.16/24h | 强大的性价比,适用于图像、视频和 24 GB 推理。 | NVIDIA Ada 架构 |
| RTX 5090Blackwell | 32 GB GDDR7 | 1,792 GB/s | 3,352 AI TOPS* Blackwell供应商AI峰值(稀疏) | US$0.69/hrUS$16.56/24h | 具有32 GB和原生FP4支持的快速单GPU生成。 | NVIDIA RTX 5090 规格 |
| L40SAda | 48 GB GDDR6 ECC | 864 GB/s | 1,466 TFLOPS FP8* Ada Tensor峰值(稀疏) | US$0.79/hrUS$18.96/24h | 48 GB ECC 用于推理、微调、渲染和视频。 | NVIDIA L40S 规格 |
| A100 80GBAmpere | 80 GB HBM2e | 1.94–2.04 TB/s | 312 TFLOPS FP16/BF16 624 TFLOPS 稀疏 | US$1.19/hrUS$28.56/24h | 成熟的80 GB平台,用于训练、微调和HPC。 | NVIDIA A100 规格 |
| H100 NVLHopper | 94 GB HBM3 | 3.9 TB/s | 1,671 TFLOPS FP16/BF16* Hopper Tensor峰值(含稀疏性) | US$2.59/hrUS$62.16/24h | 每个GPU 94 GB和NVLink,用于高吞吐LLM推理。 | NVIDIA H100 规格 |
| H100 SXMHopper | 80 GB HBM3 | 3.35 TB/s | 1,979 TFLOPS FP16/BF16* Hopper Tensor峰值(含稀疏性) | US$2.69/hrUS$64.56/24h | 高吞吐训练和FP8推理,配备900 GB/s NVLink。 | NVIDIA H100 规格 |
| H200 SXMHopper | 141 GB HBM3e | 4.8 TB/s | 1,979 TFLOPS FP16/BF16* Hopper Tensor峰值(含稀疏性) | US$3.59/hrUS$86.16/24h | 141 GB 和更高带宽,适用于长上下文和大模型推理。 | NVIDIA H200 规格 |
| B200Blackwell | 180 GB HBM3e | 最高 8 TB/s | 9 PFLOPS FP4 稠密† 每 GPU 等效值(来自 HGX 总数) | US$5.98/hrUS$143.52/24h | 180 GB 用于前沿训练和低精度推理。 | NVIDIA HGX B200 规格 |
| B300Blackwell Ultra | 288 GB HBM3e | 最高 8 TB/s | 13.5 PFLOPS FP4 稠密† 每 GPU 等效值(来自 HGX 总数) | US$6.94/hrUS$166.56/24h | 288 GB 用于前沿推理、超长上下文和大批量处理。 | NVIDIA HGX B300 规格 |
峰值数据来自 NVIDIA,并非跨 GPU 基准测试分数。* 供应商数据包含稀疏性。† 每 GPU 等效值根据官方八 GPU HGX 总数计算。不同精度、稀疏模式和外形不能直接互换。
目录费率已审查 2026 年 9 月 1 日. Regions: 欧盟西部 · 巴黎 · 欧盟中部 · 法兰克福
模型内存规划
有用的第一近似是参数数量乘以每权重字节数:FP16/BF16为2字节,INT8为1,4位权重约为0.5。
参数类别
24 GB GPU通常提供实用的推理余量。
参数类别
32–48 GB 为运行时开销和更大上下文留出空间。
参数类别
48 GB 是低比特的底线;80–288 GB 提供了有用的余量。
工作负载推荐
创意工作负载通常受益于RTX的性价比。训练和大模型推理越来越依赖ECC内存、Tensor精度、内存带宽和多GPU互连。
RTX 4090 · RTX 5090 · L40S
从 4090 开始以获得价值,转向 5090 以获得 32 GB 和更强的低精度加速,或 L40S 以获得 48 GB ECC 和数据中心操作。
阅读工作负载指南L40S · H100 NVL · H200
按模型占用和上下文选择。L40S涵盖许多量化模型;H100 NVL和H200增加内存、带宽和更强的Tensor吞吐量。
阅读工作负载指南A100 · H100 SXM · B200/B300
A100仍然是成熟的基线。H100增加了Transformer Engine和FP8;Blackwell针对最大的低精度训练和推理作业。
阅读工作负载指南RTX 4090 · RTX 5090 · L40S
RTX 显卡提供强大的创意价值。L40S 结合 48 GB ECC 显存与数据中心级图形、AI 和媒体加速,适用于持久化流水线。
阅读工作负载指南用加密货币支付的是普通云计算费用。挖矿不作为支持的工作负载进行宣传,并且仍需明确政策确认。
支付流程有意与 GPU 选择分开:选择资源,估计作业,然后使用托管发票上的确切资产和网络添加工作区信用。
在打开钱包之前检查内存适配、预期运行时、区域和每小时费率。
最低初始充值额为 $50。这是钱包信用,不是额外服务费。仅使用实时发票上显示的资产、金额和网络。
直接在控制面板中配置资源。预付费使用从钱包余额中扣除;包月租赁使用独立的结账流程。
Bitcoin、USDC、USDT或其他资产只能用于当前CoinGate发票上显示的准确资产和区块链网络。实时结账是权威的,因为商家设置和网络可用性可能变化。
提供商货币和网络列表加密货币租GPU常见问题
性能和价格已在上文介绍;这些答案侧重于资金、账户访问和工作负载政策。
是的,当比特币或USDC以及确切的区块链网络出现在实时托管发票上时。可用的支付路由可能会变化,因此结账页面(而非静态列表)是权威。
不是。充值金额会成为钱包预付余额。$50 是最低充值限额,不是费用,也不是为解锁网站而收取的金额。
仅在支付提供商报告最终确认订单且 GPURento 从服务器验证该订单后。待处理或确认中的转账不会增加钱包余额。
过期后生成新发票。错误网络的转账可能不可逆且不会自动入账;请保留订单ID和交易哈希并联系支付支持。
没有自助加密货币提款。未使用的信用保留在工作区余额中;任何退款取决于适用的支付和服务条款,可能需要手动对账。
否。加密货币描述支付方式,而非工作负载策略。不宣传支持挖矿,并且在提交任何工作负载之前需要明确确认。
硬件规格使用链接的NVIDIA产品文档。支付行为使用官方CoinGate文档。最后审核 2026 年 9 月 1 日.