Tek çalışma oturumu
$5.52
1 GPU × 8sa · yalnızca hesaplama
Üretim ve toplu çıkarım
LLM çıkarımını ağırlık hassasiyetinden, çalışma zamanı yükünden, KV önbelleğinden, bağlam uzunluğundan ve eşzamanlı dizilerden boyutlandırın. RTX 5090, L40S, H100 veya H200'ü seçmeden önce ilk token süresini, tokenlar arası gecikmeyi, p95 gecikmesini ve kabul edilen milyon token başına maliyeti karşılaştırın.
GPURento altyapı ekibi tarafından incelendi · 1 Eylül 2026
Şeffaf planlama pencereleri
Bunlar bilgi işlem kiralama pencereleridir, iş süresi veya performans tahminleri değildir. Saatleri ölçülen bir pilotla değiştirin ve hesaplayıcıya depolama ekleyin.
Tek çalışma oturumu
$5.52
1 GPU × 8sa · yalnızca hesaplama
Kırk saatlik pencere
$27.60
1 GPU × 40sa · yalnızca hesaplama
Yüz yirmi saat
$82.80
1 GPU × 120sa · yalnızca hesaplama
| Bellek sürücüleri | Ağırlıklar + KV önbelleği | Bağlam ve eşzamanlılık, ağırlıklardan sonra baskın olabilir. |
|---|---|---|
| Gecikme metrikleri | TTFT · TPOT · p95 | Ortalama gecikme, kuyruk ve kuyruk sonu davranışını gizler. |
| Ekonomik metrik | $ / 1M token | Modeli, kaliteyi ve trafik şeklini sabit tutun. |
| Yürütme seçimi | Özel veya sunucusuz | Kullanıma ve soğuk başlatma toleransına bağlıdır. |
Karar yöntemi
Aşağıdaki içerik, yayınlanmış özellikleri, GPURento katalog referanslarını ve hala bir iş yükü kıyaslaması gerektiren kararları ayırır.
Ağırlık belleği yalnızca başlangıç noktasıdır. İstenen bağlam uzunluğu, toplu iş boyutu ve eşzamanlı diziler için niceleme meta verilerini, çalışma zamanı çalışma alanını ve KV önbelleğini ekleyin. Kısa bir tepe noktasının bellek yetersizliğinden yeniden başlatmaya neden olmaması için pay bırakın.
Özel bir GPU, sabit kullanım ve öngörülebilir sıcak gecikme için uygundur. Sunucusuz, sıfıra ölçekleme tasarrufları soğuk başlangıç ve istek başına ek yükü aştığında patlamalı trafiğe uyar. Her ikisini de aynı trafik iziyle değerlendirin.
Daha büyük bir GPU, kuyruğu azalttığında, eşzamanlılığı artırdığında veya çoklu GPU parçalamayı önleyerek toplam maliyeti düşürdüğünde haklı çıkar. Aksi takdirde, 24–48 GB'lık bir kart daha iyi bir ekonomik uyum olabilir.
Katalog kısa listesi
32 GB GDDR7 · $0,69/saat
Hızlı tek GPU çıkarımı ve medya
48 GB GDDR6 ECC · $0,79/saat
Üretim çıkarımı, ince ayar ve video
80 GB HBM3 · $2,69/saat
Yoğun eğitim ve FP8 çıkarımı
141 GB HBM3e · $3,59/saat
Büyük model çıkarımı ve HPC
Sorular
Parametre sayısına, hassasiyete, çalışma süresine, bağlama ve eşzamanlılığa bağlıdır. Önce model ağırlıklarını hesaplayın, ardından KV önbelleğini ve en azından pratik bir çalışma zamanı marjını ekleyin.
Kesintili trafik için olabilir çünkü boşta çalışanlar ölçeklenebilir. Sürekli meşgul bir uç nokta, özel bir örnekte daha ucuz ve daha öngörülebilir olabilir.
Kabul edilen milyon token başına maliyeti, ilk token süresi ve p95 gecikmesiyle birlikte kullanın. Yalnızca verim, kötü kullanıcı deneyimini gizleyebilir.
Son gözden geçirme 1 Eylül 2026. GPURento ücretleri güncel katalog referanslarıdır; sağlama durumu çalışma alanında görünür kalır ve üretici özellikleri iş yükü kıyaslamalarının yerini tutmaz.
Araştırmaya devam et
Dağıtım planı
Modeli, hassasiyeti, bağlamı, eşzamanlılığı ve gecikme hedefini çalışma alanı yapılandırmasına getirin.