Eine Arbeitssitzung
$5.52
1 GPU × 8h · nur Compute
Produktions- und Batch-Inferenz
LLM-Inferenz anhand von Gewichtspräzision, Laufzeit-Overhead, KV-Cache, Kontextlänge und gleichzeitigen Sequenzen dimensionieren. Vergleichen Sie Zeit bis zum ersten Token, Inter-Token-Latenz, p95-Latenz und Kosten pro Million akzeptierter Token, bevor Sie RTX 5090, L40S, H100 oder H200 auswählen.
Überprüft vom GPURento-Infrastrukturteam · 1. September 2026
Transparente Planungsfenster
Dies sind Compute-Mietfenster, keine Vorhersagen der Jobdauer oder Leistung. Ersetzen Sie die Stunden durch einen gemessenen Piloten und fügen Sie Speicher im Rechner hinzu.
Eine Arbeitssitzung
$5.52
1 GPU × 8h · nur Compute
Vierzig-Stunden-Fenster
$27.60
1 GPU × 40h · nur Compute
Einhundertzwanzig Stunden
$82.80
1 GPU × 120h · nur Compute
| Speichertreiber | Gewichte + KV-Cache | Kontext und Parallelität können nach den Gewichten dominieren. |
|---|---|---|
| Latenzmetriken | TTFT · TPOT · p95 | Durchschnittliche Latenz verbirgt Warteschlangen- und Tail-Verhalten. |
| Wirtschaftliche Kennzahl | $ / 1 Mio. Tokens | Modell, Qualität und Verkehrsform konstant halten. |
| Ausführungswahl | Dediziert oder serverlos | Hängt von Auslastung und Kaltstarttoleranz ab. |
Entscheidungsmethode
Der folgende Inhalt trennt veröffentlichte Spezifikationen, GPURento-Katalogreferenzen und Entscheidungen, die noch einen Workload-Benchmark erfordern.
Gewichtsspeicher ist nur der Ausgangspunkt. Fügen Sie Quantisierungsmetadaten, Laufzeit-Arbeitsbereich und KV-Cache für die gewünschte Kontextlänge, Batchgröße und gleichzeitige Sequenzen hinzu. Lassen Sie Headroom, damit ein kurzer Spitzenwert keinen Out-of-Memory-Neustart verursacht.
Eine dedizierte GPU eignet sich für gleichmäßige Auslastung und vorhersehbare Warm-Latenz. Serverless passt zu burstigem Verkehr, wenn die Einsparungen durch Scale-to-Zero Kaltstart- und Pro-Request-Overhead übersteigen. Bewerten Sie beide mit derselben Verkehrsspur.
Eine größere GPU ist gerechtfertigt, wenn sie Warteschlangen reduziert, Parallelität erhöht oder Multi-GPU-Sharding genug vermeidet, um die Gesamtkosten zu senken. Andernfalls kann eine 24–48-GB-Karte wirtschaftlich besser passen.
Katalog-Shortlist
32 GB GDDR7 · $0,69/Std.
Schnelle Single-GPU-Inferenz und Medien
48 GB GDDR6 ECC · $0,79/Std.
Produktions-Inferenz, Fine-Tuning und Video
80 GB HBM3 · $2,69/Std.
Intensives Training und FP8-Inferenz
141 GB HBM3e · $3,59/Std.
Inferenz großer Modelle und HPC
Fragen
Es hängt von Parameteranzahl, Präzision, Laufzeit, Kontext und Parallelität ab. Berechnen Sie zuerst die Modellgewichte, addieren Sie dann den KV-Cache und mindestens eine praktische Laufzeitreserve.
Es kann für intermittierenden Datenverkehr geeignet sein, da idle Worker herunterskaliert werden können. Ein kontinuierlich ausgelasteter Endpunkt kann auf einer dedizierten Instanz günstiger und vorhersehbarer sein.
Verwenden Sie Kosten pro Million akzeptierter Token zusammen mit Zeit bis zum ersten Token und p95-Latenz. Durchsatz allein kann eine schlechte Benutzererfahrung verbergen.
Zuletzt überprüft am 1. September 2026. GPURento-Tarife sind aktuelle Katalogreferenzen; der Bereitstellungsstatus bleibt im Workspace sichtbar, und Herstellerspezifikationen ersetzen keine Workload-Benchmarks.
Recherche fortsetzen
Bereitstellungsplan
Bringen Sie Modell, Präzision, Kontext, Parallelität und Latenzziel in die Arbeitsbereichskonfiguration ein.