Serverlose GPU

Inferenz, die mit der Anfrage skaliert, nicht mit der Vermutung.

Verwandeln Sie einen Container oder ein Repository in einen Produktionsendpunkt mit intelligentem GPU-Routing, Warm-Pools, integrierten Warteschlangen und Scale-to-Zero-Ökonomie.

Transparente Baseline

$0 im Leerlauf

Flex-Worker skalieren zwischen Anfragen auf null

Self-Service

<250 ms

Ziel-Kaltstart

0→500

Worker

P98

Latenzansichten

4

Quellen bereitstellen

EU-Regionen, verschlüsselter Speicher und Netzwerkisolationsoptionen

Warum GPURento

Weniger Infrastrukturarbeit. Mehr Modellfortschritt.

Schnelle Starts by design

Modellbewusstes Caching und vorgefertigte Schichten reduzieren den Start-Overhead, ohne Always-on-Kapazität zu erzwingen.

Zur richtigen GPU routen

Beschleunigerfamilien und Regionen priorisieren, dann bei Pool-Engpass ausweichen.

Jede Anfrage beobachten

Verfolgen Sie Warteschlangenverzögerung, Ausführungszeit, Kaltstarts, Worker-Gesundheit, Releases und Ausgaben aus einer Ansicht.

Vom Code zur Kapazität

Ein sauberer Weg in die Produktion.

1

Quelle verbinden

Wählen Sie eine Modellvorlage, ein GitHub-Repository oder ein Docker-Image.

2

Skalierungsrichtlinie festlegen

Definieren Sie GPU-Prioritäten, Parallelität, Worker-Unter- und -Obergrenze.

3

Rufen Sie Ihren Endpunkt auf

Verwenden Sie eine Warteschlangen-API, eine synchrone Route oder eine OpenAI-kompatible Schnittstelle.

deploy.py
from gpurento import serverless

@serverless.endpoint(
  gpu=["L40S", "A100-80GB"],
  min_workers=0,
  max_workers=24,
  concurrency=8,
)
def generate(prompt: str):
  return model(prompt)
✓ Konfiguration im Arbeitsbereich gespeichert · Bereitstellungsstatus sichtbar

Enthalten

Eine ernsthafte Plattform, kein dünner Wrapper.

Jeder Workload erhält dieselbe API-, Identitäts-, Abrechnungs- und Beobachtbarkeitsebene.

Flex- und aktive Workermodi
Warteschlangen- und Lastausgleichs-Endpunkte
GPU-Priorität und regionales Routing
Modell-Cache und persistenter Speicher
Anfragelogs und Live-Worker-Zustände
Versionierte Releases und Rollback
Webhook-Zustellung und Wiederholungen
OpenAI-kompatible Modellrouten

FAQ

Klare Antworten.

Dokumentation lesen
Wie funktioniert Scale-to-Zero?+

Wenn keine Anfragen mehr vorhanden sind und das Leerlauffenster abläuft, werden Flex-Worker heruntergefahren. Die nächste Anfrage startet einen kompatiblen Worker und die Warteschlange bewahrt den Job.

Kann ich Worker warm halten?+

Ja. Legen Sie eine Mindestanzahl von Workern für stabilen Datenverkehr fest oder verwenden Sie geplante Kapazität für vorhersehbare Spitzen. Die Kostenschätzung wird aktualisiert, bevor die Richtlinie gespeichert wird.

Kann ich von GitHub aus bereitstellen?+

Der Produktablauf unterstützt GitHub, Container-Registries, kuratierte Modellvorlagen und einen Python-First-Remote-Funktions-Workflow.

Wie werden Fehler behandelt?+

Jobs zeigen klare Warteschlangen-, Lauf-, abgeschlossene, wiederholte und fehlgeschlagene Zustände. Wiederholungsrichtlinie, Timeout, Job-TTL und Webhook-Verhalten bleiben konfigurierbar.

Bereit, wenn Sie es sind

Liefern Sie die Workload, nicht das Warten.

Konto erstellen