Serverless GPU

Tahmine göre değil, isteğe göre ölçeklenen çıkarım.

Bir konteyneri veya depoyu akıllı GPU yönlendirme, sıcak havuzlar, yerleşik kuyruklar ve sıfıra ölçekleme ekonomisiyle üretim uç noktasına dönüştürün.

Şeffaf temel

$0 boşta

esnek çalışanlar istekler arasında sıfıra ölçeklenir

Self-servis

<250 ms

Hedef soğuk başlangıç

0→500

Çalışanlar

P98

Gecikme görünümleri

4

Kaynakları dağıt

AB bölgeleri, şifrelenmiş depolama ve ağ izolasyon seçenekleri

Neden GPURento

Daha az altyapı işi. Daha fazla model ilerlemesi.

Tasarım gereği hızlı başlangıçlar

Model farkında önbelleğe alma ve önceden oluşturulmuş katmanlar, her zaman açık kapasiteyi zorlamadan başlangıç cezasını azaltır.

Doğru GPU'ya yönlendir

Hızlandırıcı ailelerine ve bölgelerine öncelik verin, ardından bir havuz kısıtlandığında yük devretme yapın.

Her isteği gözlemleyin

Kuyruk gecikmesini, yürütme süresini, soğuk başlangıçları, çalışan sağlığını, sürümleri ve harcamayı tek görünümden izleyin.

Koddan kapasiteye

Üretime giden tek temiz yol.

1

Kaynağı bağla

Bir model şablonu, GitHub deposu veya Docker görüntüsü seçin.

2

Ölçekleme politikasını ayarla

GPU önceliklerini, eşzamanlılığı, çalışan alt ve üst sınırlarını tanımlayın.

3

Uç noktanızı çağırın

Bir kuyruk API'si, eşzamanlı yol veya OpenAI uyumlu arayüz kullanın.

deploy.py
from gpurento import serverless

@serverless.endpoint(
  gpu=["L40S", "A100-80GB"],
  min_workers=0,
  max_workers=24,
  concurrency=8,
)
def generate(prompt: str):
  return model(prompt)
✓ Yapılandırma çalışma alanına kaydedildi · sağlama durumu görünür

Dahil

İnce bir sarmalayıcı değil, ciddi bir platform.

Her iş yükü aynı API, kimlik, faturalandırma ve gözlemlenebilirlik katmanını alır.

Esnek ve aktif çalışan modları
Kuyruk ve yük dengeleyici uç noktalar
GPU önceliği ve bölgesel yönlendirme
Model önbelleği ve kalıcı depolama
İstek günlükleri ve canlı çalışan durumları
Sürümlü sürümler ve geri alma
Webhook teslimi ve yeniden denemeler
OpenAI uyumlu model yolları

SSS

Net cevaplar.

Belgeleri okuyun
Sıfıra ölçekleme nasıl çalışır?+

Hiçbir istek kalmadığında ve boşta kalma süresi dolduğunda, esnek çalışanlar kapanır. Sonraki istek uyumlu bir çalışan başlatır ve kuyruk işi korur.

Çalışanları sıcak tutabilir miyim?+

Evet. Sürekli trafik için minimum çalışan sayısı belirleyin veya öngörülebilir zirveler için zamanlanmış kapasite kullanın. Maliyet tahmini, ilke kaydedilmeden önce güncellenir.

GitHub’dan dağıtım yapabilir miyim?+

Ürün akışı GitHub, konteyner kayıtları, seçilmiş model şablonları ve Python öncelikli uzak işlev iş akışını destekler.

Hatalar nasıl ele alınır?+

İşler net kuyruklanmış, çalışıyor, tamamlandı, yeniden denendi ve başarısız durumlarını gösterir. Yeniden deneme ilkesi, zaman aşımı, iş TTL'si ve web kancası davranışı yapılandırılabilir kalır.

Hazır olduğunuzda

İş yükünü gönderin, beklemeyi değil.

Hesap oluştur