サーバーレスGPU

推測ではなくリクエストに応じてスケーリングする推論。

コンテナまたはリポジトリを、スマートなGPUルーティング、ウォームプール、組み込みキュー、スケールトゥゼロの経済性を備えた本番エンドポイントに変えます。

透明なベースライン

$0 アイドル

flexワーカーはリクエスト間でゼロにスケールします

セルフサービス

<250 ms

ターゲットコールドスタート

0→500

ワーカー

P98

レイテンシービュー

4

ソースをデプロイ

EUリージョン、暗号化ストレージ、ネットワーク分離オプション

GPURentoを選ぶ理由

インフラ作業を減らし、モデルの進歩を増やす。

設計による高速起動

モデル認識キャッシュと事前構築レイヤーは、常時オンのキャパシティを強制せずに起動ペナルティを削減します。

適切なGPUにルーティング

アクセラレータファミリとリージョンを優先し、プールが制約されたときにフェイルオーバーします。

すべてのリクエストを監視

キュー遅延、実行時間、コールドスタート、ワーカーヘルス、リリース、支出を1つのビューで追跡します。

コードからキャパシティへ

本番環境へのクリーンなパス。

1

ソースを接続

モデルテンプレート、GitHubリポジトリ、またはDockerイメージを選択します。

2

スケーリングポリシーを設定

GPU優先順位、並行性、ワーカーの下限と上限を定義します。

3

エンドポイントを呼び出す

キューAPI、同期ルート、またはOpenAI互換インターフェースを使用します。

deploy.py
from gpurento import serverless

@serverless.endpoint(
  gpu=["L40S", "A100-80GB"],
  min_workers=0,
  max_workers=24,
  concurrency=8,
)
def generate(prompt: str):
  return model(prompt)
✓ 設定はワークスペースに保存されました · プロビジョニング状態が表示されます

含まれています

薄いラッパーではなく、本格的なプラットフォーム。

すべてのワークロードは、同じAPI、ID、請求、可観測性レイヤーを取得します。

Flexおよびアクティブワーカーモード
キューおよびロードバランサーエンドポイント
GPU優先度とリージョナルルーティング
モデルキャッシュと永続ストレージ
リクエストログとライブワーカー状態
バージョン管理されたリリースとロールバック
Webhook配信と再試行
OpenAI互換モデルルート

FAQ

率直な回答。

ドキュメントを読む
スケール・トゥ・ゼロはどのように機能しますか?+

リクエストがなくなり、アイドルウィンドウが期限切れになると、フレックスワーカーはシャットダウンします。次のリクエストは互換性のあるワーカーを起動し、キューはジョブを保持します。

ワーカーをウォームに保てますか?+

はい。安定したトラフィックのために最小ワーカー数を設定するか、予測可能なピークのためにスケジュールされたキャパシティを使用できます。コスト見積もりはポリシーが保存される前に更新されます。

GitHubからデプロイできますか?+

製品フローは、GitHub、コンテナレジストリ、キュレーションされたモデルテンプレート、Pythonファーストのリモート関数ワークフローをサポートしています。

障害はどのように処理されますか?+

ジョブは、キュー、実行中、完了、再試行、失敗の明確な状態を公開します。再試行ポリシー、タイムアウト、ジョブTTL、Webhook動作は設定可能です。

いつでも準備完了

ワークロードを出荷し、待ち時間を出荷しない。

アカウント作成