設計による高速起動
モデル認識キャッシュと事前構築レイヤーは、常時オンのキャパシティを強制せずに起動ペナルティを削減します。
コンテナまたはリポジトリを、スマートなGPUルーティング、ウォームプール、組み込みキュー、スケールトゥゼロの経済性を備えた本番エンドポイントに変えます。
透明なベースライン
$0 アイドル
flexワーカーはリクエスト間でゼロにスケールします
<250 ms
ターゲットコールドスタート
0→500
ワーカー
P98
レイテンシービュー
4
ソースをデプロイ
GPURentoを選ぶ理由
モデル認識キャッシュと事前構築レイヤーは、常時オンのキャパシティを強制せずに起動ペナルティを削減します。
アクセラレータファミリとリージョンを優先し、プールが制約されたときにフェイルオーバーします。
キュー遅延、実行時間、コールドスタート、ワーカーヘルス、リリース、支出を1つのビューで追跡します。
コードからキャパシティへ
ソースを接続
モデルテンプレート、GitHubリポジトリ、またはDockerイメージを選択します。
スケーリングポリシーを設定
GPU優先順位、並行性、ワーカーの下限と上限を定義します。
エンドポイントを呼び出す
キューAPI、同期ルート、またはOpenAI互換インターフェースを使用します。
from gpurento import serverless
@serverless.endpoint(
gpu=["L40S", "A100-80GB"],
min_workers=0,
max_workers=24,
concurrency=8,
)
def generate(prompt: str):
return model(prompt)含まれています
すべてのワークロードは、同じAPI、ID、請求、可観測性レイヤーを取得します。
リクエストがなくなり、アイドルウィンドウが期限切れになると、フレックスワーカーはシャットダウンします。次のリクエストは互換性のあるワーカーを起動し、キューはジョブを保持します。
はい。安定したトラフィックのために最小ワーカー数を設定するか、予測可能なピークのためにスケジュールされたキャパシティを使用できます。コスト見積もりはポリシーが保存される前に更新されます。
製品フローは、GitHub、コンテナレジストリ、キュレーションされたモデルテンプレート、Pythonファーストのリモート関数ワークフローをサポートしています。
ジョブは、キュー、実行中、完了、再試行、失敗の明確な状態を公開します。再試行ポリシー、タイムアウト、ジョブTTL、Webhook動作は設定可能です。
いつでも準備完了