设计上快速启动
模型感知缓存和预构建层减少启动惩罚,而无需强制始终在线容量。
为什么选择GPURento
模型感知缓存和预构建层减少启动惩罚,而无需强制始终在线容量。
优先考虑加速器系列和区域,然后在池受限时进行故障转移。
从一个视图跟踪队列延迟、执行时间、冷启动、工作器健康、发布和支出。
从代码到容量
连接源
选择模型模板、GitHub仓库或Docker镜像。
设置扩展策略
定义GPU优先级、并发、工作器下限和上限。
调用您的端点
使用队列 API、同步路由或 OpenAI 兼容接口。
from gpurento import serverless
@serverless.endpoint(
gpu=["L40S", "A100-80GB"],
min_workers=0,
max_workers=24,
concurrency=8,
)
def generate(prompt: str):
return model(prompt)已包括
每个工作负载获得相同的API、身份、计费和可观测性层。
当没有请求且空闲窗口过期时,弹性工作进程将关闭。下一个请求启动兼容的工作进程,队列保留作业。
是的。为稳定流量设置最小工作进程数,或使用计划容量应对可预测的峰值。保存策略前成本估算会更新。
产品流程支持 GitHub、容器注册表、精选模型模板和 Python 优先的远程函数工作流。
作业暴露清晰的排队、运行、完成、重试和失败状态。重试策略、超时、作业TTL和webhook行为保持可配置。
随时准备就绪