Serverless GPU

推理随请求扩展,而非猜测。

将容器或仓库转变为生产端点,具有智能 GPU 路由、热池、内置队列和规模到零的经济性。

透明基线

$0 空闲

flex工作器在请求之间扩展到零

自助服务

<250 毫秒

目标冷启动

0→500

工作进程

P98

延迟视图

4

部署源

欧盟区域、加密存储和网络隔离选项

为什么选择GPURento

更少的基础设施工作。更多的模型进展。

设计上快速启动

模型感知缓存和预构建层减少启动惩罚,而无需强制始终在线容量。

路由到正确的 GPU

优先考虑加速器系列和区域,然后在池受限时进行故障转移。

观察每个请求

从一个视图跟踪队列延迟、执行时间、冷启动、工作器健康、发布和支出。

从代码到容量

通往生产的一条清晰路径。

1

连接源

选择模型模板、GitHub仓库或Docker镜像。

2

设置扩展策略

定义GPU优先级、并发、工作器下限和上限。

3

调用您的端点

使用队列 API、同步路由或 OpenAI 兼容接口。

deploy.py
from gpurento import serverless

@serverless.endpoint(
  gpu=["L40S", "A100-80GB"],
  min_workers=0,
  max_workers=24,
  concurrency=8,
)
def generate(prompt: str):
  return model(prompt)
✓ 配置已保存到工作区 · 供应状态可见

已包括

严肃的平台,不是薄包装。

每个工作负载获得相同的API、身份、计费和可观测性层。

Flex和活动工作器模式
队列和负载均衡器端点
GPU优先级和区域路由
模型缓存和持久存储
请求日志和实时 worker 状态
版本化发布和回滚
Webhook投递和重试
OpenAI 兼容模型路由

常见问题

直接回答。

阅读文档
缩容到零如何工作?+

当没有请求且空闲窗口过期时,弹性工作进程将关闭。下一个请求启动兼容的工作进程,队列保留作业。

我可以保持worker温暖吗?+

是的。为稳定流量设置最小工作进程数,或使用计划容量应对可预测的峰值。保存策略前成本估算会更新。

可以从 GitHub 部署吗?+

产品流程支持 GitHub、容器注册表、精选模型模板和 Python 优先的远程函数工作流。

故障如何处理?+

作业暴露清晰的排队、运行、完成、重试和失败状态。重试策略、超时、作业TTL和webhook行为保持可配置。

随时准备就绪

交付工作负载,而不是等待。

创建账户