서버리스 GPU

추측이 아닌 요청에 따라 확장되는 추론.

스마트 GPU 라우팅, 웜 풀, 내장 큐 및 제로 스케일링 경제성으로 컨테이너 또는 리포지토리를 프로덕션 엔드포인트로 전환하십시오.

투명한 기준

$0 유휴

flex 작업자는 요청 사이에 0으로 확장됩니다.

셀프 서비스

<250 ms

목표 콜드 스타트

0→500

워커

P98

지연 시간 보기

4

소스 배포

EU 지역, 암호화된 스토리지 및 네트워크 격리 옵션

GPURento를 선택하는 이유

인프라 작업은 줄이고 모델 진행은 늘리세요.

설계상 빠른 시작

모델 인식 캐싱 및 사전 빌드된 레이어는 항상 켜진 용량을 강요하지 않고 시작 패널티를 줄입니다.

올바른 GPU로 라우팅

가속기 제품군과 지역을 우선시한 다음 풀이 제한될 때 장애 조치하십시오.

모든 요청 관찰

한 보기에서 대기열 지연, 실행 시간, 콜드 스타트, 작업자 상태, 릴리스 및 지출을 추적하십시오.

코드에서 용량까지

프로덕션으로 가는 하나의 깔끔한 경로.

1

소스 연결

모델 템플릿, GitHub 저장소 또는 Docker 이미지를 선택하세요.

2

확장 정책 설정

GPU 우선 순위, 동시성, 작업자 하한 및 상한을 정의합니다.

3

엔드포인트 호출

큐 API, 동기식 경로 또는 OpenAI 호환 인터페이스를 사용하십시오.

deploy.py
from gpurento import serverless

@serverless.endpoint(
  gpu=["L40S", "A100-80GB"],
  min_workers=0,
  max_workers=24,
  concurrency=8,
)
def generate(prompt: str):
  return model(prompt)
✓ 구성이 작업공간에 저장되었습니다 · 프로비저닝 상태 표시

포함됨

얇은 래퍼가 아닌 진지한 플랫폼.

모든 워크로드는 동일한 API, ID, 청구 및 관찰 가능성 계층을 얻습니다.

Flex 및 활성 작업자 모드
큐 및 로드 밸런서 엔드포인트
GPU 우선 순위 및 리전 라우팅
모델 캐시 및 영구 스토리지
요청 로그 및 실시간 작업자 상태
버전별 릴리스 및 롤백
웹훅 전달 및 재시도
OpenAI 호환 모델 경로

FAQ

직접적인 답변.

문서 읽기
스케일 투 제로는 어떻게 작동하나요?+

요청이 남아 있지 않고 유휴 창이 만료되면 flex 워커가 종료됩니다. 다음 요청은 호환 가능한 워커를 시작하고 대기열은 작업을 보존합니다.

워커를 웜 상태로 유지할 수 있나요?+

예. 안정적인 트래픽을 위해 최소 워커 수를 설정하거나 예측 가능한 피크를 위해 예약된 용량을 사용하십시오. 정책이 저장되기 전에 비용 추정치가 업데이트됩니다.

GitHub에서 배포할 수 있나요?+

제품 흐름은 GitHub, 컨테이너 레지스트리, 큐레이팅된 모델 템플릿 및 Python 우선 원격 함수 워크플로를 지원합니다.

실패는 어떻게 처리되나요?+

작업은 명확한 대기, 실행 중, 완료, 재시도 및 실패 상태를 노출합니다. 재시도 정책, 시간 초과, 작업 TTL 및 웹훅 동작은 구성 가능합니다.

준비가 되면

워크로드를 배송하세요. 대기는 잊으세요.

계정 생성