설계상 빠른 시작
모델 인식 캐싱 및 사전 빌드된 레이어는 항상 켜진 용량을 강요하지 않고 시작 패널티를 줄입니다.
GPURento를 선택하는 이유
모델 인식 캐싱 및 사전 빌드된 레이어는 항상 켜진 용량을 강요하지 않고 시작 패널티를 줄입니다.
가속기 제품군과 지역을 우선시한 다음 풀이 제한될 때 장애 조치하십시오.
한 보기에서 대기열 지연, 실행 시간, 콜드 스타트, 작업자 상태, 릴리스 및 지출을 추적하십시오.
코드에서 용량까지
소스 연결
모델 템플릿, GitHub 저장소 또는 Docker 이미지를 선택하세요.
확장 정책 설정
GPU 우선 순위, 동시성, 작업자 하한 및 상한을 정의합니다.
엔드포인트 호출
큐 API, 동기식 경로 또는 OpenAI 호환 인터페이스를 사용하십시오.
from gpurento import serverless
@serverless.endpoint(
gpu=["L40S", "A100-80GB"],
min_workers=0,
max_workers=24,
concurrency=8,
)
def generate(prompt: str):
return model(prompt)포함됨
모든 워크로드는 동일한 API, ID, 청구 및 관찰 가능성 계층을 얻습니다.
요청이 남아 있지 않고 유휴 창이 만료되면 flex 워커가 종료됩니다. 다음 요청은 호환 가능한 워커를 시작하고 대기열은 작업을 보존합니다.
예. 안정적인 트래픽을 위해 최소 워커 수를 설정하거나 예측 가능한 피크를 위해 예약된 용량을 사용하십시오. 정책이 저장되기 전에 비용 추정치가 업데이트됩니다.
제품 흐름은 GitHub, 컨테이너 레지스트리, 큐레이팅된 모델 템플릿 및 Python 우선 원격 함수 워크플로를 지원합니다.
작업은 명확한 대기, 실행 중, 완료, 재시도 및 실패 상태를 노출합니다. 재시도 정책, 시간 초과, 작업 TTL 및 웹훅 동작은 구성 가능합니다.
준비가 되면