본문으로 건너뛰기
Enclave
로컬 모델

Enclave에서 vLLM 자체 호스팅 추론 연결

Enclave는 vLLM을 지원합니다: 모델 계층을 직접 배포한 vLLM 추론 서비스(OpenAI 호환 API)로 향하게 하면 캐릭터가 사설·고처리량 로컬 배포로 답합니다. GPU 자원이 있고 사설화·고동시성을 추구하는 고급 사용자에게 적합합니다.

최근 검토:

한마디로

Enclave 모델 계층을 자체 호스팅 vLLM(OpenAI 호환 엔드포인트)로 향하게 하면 사설·고처리량 추론으로 캐릭터를 구동할 수 있어요.

핵심 요약

  • 사설 추론: 모델이 본인 GPU/서버에서 실행.
  • OpenAI 호환 API로, 설정 방식은 클라우드 API 연결과 비슷합니다.
  • 고동시성에 지연·비용 요구가 있는 고급 배포에 적합.

연결 방법

먼저 vLLM으로 OpenAI 호환 추론 엔드포인트를 띄운 뒤, Enclave 모델 설정에서 OpenAI 호환 공급자를 선택하고 base URL을 vLLM 주소로 향하게 하며 해당 키(있다면)를 입력하세요. 이후 그 모델을 기본 또는 캐릭터별로 지정할 수 있어요.

이런 분께

GPU 자원이 있고 추론을 완전히 사설화하려는, 또는 다중 사용자/고동시성 상황에서 안정적 처리량이 필요한 팀과 고급 사용자에게. Enclave 자체 호스팅으로 모델과 데이터 모두 본인 인프라 안에 둘 수 있습니다.

핵심 사실

연결 방식
OpenAI 호환 엔드포인트 (base URL)
과금
자체 호스팅, 제3자 API 비용 없음
적합 용도
고동시성 / 사설 추론
데이터 흐름
본인 인프라 안에 머무름

한번 써보시겠어요?

브라우저에서 바로 시작하세요. 신용카드 등록도, 설치도 필요 없습니다.

관련 콘텐츠

다른 모델 연결

Enclave에서 vLLM 자체 호스팅 추론 연결 · Enclave