핵심 요약
- 사설 추론: 모델이 본인 GPU/서버에서 실행.
- OpenAI 호환 API로, 설정 방식은 클라우드 API 연결과 비슷합니다.
- 고동시성에 지연·비용 요구가 있는 고급 배포에 적합.
연결 방법
먼저 vLLM으로 OpenAI 호환 추론 엔드포인트를 띄운 뒤, Enclave 모델 설정에서 OpenAI 호환 공급자를 선택하고 base URL을 vLLM 주소로 향하게 하며 해당 키(있다면)를 입력하세요. 이후 그 모델을 기본 또는 캐릭터별로 지정할 수 있어요.
이런 분께
GPU 자원이 있고 추론을 완전히 사설화하려는, 또는 다중 사용자/고동시성 상황에서 안정적 처리량이 필요한 팀과 고급 사용자에게. Enclave 자체 호스팅으로 모델과 데이터 모두 본인 인프라 안에 둘 수 있습니다.
핵심 사실
- 연결 방식
- OpenAI 호환 엔드포인트 (base URL)
- 과금
- 자체 호스팅, 제3자 API 비용 없음
- 적합 용도
- 고동시성 / 사설 추론
- 데이터 흐름
- 본인 인프라 안에 머무름
한번 써보시겠어요?
브라우저에서 바로 시작하세요. 신용카드 등록도, 설치도 필요 없습니다.