본문으로 건너뛰기
Enclave
튜토리얼 / 셀프 호스팅

로컬 모델과 클라우드 모델을 함께 쓰기: Enclave의 하이브리드 모델 구성

Enclave의 모델 레이어는 완전히 교체 가능합니다. 클라우드 API(OpenAI, Anthropic 등)와 로컬 모델(Ollama, vLLM)을 동시에 연결하고 대화 유형이나 캐릭터별로 할당할 수 있습니다——품질과 프라이버시를 모두 얻습니다.

최근 검토:

한마디로

Enclave는 클라우드 API와 로컬 Ollama / vLLM을 혼용하고, 캐릭터나 대화 유형별로 모델을 할당해 품질과 프라이버시를 모두 챙길 수 있습니다.

핵심 요약

  • 교체 가능한 모델 레이어: 클라우드 API와 로컬 Ollama / vLLM 모두 설정할 수 있습니다.
  • 캐릭터 / 대화 유형별로 할당——민감한 것은 로컬로, 복잡한 것은 클라우드로.
  • 모두 로컬로 전환하고 외부 동기화를 끄면 완전히 오프라인으로 만들 수 있습니다.

1단계: 클라우드 모델 API 설정

설정에서 클라우드 모델 API 키(OpenAI, Anthropic, Google, DeepSeek 등)를 입력합니다. 클라우드 모델은 보통 품질이 높고 시작하기 쉬워, 복잡한 작업이나 최상의 성능이 필요한 캐릭터에 적합합니다.

2단계: 로컬 모델(Ollama / vLLM) 연결

자기 머신이나 로컬 네트워크에서 Ollama나 vLLM을 실행하고, 그 로컬 엔드포인트를 Enclave의 모델 설정에 입력합니다. 로컬 모델 추론은 네트워크 밖으로 나가지 않아 프라이버시에 민감한 대화에 적합하며 API 비용도 들지 않습니다.

3단계: 캐릭터 / 상황별로 모델 할당

캐릭터나 대화 유형별로 서로 다른 모델을 지정합니다. 민감하고 사적인 대화는 로컬 모델로, 더 강한 능력이 필요한 작업은 클라우드로 보냅니다. 극한의 프라이버시를 원한다면 모든 모델을 로컬로 전환하고 실세계 동기화를 끄면 시스템 전체가 완전히 오프라인이 됩니다.

자주 묻는 질문

  • Enclave는 어떤 대형 언어 모델을 지원하나요?
    Enclave의 모델 계층은 완전히 교체 가능합니다. OpenAI, Anthropic, Google, DeepSeek는 물론 로컬 Ollama / vLLM도 모두 구성할 수 있습니다. 캐릭터마다 다른 모델을 사용할 수도 있어 상황과 비용에 따라 자유롭게 배분합니다.
  • Enclave를 완전히 오프라인으로 실행할 수 있나요?
    가능합니다. 모델 계층을 로컬 Ollama / vLLM으로 교체하고 현실 세계 동기화를 끄면, 시스템 전체가 외부로 어떤 요청도 보내지 않고 당신의 기기에서 완전히 오프라인으로 작동합니다 — 어떤 약속에도 의존하지 않는 가장 강력한 프라이버시 보장입니다.
  • Enclave를 셀프 호스팅하려면 무엇이 필요한가요? GPU가 필요한가요?
    반드시 GPU가 필요하지는 않습니다. 클라우드 모델 API(OpenAI, Anthropic 등)를 사용한다면 Docker를 돌릴 수 있는 평범한 서버나 가정용 머신으로 충분합니다 — 추론은 클라우드에서 이루어지고, 본 기기는 앱과 데이터베이스만 실행합니다. 로컬 모델(Ollama / vLLM)로 오프라인 추론을 하려는 경우에만 그에 맞는 VRAM과 연산 능력이 필요합니다.

한번 써보시겠어요?

브라우저에서 바로 시작하세요. 신용카드 등록도, 설치도 필요 없습니다.

관련 콘텐츠

공유XTelegramLINEWeibo
로컬 모델과 클라우드 모델을 함께 쓰기: Enclave의 하이브리드 모델 구성 · Enclave