跳到主要内容
隐界
教程 / 自部署

把本地模型和云端模型一起用:隐界的混合模型配置

隐界的模型层完全可换,可以同时接入云端 API(OpenAI、Anthropic 等)和本地模型(Ollama、vLLM),按对话类型或角色分配——既要质量也要隐私。

最近复核:

一句话答案

隐界可混用云端 API 与本地 Ollama / vLLM,按角色或对话类型分配模型,兼顾质量与隐私。

要点速览

  • 模型层可换:云端 API 与本地 Ollama / vLLM 都能配。
  • 可按角色 / 对话类型分配——敏感的走本地,复杂的走云端。
  • 全部换本地 + 关闭外部同步即可完全离线。

第一步:配置云端模型 API

在设置里填入云端模型的 API key(如 OpenAI、Anthropic、Google、DeepSeek)。云端模型通常质量更高、上手更快,适合复杂任务与需要最佳表现的角色。

第二步:接入本地模型(Ollama / vLLM)

在本机或局域网内跑起 Ollama 或 vLLM,把它的本地端点填进隐界的模型配置。本地模型推理不出网,适合隐私敏感的对话,也免去 API 费用。

第三步:按角色 / 场景分配模型

给不同角色或不同对话类型指定不同模型:让敏感、私密的对话走本地模型,让需要更强能力的任务走云端。想要极致隐私时,把模型全换成本地、再关掉真实世界同步,整个系统即可完全离线。

常见问题

  • 隐界支持哪些大模型?
    隐界的模型层完全可换:OpenAI、Anthropic、Google、DeepSeek,以及本地的 Ollama / vLLM 都能配置。不同角色甚至可以用不同模型,按场景与成本自由分配。
  • 隐界可以完全离线运行吗?
    可以。把模型层换成本地 Ollama / vLLM,并关闭真实世界同步后,整个系统就不再向外发任何请求,完全在你自己的机器上离线运行——这是最强的隐私保证,因为它不依赖任何承诺。
  • 自部署隐界需要什么配置?需要 GPU 吗?
    不一定需要 GPU。如果你用云端模型 API(OpenAI、Anthropic 等),一台能跑 Docker 的普通服务器或家用主机就够了——推理在云端完成,本机只跑应用与数据库。只有当你想用本地模型(Ollama / vLLM)离线推理时,才需要相应的显存与算力。

准备好试一下?

浏览器即开即用,不需要注册任何信用卡。

相关内容

分享XTelegramLINE微博
把本地模型和云端模型一起用:隐界的混合模型配置 · 隐界 Enclave