メインコンテンツへスキップ
Enclave
ローカルモデル

Enclave で vLLM のセルフホスト推論を接続

Enclave は vLLM に対応:モデル層を自前で展開した vLLM 推論サービス(OpenAI 互換 API)に向ければ、キャラはあなたのプライベートで高スループットなローカル展開で返信します。GPU を持ち、プライバシーと高並列を追求する上級ユーザーに最適。

最終確認:

一言で言うと

Enclave のモデル層を自前の vLLM(OpenAI 互換エンドポイント)に向ければ、プライベートで高スループットな推論でキャラを動かせます。

ポイント早わかり

  • プライベート推論:モデルは自前の GPU/サーバーで動作。
  • OpenAI 互換 API で、設定はクラウド API の接続とほぼ同じ。
  • 高並列でレイテンシやコストに要求のある上級展開に適合。

接続方法

まず vLLM で OpenAI 互換の推論エンドポイントを立て、Enclave のモデル設定で OpenAI 互換プロバイダーを選び、base URL を vLLM のアドレスに向け、対応するキー(あれば)を入力します。その後、そのモデルを既定に、あるいはキャラごとに指定できます。

こんな人に

GPU リソースを持ち、推論を完全にプライベート化したい、あるいは多人数/高並列で安定したスループットが必要なチームや上級ユーザー向け。Enclave のセルフホストにより、モデルもデータも自前のインフラ内に置けます。

重要な事実

接続方式
OpenAI 互換エンドポイント(base URL)
課金
セルフホスト、第三者 API 費用なし
適する用途
高並列/プライベート推論
データの流れ
自前のインフラ内に留まる

試してみますか?

ブラウザですぐ使えます。クレジットカード登録もインストールも不要。

関連コンテンツ

他のモデルを接続

Enclave で vLLM のセルフホスト推論を接続 · Enclave