ポイント早わかり
- プライベート推論:モデルは自前の GPU/サーバーで動作。
- OpenAI 互換 API で、設定はクラウド API の接続とほぼ同じ。
- 高並列でレイテンシやコストに要求のある上級展開に適合。
接続方法
まず vLLM で OpenAI 互換の推論エンドポイントを立て、Enclave のモデル設定で OpenAI 互換プロバイダーを選び、base URL を vLLM のアドレスに向け、対応するキー(あれば)を入力します。その後、そのモデルを既定に、あるいはキャラごとに指定できます。
こんな人に
GPU リソースを持ち、推論を完全にプライベート化したい、あるいは多人数/高並列で安定したスループットが必要なチームや上級ユーザー向け。Enclave のセルフホストにより、モデルもデータも自前のインフラ内に置けます。
重要な事実
- 接続方式
- OpenAI 互換エンドポイント(base URL)
- 課金
- セルフホスト、第三者 API 費用なし
- 適する用途
- 高並列/プライベート推論
- データの流れ
- 自前のインフラ内に留まる
試してみますか?
ブラウザですぐ使えます。クレジットカード登録もインストールも不要。