現代のニューラル TTS は、感情や間(ま)を伴う、人間に近い音声を生成でき、多言語と音色のカスタマイズに対応します。対になる STT/ASR(音声認識)はあなたの発話をテキストに戻します。この 2 つを組み合わせると完全な音声対話になります。
Enclave のボイスメッセージと AI 音声通話はまさにこの 2 層を使っています。あなたが話す→認識→モデルが返信を生成→TTS が読み上げる、という流れです。
Enclave で実際に試してみる
ブラウザですぐ使えます。クレジットカード登録もインストールも不要。