LLM は生成のたびに限られた長さの入力しか読めません(数万〜100 万 token 超までさまざま)。会話が長くなるほど、早い時点の内容ほどウィンドウから押し出されやすくなります。素のチャットボットと長く話すと「物忘れ」するのはこのためです。
解決策はウィンドウを無限に拡大することではなく(コストも速度も許しません)、ウィンドウの外に永続ストレージ層を設け、必要に応じて関連内容を検索して書き戻すこと——まさに長期記憶と RAG がやっていることです。
Enclave で実際に試してみる
ブラウザですぐ使えます。クレジットカード登録もインストールも不要。