長いマニュアルを丸ごと渡すのではなく、章ごとに付箋を貼って、必要なページをすぐ開けるようにしておく。チャンク分割は、AI に資料を渡す前のこの下ごしらえです。長い文書をそのまま扱わず、意味の切れ目ごとに小分けにしておくことで、RAG やベクトル検索で必要な箇所だけを拾えるようにします。
文書を丸ごと1件として扱うと、欲しい箇所がその中に埋もれます。コンテキストウィンドウに全部は入らない資料も、区切っておけば質問に近い段落だけを渡せます。検索で返す単位を決める作業なので、単に文字数で区切ることとは違います。
細かすぎても、粗すぎても
社内規程集を、機械的に500文字ずつ切って検索させたら?
条文の途中で切れて、「ただし」以降が別の塊になっちゃいそう。
そうなんだよ。機械的に切ると、そういうことが起きるんだ。
細かく切りすぎると、前後の関係が切れて、一つひとつの塊の意味が薄くなります。反対に粗すぎると、関係のない情報まで一緒に入り、検索の精度が落ちます。隣の塊と少しだけ内容を重ねておくと、文脈の切れ目を減らしやすくなります。
文書の種類ごとにちょうどよい切り方がある
マニュアル、FAQ、議事録では、ちょうどよい大きさがそれぞれ違う。数値に変える(エンベディング)前に、見出しや段落の境目を活かして分けるのが基本です。画像の説明や表の注釈のように、それだけでは意味が弱い部分は、本文から切り離しすぎないようにします。
分け方のルールを変えたら、同じ質問セットで評価し直します。見るのは検索の当たり具合だけでなく、最終的な回答の読みやすさまでです。
チャンク分割は目立たない裏方の作業ですが、RAG の使い勝手に直結します。モデルだけを替えても、分け方が雑なままなら、答えの質はなかなか伸びません。