文章に「意味の棚番号」を付ける
書類を整理するとき、内容の近いものほど近い棚に並べておけば、あとで関連する書類をまとめて取り出せます。エンベディングは、これを文章でやるための仕組みです。文章や単語の意味を、数値の並び(ベクトル)に変えて、意味の近いものほど近い位置に来るようにします。
キーワードが一致しなくても意味の近さで文書を探せるセマンティック検索や、ベクトル検索は、この数値を使っています。社内文書の検索、RAG で関連資料を探す工程、似た FAQ の自動での発見、タグを付ける前の大まかな分類。どれも、文章を「近い・遠い」で比べられるようになったことで可能になりました。
ただし、並んだ数値そのものに、人が読める意味はありません。「この数字は価格を表す」といった解釈はできず、あくまで近さを比べるための座標です。
区切り方とモデルで結果が変わる
どこで文書を区切ってから数値に変えるか(チャンク分割)によって、探したときの当たり方は変わります。数値に変えるモデル(埋め込みモデル)にも得意な分野があり、選び方で結果が変わります。
だから、導入の前に「この質問なら、この文書が出てきてほしい」という評価用の質問セットを用意しておき、それで比べるのが近道です。近い棚から出てきた書類が、業務の上でも本当に関係のある書類かどうか。そこは数値ではなく、実際の質問で確かめます。
エンベディングは意味を整理するための部品で、答えそのものではありません。検索で近い文書が見つかっても、最終的な回答の確認は別に必要です。