もう少し詳しく
RAGでは文書全体ではなく、必要な部分を取り出すために分割します。文字数だけでなく、見出しや段落などの意味の区切りを考えて分ける方法もあります。
チャンク分割は、長文をそのままモデルへ渡すより、質問に関係する根拠だけを検索して渡したいというRAGの要請から重要になりました。チャンクの長さと重なりを固定するだけでなく、見出し・表・コード・段落の構造を保ち、検索結果の根拠が途中で切れないようにします。
HISTORY
開発された年代と歴史
この用語を大きな流れで見ると、1960年代〜現在に発展してきました。
- 1960年代情報検索システムが文書を索引化するため、文書単位の分割と特徴抽出を行った。
- 2010年代検索・自然言語処理で段落や文を単位に扱う実装が一般化。
- 2020年代RAGで検索精度とコンテキスト長を左右する設計項目になった。
キーマン・関わった研究者
Gerard Salton、情報検索研究者、RAG開発者
技術の変遷
文書全体 → 段落・文の分割 → 意味境界と検索単位の最適化
理解のポイント
- 長い文書から必要な箇所を検索できるよう、処理しやすい小さなまとまりへ分けます。
- 文字数だけで機械的に切ると説明が途中で途切れるため、見出しや段落の意味の区切りも考慮します。
- 欲しい回答の根拠が一緒に取り出せるかを、実際の質問で確認して分割方法を調整します。
たとえば、こんな場面で
取扱説明書を「初期設定」「お手入れ」などの内容ごとに分割して検索できるようにします。
覚えておきたいこと
細かすぎると文脈が失われ、大きすぎると無関係な情報が混ざることがあります。