もう少し詳しく

RAGでは文書全体ではなく、必要な部分を取り出すために分割します。文字数だけでなく、見出しや段落などの意味の区切りを考えて分ける方法もあります。

チャンク分割は、長文をそのままモデルへ渡すより、質問に関係する根拠だけを検索して渡したいというRAGの要請から重要になりました。チャンクの長さと重なりを固定するだけでなく、見出し・表・コード・段落の構造を保ち、検索結果の根拠が途中で切れないようにします。

HISTORY

開発された年代と歴史

この用語を大きな流れで見ると、1960年代〜現在に発展してきました。

  1. 1960年代情報検索システムが文書を索引化するため、文書単位の分割と特徴抽出を行った。
  2. 2010年代検索・自然言語処理で段落や文を単位に扱う実装が一般化。
  3. 2020年代RAGで検索精度とコンテキスト長を左右する設計項目になった。

キーマン・関わった研究者

Gerard Salton、情報検索研究者、RAG開発者

技術の変遷

文書全体 → 段落・文の分割 → 意味境界と検索単位の最適化

理解のポイント

  • 長い文書から必要な箇所を検索できるよう、処理しやすい小さなまとまりへ分けます。
  • 文字数だけで機械的に切ると説明が途中で途切れるため、見出しや段落の意味の区切りも考慮します。
  • 欲しい回答の根拠が一緒に取り出せるかを、実際の質問で確認して分割方法を調整します。
FOR EXAMPLE

たとえば、こんな場面で

取扱説明書を「初期設定」「お手入れ」などの内容ごとに分割して検索できるようにします。

覚えておきたいこと

細かすぎると文脈が失われ、大きすぎると無関係な情報が混ざることがあります。