もう少し詳しく

存在しない文献や誤った数値などが、自然な文章の中に混ざる場合があります。言い切った口調や詳しい説明であっても、根拠があるとは限りません。

ハルシネーションは、もっともらしい文章を生成する仕組みと、現実の事実を検証する仕組みが別であることから起こります。検索や引用を導入しても、根拠の適用範囲を超えた推論や誤読は残るため、重要な情報には人の確認を置きます。

HISTORY

開発された年代と歴史

この用語を大きな流れで見ると、2010年代〜現在に発展してきました。

  1. 2018ニューラル機械翻訳で、もっともらしいが原文にない出力を扱う研究が注目された。
  2. 2020年代初頭生成モデルの事実誤りを指す言葉として広く使われる。
  3. 2023〜原因分析、事実性ベンチマーク、検索・引用による低減策が研究されている。

キーマン・関わった研究者

Katherine Lee、Ziwei Ji、生成モデルの評価研究者

技術の変遷

流暢な生成 → 事実性の問題の可視化 → 検索・検証・不確実性表示

理解のポイント

  • 自然な文章の中に、存在しない資料や根拠のない数値が混じる現象です。
  • 断定的な口調や詳しい説明、出典らしい記載だけで信用せず、元資料の内容まで照合します。
  • 検索を追加しても、資料の読み違いや根拠のない補足が残る可能性があります。
FOR EXAMPLE

たとえば、こんな場面で

実在しない論文名やURLを、参考文献として挙げてしまうケースです。

覚えておきたいこと

重要な情報は元資料で確認します。検索や出典表示は助けになりますが、完全な解決ではありません。

参考資料

IBM — AI hallucinations