もう少し詳しく
人が回答の好ましさを比較するなどして得た情報を利用し、望ましい応答が出やすくなるようにモデルを学習させます。
RLHFは、人が感じる有用さや安全性をモデルの調整へ反映したいという背景から広く研究されました。評価者の基準をそろえ、報酬モデルの偏りや過剰最適化を点検しながら、正確性・安全性・使いやすさを別々の指標でも確認します。
HISTORY
開発された年代と歴史
この用語を大きな流れで見ると、2017年〜に発展してきました。
- 2017Christianoらが、人の比較評価を報酬モデルに学習させるRLHFを発表。
- 2022OpenAIのInstructGPTが、教師あり調整・報酬モデル・PPOを組み合わせた流れを実用例として示した。
- 2020年代AIアシスタントの有用性、安全性、拒否方針の調整に使われる。
キーマン・関わった研究者
Paul Christiano、Long Ouyang、OpenAIのInstructGPT研究チーム
技術の変遷
教師あり学習 → 人の比較評価 → 報酬モデル+強化学習
理解のポイント
- 人が回答を比較・評価した情報を使い、好ましい応答を出す方向へ強化学習で調整します。
- 人が評価基準を与える学習方法であり、回答のたびに人が承認する仕組みとは異なります。
- 好まれる答えと事実に正しい答えは一致するとは限らず、正確性の確認も別途必要です。
たとえば、こんな場面で
複数の回答を人が比較した結果をもとに、より役立つ回答の方向へ調整します。
覚えておきたいこと
人の好みへの適合と、回答の事実的な正確さは同じものではありません。