もう少し詳しく
人が回答の好ましさを比較するなどして得た情報を利用し、望ましい応答が出やすくなるようにモデルを学習させます。
たとえば、こんな場面で
複数の回答を人が比較した結果をもとに、より役立つ回答の方向へ調整します。
覚えておきたいこと
人の好みへの適合と、回答の事実的な正確さは同じものではありません。
Reinforcement Learning from Human Feedback
人の評価をもとに、モデルの出力を調整する強化学習の方法。
人が回答の好ましさを比較するなどして得た情報を利用し、望ましい応答が出やすくなるようにモデルを学習させます。
複数の回答を人が比較した結果をもとに、より役立つ回答の方向へ調整します。
人の好みへの適合と、回答の事実的な正確さは同じものではありません。