もう少し詳しく

人が回答の好ましさを比較するなどして得た情報を利用し、望ましい応答が出やすくなるようにモデルを学習させます。

FOR EXAMPLE

たとえば、こんな場面で

複数の回答を人が比較した結果をもとに、より役立つ回答の方向へ調整します。

覚えておきたいこと

人の好みへの適合と、回答の事実的な正確さは同じものではありません。