ホーム / 生成AIの技術 / 特徴 / RLHF

601

RLHF

生成AIの技術特徴

RLHF とは、人間の評価を報酬として使い、モデルの出力を人の好みに合わせて調整する手法です。

複数の応答を人が見比べてどちらが良いかを示し、その判断を学んだ評価役のモデルを作ります。そのうえで、高く評価される応答を出すよう強化学習で調整していきます。

有用さや安全さは正解を明示しにくいため、人の比較判断を手がかりにする形が採られました。