約2分

RLHF:人の評価をモデルの振る舞いへ反映する学習

RLHF は、人間が回答を評価した結果を使って AI の振る舞いを調整する学習手法です。

ベテランの担当者が新人の対応を毎回採点し、その積み重ねを返しながら育てていく。RLHF(Reinforcement Learning from Human Feedback)は、人が「こちらの答えのほうが良い」と評価した結果をモデルに返して、出力の方向を調整する学習の手法です。

正解を書けないなら比べてもらう

「良い回答」には、正解を一つに決めにくいものがたくさんあります。丁寧さ、分かりやすさ、言ってはいけないことを避けているか。こうした良し悪しは、正解ラベルとして直接書き表しにくいものです。RLHF は、それを「比べる」という形で扱います。

  1. モデルが、同じ質問に対して複数の回答候補を作る
  2. 人の評価者が、どちらが良いかを比べて採点する
  3. その評価をもとに、好ましい回答が出やすい方向へ学習を進める
  4. これを繰り返して、人の感覚に近い出力の傾向へ近づける

正解のデータを直接学ばせて、特定の形式や言い回しに寄せるファインチューニングが、正解がはっきりしている用途に向くのに対して、RLHF は望ましい振る舞いの方向性そのものを調整したいときに使われます。AI の振る舞いを目的に合わせるアラインメントの手段の一つです。

採点する人の好みも一緒に学ばれる

新人は、採点する先輩の癖まで覚えます。RLHF でも、評価者の価値観や偏りがそのままモデルに入り込みます。評価者によって基準がばらつけば学習の方向がぶれ、評価者の偏りはそのままモデルの偏りになります。

だから、「どういう回答を良しとするか」の基準を、事前に文書にしておくことが欠かせません。この基準の設計は、技術そのものと同じくらい重要です。人の評価にはお金と時間がかかるため、続けて運用するには負担もかかります。アラインメントの手段としても、RLHF だけで万全になるわけではありません。