Search OS
用語集
GEOとAI検索

RLHF

RLHF(Reinforcement Learning from Human Feedback)は、人間の選好データで報酬モデルを学習させ、その報酬シグナルを強化学習で最適化することで、大規模言語モデル(LLM)を人間の意図や価値観に整合させる手法です。その目的は、見た目には同等に妥当に思える回答どうしであっても、人々が実際に好む出力へとモデルの挙動を導くことにあります。

  • RLHFは、人間の選好比較に基づいてreward modelを学習し、その報酬を強化学習で最適化して、LLMを人間の意図に整合させます。

  • 標準的なRLHFは3段階で実行されます。supervised fine-tuning (SFT) → reward model training → PPO reinforcement learning

  • OpenAIのInstructGPT論文では、13億パラメータのRLHFモデルが、人間の評価者に100倍大きい175BのGPT-3よりも好まれました。

  • 強化学習の段階では、KLダイバージェンスのペナルティを追加して、モデルが元の状態から離れすぎたり、目的をreward hackingしたりしないようにします。

  • 近年では、DPOが、別個のreward modelとRLループを完全に取り除いた、よりシンプルで安定した代替手法として登場しています。

概要

RLHF(Reinforcement Learning from Human Feedback)は、人間の選好データ上でreward modelを学習し、その報酬シグナルを強化学習で最適化することで、大規模言語モデルを人間の意図や価値観に沿わせるアライメント手法です。事前学習のみのモデルは次のトークンをうまく予測できますが、それだけで人々が実際に望む形で役立つことが保証されるわけではありません。RLHFは、どちらの答えがより良いかに関する人間の判断を学習シグナルへ変換し、モデルの振る舞いを修正することで、このギャップを埋めます。これは、ChatGPTやClaudeを含む現在の主要な対話モデルに共通する中核的なアライメント手法です。

RLHFが重要なのは、「良い答え」の条件を明示的な式で表すのが難しいからです。役立つこと、正直であること、無害であることといった特性は主観的かつ文脈依存であるため、RLHFでは正解ラベルの代わりに相対的な人間の選好(AはBより良い)を収集し、モデルが従うべき方向を間接的に定義します。

3段階のパイプライン

OpenAIのInstructGPT論文(Ouyang et al., 2022)によって確立された標準的なRLHFは、3段階で構成されます。

ステージ1: Supervised fine-tuning (SFT)

まず、事前学習済みモデルを、人間のラベラーが作成した模範回答(デモンストレーションデータ)で教師あり学習によりファインチューニングします。この段階でモデルは、指示に応答するための基本的な形式とトーンを学習し、後続の強化学習の出発点となる初期ポリシーを生成します。

ステージ2: Reward model training

与えられたプロンプトに対して、人間がモデルの生成した複数の出力を最良から最悪まで順位付けします。絶対スコアではなく出力間の比較と順位付けを用いることで、評価者間のばらつきが減り、より安定したデータが得られます。この選好データは、reward modelの学習に用いられ、任意の候補回答にスカラー値のスコアを付与します。

ステージ3: 強化学習(PPO)

最後に、報酬モデルのスコアは報酬として使われ、通常はPPO(Proximal Policy Optimization)アルゴリズムを通じて、LLMの強化学習に用いられます。報酬関数にはKLダイバージェンスのペナルティも含まれており、現在のポリシーがSFTの初期モデルから大きく逸脱しすぎないようにします。この制約がなければ、モデルは報酬モデルの弱点を突いて、見かけ上は高スコアでも実際には不自然または無意味な「reward hacking」テキストを生成してしまう可能性があります。Anthropicによる、役立ち有害性のないアシスタントに関する研究(Bai et al., 2022)では、RL報酬とKLダイバージェンスの平方根との間に、おおむね線形の関係があることも報告されました。

重要性とエビデンス

InstructGPTは、RLHFの影響を最も明確に示した成果です。論文によれば、RLHFで整合された13億パラメータのモデルの出力は、100倍大きい175BのGPT-3の出力よりも、人間の評価者に好まれました。同時に、整合化学習は、標準的なNLPベンチマークでの性能低下を最小限に抑えつつ、真実性を改善し、有害な出力を減少させました。これは、人間のフィードバックに合わせてモデルを整合させることが、単にモデルを大きくするよりも「真に有用な回答」に対して効果的であることを示す事例です。

Anthropicの研究(Bai et al., 2022)では、役立ち有害性のないアシスタントの学習にRLHFを適用し、毎週、新しい人間のフィードバックで報酬モデルとポリシーを反復的に更新するアプローチを提案しました。また、整合化学習はほぼすべてのNLP評価で性能を改善し、コーディングや要約のような専門的スキルの学習とも競合しないことが報告されました。

とはいえ、標準的なRLHFは、報酬モデルの学習とPPOループの両方を実行する必要があるため、実装が複雑で不安定になりがちです。より簡略化された代替手法がDPO(Direct Preference Optimization, Rafailov et al., 2023)です。DPOは、ポリシーに関して報酬モデルを閉形式で再パラメータ化し、別個の報酬モデルや強化学習ループなしに、単純な分類損失で選好データを直接最適化します。論文では、DPOはPPOベースのRLHFよりも実装と学習が容易で、より安定しており、計算負荷も小さい一方で、感情制御や対話品質などのタスクでは同等かそれ以上の性能を示したと報告されています。AnthropicはまたRLAIF(Constitutional AI, Bai et al., 2022)も提案しており、これは人間ではなくAIが原則の憲法に従ってフィードバックを生成する手法です。大量の人手ラベルにかかるコストを削減できる、拡張性の高いアプローチです。

参考文献

既存のウェブサイトを維持したまま、

検索とAIが情報を読み取れる状態を確認します。

SEOの基盤からAI検索での可視性まで、継続して運用します。

まずは製品資料で、Search OSの仕組みをご確認ください。