# 基于人类反馈的强化学习

> 先让AI乱说，人类对它的回答打分（好/坏），训练一个奖励模型，再让AI为了获得高分而调整策略。

- ID: m01901
- 分类: business
- 领域: 管理学

## 定义

Reinforcement Learning from Human Feedback。先让AI乱说，人类对它的回答打分（好/坏），训练一个奖励模型，再让AI为了获得高分而调整策略。这是让AI学会“讲人话”和“价值观对齐”的关键。脚手架作用：- 对齐机制：不仅用于AI，也用于管理。你想要什么样的员工？不仅要给JD（指令），还要高频地给反馈（RLHF），让他通过你的奖惩微调行为，最终“对齐”你的价值观。

## 机制

复杂目标（"说人话""有用""安全"）难写成规则 / 损失函数。RLHF 先收集人类对 AI 输出的偏好排序，训一个奖励模型近似人类偏好，再用强化学习让策略最大化该奖励，使模型行为对齐人类价值。本质是把"不可写出的目标"转为"可学习的信号"。

## 练习

1. 用监督微调得基础模型。 2. 人类对若干输出排序，训奖励模型（RM）。 3. 用 PPO 等强化学习，以 RM 为奖励优化策略。 4. 迭代收集反馈、重训 RM，防奖励 hacking。

## 脚手架用法

- 对齐机制：不仅用于AI，也用于管理。你想要什么样的员工？不仅要给JD（指令），还要高频地给反馈（RLHF），让他通过你的奖惩微调行为，最终“对齐”你的价值观。

[阅读网页](https://thinkingmodels.site/entries/detail/m01901)
