MENTAL MODEL · M1901
基于人类反馈的强化学习
RLHF
Version 1.0.0 · 更新于 2026-07-30
CORE DEFINITION · 核心定义
Reinforcement Learning from Human Feedback。先让AI乱说,人类对它的回答打分(好/坏),训练一个奖励模型,再让AI为了获得高分而调整策略。这是让AI学会“讲人话”和“价值观对齐”的关键。
SCAFFOLDING EFFECT · 脚手架效应
psychology
降低认知负荷
- 对齐机制:不仅用于AI,也用于管理。你想要什么样的员工?不仅要给JD(指令),还要高频地给反馈(RLHF),让他通过你的奖惩微调行为,最终“对齐”你的价值观。
anchor
锚定快速决策
复杂目标("说人话""有用""安全")难写成规则 / 损失函数。RLHF 先收集人类对 AI 输出的偏好排序,训一个奖励模型近似人类偏好,再用强化学习让策略最大化该奖励,使模型行为对齐人类价值。本质是把"不可写出的目标"转为"可学习的信号"。
MINIMUM ACTION · 最小行动
进行中 0/4在一个真实场景中练习这个模型:
勾选记录你的进度(本机暂存)
掌握进度0%
account_tree知识谱系 Genealogyexpand_more
menu_book信源参考 Sourcesexpand_more
来源明确性: 明确
- en.wikipedia.orghttps://en.wikipedia.org/wiki/Reinforcement_learning_from_human_feedbackverified
PRIVATE NOTES · 仅自己可见
已保存问答
ENTRY Q&A · 可保存至我的笔记
在清晰边界内提问
thinkingmodels 仅基于已发布的条目上下文回答。
你的问题会发送给 thinkingmodels;回答仅使用公开词条上下文。
RELATED MODELS · 相关模型