认知脚手架

正在准备你的认知工作台

arrow_back_ios_new
MENTAL MODEL · M1901

基于人类反馈的强化学习

RLHF
商业战略高支撑管理学
已收录
account_tree

Version 1.0.0 · 更新于 2026-07-30

CORE DEFINITION · 核心定义

Reinforcement Learning from Human Feedback。先让AI乱说,人类对它的回答打分(好/坏),训练一个奖励模型,再让AI为了获得高分而调整策略。这是让AI学会“讲人话”和“价值观对齐”的关键。

SCAFFOLDING EFFECT · 脚手架效应

psychology

降低认知负荷

- 对齐机制:不仅用于AI,也用于管理。你想要什么样的员工?不仅要给JD(指令),还要高频地给反馈(RLHF),让他通过你的奖惩微调行为,最终“对齐”你的价值观。

anchor

锚定快速决策

复杂目标("说人话""有用""安全")难写成规则 / 损失函数。RLHF 先收集人类对 AI 输出的偏好排序,训一个奖励模型近似人类偏好,再用强化学习让策略最大化该奖励,使模型行为对齐人类价值。本质是把"不可写出的目标"转为"可学习的信号"。

MINIMUM ACTION · 最小行动

进行中 0/4

在一个真实场景中练习这个模型:

勾选记录你的进度(本机暂存)
掌握进度0%
account_tree知识谱系 Genealogyexpand_more
menu_book信源参考 Sourcesexpand_more

来源明确性: 明确

  • link
    en.wikipedia.orghttps://en.wikipedia.org/wiki/Reinforcement_learning_from_human_feedbackZH · 明确
    verified

RELATED MODELS · 相关模型