MENTAL MODEL · M3711
对齐问题
The Alignment Problem
Version 1.0.0 · 更新于 2026-07-28
CORE DEFINITION · 核心定义
如何确保AI系统的目标(Goal)与人类的真实意图(Intention)和价值观(Values)完全一致?由于语言的模糊性和人类价值观的复杂性,AI很容易在执行字面指令时造成灾难(如"消除癌症"->"杀死所有人类")。
SCAFFOLDING EFFECT · 脚手架效应
psychology
降低认知负荷
委托风险。在管理下属或外包时,最大的风险就是"对齐问题"。你以为传达了精神,他其实只听懂了指标。必须反复校准目标函数。
anchor
锚定快速决策
目标函数与目标意图之间存在语义鸿沟;字面优化目标可能引向与人类价值相悖的结果(奖励黑客),因为人类价值难以完整编码。
MINIMUM ACTION · 最小行动
进行中 0/4在一个真实场景中练习这个模型:
勾选记录你的进度(本机暂存)
掌握进度0%
account_tree知识谱系 Genealogyexpand_more
menu_book信源参考 Sourcesexpand_more
来源明确性: 明确
- en.wikipedia.orghttps://en.wikipedia.org/wiki/The_Alignment_Problemverified
PRIVATE NOTES · 仅自己可见
已保存问答
ENTRY Q&A · 可保存至我的笔记
在清晰边界内提问
thinkingmodels 仅基于已发布的条目上下文回答。
你的问题会发送给 thinkingmodels;回答仅使用公开词条上下文。
RELATED MODELS · 相关模型