MENTAL MODEL · M1620
宪法AI
Constitutional AI
Version 1.0.0 · 更新于 2026-07-30
CORE DEFINITION · 核心定义
不通过大量的人工标注(RLHF)来教AI什么是对的,而是给AI一套高层原则(宪法,如“不伤害”、“有用”),让AI根据这些原则自我批判和修正其输出。
SCAFFOLDING EFFECT · 脚手架效应
psychology
降低认知负荷
基于原则的治理。管理数百万员工(或AI)时,微操(逐个纠正)是不可能的。必须建立“宪法”(核心价值观),让系统具备自我纠错的道德罗盘。
anchor
锚定快速决策
不靠海量人工逐条标注(RLHF),而给模型一套高层原则(宪法,如"不伤害""有用"),让模型据此自我批判并修订输出,再用修订后样本训练。把"微观纠错"升级为"原则自律",可扩展且减少人工偏见。
MINIMUM ACTION · 最小行动
进行中 0/5在一个真实场景中练习这个模型:
勾选记录你的进度(本机暂存)
掌握进度0%
account_tree知识谱系 Genealogyexpand_more
menu_book信源参考 Sourcesexpand_more
来源明确性: 明确
- en.wikipedia.orghttps://en.wikipedia.org/wiki/Claude_%28AI%29verified
PRIVATE NOTES · 仅自己可见
已保存问答
ENTRY Q&A · 可保存至我的笔记
在清晰边界内提问
thinkingmodels 仅基于已发布的条目上下文回答。
你的问题会发送给 thinkingmodels;回答仅使用公开词条上下文。
RELATED MODELS · 相关模型