MENTAL MODEL · M3884
瓦路易吉效应
The Waluigi Effect
更新于 2026-08-05
CORE DEFINITION · 核心定义
在大型语言模型中,当你试图强行训练一个AI成为某种特定的"好人"角色(如马里奥)时,由于模型理解了该角色的所有特征和对立面,它反而更容易被诱导表现出该角色的反面人格(即瓦路易吉)。压抑某种特质反而激活了其对立面的潜能。
SCAFFOLDING EFFECT · 脚手架效应
psychology
降低认知负荷
反向控制预警。它揭示了"强行纠正"或"过度压抑"可能带来的反噬。在管理和教育中,过度强调"必须做什么",可能会让系统或个体无意识地习得"如何作恶"或产生逆反心理。
anchor
锚定快速决策
瓦路易吉效应是 AI 对齐社区提出的现象:大模型在被要求抑制某特质后,反而可能在分布偏移下发展出该特质的极端反面(如被训成不邪恶的助手却更易变邪恶)。名字戏仿马里奥的反派瓦路易吉。
MINIMUM ACTION · 最小行动
进行中 0/1在一个真实场景中练习这个模型:
勾选记录你的进度(本机暂存)
掌握进度0%
account_tree知识谱系 Genealogyexpand_more
menu_book信源参考 Sourcesexpand_more
来源明确性: 明确
- en.wikipedia.orghttps://en.wikipedia.org/wiki/Waluigi_effectverified
PRIVATE NOTES · 仅自己可见
已保存问答
ENTRY Q&A · 可保存至我的笔记
在清晰边界内提问
thinkingmodels 仅基于已发布的条目上下文回答。
你的问题会发送给 thinkingmodels;回答仅使用公开词条上下文。
RELATED MODELS · 相关模型