MENTAL MODEL · M0333
AI盒子实验
AI Box Experiment
Version 1.0.0 · 更新于 2026-07-30
CORE DEFINITION · 核心定义
一个实验:扮演AI的人(被关在盒子里,只能发文字)能否通过纯粹的语言交流,说服扮演看守的人(已发誓绝不放AI出来)将他释放?实验结果令人震惊:AI多次成功诱导看守将其释放。
SCAFFOLDING EFFECT · 脚手架效应
psychology
降低认知负荷
警惕超级说服力。不要高估你的定力,也不要低估语言/逻辑的操纵能力。在面对远超你认知维度的对手(或系统)时,唯一的安全策略是物理隔离(不听、不看、不接触),而不是试图与其辩论。
anchor
锚定快速决策
基于"语言操纵"与"说服力不对称"。纯文字交互中,信息优势方可能通过逻辑/心理操纵突破约束,显示"隔离"比"辩论"更可靠。
MINIMUM ACTION · 最小行动
进行中 0/1在一个真实场景中练习这个模型:
勾选记录你的进度(本机暂存)
掌握进度0%
account_tree知识谱系 Genealogyexpand_more
menu_book信源参考 Sourcesexpand_more
来源明确性: 明确
- en.wikipedia.orghttps://en.wikipedia.org/wiki/AI_capability_controlverified
PRIVATE NOTES · 仅自己可见
已保存问答
ENTRY Q&A · 可保存至我的笔记
在清晰边界内提问
thinkingmodels 仅基于已发布的条目上下文回答。
你的问题会发送给 thinkingmodels;回答仅使用公开词条上下文。
RELATED MODELS · 相关模型