MENTAL MODEL · M1625
机械解释性
Mechanistic Interpretability
Version 1.0.0 · 更新于 2026-07-30
CORE DEFINITION · 核心定义
试图通过逆向工程神经网络,搞清楚每一个神经元和权重具体在做什么(就像拆解钟表一样),从而彻底理解AI的思考过程,而不仅仅是看输入输出。
SCAFFOLDING EFFECT · 脚手架效应
psychology
降低认知负荷
打开黑箱。在面对复杂的黑箱系统(如AI或复杂的官僚机构)时,不要满足于“它能工作”,要追求“我知道它为什么工作”。只有理解了机械原理,才能真正信任系统。
anchor
锚定快速决策
机器学习中,指把模型(尤指神经网络)的内部机制拆解为可理解的「零件与电路」,像理解机械装置一样理解其计算通路。
MINIMUM ACTION · 最小行动
进行中 0/3在一个真实场景中练习这个模型:
勾选记录你的进度(本机暂存)
掌握进度0%
account_tree知识谱系 Genealogyexpand_more
menu_book信源参考 Sourcesexpand_more
来源明确性: 明确
- en.wikipedia.orghttps://en.wikipedia.org/wiki/Mechanistic_interpretabilityverified
PRIVATE NOTES · 仅自己可见
已保存问答
ENTRY Q&A · 可保存至我的笔记
在清晰边界内提问
thinkingmodels 仅基于已发布的条目上下文回答。
你的问题会发送给 thinkingmodels;回答仅使用公开词条上下文。
RELATED MODELS · 相关模型