MENTAL MODEL · M6093
马尔可夫决策过程
Markov Decision Process, MDP
Version 1.0.0 · 更新于 2026-07-28
CORE DEFINITION · 核心定义
描述在不确定环境下进行序贯决策的数学框架。包含状态、动作、转移概率和奖励。核心假设是未来只取决于当前,与过去无关(马尔可夫性)。
SCAFFOLDING EFFECT · 脚手架效应
psychology
降低认知负荷
动态决策的通用框架。人生是一个MDP:你处于某个状态,采取动作,环境按概率转移到新状态并给你奖励。要在MDP中获胜,你需要寻找“最优策略”(Policy)——即在每个状态下该做什么,以最大化长期累积奖励。
anchor
锚定快速决策
MDP 用状态、动作、转移概率与即时奖励刻画序贯决策:智能体在状态 s 采取动作 a,以概率转移到 s' 并获得奖励,目标是最大化累计折扣奖励。它把不确定环境下的规划形式化。
MINIMUM ACTION · 最小行动
进行中 0/4在一个真实场景中练习这个模型:
勾选记录你的进度(本机暂存)
掌握进度0%
account_tree知识谱系 Genealogyexpand_more
menu_book信源参考 Sourcesexpand_more
来源明确性: 明确
- zh.wikipedia.orghttps://zh.wikipedia.org/wiki/%E9%A6%AC%E5%8F%AF%E5%A4%AB%E6%B1%BA%E7%AD%96%E9%81%8E%E7%A8%8Bverified
PRIVATE NOTES · 仅自己可见
已保存问答
ENTRY Q&A · 可保存至我的笔记
在清晰边界内提问
thinkingmodels 仅基于已发布的条目上下文回答。
你的问题会发送给 thinkingmodels;回答仅使用公开词条上下文。
RELATED MODELS · 相关模型