认知脚手架

正在准备你的认知工作台

arrow_back_ios_new
MENTAL MODEL · M6093

马尔可夫决策过程

Markov Decision Process, MDP
决策取舍高支撑决策科学
已收录
account_tree

Version 1.0.0 · 更新于 2026-07-28

CORE DEFINITION · 核心定义

描述在不确定环境下进行序贯决策的数学框架。包含状态、动作、转移概率和奖励。核心假设是未来只取决于当前,与过去无关(马尔可夫性)。

SCAFFOLDING EFFECT · 脚手架效应

psychology

降低认知负荷

动态决策的通用框架。人生是一个MDP:你处于某个状态,采取动作,环境按概率转移到新状态并给你奖励。要在MDP中获胜,你需要寻找“最优策略”(Policy)——即在每个状态下该做什么,以最大化长期累积奖励。

anchor

锚定快速决策

MDP 用状态、动作、转移概率与即时奖励刻画序贯决策:智能体在状态 s 采取动作 a,以概率转移到 s' 并获得奖励,目标是最大化累计折扣奖励。它把不确定环境下的规划形式化。

MINIMUM ACTION · 最小行动

进行中 0/4

在一个真实场景中练习这个模型:

勾选记录你的进度(本机暂存)
掌握进度0%
account_tree知识谱系 Genealogyexpand_more
menu_book信源参考 Sourcesexpand_more

来源明确性: 明确

  • link
    zh.wikipedia.orghttps://zh.wikipedia.org/wiki/%E9%A6%AC%E5%8F%AF%E5%A4%AB%E6%B1%BA%E7%AD%96%E9%81%8E%E7%A8%8BZH · 明确
    verified

RELATED MODELS · 相关模型