# 马尔可夫决策过程

> 在数学中，马尔可夫决策过程（英语：Markov decision process，MDP）是离散时间随机控制过程。 它提供了一个数学框架，用于在结果部分随机且部分受决策者控制的情况下对决策建模。 MDP对于研究通过动态规划解决的优化问题很有用。 MDP至少早在1950年代就已为人所知；一个对马尔可夫决策过程的核心研究是罗纳德·霍华德于1960年出版的《动态规划和马尔可夫过程》。

- ID: m06093
- 分类: decide
- 领域: 决策科学

## 定义

描述在不确定环境下进行序贯决策的数学框架。包含状态、动作、转移概率和奖励。核心假设是未来只取决于当前，与过去无关（马尔可夫性）。脚手架作用： 动态决策的通用框架。人生是一个MDP：你处于某个状态，采取动作，环境按概率转移到新状态并给你奖励。要在MDP中获胜，你需要寻找“最优策略”（Policy）——即在每个状态下该做什么，以最大化长期累积奖励。

## 机制

MDP 用状态、动作、转移概率与即时奖励刻画序贯决策：智能体在状态 s 采取动作 a，以概率转移到 s' 并获得奖励，目标是最大化累计折扣奖励。它把不确定环境下的规划形式化。

## 练习

定义状态空间与动作空间；给出转移概率 P(s'|s,a) 与奖励 R(s,a)；设定折扣因子 γ；用值迭代/策略迭代求解最优策略 π*。

## 脚手架用法

动态决策的通用框架。人生是一个MDP：你处于某个状态，采取动作，环境按概率转移到新状态并给你奖励。要在MDP中获胜，你需要寻找“最优策略”（Policy）——即在每个状态下该做什么，以最大化长期累积奖励。

[阅读网页](https://thinkingmodels.site/entries/detail/m06093)
