核心概念

MDP 与 POMDP

分别描述状态可知和状态不能直接得知之随机序贯决策的形式框架。

简明解释

马尔可夫决策过程(Markov decision process,MDP)用状态、动作、转移概率和奖励描述随机序贯决策,并假定当前状态已知。部分可观察MDP(POMDP)增加观测模型,用信念状态表示对可能真实状态的概率分布。部分可观察、随机转移和模型未知是不同维度。[1, pp. 101–109]

别和什么混淆

经典规划小模型常假定确定且完全可观察;POMDP不是只给MDP加“噪声”一词,须明确观测与信念更新。

在本书中

第6章:规划、博弈与约束求解

本页参考来源

  1. Kaelbling L P, Littman M L, Cassandra A R. Planning and Acting in Partially Observable Stochastic Domains [J]. Elsevier, 1998. 定位:pp. 101–109. 稳定来源(访问 )。