核心概念

蒙特卡洛树搜索

通过反复模拟逐步扩展树并更新动作价值统计的树搜索框架。

简明解释

蒙特卡洛树搜索(Monte Carlo tree search,MCTS)常以选择、扩展、模拟或评估、回传四部分反复使用预算。模拟可随机走到终局,也可调用价值模型。UCT只是选择规则的一种;有限预算有方差和偏差,不保证找到真正最优动作。[1, Abstract; §§1–3]

别和什么混淆

MCTS是框架;UCT是具体树策略。AlphaGo还使用策略网络和价值网络,不能缩写成裸MCTS。

在本书中

第6章:规划、博弈与约束求解

本页参考来源

  1. Kocsis L, Szepesvári C. Bandit Based Monte-Carlo Planning [C]. Springer, 2006. 定位:Abstract; §§1–3. 稳定来源(访问 )。