核心概念

梯度下降

利用损失对参数的局部导数,反复朝降低损失的方向更新参数的优化方法。

简明解释

梯度下降(gradient descent,GD)利用损失对参数的局部导数,反复朝降低损失的方向更新参数。学习率控制每一步大小;太小会慢,太大可能越过低点、振荡或发散。[1, Learning rate] “沿坡下山”只说明局部方向,不保证一般非凸问题都抵达全局最低点;反向传播是高效求梯度的方法,也不等于更新规则本身。

别和什么混淆

梯度下降是参数更新方法;反向传播是高效计算梯度的方法。二者常配合使用,但不是同一个步骤。

在本书中

第 4 章:读懂 AI 所需的计算、数据与数学直觉

本页参考来源

  1. Google for Developers. Linear regression: Hyperparameters [EB/OL]. Google, 2025. 定位:Learning rate. 稳定来源(访问 )。

相关概念