首页/问答百科/梯度下降
📖 基础概念

梯度下降

梯度下降法Gradient Descent最速下降法参数优化

梯度下降是最常用的优化算法,通过沿损失函数梯度的反方向迭代更新模型参数,逐步逼近最小化损失的最优解,是训练几乎所有机器学习模型的基石方法。


什么是梯度下降

梯度下降(Gradient Descent)是一种一阶迭代优化算法,用于最小化目标函数(在机器学习中即损失函数)。它的核心思想是:沿着函数梯度(导数)的反方向逐步调整参数,因为梯度方向指向函数增长最快的方向,其反方向则指向下降最快的方向。

三种变体

  • ·批量梯度下降(Batch GD):每次迭代使用全部训练数据计算梯度,方向准确但计算量大
  • ·随机梯度下降(SGD):每次只用一个样本计算梯度,更新频繁但噪声大
  • ·小批量梯度下降(Mini-batch GD):综合前两者优点,每次使用一个小批量样本,是实践中默认选择

改进算法

基础梯度下降存在学习率选择困难、在鞍点处停滞等问题,衍生出带动量的 SGD、AdaGrad、RMSProp、Adam 等自适应优化器,它们通过调整学习率或引入动量机制显著提升了训练效率和稳定性。


相关术语

分享: