什么是梯度下降
梯度下降(Gradient Descent)是一种一阶迭代优化算法,用于最小化目标函数(在机器学习中即损失函数)。它的核心思想是:沿着函数梯度(导数)的反方向逐步调整参数,因为梯度方向指向函数增长最快的方向,其反方向则指向下降最快的方向。
三种变体
- ·批量梯度下降(Batch GD):每次迭代使用全部训练数据计算梯度,方向准确但计算量大
- ·随机梯度下降(SGD):每次只用一个样本计算梯度,更新频繁但噪声大
- ·小批量梯度下降(Mini-batch GD):综合前两者优点,每次使用一个小批量样本,是实践中默认选择
改进算法
基础梯度下降存在学习率选择困难、在鞍点处停滞等问题,衍生出带动量的 SGD、AdaGrad、RMSProp、Adam 等自适应优化器,它们通过调整学习率或引入动量机制显著提升了训练效率和稳定性。