Hitomi's Note

瞳の笔记

李宏毅机器学习 (3)误差和梯度下降

发布于|# AI# DeepLearning

Optimization Fails

ΔL(θ)≈0\Delta L(\theta) \approx 0

L(θ)≈L(θ′)+(θ−θ′)Tg+12(θ−θ′)TH(θ−θ′)L(\theta)\approx L(\theta')+(\theta-\theta')^Tg+\frac12(\theta-\theta')^TH(\theta-\theta')

image-20220916194138247

Gradient

梯度消失

Hessian

vTHv>0⇒L(θ)>L(θ′)⇒Local minimav^THv>0 \Rightarrow L(\theta)>L(\theta')\Rightarrow\texttt{Local minima}

vTHv<0⇒L(θ)<L(θ′)⇒Local maximav^THv<0 \Rightarrow L(\theta)<L(\theta')\Rightarrow\texttt{Local maxima}

vTHv>0∣∣vTHv<0⇒Saddle pointv^THv>0 || v^THv<0\Rightarrow\texttt{Saddle point}

image-20220916195251839

在 saddle point 中可以指出更新方向。也许只存在于低维度,高维度就可以解决。

image-20220916210626479

Batch Size

image-20220916211549438

image-20220916212405856

image-20220916212501502

image-20220916212902908

image-20220916213202342

Gradient Descent & Momentum

image-20220916213604725

Learning Rate

image-20220916214430218

RMSProp

动态调整,避免卡在一个小范围内。

image-20220916215516397

Softmax

image-20220916221044157

image-20220916221814724