1 工作原理

Momentum(动量，冲量)：结合当前梯度与上一次更新信息，用于当前更新。

动量梯度下降法是计算梯度的指数加权平均数，并利用该数值来更新参数值。

指数加权平均：

与原始的梯度下降相比，动量的梯度下降趋势更加平滑，不但能使用较大的学习率，其迭代次数也减少。

在随机梯度的学习算法中，每一步的步幅都是固定的，而在动量学习算法中，每一步走多远不仅依赖于本次的梯度的大小还取决于过去的速度。速度v是累积各轮训练参的梯度，其中 $\beta$ 越大，依赖以前的梯度越大。假如每轮训练的梯度方向都是相同的，和小球从斜坡滚落，由于但衰减因子 $\beta$ 的存在，小球并不会一直加速，而是达到最大速度后开始匀速行驶，这里假设每轮获得的梯度都是相同的，那么速度最大值为：

从上式可以看到当 $\beta$ = 0.9时，最大速度相当于梯度下降的10倍（带进上式去算可得），通常 $\beta$ 可取0.5,0.9,0.99，情况一般 $\beta$ 的调整没有 $\alpha$ 调整的那么重要适当。取值即可。

不使用动量： $w = w - Lr * dw$

使用动量： $v= momentum*v - Lr*dw$ $w = w + v$

其中 $w$ 表示权重， $Lr$ 表示学习率， $dw$ 表示 $w$ 的导数， $v$ 表示速度，一般初始化为0； $momentum$ 就是引入的动量，一般是设置为0.9。可以理解为，如果上一次的 $momentum(v)$ 与当前的 $momentum$ 负梯度方向是相同的，那这次下降的幅度就会加大，从而可以加快模型收敛。

def sgd_momentum(parameters, vs, lr, gamma):for param, v in zip(parameters, vs):v[:] = gamma * v + lr * param.grad.dataparam.data = param.data - v

2 作用

主要是在训练网络时，最开始会对网络进行权值初始化，但是这个初始化不可能是最合适的；因此可能就会出现损失函数在训练的过程中出现局部最小值的情况，而没有达到全局最优的状态。

momentum的出现可以在一定程度上解决这个问题。动量来源于物理学，当momentum越大时，转换为势能的能量就越大，就越有可能摆脱局部凹区域，从而进入全局凹区域。momentum主要是用于权值优化。

3 代码实现

使用公式手动实现动量：

import numpy as np
import torch
from torchvision.datasets import MNIST # 导入 pytorch 内置的 mnist 数据
from torch.utils.data import DataLoader
from torch import nn
from torch.autograd import Variable
import time
import matplotlib.pyplot as plt
# %matplotlib inlinedef data_tf(x):x = np.array(x, dtype='float32') / 255x = (x - 0.5) / 0.5 # 标准化，这个技巧之后会讲到x = x.reshape((-1,)) # 拉平x = torch.from_numpy(x)return xtrain_set = MNIST('./data', train=True, transform=data_tf, download=True) # 载入数据集，申明定义的数据变换
test_set = MNIST('./data', train=False, transform=data_tf, download=True)# 定义 loss 函数
criterion = nn.CrossEntropyLoss()# 现在手动实现一下动量法
def sgd_momentum(parameters, vs, lr, gamma):for param, v in zip(parameters, vs):v[:] = gamma * v + lr * param.grad.dataparam.data = param.data - vtrain_data = DataLoader(train_set, batch_size=64, shuffle=True)
# 使用 Sequential 定义 3 层神经网络
net = nn.Sequential(nn.Linear(784, 200),nn.ReLU(),nn.Linear(200, 10),
)# 将速度初始化为和参数形状相同的零张量
vs = []
for param in net.parameters():vs.append(torch.zeros_like(param.data))# 开始训练
losses = []
idx = 0
start = time.time()  # 记时开始
for e in range(5):train_loss = 0for im, label in train_data:im = Variable(im)label = Variable(label)# 前向传播out = net(im)loss = criterion(out, label)# 反向传播net.zero_grad()loss.backward()sgd_momentum(net.parameters(), vs, 1e-2, 0.9)  # 使用的动量参数为 0.9，学习率 0.01train_loss += loss.data# 记录误差if idx % 30 == 0:  # 30 步记录一次losses.append(loss.data)idx += 1print('epoch: {}, Train Loss: {:.6f}'.format(e, train_loss / len(train_data)))
end = time.time()  # 计时结束
print('使用时间: {:.5f} s'.format(end - start))

pytorch 内置了动量法的实现，直接用 torch.optim.SGD(momentum=0.9) 实现：

import numpy as np
import torch
from torchvision.datasets import MNIST # 导入 pytorch 内置的 mnist 数据
from torch.utils.data import DataLoader
from torch import nn
from torch.autograd import Variable
import time
import matplotlib.pyplot as plt
# %matplotlib inlinedef data_tf(x):x = np.array(x, dtype='float32') / 255x = (x - 0.5) / 0.5 # 标准化，这个技巧之后会讲到x = x.reshape((-1,)) # 拉平x = torch.from_numpy(x)return xtrain_set = MNIST('./data', train=True, transform=data_tf, download=True) # 载入数据集，申明定义的数据变换
test_set = MNIST('./data', train=False, transform=data_tf, download=True)# 定义 loss 函数
criterion = nn.CrossEntropyLoss()train_data = DataLoader(train_set, batch_size=64, shuffle=True)
# 使用 Sequential 定义 3 层神经网络
net = nn.Sequential(nn.Linear(784, 200),nn.ReLU(),nn.Linear(200, 10),
)
optimizer = torch.optim.SGD(net.parameters(), lr=1e-2, momentum=0.9) # 加动量# 开始训练
losses = []
idx = 0
start = time.time()  # 记时开始
for e in range(5):train_loss = 0for im, label in train_data:im = Variable(im)label = Variable(label)# 前向传播out = net(im)loss = criterion(out, label)# 反向传播optimizer.zero_grad()loss.backward()optimizer.step()train_loss += loss.data# 记录误差if idx % 30 == 0:  # 30 步记录一次losses.append(loss.data)idx += 1print('epoch: {}, Train Loss: {:.6f}'.format(e, train_loss / len(train_data)))
end = time.time()  # 计时结束
print('使用时间: {:.5f} s'.format(end - start))x_axis = np.linspace(0, 5, len(losses), endpoint=True)
plt.semilogy(x_axis, losses, label='momentum: 0.9')
plt.legend(loc='best')
plt.show()

对比动量和不加动量的SGD：

net = nn.Sequential(nn.Linear(784, 200),nn.ReLU(),nn.Linear(200, 10),
)
optimizer = torch.optim.SGD(net.parameters(), lr=1e-2) # 加动量
losses1 = []
idx = 0
start = time.time()  # 记时开始
for e in range(5):train_loss = 0for im, label in train_data:im = Variable(im)label = Variable(label)# 前向传播out = net(im)loss = criterion(out, label)# 反向传播optimizer.zero_grad()loss.backward()optimizer.step()train_loss += loss.data# 记录误差if idx % 30 == 0:  # 30 步记录一次losses1.append(loss.data)idx += 1print('epoch: {}, Train Loss: {:.6f}'.format(e, train_loss / len(train_data)))
end = time.time()  # 计时结束
print('使用时间: {:.5f} s'.format(end - start))x_axis = np.linspace(0, 5, len(losses), endpoint=True)
plt.semilogy(x_axis, losses, label='momentum: 0.9')
plt.semilogy(x_axis, losses1, label='no momentum')
plt.legend(loc='best')
plt.show()

《python深度学习》笔记（十二）：动量相关推荐

Kera之父Python深度学习笔记（二）神经网络的数学基础
目录神经网络的数据表示标量(0D张量) 向量(1D张量) 矩阵(2D张量) 3D张量以及更高维张量关键属性在Numpy中操作张量数据批量的概念现实世界中的数据张量向量数据时间序列数据和 ...
Programming Computer Vision with Python （学习笔记十二）
ORB(Oriented FAST and Rotated BRIEF)可用来替代SIFT(或SURF),它对图像更具有抗噪特性,是一种特征检测高效算法,其速度满足实时要求,可用于增强图像匹配应用. ...
Programming Computer Vision with Python （学习笔记十二） 1
ORB(Oriented FAST and Rotated BRIEF)可用来替代SIFT(或SURF),它对图像更具有抗噪特性,是一种特征检测高效算法,其速度满足实时要求,可用于增强图像匹配应用. ...
Python语言入门这一篇就够了-学习笔记(十二万字)
Python语言入门这一篇就够了-学习笔记(十二万字) 友情提示:先关注收藏,再查看,12万字保姆级 Python语言从入门到精通教程. 文章目录 Python语言入门这一篇就够了-学习笔记(十二万字 ...
Tensorflow深度学习之十二：基础图像处理之二
Tensorflow深度学习之十二:基础图像处理之二 from:https://blog.csdn.net/davincil/article/details/76598474 首先放出原始图像: ...
python做直方图-python OpenCV学习笔记实现二维直方图
本文介绍了python OpenCV学习笔记实现二维直方图,分享给大家,具体如下: 官方文档 – https://docs.opencv.org/3.4.0/dd/d0d/tutorial_py_2d ...
吴恩达《机器学习》学习笔记十二——机器学习系统
吴恩达<机器学习>学习笔记十二--机器学习系统一.设计机器学习系统的思想 1.快速实现+绘制学习曲线--寻找重点优化的方向 2.误差分析 3.数值估计二.偏斜类问题(类别不均衡) 三. ...
前几帧预测深度学习_使用深度学习从十二导联心电图预测心律失常
上集讲到使用深度学习从单导联预测房颤这一集将继续讨论该问题单导联心电图对心律失常的预测作用非常有限因为单导联的信号很有限临床上需要结合多导联心电图判断心律失常的类型这一集的 ...
花书+吴恩达深度学习（十二）卷积神经网络 CNN 之全连接层
目录 0. 前言 1. 全连接层(fully connected layer) 如果这篇文章对你有一点小小的帮助,请给个关注,点个赞喔~我会非常开心的~ 花书+吴恩达深度学习(十)卷积神经网络 CNN ...
ROS学习笔记十二：使用roswtf
ROS学习笔记十二:使用roswtf 在使用ROS过程中,roswtf工具可以为我们提供ROS系统是否正常工作的检查作用. 注意:在进行下列操作之前,请确保roscore没有运行. 检查ROS是否安装 ...

《python深度学习》笔记（十二）：动量

1 工作原理

2 作用

3 代码实现

《python深度学习》笔记（十二）：动量相关推荐

最新文章

热门文章