概述
定义:一种带有卷积结构的深度神经网络,通过特征提取和分类识别完成对输入数据的判别
历史
在1989年提出,早期被成功用于手写字符图像识别
2012年更深层次的AlexNet网络取得成功,此后被广泛应用
层级结构
输入层
定义:接收数据的输入,可以处理多维数据,也能对输入特征进行标准化处理,有利于提升卷积神经网络的学习效率和表现
进行预处理的主要原因
数据范围影响
输入数据单位不一致
激活函数值域影响
卷积层
定义:提取一个局部区域的特征,不同的卷积核相当于不同的特征提取器
主要应用:图像处理
池化层
定义:包含预设定的池化函数,将特征图中单个点的结果替换为其相邻区域的特征图统计量
目的:对数据进行降维,减少数据特征,减少网络参数和运算次数,避免过拟合
全连接层
神经元排成一列,这些神经元与前一层神经元通过权值互连,呈全连接结构
等价于传统前馈神经网络中的隐藏层,通常位于卷积神经网络的最后部分,并只向其他全连接层传递信号
输出层
通常是全连接层,其结构和工作原理与传统前馈神经网络中的输出层相同
可能的输出结果
分类标签
中心坐标、大小、分类
每个像素分类结果
经典卷积神经网络
LeNet-5
时间:上世纪90年代,第一个卷积神经网络
结构
7层网络结构 = 2个卷积层 + 2个池化层 + 2个全连接层 + 1个输出层
卷积核大小:5*5
应用:手写数字识别系统在20世纪90年代被美国很多银行使用,用来识别支票上的手写数字
AlexNet
时间:2012年的ImageNet竞赛,第一个现代深度卷积网络模型
结构
8层网络结构 = 5卷积 + 3全连接
卷积核大小:11*11、5*5、3*3
使用现代深度卷积网络技术方法
使用CPU进行并行训练
采用ReLU作为非线性激活函数
使用Dropout防止过拟合
使用数据增强来提高模型准确率
ResNet
时间:残差网络,ILSVRC 2015胜利者
结构
152层网络结构 = 151卷积 + 1全连接
使用残差单元
使用了跳跃链接,并大量使用了批量归一化
优点
容易优化
能够通过增加深度来提高准确率
缓解了梯度消失问题