马冠龙

深度学习——权重初始化

一,参数初始化概述 我们知道神经网络模型一般是依靠随机梯度下降优化算法进行神经网络参数更新的,而神经网络参数学习是非凸问题,利用梯度下降算法优化参数时,网络权重参数的初始值选取十分关键。 首先得明确的是现代的网络参数初始化策略是简单的、启发式的。设定改进的初始化策略是一项困难的 任务,因为神经网络优化至今还未被很好地理解(即模型训练过程是一个黑盒)。 大多数初始化策略基于在神经网络初始...

深度学习——损失函数

一、损失函数概述 大多数深度学习算法都会涉及某种形式的优化,所谓优化指的是改变 \(x\) 以最小化或最大化某个函数 \(f(x)\) 的任务,我们通常以最小化 \(f(x)\) 指代大多数最优化问题。 在机器学习中,损失函数是代价函数的一部分,而代价函数是目标函数的一种类型。 损失函数(loss function): 用于定义单个训练样本预测值与真实值之间的误差 代...

深度学习——优化算法

前言 所谓深度神经网络的优化算法,即用来更新神经网络参数,并使损失函数最小化的算法。优化算法对于深度学习非常重要,如果说网络参数初始化(模型迭代的初始点)能够决定模型是否收敛,那优化算法的性能则直接影响模型的训练效率。 了解不同优化算法的原理及其超参数的作用将使我们更有效的调整优化器的超参数,从而提高模型的性能。 本文的优化算法特指: 寻找神经网络上的一组参数 $\theta $,它能...

深度学习——Norm层

一、内部协变量转移Internal Covariate Shift 训练深度神经网络的复杂性在于,因为前面的层的参数会发生变化导致每层输入的分布在训练过程中会发生变化。这又导致模型需要需要较低的学习率和非常谨慎的参数初始化策略,从而减慢了训练速度,并且具有饱和非线性的模型训练起来也非常困难。 网络层输入数据分布发生变化的这种现象称为内部协变量转移,BN 就是来解决这个问题。 2.1,如...