Why we are assuming all weight distributions are Gaussian
9/10/25About 2 min
#Bayes
Q:
对于深度神经网络来说他们的权重符合正态分布么?
A:
深度神经网络的权重是否符合正态分布这个问题并没有一个定论,它取决于多种因素,包括网络的初始化方式、网络的结构、训练数据的分布以及训练过程中的优化算法等。
初始化方式:在神经网络的训练开始时,我们通常会对权重进行初始化。通常的初始化方法有很多种,其中一种常见的方法就是使用正态分布或者均匀分布来进行初始化。这样一来,至少在训练开始时,权重会近似地服从这种分布。
网络结构和训练数据:随着训练的进行,权重的分布会受到训练数据和网络结构的影响。例如,如果网络的某一层主要学习的特征在数据中的分布是非对称的,那么这一层的权重的分布可能就会偏离正态分布。
优化算法:训练过程中使用的优化算法也会影响权重的分布。例如,使用带有动量项的优化算法(如Adam)可能会使权重的分布在训练过程中变得更加复杂。
因此,虽然我们可以通过初始化的方式使权重的分布在训练开始时近似正态分布,但在训练过程中,权重的分布可能会发生变化,甚至可能偏离正态分布。另外,我们也无法简单地假设所有的深度神经网络的权重都符合正态分布,因为这会忽略了网络结构、训练数据和优化算法等因素的影响。
对于权重的分布,一种常见的研究方法是在训练过程中对权重进行可视化,观察其分布的变化。这可以帮助我们更好地理解网络的训练过程,以及权重的分布对网络性能的影响。
Q: Are they?
A: They are not, see "Bayesian attention module" 2020 ICLR
Q: Are they?
A: They are not, see "Bayesian attention module" 2020 ICLR