Xavier Weight Initialization
Medium
neural-networks
DeepMind
Google
Meta
Xavier (Glorot) initialization sets weights with variance 2/(n_in + n_out). Why is this preferred over initializing all weights to a small constant for networks with sigmoid or tanh activations?
Multiple Choice
Correct!
Incorrect — try again next time!