Xavier Weight Initialization

Medium
neural-networks DeepMind Google Meta

Xavier (Glorot) initialization sets weights with variance 2/(n_in + n_out). Why is this preferred over initializing all weights to a small constant for networks with sigmoid or tanh activations?

Multiple Choice

Correct!
Incorrect — try again next time!