He Initialization for ReLU

Medium
neural-networks DeepMind Google NVIDIA

He initialization uses variance 2/n_in instead of Xavier's 2/(n_in + n_out). Why is this modification necessary for networks using ReLU activations?

Multiple Choice

Correct!
Incorrect — try again next time!