He Initialization for ReLU
Medium
neural-networks
DeepMind
Google
NVIDIA
He initialization uses variance 2/n_in instead of Xavier's 2/(n_in + n_out). Why is this modification necessary for networks using ReLU activations?
Multiple Choice
Correct!
Incorrect — try again next time!