🎉 75% of content is free forever — Unlock Premium from $10/mo →
CW
Search courses…
💼 Servicesℹ️ About✉️ ContactView Pricing Plansfrom $10

Weight Initialization — Xavier, He, LSUV and Variance Preservation

FoundationsTraining🟢 Free Lesson

Advertisement

DL Foundations

Weight Initialization — The Hidden Key to Training Deep Networks

Poor weight initialization causes vanishing or exploding gradients, making deep networks untrainable before training even begins. Proper initialization preserves activation variance across layers.

  • Xavier for Sigmoid/Tanh — Preserves variance for activations that are approximately linear near zero
  • He/Kaiming for ReLU — Doubles variance to compensate for ReLU zeroing out half the activations
  • ResNet Zero-Init Trick — Initialize last batch norm to zero in residual blocks for stable deep training

Weight Initialization — Xavier, He, LSUV and Variance Preservation

Weight initialization determines how neural network parameters are set before training begins. Poor initialization leads to vanishing or exploding gradients, making deep networks untrainable.


Why Initialization Matters

Initialization Impact on Activation VarianceLayer 1Layer 2Layer 3Layer 4Layer 5ExplodingPreservedVanishing← Good initialization preserves variance across layers →

Random Initialization


Xavier/Glorot Initialization

Xavier Initialization: Variance AnalysisInputVar(h⁽ˡ⁻¹⁾) = 1n_in inputsWeightsVar(W) = 2/(n_in+n_out)XavierOutputVar(h⁽ˡ⁾) ≈ 1n_out outputsVar(h⁽ˡ⁾) = n_in · Var(W) · Var(h⁽ˡ⁻¹⁾) ≈ 1

He/Kaiming Initialization

He vs Xavier: ReLU CompensationXavier (no ReLU)Var = 1.0ReLUzeros halfVar = 0.5Vanishes!He (with ReLU)Var = 1.0ReLUzeros halfVar = 1.0Preserved!

Orthogonal Initialization


LSUV (Layer-Sequential Unit-Variance)


Initialization for ResNets

ResNet Zero-Init: Residual Block at Initializationh⁽ˡ⁾Identity (skip)F(h⁽ˡ⁾): Conv → BN → ReLU → Conv → BNγ=0+h⁽ˡ⁺¹⁾At initialization: F(h) = 0, so h⁽ˡ⁺¹⁾ = h⁽ˡ⁾ (identity mapping)

Practical Recommendations

Initialization Selection GuideCNNsHe (Kaiming) + ReLUResNet: zero-init BNEfficientNet: NAS-tunedTransformersXavier for embeddings1/√d for projectionsOutput: small init (0.02)RNNs/LSTMsOrthogonal recurrentXavier input→hiddenIdentity forget gate

Summary

  • Xavier/Glorot for sigmoid/tanh: preserves variance
  • He/Kaiming for ReLU: doubles variance to compensate for ReLU
  • Orthogonal for RNNs: preserves gradient magnitude through time
  • Zero-init for ResNet last BN: ensures identity mapping at initialization
  • LSUV: data-driven, works for any architecture

Next: Regularization for Deep Learning

Need Expert Deep Learning Help?

Get personalized tutoring, project support, or professional consulting.

Advertisement