← All categories

Deep Learning

Backprop, architectures, and everything that makes training actually work.

Scroll this category (48) →

Ready to read

48
🟢Activation Functionsmust-know4 min🟢Dropoutmust-know4 min🟡Backpropagationmust-know5 min🟡Vanishing & Exploding Gradientsmust-know4 min🟡Batch Normalizationmust-know5 min🟡SGD, Momentum, Adam & AdamWmust-know5 min🟡Transfer Learning & Fine-Tuningmust-know4 min🟡Debugging a Training Runmust-know5 min🟢Perceptron & the MLP4 min🟢Choosing a Loss Function4 min🟢Data Augmentation5 min🟡Universal Approximation Theorem4 min🟡Computational Graphs & Autograd5 min🟡The Dying ReLU Problem4 min🟡Gradient Clipping4 min🟡Weight Initialization (Xavier/He)5 min🟡Learning Rate Schedules & Warmup4 min🟡How Batch Size Changes Training4 min🟡Softmax, Logits & Numerical Stability4 min🟡Label Smoothing4 min🟡Convolutional Neural Networks5 min🟡Pooling, Strides & Receptive Field5 min🟡Residual Connections4 min🟡RNNs, LSTMs & GRUs5 min🟡Seq2Seq & Encoder–Decoder5 min🟡Autoencoders4 min🟡Which Layers to Freeze4 min🟡Reproducibility & Nondeterminism4 min🔴LayerNorm vs BatchNorm vs RMSNorm5 min🔴Depthwise Separable Convolutions5 min🔴Backprop Through Time4 min🔴Teacher Forcing & Exposure Bias4 min🔴Variational Autoencoders5 min🔴Generative Adversarial Networks5 min🔴Mode Collapse & GAN Instability5 min🔴Diffusion Models5 min🔴Flow Matching & Rectified Flow5 min🔴Graph Neural Networks5 min🔴Mixup & CutMix4 min🔴Mixed Precision Training5 min🔴Gradient Accumulation & Checkpointing5 min🔴Data vs Model Parallelism5 min🔴ZeRO, FSDP & Sharded Training5 min🔴Contrastive & Self-Supervised Learning5 min🔴Knowledge Distillation5 min🔴Pruning & Quantization5 min🔴Catastrophic Forgetting5 min🔴Double Descent & Grokking5 min