← All categories

NLP & Transformers

Tokenization through attention. The architecture every modern interview comes back to.

Scroll this category (30) →

Ready to read

30
🟡The Attention Mechanismmust-know5 min🟡Transformer Architecturemust-know5 min🟡Tokenization & BPEmust-know5 min🟡BERT vs GPT: Encoder vs Decodermust-know5 min🔴The KV Cachemust-know5 min🟢Word2Vec, GloVe & Embeddings5 min🟢Text Classification Pipelines4 min🟢TF-IDF & BM255 min🟢Stemming, Lemmatization & Stopwords4 min🟡Self-Attention vs Cross-Attention4 min🟡Why Multi-Head Attention4 min🟡Why Divide by √d_k4 min🟡Causal Masking4 min🟡The Feed-Forward Block4 min🟡Tokenizer Pitfalls (Numbers, Code, Unicode)5 min🟡Static vs Contextual Embeddings4 min🟡Masked vs Causal Language Modelling4 min🟡NER & Sequence Labelling4 min🟡Topic Modelling & LDA5 min🟡Machine Translation5 min🟡Summarization & ROUGE/BLEU5 min🟡Extractive vs Abstractive QA5 min🟡Sentence Embeddings & Sentence-BERT5 min🟡Beam Search & Decoding Strategies5 min🟡Perplexity4 min🔴Positional Encodings & RoPE5 min🔴Grouped-Query & Multi-Query Attention5 min🔴Why Attention Is O(n²)4 min🔴FlashAttention & Efficient Attention5 min🔴Linear Attention, Mamba & SSMs5 min