← All categoriesReinforcement Learning
MDPs through to PPO. Asked more and more now that RL sits behind LLM alignment.
Scroll this category (18) →Ready to read
18🟡Value-Based vs Policy-Based Methodsmust-know5 min🟡Multi-Armed Banditsmust-know4 min🔴Proximal Policy Optimizationmust-know5 min🟡Markov Decision Processes4 min🟡Bellman Equations5 min🟡Q-Learning4 min🟡ε-greedy, UCB & Thompson Sampling5 min🟡Why RL Is Sample-Inefficient5 min🔴SARSA vs Q-Learning (On vs Off Policy)5 min🔴Deep Q-Networks & Replay Buffers5 min🔴Policy Gradients & REINFORCE5 min🔴Actor–Critic Methods5 min🔴GRPO & Group-Relative Methods5 min🔴Advantage Estimation & GAE5 min🔴Contextual Bandits in Production5 min🔴Reward Shaping & Specification Gaming5 min🔴Offline RL5 min🔴Imitation & Inverse RL5 min