DeepSeek-R1 Architecture: How Mixture of Experts (MoE) & Reasoning Fine-Tuning Scale Intelligence
Unpacking DeepSeek-R1's Multi-head Latent Attention (MLA), DeepSeekMoE 210B sparse routing, and group relative policy optimization (GRPO) reinforcement learning.