主流大模型为什么都是 MoE:从 DeepSeek-V3 到 Qwen3.8 的架构演进
结论先行:2026 年的主流开源模型(DeepSeek-V3/V4、Qwen3.8)不约而同选择了 MoE——把 FFN 拆成数百个专家、每个 token 只激活其中几个。这不是跟风,而是三个结构性问题同时被 MoE 解决的必然结果:容量与算力解耦、注意力与解码的双重优化、加速机制内建于训练。这篇文章从 DeepSeek-V3 的细节讲起,把 MoE 的每个零件、注意力的两条改进路线、MTP 的来龙去脉,以及“小模型为什么不用 MoE”,按我自己的逻辑线一次讲清楚。 引子:一个值得注意的现象 2024 年之前,主流大模型是两种形态:dense 的(GPT-3、Llama)和稀疏的(GShard 式的 MoE)。到 2026 年,事情变了:DeepSeek 全线 MoE(V3 的 671B、V4 的 284B/1.6T),Qwen 的主力也变成 MoE(Qwen3.8-2.4T-A95B),连“80B 总参、3B 激活”的中间档(Qwen3-Next)都是 MoE。dense 只留在小模型区(Qwen 的 0.6B-32B)。 为什么?答案是 MoE 同时解决了两类问题:训练侧,它把“模型容量”和“每 token 算力”解耦,让你可以养一个 600B 的模型而每次推理只花 37B 的钱;推理侧,它和注意力压缩、MTP(多 token 预测)叠加,把单步成本和步数同时压下来。下面从零件讲起。 一、MoE 是什么:把 Transformer 的 FFN 拆开 以 DeepSeek-V3(2024 年 12 月)为例——它是第一个把 MoE 细节大规模定型的模型,也是理解后续一切的地基:671B 总参数、37B 每 token 激活。 1.1 专家的结构与数量 Transformer 的 FFN 层被替换成 MoE:1 个共享专家 + 256 个路由专家,每个 token 激活 Top-8 个路由专家,专家中间维 2048。共享专家永远参与,负责通用能力;路由专家做细粒度分工。 ...