什么是 MoE?
MoE(Mixture of Experts,混合专家模型)是一种高效的模型架构。它的核心思想是:与其用一个巨大的单一网络来处理所有输入,不如训练多个"专家"子网络(每个专家擅长处理不同类型的输入),然后由一个"门控网络"(Router)来决定每个输入应该交给哪些专家处理。
MoE 的工作原理
专家网络:模型包含多个独立的神经网络(通常 8 个或 16 个),每个专家在训练过程中会逐渐 specialize 到不同类型的数据模式。
门控网络:对于每个输入,门控网络会计算应该激活哪些专家。通常只激活 top-2 专家,其余专家不参与计算。
稀疏激活:虽然模型总参数可能很大(如 1 万亿),但每次推理只激活其中一小部分参数(如 10%),计算成本远低于同等参数量的稠密模型。
为什么 MoE 如此重要?
MoE 让模型可以在可控的计算成本下实现更大的规模。GPT-4 据推测使用了 MoE 架构(8 个专家,每个约 2200 亿参数),在推理速度上远优于同等能力的单一稠密模型。Mixtral 8x7B 也是一个成功的 MoE 开源模型,用 8 个 70 亿参数的专家实现了接近 700 亿参数模型的效果,但推理速度更快。
MoE 架构是目前大模型扩展的主流方向之一,让 AI 在有限算力下实现更强的能力。