首页/问答百科/MoE(混合专家模型)
🧠 模型与架构

MoE(混合专家模型)

MoE混合专家模型Mixture of Experts混合专家

MoE(Mixture of Experts,混合专家模型)是一种模型架构,将多个专门的"专家"子网络组合在一起,每次只激活部分专家来处理输入,在保持模型能力的同时大幅降低计算成本,GPT-4、Mixtral 等都采用了 MoE 架构。


什么是 MoE?

MoE(Mixture of Experts,混合专家模型)是一种高效的模型架构。它的核心思想是:与其用一个巨大的单一网络来处理所有输入,不如训练多个"专家"子网络(每个专家擅长处理不同类型的输入),然后由一个"门控网络"(Router)来决定每个输入应该交给哪些专家处理。

MoE 的工作原理

专家网络:模型包含多个独立的神经网络(通常 8 个或 16 个),每个专家在训练过程中会逐渐 specialize 到不同类型的数据模式。

门控网络:对于每个输入,门控网络会计算应该激活哪些专家。通常只激活 top-2 专家,其余专家不参与计算。

稀疏激活:虽然模型总参数可能很大(如 1 万亿),但每次推理只激活其中一小部分参数(如 10%),计算成本远低于同等参数量的稠密模型。

为什么 MoE 如此重要?

MoE 让模型可以在可控的计算成本下实现更大的规模。GPT-4 据推测使用了 MoE 架构(8 个专家,每个约 2200 亿参数),在推理速度上远优于同等能力的单一稠密模型。Mixtral 8x7B 也是一个成功的 MoE 开源模型,用 8 个 70 亿参数的专家实现了接近 700 亿参数模型的效果,但推理速度更快。

MoE 架构是目前大模型扩展的主流方向之一,让 AI 在有限算力下实现更强的能力。


相关术语

分享: