拓冰建站拓冰建站
首页 / 资讯中心 / 正文

参数暴增,算力不涨?一文拆透大模型的MoE“混合专家”架构

理解 MoE 架构:让大模型按需调用参数大模型扩展能力的一条常见路径是增加参数。但对于传统的稠密模型,参数增加往往也意味着每个 token 的计算量增加。MoE 提供了另一种思路:模型可以拥有很多参数,但每次只调用其中一部分。什么是MoEMoE 是 Mixture of Experts(混合专家)​ 的缩写。本文讨论的是大语言模型中常见的 稀疏 MoE:通过路由器,为每个 token 选择少量专家参与计算。一个 MoE 模块通常包含三个部分:组件作用专家网络(Experts)对输入进行计算,通常由多个参数独立的前馈网络(FFN)组成路由器(Router)根据输入为各专家打分,并选择其中得分最高的若干个专家输出合并根据路由器给出的权重,将选中专家的计算结果进行加权求和/
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门