拓冰建站拓冰建站
首页 / 资讯中心 / 正文

从预训练到RL:Instella-MoE-16B-A3B-Base六阶段训练流水线完整揭秘(含数据配方)

从预训练到RLInstella-MoE-16B-A3B-Base六阶段训练流水线完整揭秘含数据配方【免费下载链接】Instella-MoE-16B-A3B-Base项目地址: https://ai.gitcode.com/hf_mirrors/amd/Instella-MoE-16B-A3B-Base大模型是如何一步步炼成的Instella-MoE-16B-A3B-Base是 AMD 推出的完全开源 MoE 大模型总参数 160 亿、每 token 仅激活 28 亿参数并首次完整公开了从预训练到强化学习的六阶段训练流水线与全部数据配方。本文为你逐阶段拆解这条炼金之路无论你是想复现训练流程还是想深入理解 MoE 模型的成长逻辑这篇指南都值得收藏。图1Instella-MoE 与同类规模 SOTA 模型的成本-性能对比来自 README.md一、认识主角Instella-MoE-16B-A3B-Base 模型档案在拆解流水线之前先看这份模型档案完整配置见 config.json配置项数值总参数量 / 激活参数量16B / 2.8BDecoder 层数27 层Hidden Size2048路由专家 / 共享专家64 / 2每 token 激活专家数6词表大小128,896注意力机制Gated Multi-head Latent Attention门控 MLAMoE 通信方案FarSkip-Collective最大序列长度65536YaRN 扩展到 131072核心亮点这个仓库中的 Base 版本正是长上下文训练后的最终基座模型也是后续 SFT、DPO、RL 的起点。所有架构细节和推理代码都在 modeling_instella_moe.py 与 configuration_instella_moe.py 中完整开放。二、六阶段训练流水线全景图Instella-MoE 从零开始在 AMD Instinct™ MI300X / MI325X 上基于 ROCm 软件栈完成端到端训练共经历6 个阶段预训练Pre-training从零训练基础语言能力中期训练Mid-training用高质量数据精修关键能力长上下文扩展Long-context拉长序列处理能力SFT 监督微调学会指令跟随与思维链DPO 偏好优化对齐人类偏好RL 强化学习产出最终 Thinking 版本每一阶段都发布了独立的公开 checkpoint方便研究者对比学习。三、阶段一至三从零到最强基座预训练16B 参数如何从零起步预训练阶段在多样化的大规模语料上从零训练 MoE 模型。得益于稀疏激活设计虽然总参数达 160 亿但每个 token 只激活 2.8B 参数训练与推理成本都大幅低于同规模稠密模型。架构上采用 Gated MLA 注意力压缩 KV 缓存配合 FarSkip-Collective 实现通信计算极致重叠大幅提升大规模训练效率。中期训练Dolmino 高质量数据配方揭秘这是本仓库最有价值的数据配方线索。查看 merge_metadata.json 可以看到Base 版本正是由 3 个中期训练 checkpoint 以 float32 精度加权合并而成3 个分支均基于dolmino_100B数据混合训练约 21000~22125 步学习率 2e-4每分支权重 0.5归一化后各占 1/3合并张量总数达 5568 个这种多分支训练 权重合并的配方是让基座在保持通用能力的同时精修关键技能的高效手段。长上下文扩展从 4096 到 131072Base 版本通过YaRNRope Scalingfactor40将原生 4096 上下文扩展到 65536配合 MTP多 token 预测层最终支持最长 131072 token 的推理见 tokenizer_config.json 中的model_max_length。表2Base 版本在标准基准上的表现来自 README.md表3Base 版本在 HELMET 与 RULER 长上下文基准上的表现来自 README.md四、阶段四至六对齐与强化炼出会思考的模型SFT学会听懂人话在 Base 基础上通过监督微调SFT让模型获得指令跟随与思维链推理能力。这一步的数据主要来自高质量指令-回答对是模型从续写机器走向对话助手的关键转折。DPO让答案更讨人喜欢DPO直接偏好优化在对比偏好数据上训练无需复杂的奖励模型即可对齐人类偏好。相比 RLHFDPO 训练更稳定、成本更低是中小团队对齐模型的理想选择。RL最终 Thinking 版本出炉最后一个阶段用Miles RL 框架强化学习精修产出Instella-MoE-16B-A3B-Think版本进一步强化指令跟随与整体回答质量。表4Instella-MoE-Think 在 OLMES 框架下的评测结果最多生成 32768 tokens来自 README.md五、完整数据配方与训练清单总结版如果你打算复现或借鉴这套流水线记住这张清单阶段数据/方法关键参数输出模型预训练多样化大规模语料稀疏 MoE 激活 2.8BPretrain中期训练Dolmino 100B 高质量混合3 分支 × 2e-4权重合并Midtrain长上下文YaRN 缩放 factor404096→65536MTP 层Base本仓库SFT指令 思维链数据—SFTDPO对比偏好数据—DPORLMiles 框架强化学习—Think六、如何上手体验想立即体验这套模型的推理效果示例代码如下详见 README.mdfrom transformers import AutoModelForCausalLM, AutoTokenizer tokenizer AutoTokenizer.from_pretrained(checkpoint, trust_remote_codeTrue) model AutoModelForCausalLM.from_pretrained(checkpoint, device_mapauto, trust_remote_codeTrue)需要说明的是本仓库以研究许可ResearchRAIL发布仅限学术与研究用途模型具备一定的多语言与推理能力但多语言能力尚未充分测试使用时请结合场景做好安全评估详见 LICENSE。结语为什么这值得关注Instella-MoE 的价值不仅在于性能更在于**完全开放**训练框架Primus、RL 框架Miles、每阶段数据配方、中间 checkpoint 与推理代码全部公开。对研究者而言这是研究 MoE 训练全流程的绝佳教材对工程师而言这也是在 AMD ROCm 平台上搭建大模型训练流水线的完整范本。从预训练到 RL 的六阶段流水线此刻就摆在你的面前——动手探索吧【免费下载链接】Instella-MoE-16B-A3B-Base项目地址: https://ai.gitcode.com/hf_mirrors/amd/Instella-MoE-16B-A3B-Base创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门