MARS框架三大实例:MARS-AdamW、MARS-Lion与MARS-Shampoo对比分析

发布时间:2026/7/25 21:41:08
MARS框架三大实例:MARS-AdamW、MARS-Lion与MARS-Shampoo对比分析 MARS框架三大实例MARS-AdamW、MARS-Lion与MARS-Shampoo对比分析【免费下载链接】MARSThe official implementation of MARS: Unleashing the Power of Variance Reduction for Training Large Models项目地址: https://gitcode.com/gh_mirrors/mars11/MARSMARSMake variance Reduction Shine是一个统一的优化框架旨在解决训练大型模型时的固有挑战。它结合了预条件梯度方法和方差减少技术通过缩放随机递归动量和预条件更新加速优化过程中临界点的搜索。本文将深入对比MARS框架下的三大实例——MARS-AdamW、MARS-Lion和MARS-Shampoo帮助开发者选择最适合自己需求的优化器。MARS框架概述MARS框架的核心在于将方差减少技术与预条件梯度方法相结合其数学形式包含四个关键步骤缩放梯度校正、梯度裁剪、动量更新和预条件优化。通过这种设计MARS能够同时实现更好的梯度复杂度和每步迭代复杂度为大型模型训练提供强大支持。在MARS框架下有三个主要实例它们基于不同的Hessian矩阵近似方法MARS-AdamW使用对角矩阵近似HessianMARS-Lion基于动量的Hessian近似MARS-Shampoo采用矩阵分解技术近似Hessian需要注意的是框架中的超参数默认针对MARS-AdamW进行了调优。使用其他实例时特别是学习率等关键参数需要重新调整以获得最佳性能。MARS-AdamW对角矩阵近似的高效实现MARS-AdamW是MARS框架中最成熟的实例通过对角矩阵近似Hessian矩阵。它的实现位于MARS/mars.py通过设置mars_typemars-adamw启用。核心公式MARS-AdamW的Hessian矩阵近似定义为v_t β₂v_{t-1} (1-β₂)(∇f(x_t, ξ_t))² H_t : √(diag(v_t)) · (1 - β₁ᵗ)/√(1 - β₂ᵗ)性能表现MARS-AdamW在多个任务上表现出色。在FineWeb-Edu数据集上GPT-2 Small模型使用MARS-AdamW达到了45.93的平均分数显著优于AdamW和OpenAI基线。图1MARS-AdamW在GPT-2 Small模型上的训练损失曲线显示出快速收敛特性在GPT-2 XL模型上MARS-AdamW更是实现了56.52的HellaSwag准确率证明了其在大型模型上的优势。图2MARS-AdamW在GPT-2 XL模型上的验证损失曲线展示了持续的低损失表现适用场景需要快速收敛的大型语言模型训练资源有限但追求高精度的场景作为其他MARS实例的性能基准MARS-Lion基于动量的轻量级方案MARS-Lion是MARS框架的轻量级实例通过动量的平方对角矩阵近似Hessian。它的实现同样位于MARS/mars.py通过设置mars_typemars-lion启用。核心公式MARS-Lion的Hessian矩阵近似定义为H_t : √(diag(m_t²))其中m_t是动量项这种设计使得MARS-Lion的计算复杂度低于MARS-AdamW。特点与优势计算效率高无需维护二阶矩估计内存占用更小收敛稳定基于动量的更新有助于避免局部最优调参简单相比MARS-AdamW需要调整的超参数更少适用场景内存受限的大型模型训练需要简化调参流程的场景对训练速度要求较高的应用MARS-Shampoo矩阵分解的高阶近似MARS-Shampoo是MARS框架中最复杂的实例采用矩阵分解技术近似Hessian矩阵。它的实现位于MARS/mars.py通过设置mars_typemars-shampoo启用。核心公式MARS-Shampoo的预条件器基于SVD分解U_t, Σ_t, V_t SVD(G_t) x_{t1} x_t - η_t U_t V_t^⊤在实践中MARS-Shampoo使用Newton-Schulz迭代加速SVD问题的求解平衡了计算复杂度和近似精度。特点与优势高阶近似能够捕捉参数间的相关性理论最优在某些条件下可达到二阶方法的收敛速度泛化能力强在小样本数据上可能表现更好适用场景数据量有限但模型复杂的任务追求理论最优解的研究场景特征维度高且存在相关性的应用三大实例的性能对比虽然MARS-AdamW是目前文档中唯一提供详细实验数据的实例但我们可以根据三种方法的特性进行理论对比计算复杂度MARS-AdamWO(d)d为参数维度MARS-LionO(d)但常数因子更小MARS-ShampooO(d^(3/2))但可通过低秩近似优化内存占用MARS-AdamW高需要存储二阶矩MARS-Lion低仅需存储动量MARS-Shampoo中到高取决于矩阵分解策略收敛特性MARS-AdamW均衡的收敛速度和稳定性MARS-Lion初期收敛快后期可能震荡MARS-Shampoo理论收敛快但实际可能受近似质量影响实际应用建议对于大多数用户我们建议从MARS-AdamW开始因为它在各种任务上都表现出稳定的高性能。如果你面临内存限制可以尝试MARS-Lion如果追求理论上的最优解且能接受更高的计算成本可以尝试MARS-Shampoo。图3MARS实例在不同规模GPT模型上的训练效率对比展示了MARS框架的整体优势快速开始使用MARS实例要在你的项目中使用MARS框架的不同实例只需在初始化优化器时指定mars_type参数# 导入MARS优化器 from mars import MARS # 使用MARS-AdamW optimizer MARS(model.parameters(), lr1e-3, mars_typemars-adamw) # 使用MARS-Lion optimizer MARS(model.parameters(), lr1e-3, mars_typemars-lion) # 使用MARS-Shampoo optimizer MARS(model.parameters(), lr1e-3, mars_typemars-shampoo)项目提供了多种配置文件和脚本方便快速启动不同模型的训练配置文件config/目录下包含各种模型的训练配置脚本文件scripts/目录下提供了一键启动脚本例如要使用MARS-AdamW训练GPT-2 Small模型可以运行$ bash scripts/run_mars_small.sh总结MARS框架通过统一的设计理念提供了三种各具特色的优化器实例满足不同场景下的训练需求。MARS-AdamW作为基准实例在性能和稳定性之间取得了平衡MARS-Lion以其轻量级设计提供了高效的训练方案MARS-Shampoo则通过高阶近似追求理论上的最优解。无论你是训练大型语言模型还是计算机视觉模型MARS框架都能提供强大的优化支持。建议根据你的具体任务需求、资源限制和精度要求选择最适合的MARS实例并通过调整超参数进一步优化性能。图4MARS在CIFAR-10数据集上的测试准确率展示了其在计算机视觉任务上的优势通过合理选择和配置MARS框架的优化器实例你可以充分释放大型模型的训练潜力加速模型收敛并提高最终性能。【免费下载链接】MARSThe official implementation of MARS: Unleashing the Power of Variance Reduction for Training Large Models项目地址: https://gitcode.com/gh_mirrors/mars11/MARS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考