拓冰建站拓冰建站
首页 / 资讯中心 / 正文

8.2万亿 tokens训练数据揭秘:A.X-K2的多阶段课程学习策略

8.2万亿 tokens训练数据揭秘A.X-K2的多阶段课程学习策略【免费下载链接】A.X-K2项目地址: https://ai.gitcode.com/hf_mirrors/skt/A.X-K2A.X K2是SK Telecom开发的大型混合专家Mixture-of-Experts, MoE语言模型作为高性能的智能基础模型其拥有6880亿总参数和330亿活跃参数通过创新的多阶段课程学习策略在8.2万亿tokens的海量数据上训练而成实现了强大的推理能力和指令遵循性能。模型架构概览A.X K2采用 decoder-only Transformer 架构结合了多项创新技术使其在保持高性能的同时兼顾推理效率。A.X K2 模型标志体现了其作为下一代AI模型的前沿定位核心架构特点包括混合专家机制256个路由专家1个共享专家每个token激活8个专家稀疏门控注意力SGA通过轻量级索引器选择top-k token大幅降低长上下文计算量门控归一化GN在RMSNorm后应用输入相关门控抑制异常激活提升训练稳定性和低精度服务性能原生FP8训练采用MXFP8E4M3格式进行前向和反向传播训练释放内存空间多阶段课程学习策略详解A.X K2的训练数据经过精心设计的三阶段课程学习策略总训练量达到8.2万亿tokens每个阶段针对不同能力维度进行优化第一阶段6.4万亿通用知识积累数据构成以网页文本、书籍、学术论文为主语言分布英语72.7%、韩语15.4%、代码8.3%其余为日语、西班牙语和中文主要来源包括Nvidia Nemotron-CC-v2.1、FineWeb2等公共数据集以及SKT内部爬取的韩语数据训练目标构建广泛的世界知识基础培养基本语言理解能力第二阶段1.4万亿高质量推理训练数据特点精选推理密集型内容包括数学问题、科学知识、逻辑推理任务训练重点强化多步推理能力培养复杂问题解决技巧质量控制通过启发式和基于模型的质量过滤结合去重和领域感知混合策略第三阶段0.36万亿长上下文扩展数据特性专注于超长文本序列支持原生128K上下文长度通过YaRN扩展至256K技术突破采用Adjusted Base Frequency (ABF)技术优化长序列训练能力提升显著增强长文档理解、多跳追踪和远距离事实检索能力数据处理与质量保障为确保训练数据的高质量和多样性A.X K2采用了严格的数据处理流程数据筛选从约16.2万亿tokens的候选池中精选8.2万亿tokens用于训练质量控制应用领域特定质量阈值而非全局标准随训练进展逐步提高标准PII处理内部收集的语料通过PII masking管道将检测到的标识符替换为类型特定的占位符令牌数据溯源记录每个语料库的来源和收集方法确保符合许可要求和使用范围训练成果与性能表现通过精心设计的多阶段课程学习策略A.X K2在各项评估中表现卓越数学推理在AIME26 benchmark上达到97.1%的准确率Apex-shortlist任务准确率88.6%韩语能力KMMLU-Pro获得80.5%的分数CLIcK任务达到91.6%的准确率长上下文理解在RULER评估中256K上下文长度下仍保持86.6%的性能事实检索在Needle-in-a-Haystack测试中256K和512K上下文长度下实现100%的精确检索率A.X K2在256K上下文长度下的NIAH事实检索性能即使在NVFP4量化下也能实现100%准确率实际应用与部署A.X K2提供灵活的部署选项支持不同场景需求思考模式生成带推理步骤的详细响应适用于复杂问题解决非思考模式生成简洁直接的回答优化低延迟使用部署要求FP8权重约647 GiB建议至少800 GiB GPU内存支持框架原生支持Hugging Face Transformers和vLLM通过SKT-AI fork要开始使用A.X K2可通过以下命令克隆仓库git clone https://gitcode.com/hf_mirrors/skt/A.X-K2A.X K2的多阶段课程学习策略展示了大规模语言模型训练的先进方法通过精心设计的训练数据和创新架构为用户提供了强大而高效的AI能力特别在数学推理、韩语理解和长上下文处理方面表现突出。随着开源社区的进一步探索和应用A.X K2有望在更多领域发挥重要作用。【免费下载链接】A.X-K2项目地址: https://ai.gitcode.com/hf_mirrors/skt/A.X-K2创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门