拓冰建站拓冰建站
首页 / 资讯中心 / 正文

彩云科技两破NanoGPT训练纪录:改结构正在比堆算力更值钱

据中新网等媒体报道中国 AI 企业彩云科技的基础模型算法团队在全球开源 AI 竞速项目 NanoGPT Speedrun 中两次刷新世界纪录把 1.24 亿参数 GPT-2 的达标训练时间压缩到了约 1 分 16 秒。相关代码已并入官方开源仓库。这不是又一个大厂刷榜的新闻而是一个小团队在改模型结构这条路上被公开验证了一次。NanoGPT Speedrun 到底比什么先说清楚这个项目为什么值得看。NanoGPT Speedrun 是一个面向全球开发者开放的开源竞速项目规则很纯粹固定 8 张 H100、固定数据集、固定目标 loss。换句话说赛道一样、燃料一样唯一能拉开差距的就是训练技术本身——优化器、并行策略、网络结构、数值精度。据公开信息彩云团队的两项成绩对应官方纪录榜的第 81 和第 85 位把达标训练时间从约 84 秒压到 76.3 秒。当榜单已经被挤到接近于硬件理论极限时再想省下几秒靠调参已经不够了必须动模型的底层结构。两项架构创新是什么两项工作分别是 DCMHA 和 MUDD据公开报道均已发表于 ICML代码已被官方仓库合并全球开发者可以自由复现和迭代。DCMHA可动态组合多头注意力注意力机制里不同的注意力头负责关注不同的信息。传统做法是每个头固定分工而 DCMHA 让头的组合方式随输入动态变化相当于让模型自己决定这一句该重点看哪里。MUDD多路动态稠密连接残差连接residual是 Transformer 里信息跨层流动的通道。MUDD 的思路是提供多条可动态选择的稠密通路让信息按需要流转而不是只走一条固定的加法支路。据团队论文口径MUDD 只增加了约 0.23% 的参数和约 0.4% 的算力就能达到普通 Transformer 用 1.8–2.4 倍训练算力时的效果。这个交换比才是重点不是用更多资源换更好效果而是用更聪明的结构换同等效果。变的是什么没变的是什么变的是竞争的主轴。近半年里不只是彩云多个团队都往同一个方向使劲Kimi 的 AttnRes、字节 Seed 的 Hyper-Connections、DeepSeek 的 Engram以及催生 Kimi K2 的 Muon 优化器指向的都是改造 Transformer 内部的信息流转机制而不是继续单纯地堆算力、扩参数。当谁卡多的边际收益开始下降谁让每次计算更值钱就变成了新的比较维度。没变的是竞赛纪录不等于商用能力。NanoGPT Speedrun 是固定硬件、固定数据的极限测试3% 左右的提速不能直接外推到千亿级参数的真实训练里。从进了公共代码库到跑通工业级训练中间还有大量工程适配要做。把榜单成绩直接当成商用模型的能力跃迁是很容易踩的认知坑。对做模型/训练的开发者意味着什么如果你在做模型训练、微调或者只是关注底层技术这件事有几个实际启示。第一动态连接类机制可以抄作业了。代码已经开源并进官方仓库这给了中小团队一个低成本的实验起点。想验证方向先把竞速仓库拉下来跑通gitclone https://github.com/KellerJordan/modded-nanogptcdmodded-nanogpt这个仓库就是 NanoGPT Speedrun 的官方代码库纪录榜和提交记录都在里面可以对照着看别人是怎么把时间一秒一秒抠下来的。第二算力预算有限的团队架构收益是实打实的。对高校课题组、中小 AI 公司和独立研究者来说架构层面个位数的效率提升可能就决定了一个实验做不做得起。同一块 H100结构改对了能跑更多轮实验。第三盯紧单位 token 训练成本这条曲线。如果动态残差、动态注意力这类机制被越来越多的模型默认采用训练成本曲线会进一步下探。这比追单个版本号更值得长期关注。几个要留意的点别把论文红利当工业级成果。竞速项目里的收益到了真实的大规模分布式训练可能被通信开销、稳定性问题吃掉一部分需要重新验证。别迷信小团队逆袭的叙事。真正值得记住的不是爽文情节而是动态信息通路这个方向被公开验证、并且可被继续迭代——这才是它留给行业最实在的东西。复现时注意环境一致性。这类极限成绩高度依赖具体硬件、驱动和精度设置换机器跑出来的数字和榜单不一致是正常的。结尾这场竞速最值得琢磨的地方是它把大模型竞争的另一面摆到了台面上在几十万张 GPU 的军备竞赛之外模型结构本身仍然有可挖的空间。对普通开发者来说把这套开源代码拉下来跑一遍比看十条新闻都实在。你觉得下一步改结构和堆算力哪个对行业影响更大评论区聊聊。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门