拓冰建站拓冰建站
首页 / 资讯中心 / 正文

【清华代码熊】解析|GLM 5.3 后训练技术博客

本期深度解析 GLM 5.3 官方技术博客《GLM-5.3: Frontier Coding with Emergent Cyber Capabilities》 GLM-5.3 在 GLM-5.2 的上基座主要进行了后训练拓展环境拓展、任务多样性拓展、算力拓展在模型架构、基础设施上GLM-5.3 继承了 GLM-5.2 已经搭建好的长程任务环境 stack。RL Scaling 的难点从模型转移到环境GLM-5.3 在环境/任务合成上用 pipeline 端到端合成环境部分任务连 RL 奖励信号也一起合成。slime 框架的进一步优化 MOPD 支持、训推一致性。在模型能力上GLM-5.3仅通过后训练来到了开源顶尖水平并且有参数量优势并且涌现网络安全能力Emergent Cyber Capabilities。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门