【清华代码熊】总结|Kimi / GLM / DeepSeek后训练OPD算法 2026/8/4 3:27:42 0 次阅读 本期对比总结Kimi K3/ GLM 5/ DeepSeek V4 后训练On-Policy Distillation 算法。 分享: