兼顾理解与生成:awesome-pretrained-chinese-nlp-models 仓库 NLU-NLG 系列中文预训练模型全景指南
兼顾理解与生成awesome-pretrained-chinese-nlp-models 仓库 NLU-NLG 系列中文预训练模型全景指南【免费下载链接】awesome-pretrained-chinese-nlp-modelsAwesome Pretrained Chinese NLP Models高质量中文预训练模型大模型多模态模型大语言模型集合项目地址: https://gitcode.com/GitHub_Trending/aw/awesome-pretrained-chinese-nlp-models本文聚焦开源仓库 awesome-pretrained-chinese-nlp-models 中「NLU-NLG 系列」9 个核心模型UniLM、SimBERT、RoFormer-sim、周文王、CPM-2、CPT、GLM、PLUG、OPD完整整理每个模型的论文出处、版本规格与各框架下载渠道并结合 README.md 的分类体系与 docs/changelog.md 的演进记录给出选型与获取建议。读完本文你将掌握这类既能理解、又能生成的中文预训练模型谱系能够按任务场景快速锁定合适的模型与资源入口。本文内容主体继承自仓库文档 docs/nlu-nlg-models.md仓库的 README 与更新日志仅作为补充佐证。一、什么是 NLU-NLG 预训练模型在中文预训练模型体系中主流模型通常偏向单一能力以 BERT、RoBERTa、ALBERT、ERNIE 为代表的 NLU 系列 擅长理解分类、抽取、匹配以 GPT、T5、BART、CPM 为代表的 NLG 系列 擅长生成续写、摘要、对话。而 NLU-NLG 系列的目标是把两种能力放进同一个模型——既能做语义理解/检索也能做文本生成。在 README.md 的模型分类索引中该系列被定位为系列代表模型详情NLU-NLG系列UniLM · GLM · CPT · SimBERT查看全部 9 个其技术路线大体有三类统一掩码/预训练目标如 UniLM 通过不同的自注意力掩码机制把双向编码理解与自回归/序列到序列生成统一到一个 Transformer 中GLM 则用自回归空白填充目标同时适配理解与生成。检索 生成融合如 SimBERT、RoFormer-sim把句向量检索与 Seq2Seq生成能力训练进同一个模型实现鱼与熊掌兼得。大规模多任务统一如 CPM-2、PLUG、OPD以十亿到千亿级参数规模在理解与生成两类下游任务上同时发力。下文按 docs/nlu-nlg-models.md 的原始顺序逐一展开。二、UniLM统一语言模型预训练的开山之作论文/资料2019 | Unified Language Model Pre-training for Natural Language Understanding and Generation | Li Dong, et al. | arXiv | PDFUniLM 的核心思想是在同一个 Transformer 上通过不同的自注意力掩码双向掩码、从左到右掩码、序列到序列掩码分别模拟理解型预训练目标与生成型预训练目标从而让单一模型同时胜任 NLU 与 NLG 任务。它也是后续大量理解生成中文模型如 SimBERT的底层结构基础。模型版本TensorFlowPyTorch作者源地址应用领域Unilmbase百度网盘-tblr百度网盘-etwfYunwenTechnologygithub通用提示该行中 TensorFlow 与 PyTorch 列均为百度网盘分享提取码见链接后缀作者为 YunwenTechnology源仓库为 Unilm适用于通用场景。三、SimBERT融合检索和生成的鱼与熊掌论文/资料2020 | 鱼与熊掌兼得融合检索和生成的SimBERT模型 | 苏剑林 | spaces | Blog postSimBERT 由苏剑林科学空间提出目标是把语义向量检索和生成统一到一个模型中模型的句向量端用于相似文本检索/匹配Seq2Seq 端用于文本生成如改写、扩写二者共享同一套参数。它继承了 UniLM 的掩码思想并在中文语料上做融合训练因此兼顾理解和生成。模型版本TensorFlowPyTorch作者源地址应用领域SimBERT Tinytiny百度网盘-1tp7ZhuiyiTechnologygithub通用SimBERT Smallsmall百度网盘-nu67ZhuiyiTechnologygithub通用SimBERT Basebase百度网盘-6xhqZhuiyiTechnologygithub通用该系列共提供 tiny / small / base 三个规格参数规模从轻量到标准逐级递进便于在不同资源约束下选用tiny 适合快速实验与轻量部署场景base 适合作为生产基线。四、RoFormer-simSimBERTv2检索生成的进一步升级论文/资料2021 | SimBERTv2来了融合检索和生成的RoFormer-Sim模型 | 苏剑林 | spaces | Blog postRoFormer-sim 是 SimBERT 的升级版SimBERTv2将底座从 BERT 更换为引入**旋转位置编码Rotary Position Embedding**的 RoFormer 结构并重新设计了句向量与 Seq2Seq 的联合训练在检索相似度和生成质量上都有进一步提升。根据 docs/changelog.md 的更新记录2021.07.19 还发布了roformer-sim-v2利用标注数据增强版本即在无监督训练基础上叠加了人工标注数据增强效果更强。模型版本TensorFlowPyTorch作者源地址应用领域roformer-simbase(L12)百度网盘-2cgzZhuiyiTechnologygithub通用roformer-simsmall(L6)百度网盘-h68qZhuiyiTechnologygithub通用roformer-sim-v2base(L12)百度网盘-w15nZhuiyiTechnologygithub通用版本说明base(L12) 为 12 层标准规模small(L6) 为 6 层轻量规模v2 是在 v1 基础上的标注增强版本。五、周文王Zhouwenwang封神榜系列的 RoFormer 中文模型模型来源IDEA-CCNL 封神榜Fengshenbang-LM开源体系。根据 docs/changelog.md 的更新记录2021.11.27 新增了 IDEA 研究院开源的封神榜系列语言模型包含二郎神、周文王、闻仲、余元等。其中周文王属于 RoFormer 类型定位为中文通用模型主打理解与生成的兼顾能力。模型版本类型TensorFlowPyTorch作者源地址应用领域Zhouwenwangbase(L12)roformer[HF]IDEA-CCNLgithub中文通用Zhouwenwanglarge(L24)roformer[HF]IDEA-CCNLgithub中文通用规模说明base(L12) 对应 12 层约 110M 参数large(L24) 对应 24 层约 1.3B 参数。两档均提供 HuggingFace 权重可直接通过 transformers 生态加载使用面向中文通用理解与生成任务。六、CPM-2大规模高性价比预训练模型悟道系列论文/资料2021 | CPM-2: Large-scale Cost-effective Pre-trained Language Models | Zhengyan Zhang, et al. | arXiv | PDFCPM-2 由智源研究院BAAI-WuDao提出来自悟道WuDao大模型体系主打低成本大规模预训练通过模型结构、训练策略上的成本优化在可控资源下训练出十亿到千亿级的生成式语言模型兼顾理解与生成。根据 docs/changelog.md该模型于 2021.08.16 收录进仓库。模型版本介绍模型下载作者源地址应用领域备注CPM-2110亿参数项目首页模型下载BAAI-WuDaogithub通用需要申请才能下载CPM-2100亿参数项目首页模型下载BAAI-WuDaogithub中英需要申请才能下载CPM-21980亿参数项目首页模型下载BAAI-WuDaogithub中英需要申请才能下载下载注意CPM-2 各规格均需申请后才能下载下载入口与项目首页均指向悟道平台wudaoai.cn应用领域涵盖通用与中英双语场景其中 1980 亿参数版本属于超大规模模型对部署资源要求极高。七、CPT非均衡 Transformer同时服务理解与生成论文/资料2021 | CPT: A Pre-Trained Unbalanced Transformer for Both Chinese Language Understanding and Generation | Yunfan Shao, et al. | arXiv | PDFCPT 由复旦 fastNLP 团队提出。其核心是非均衡 Transformer结构编码器部分负责理解解码器部分负责生成二者共享大部分底层参数从而在保证理解与生成能力的同时节省整体参数量。根据 docs/changelog.md 的介绍CPT 是兼顾理解和生成的中文预训练模型同仓库的中文版 BARTdocs/nlg-models.md也是该团队为中文生成任务如摘要提供的可靠 Baseline可作为对比参考。模型版本TensorFlowPyTorch作者源地址应用领域CPT-basebase(L12)[HF]fastNLPgithub通用CPT-largelarge(L24)[HF]fastNLPgithub通用版本说明CPT-base 为 12 层L12CPT-large 为 24 层L24均提供 HuggingFace 权重可直接通过 transformers 加载。八、GLM自回归空白填充的通用语言模型论文/资料2022 | GLM: General Language Model Pretraining with Autoregressive Blank Infilling | Zhengxiao Du, et al. | arXiv | PDF2022 | GLM-130B: An Open Bilingual Pre-trained Model | Aohan Zeng, et al. | arXiv | PDFGLMGeneral Language Model由清华 THUDM 提出采用自回归空白填充Autoregressive Blank Infilling目标进行预训练把文本中的片段挖空再以自回归方式按任意顺序生成被挖空的内容从而同时适配理解任务与生成任务。根据 docs/changelog.md2022.06.15 收录 GLM 时即指出使用自回归填空目标进行预训练可以针对各种自然语言理解和生成任务进行微调随后 2022.09.11 收录的 GLM-130B 则是开源的双语中英预训练生成模型是当时少有的千亿级开放双语模型。模型版本TensorFlowPyTorch作者源地址应用领域GLMlarge[HF]THUDMgithub通用GLMxxlarge[HF]THUDMgithub通用GLM-130B130B申请地址1 / 申请地址2THUDMgithub通用下载注意GLM large约 3.35 亿参数、xxlarge约 100 亿参数提供 HuggingFace 权重GLM-130B 为 1300 亿参数级模型需通过申请地址获取且对推理显存要求极高。九、PLUG27B 参数的理解与生成一体化模型AliceMind论文/资料2019 | StructBERT: Incorporating Language Structures into Pre-training for Deep Language Understanding | Wei Wang, et al. | arXiv | PDF2020 | PALM: Pre-training an Autoencoding Autoregressive Language Model for Context-conditioned Generation | Bin Bi, et al. | ACL | PDFPLUG 出自阿里巴巴达摩院 AliceMind 体系相关研究脉络是 StructBERT语言结构增强的理解预训练与 PALM自编码自回归联合的上下文条件生成预训练。根据 docs/changelog.md 的收录说明PLUG 集语言理解与生成能力于一身支持文本生成、问答、语义理解等多类下游任务PLUG 开源将助力开发者在语言理解和语言生成上做出更多延拓。模型版本模型下载作者源地址应用领域PLUG27BAliceMind-需要申请Alibabagithub通用下载注意PLUG 为 270 亿参数级模型需通过 AliceMind 平台申请获取其源码位于 AliceMind 仓库的 StructBERT 目录下。十、OPD6.3B 中文开放域对话模型论文/资料2022 | 待定 | , et al. | arXiv | PDFOPD清华 thu-coai定位为中文开放域对话预训练模型。根据 docs/changelog.md 的收录说明OPD 是一个中文开放域对话预训练模型拥有 63 亿参数在 70GB 高质量对话数据上进行训练而成大规模高性能。这也解释了为何仓库 README.md 中还存在独立的 Awesome-OPD 资源列表涉及 On-Policy Distillation 等训练方法。模型版本介绍模型下载作者源地址应用领域备注OPD6.3B项目首页模型下载thu-coaigithub中文开放域对话需要申请才能下载下载注意OPD 需申请后才能下载项目首页与模型下载指向清华 coai 实验室页面适用于中文开放域闲聊、对话生成等场景。十一、模型对比与选型参考综合 docs/nlu-nlg-models.md 全表可以按参数量级、获取方式、应用领域三个维度做横向对比模型发布时间规模档位下载方式应用领域技术路线要点UniLM2019base百度网盘通用统一掩码理解生成一体SimBERT2020tiny / small / base百度网盘通用检索句向量 生成Seq2Seq融合RoFormer-sim2021small(L6) / base(L12)百度网盘通用SimBERTv2旋转位置编码底座v2 为标注增强版周文王 Zhouwenwang2021base(L12) / large(L24)HuggingFace中文通用RoFormer 类型封神榜系列CPM-22021110亿 / 100亿 / 1980亿申请制悟道平台通用 / 中英大规模高性价比预训练CPT2021base(L12) / large(L24)HuggingFace通用非均衡 Transformer共享参数GLM2022large / xxlarge / 130BHuggingFace 申请制通用自回归空白填充GLM-130B 为开源双语千亿模型PLUG2019-2020 研究脉络27B申请制AliceMind通用理解生成一体化阿里达摩院OPD20226.3B申请制中文开放域对话70GB 对话数据训练选型建议句子相似度/检索 改写生成都要优先 SimBERT 或 RoFormer-simv2 效果更佳二者是开箱即用的检索生成融合模型且体量小、易部署。需要标准理解生成双任务微调CPT、UniLM 是经典选择均有 base 规模权重HuggingFace 生态支持好。追求更强生成质量、资源充足GLMxxlarge/130B、CPM-2百亿/千亿、PLUG27B等大参数模型更合适但需注意申请流程与硬件成本。中文开放域对话机器人OPD 是专门面向对话场景的选择。偏好 HuggingFace 直接加载周文王、CPT、GLMlarge/xxlarge均提供 [HF] 权重体验最顺畅。十二、获取资源的注意事项结合 README.md 与上文各表获取 NLU-NLG 系列模型时有几点实操提示下载渠道分三类百度网盘UniLM、SimBERT、RoFormer-simTensorFlow 与 PyTorch 权重往往分属不同链接HuggingFace周文王、CPT、GLM 部分版本标有 [HF]申请制平台CPM-2、GLM-130B、PLUG、OPD需在项目首页/模型下载页提交申请。国内访问 HuggingFace 可使用镜像README 中明确推荐使用 HuggingFace 镜像地址hf-mirror.com加速下载仓库模型。网盘链接时效性百度网盘分享链接可能因分享政策调整而失效若遇失效可顺藤摸瓜访问作者源地址如 ZhuiyiTechnology、YunwenTechnology 的 GitHub 仓库寻找更新入口。大模型部署成本百亿级以上的模型CPM-2、GLM-130B、PLUG对显存、推理框架要求很高建议先评估硬件再申请。关注更新脉络仓库 docs/changelog.md 记录了每个模型的收录时间与说明如 roformer-sim-v2 的标注增强、OPD 的 70GB 对话数据等是判断模型迭代关系的第一手资料。十三、总结NLU-NLG 系列是中文预训练模型中理解与生成兼备的一类特殊存在。通过本文对 docs/nlu-nlg-models.md 中 9 个模型的完整梳理——从 UniLM 的统一掩码、SimBERT/RoFormer-sim 的检索生成融合到 CPT 的非均衡结构、GLM 的自回归空白填充再到 CPM-2/PLUG/OPD 的大规模实践——可以看到一条从轻量融合到千亿级统一的清晰技术演进线。按需选取合适的模型与下载渠道后建议结合仓库中对应的 NLU 系列、NLG 系列 文档横向对比并在 README.md 的分类索引中持续跟踪新收录模型构建属于自己的中文预训练模型选型地图。【免费下载链接】awesome-pretrained-chinese-nlp-modelsAwesome Pretrained Chinese NLP Models高质量中文预训练模型大模型多模态模型大语言模型集合项目地址: https://gitcode.com/GitHub_Trending/aw/awesome-pretrained-chinese-nlp-models创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考