DeepSeek-V3 预训练数据分布:14.8T 训练 tokens 到底用在了哪里?
DeepSeek-V3 预训练数据分布14.8T 训练 tokens 到底用在了哪里【免费下载链接】DeepSeek-V3项目地址: https://gitcode.com/GitHub_Trending/de/DeepSeek-V3本文从官方 README 的基准成绩出发反推 DeepSeek-V3 的预训练数据分布。一句话结论英语与中文是语料主力代码与数学被高密度训练长文本与多语言覆盖面较广低资源语言是明显短板。一、先说方法从基准分数反推数据分布的证据链本文结论基于三级证据链前两级是事实第三级是推断全文严格区分。第一级是官方披露README.md 写明预训练训练 tokens 规模为14.8万亿 tokens、2.664M H800 GPU 小时全程无不可恢复的损失峰值第二级是官方公布的 Base 与 Chat 两版基准成绩第三级是作者根据分数反推的语料配比均标注为推断不能当官方口径引用。另外两个背景该模型是 671B 总参数、每 token 仅激活 37B 的 MoE混合专家即只让一部分专家网络参与计算兼顾能力与成本架构并采用 FP88 位浮点低精度训练省显存也省算力。二、核心发现分数反推出的四个数据特征本节结论先行成绩指向英语为主力、中文占比高、代码数学高密度、长文本多语言广覆盖四个数据特征。1. 英语数据仍是训练语料的主力证据Base 版 MMLU87.1%、BBH 87.5%Pile-test 达 0.548 BPB越低越好逼近同档最强。推断英语在语料中占比大概率超过 50%以学术文献与网页文本为主。对使用者的意义英语知识问答与推理任务可直接使用无需额外补偿。图1DeepSeek-V3 与 GPT-4o、Claude-3.5 等在 MATH-500、AIME 等任务上的成绩对比数学与代码项差距最明显2. 中文数据占比高数学类中文任务优势突出证据C-Eval 90.1%Base/ 86.5%Chat、CMMLU 88.8%、CMath 90.7%Chat 版 C-SimpleQA 64.8% 超过 GPT-4o 的 59.3%。推断中文占比约 20%–30%覆盖新闻、书籍、网络文本等来源。对使用者的意义中文业务场景无需换模型中文数学题能力可直接用于教育类产品。3. 代码与数学语料被高密度训练证据HumanEval 65.2%、MBPP 75.4%、LiveCodeBench-Base 19.4%、MATH 61.6%、GSM8K 89.3%Chat 版 MATH-500 90.2%、AIME 2024 39.2%、Codeforces 51.6 分位。推断代码仓库与数学题库被大规模纳入预训练且官方披露其后训练阶段从 R1 系列蒸馏了推理能力。对使用者的意义代码辅助与数学推理是最强的两个能力点。4. 多语言数据占比不低长文本覆盖超出预期证据大海捞针NIAH测试中 2K–128K 上下文、0%–100% 文档深度的所有组合均保持接近满分10 分MMMLU-non-English 79.4%较 V2 提升 15.4 分。推断预训练包含 128K 长上下文语料多语言数据占比估计在 10%–20%。对使用者的意义可做 128K 长文档解析类任务。图2长文本数据训练效果验证——NIAH 测试在 128K 上下文上全绿三、落到你的场景 数据分布对应的四类使用建议数据分布直接决定哪些场景可以开箱即用下表把四个高频场景与证据分数对应起来。使用场景能力匹配证据分数建议英文技术问答 / 推理MMLU 87.1%、BBH 87.5%直接使用调低 temperature 输出更稳中文内容 / 数学教育C-Eval 86.5%、CMath 90.7%直接使用数学任务开启思维链输出代码补全 / 算法题HumanEval 65.2%、AIME 39.2%配单元测试校验竞赛级题目建议换用 R1 系列128K 长文档分析NIAH 全区间满分关键事实放在上下文首尾多文档交叉验证四、诚实的边界 ⚠️数据分布保证不了什么反推出的强项不等于全能以下三点是明确的缺口。1. 低资源语言MMMLU-non-English 79.4% 与英语 87.1% 存在 7.7 分差距且评测集之外的语言泰语、越南语等完全没有成绩支撑此类业务建议补领域微调。2. 专业深度GPQA-Diamond 59.1% 低于 Claude-3.5 的 65.0%医疗、法律等合规敏感场景权威语料有限建议领域微调加知识库。3. 推断盲区数据清洗流程去重、质量评分官方未逐项公开社区流传的 SimHash 去重等说法无法证实Base 版 RACE-High 仅 51.3%低于 LLaMA3.1 405B 的 56.8%说明高难度英文阅读数据覆盖可能不足。接下来值得关注MTPMulti-Token Prediction每一步同时预测多个 token还能反过来加速推理模块正在进入推理框架inference/configs/config_v3.1.json 显示 V3.1 配置已在社区推进数据配比的变化会最先体现在长文本与推理基准上。落地前建议核对 README.md 的最新成绩权重精度细节可参考 inference/fp8_cast_bf16.py。本地部署需克隆仓库git clone https://gitcode.com/GitHub_Trending/de/DeepSeek-V3【免费下载链接】DeepSeek-V3项目地址: https://gitcode.com/GitHub_Trending/de/DeepSeek-V3创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考