拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Kimi K2 checkpoint 选型与部署:从 Base/Instruct 选择到调优的完整清单

Kimi K2 checkpoint 选型与部署从 Base/Instruct 选择到调优的完整清单【免费下载链接】Kimi-K2Kimi K2 is the large language model series developed by Moonshot AI team项目地址: https://gitcode.com/GitHub_Trending/ki/Kimi-K2Kimi K2 是 Moonshot AI 推出的 MoE 大模型系列官方提供 Base 与 Instruct 两个 checkpointBase 是未做指令后训练的基座版本留给二次开发与微调Instruct 是后训练版本面向对话、Agent 与工具调用的开箱即用推理部署。下面按选哪个、怎么跑、怎么调、换框架注意什么四个问题逐一说清。Kimi K2 选 Base 还是 Instruct按场景对号入座一句话定位Base 给你完整的微调控制权Instruct 主打对话与工具调用、直接上线reflex 级响应不带长思考。权重以 block-fp8 格式提供。场景推荐版本关键配置对话机器人 / AgentInstructTP16 --tool-call-parser kimi_k2代码修复、SWE 类任务Instruct--enable-auto-tool-choice 内置解析器领域微调、自定义训练Base作为基座直接接入自有训练流程高吞吐在线服务InstructDPEP 混合并行 DeepEPInstruct 的成绩单官方 README 评测数据SWE-bench VerifiedAgentic单次 patch65.8SWE-bench MultilingualAgentic单次47.3GPQA-DiamondAvg875.1Kimi K2 最少要几张卡部署vLLM 一条命令跑起来 最小部署单元16 张 H200 或 H20FP8 权重、128K 上下文并行方式二选一Tensor Parallel张量并行TP或 DPEP数据并行专家并行vLLM 版本要求 v0.10.0rc1 及以上# 并行度 ≤16 时可用纯张量并行超过 16 卡需叠加流水线并行 # 下面两个工具调用参数在启用工具使用时必须保留 vllm serve $MODEL_PATH \ --port 8000 \ --served-model-name kimi-k2 \ --trust-remote-code \ --tensor-parallel-size 16 \ --enable-auto-tool-choice \ --tool-call-parser kimi_k2SGLang 同样支持 TP 与 DPEP官方还给了 4P12D4 个 Prefill 节点 12 个 Decode 节点的 Prefill-Decode 分离Disaggregation示例MoE 部分走 DeepEP 加速适合更大规模。Instruct 工具调用怎么开--enable-auto-tool-choice让引擎开启自动工具选择--tool-call-parser kimi_k2使用内置的kimi_k2解析器不用自己写解析逻辑客户端每次请求带上tools列表并设置tool_choiceauto模型自主决定何时调用循环请求直到finish_reason不再是tool_callsKimi K2 怎么调得又快又稳一份调优清单 ⚡并行策略16 卡以内走纯 TP超过 16 卡TP 叠加流水线并行或改走 DPEP 放大 batch 与吞吐DPEP 路线先装好 DeepEP / DeepGEMM再用--enable-expert-parallel开启--gpu-memory-utilization 0.85官方 DPEP 示例的显存利用率取值兼顾性能与稳定性--max-num-batched-tokens 8192与--max-num-seqs 256官方示例的批处理相关参数KTransformers 路线加--optimize_config_path ktransformers/optimize/optimize_rules/DeepSeek-V3-Chat-fp8-linear-ggml-experts-serve-amx.yaml启用 AMX 优化Kimi K2 换框架部署会踩什么坑model_type 的兼容写法Kimi K2 复用DeepSeekV3CausalLM架构config.json里用model_type: kimi_k2标识方便推理引擎识别并套用对应优化如果所用框架不在推荐列表vLLM、SGLang、KTransformers、TensorRT-LLM内可把model_type临时改成deepseek_v3先把模型加载起来// config.json 中的临时兼容写法 { model_type: deepseek_v3 }副作用目标框架若没有内置kimi_k2解析器工具调用功能会失效需要自己按标记格式手动解析模型输出手动解析规则见 工具调用指南Kimi K2 部署文档与工具调用文档在哪获取代码与文档git clone https://gitcode.com/GitHub_Trending/ki/Kimi-K2部署指南vLLM、SGLang、KTransformers、TensorRT-LLM 四个引擎的启动示例工具调用指南工具调用完整流程、流式输出与手动解析技术报告架构细节与完整评测表版本只决定起点硬件与并行策略才决定吞吐先按场景定 Base 或 Instruct再按 GPU 数量选 TP 还是 DPEP最后照官方示例微调显存与批处理参数即可稳定运行。建议首次部署直接照抄 部署指南 里的 16 卡 TP 命令确认工具调用链路通了再谈扩容与调优。【免费下载链接】Kimi-K2Kimi K2 is the large language model series developed by Moonshot AI team项目地址: https://gitcode.com/GitHub_Trending/ki/Kimi-K2创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门