拓冰建站拓冰建站
首页 / 资讯中心 / 正文

大模型推理核心原理:KV Cache、Prefill、Decode、TTFT、vLLM、算子

在大模型落地部署、推理优化中KV Cache、Prefill/Decode、TTFT/TPOT、GPU算子、vLLM 是一套高度关联的核心体系。本文将系统性地讲解大模型自回归推理的核心原理、推理阶段特性、性能瓶颈与工程优化方案梳理完整的底层落地逻辑。一、大模型推理的核心痛点重复计算当前主流大模型LLaMA、Qwen、GPT 系列均为解码器自回归模型生成文本的规则是逐 Token 生成生成一个 Token 后将完整历史序列作为输入预测下一个 Token。如果不做任何优化每生成一个新 Token模型都会对所有历史 Token 重新做一次注意力计算。注意力机制的时间复杂度为O(n²)上下文越长计算量爆炸式增长推理速度极慢完全无法落地商用。基于这个痛点业界诞生了大模型推理最核心的优化技术KV Cache。二、KV Cache大模型推理的核心加速基石2.1 什么是 KV CacheKV Cache 是存储在 GPU 显存中的Key、Value 向量缓存数据而非代码或算法。模型注意力计算的核心公式为$$\text{Attention}(Q,K,V)\text{softmax}(\frac{QK^\top}{\sqrt{d_k}})V$$。在自回归推理中历史 Token 的 K、V 向量一旦计算完成永远不会改变只有当前最新 Token 的 Q 向量是全新的。因此我们可以将所有历史 Token 的 K、V 向量提前计算并缓存到显存中后续生成新 Token 时无需重复计算历史序列直接读取缓存数据即可。2.2 KV Cache 的核心价值与代价核心价值将解码阶段注意力复杂度从 O(n²) 降至 O(n)彻底解决长序列重复计算问题大幅提升推理速度。核心代价占用大量 GPU 显存。对话序列越长、并发请求越多KV Cache 显存占用越高甚至会超过模型权重本身的显存占用是限制推理并发和上下文长度的核心瓶颈。2.3 主流 KV Cache 优化方案GQA/MQA减少 KV 头数量直接压缩缓存体积是主流模型标配方案KV 量化将 FP16 精度转为 INT8/INT4以微小精度损失换取大幅显存节省缓存淘汰策略丢弃低权重不重要 Token 的 KV 向量适配超长上下文场景PagedAttention分页式内存管理解决 KV Cache 内存碎片问题vLLM 核心技术。三、推理两大核心阶段Prefill 与 Decode大模型每一次对话推理都会严格分为Prefill预填充和Decode解码生成两个阶段两个阶段的计算特征、瓶颈、作用完全不同且直接决定推理性能指标。3.1 Prefill 预填充阶段Prefill 是推理的第一阶段负责一次性处理用户输入的完整 Prompt对所有 Prompt Token 进行并行计算。该阶段的核心任务计算所有输入 Token 的 Q、K、V 向量初始化构建完整的 KV Cache并输出对话的第一个 Token。核心特征算力密集型Compute-Bound矩阵运算量大GPU 算力打满时间复杂度 O(n²)。Prompt 越长、文档越大RAG 场景Prefill 耗时越高。对应性能指标TTFT首 Token 延迟。3.2 Decode 解码阶段Prefill 完成后进入循环 Decode 阶段这是模型逐字生成回答的阶段。该阶段的核心逻辑每次仅计算当前最新 1 个 Token的 Q、K、V复用 Prefill 构建的历史 KV Cache完成注意力计算并将新的 K、V 追加缓存循环迭代直到生成结束符。核心特征带宽密集型Bandwidth-Bound单次计算量极小瓶颈在于反复读写显存中的 KV CacheGPU 算力利用率偏低。对应性能指标TPOT单 Token 生成耗时。四、推理核心性能指标TTFT 与 TPOT4.1 TTFTTime To First Token首 Token 延迟定义从用户提交请求到模型返回第一个输出 Token的总耗时。TTFT 几乎完全由Prefill 阶段耗时决定同时受网络延迟、请求排队、GPU 算力影响。业务意义直接决定用户聊天体感TTFT 过高会让用户误以为服务卡顿。RAG 场景下超长检索文档会显著拉高 TTFT。优化思路Prompt 缓存、限制并发 Prefill 数量、Prefill/Decode 分离部署、高性能算子加速。4.2 TPOTTime Per Output Token单 Token 耗时定义首个 Token 生成后后续每生成一个 Token 的平均耗时对应 Decode 阶段。TPOT 瓶颈是显存带宽和 KV Cache 读写效率决定了模型后续的打字速度。两者的区别可以概括为TTFT 决定模型响应的等待时长TPOT 决定模型持续生成文本的速度。五、底层执行单元GPU 算子Prefill 计算、KV Cache 读写、Decode 解码等所有模型运算逻辑最终都依靠 GPU 算子Kernel执行。算子是 GPU 硬件层面最小的可执行计算单元是模型推理的底层执行载体。常见核心算子分类基础计算算子矩阵乘法、归一化、RoPE 位置编码、激活函数注意力优化算子FlashAttention、PagedAttention缓存专用算子reshape_and_cache负责将 K、V 向量写入显存、更新 KV Cache。算子的性能直接决定推理速度原生 PyTorch 算子效率极低商用推理均采用高度优化的定制 GPU 算子。六、工程落地框架vLLMvLLM 是当前业界主流的大模型高吞吐推理引擎它没有发明 KV Cache 原理而是解决了传统 KV Cache 的致命缺陷显存碎片多、并发能力弱、内存利用率低。vLLM 核心创新是PagedAttention 分页注意力机制借鉴操作系统虚拟内存思想将整块 KV Cache 显存切分为固定大小的物理 Block 块通过 Block-Table 映射逻辑地址与物理地址支持 KV Cache 零散存储实现 Block 块的复用、分配、回收彻底消除内存碎片上层调度 Prefill/Decode 请求底层调用高性能算子完成计算与缓存读写。三者的层级关系清晰明确KV Cache是推理过程中产生的显存数据算子是负责计算和读写的底层工具vLLM 是统筹调度资源、优化整体推理效率的工程平台。七、完整推理链路串联用户发送对话请求 → vLLM 调度器接收请求并排队 → 进入Prefill 阶段→ 调用 FlashAttention 算子并行计算全部 Prompt Token 的 Q/K/V → 通过缓存算子写入显存、初始化 KV Cache → 输出第一个 Token完成 TTFT 计时 → 进入Decode 循环阶段→ PagedAttention 算子读取历史 KV Cache → 计算新 Token 并追加更新缓存 → 持续生成文本TPOT 计时→ 直到生成结束。八、核心点总结面试/工作可用1.KV Cache是显存中存储的 K、V 向量缓存通过复用历史计算结果将解码复杂度从 O(n²) 降至 O(n)是自回归推理的核心加速技术痛点是显存占用高、易产生内存碎片。2.Prefill处理完整用户 Prompt并行计算构建 KV Cache算力密集决定首 Token 延迟 TTFTDecode逐 Token 生成复用缓存带宽密集决定单 Token 生成速度 TPOT。3.算子是 GPU 底层计算内核所有模型计算、KV 缓存读写都依赖优化后的 GPU 算子实现。4.vLLM基于 PagedAttention 分页内存管理解决传统 KV Cache 内存碎片问题通过高效请求调度和高性能算子调用大幅提升推理并发和吞吐。九、核心概念关系对照表概念本质核心作用对应阶段/瓶颈KV Cache显存张量数据缓存历史 K/V避免重复计算全程复用显存瓶颈Prefill推理计算阶段初始化 KV Cache生成首 Token算力密集、TTFTDecode推理计算阶段逐字生成文本迭代更新缓存带宽密集、TPOT算子GPU 计算内核执行所有张量运算、缓存读写底层执行载体vLLM推理服务框架调度请求、管理显存、优化吞吐工程落地层
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门