拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Not All Prefills Are Equal:PPD Disaggregation for Multi-turn LLM Serving并非所有预填充都相同:面向多轮LLM服务的PPD分离架构

《Not All Prefills Are Equal: PPD Disaggregation for Multi-turn LLM Serving》聚焦于大语言模型LLM推理系统中预填充-解码PD分离架构在多轮对话场景下的效率问题并提出了一种新的动态路由解决方案——PPDPrefill-capable Decode分离架构。以下是全文的核心研究内容总结1. 研究背景与问题PD分离架构是当前LLM推理的标准架构将计算密集的“预填充”和内存密集的“解码”分到不同GPU池以避免相互干扰。问题发现在多轮对话如聊天机器人、代理系统中该架构存在两个严重低效每轮都需重新计算全部历史KV缓存即使上一轮响应已在解码节点导致预填充成本极高可占99%。重复的KV传输从预填充节点到解码节点会饱和网络带宽造成高延迟和服务降级。2. 核心洞察并非所有预填充都一样全预填充Full Prefill无缓存从零计算对解码干扰大TPOT减速达48%。追加预填充Append-Prefill仅处理新令牌复用缓存KV对解码干扰极小TPOT减速仅2%。因此解码节点完全可以安全地本地处理后续轮次的追加预填充从而避免重计算和KV传输。3. 现有方案的不足静态路由策略如总是走预填充节点x0或总是本地处理x1无法在所有服务等级目标SLO上同时最优。通过系统性扫描3060种配置17种部署 × 18种工作负载 × 10个QPS级别发现没有单一固定策略能同时优化TTFT、TPOT和吞吐量。4. 提出的解决方案PPDPrefill-capable Decode核心思想动态、按请求决策——将第2轮及以后的追加预填充操作根据当前工作负载、用户SLO权重和节点配置灵活路由到预填充节点或解码节点。实现方式离线阶段构建查找表预先测量在极端情况x0和x1下的TTFT和TPOT并计算决策分数。在线阶段每个请求根据其特征上下文长度、输入输出比、当前QPS快速查表在1ms内返回路由决策。关键优势通过单旋钮权重wtft/wtpot控制TTFT-TPOT权衡可平滑插值从x0到x1的行为。与现有PD部署无缝兼容可恢复传统PD作为特例。5. 实验验证与主要结果数据集合成工作负载 真实对话数据集ShareGPT, WildChat。主要发现TTFT大幅降低第2轮及以后TTFT平均降低约68%高负载下可达73%。稳定性提升PD基线在多配置下成功率95%因KV传输饱和而PPD在所有测试中保持100%成功率。网络鲁棒性在网络变慢如从NVLink到100GbE时PPD优势反而扩大TTFT降低从64%增至70%。权重可调性通过调整权重PPD可平滑地在TTFT优化和TPOT优化之间切换满足不同SLO需求。优于静态最强基线x1PPD在TPOT上胜于x0在TTFT上胜于x1同时保持同样高的成功率。6. 与现有工作的关系与同期工作AMPD互补AMPD侧重实时队列估计PPD提供原则性的离线优化框架两者可组合。与分布式KV缓存层如Mooncake兼容存储层管理缓存位置PPD管理调度决策避免相互干扰。7. 贡献总结揭示多轮对话下PD分离的根本低效性。首次量化全预填充与追加预填充的干扰差距一个数量级。形式化多轮推理服务为优化问题证明无静态策略最优。提出PPD动态路由系统实现TTFT显著降低、稳定性增强并提供灵活的SLO调节能力。文章通过区分“全预填充”和“追加预填充”的不同干扰程度提出了一种动态路由策略PPD使得LLM在多轮对话场景下能大幅降低首令牌延迟、消除网络拥塞并灵活满足不同服务等级目标。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示摘要预填充-解码PD分离已成为现代LLM推理引擎的标准架构它缓解了两种不同工作负载之间的干扰。随着聊天机器人和代理系统中多轮交互需求的增长我们在此场景下重新审视了PD并发现了两个基本低效问题(1) 每一轮都需要为新的提示词和上一轮的响应重新进行预填充(2) 预填充节点和解码节点之间重复的KV传输会饱和带宽导致高延迟甚至服务降级。我们的关键洞察是并非所有预填充操作都具有同等的破坏性追加预填充append-prefill仅处理新的输入令牌同时重用缓存的KV状态其造成的解码减速比全预填充full prefill小一个数量级。这促使我们将追加预填充本地路由到解码节点。然而通过全面分析我们表明没有单一固定的路由策略能够同时满足所有服务等级目标SLO。基于此洞察我们提出了预填充能力解码PPD分离架构这是一个动态路由系统它决定何时使用缓存的KV状态在解码节点上本地处理第2轮及以后的请求。PPD通过可配置的权重适应不同的SLO并能无缝集成到传统的PD部署中。通过广泛的评估我们表明PPD将第2轮及以后的首令牌时间TTFT减少了约68%同时保持了具有竞争力的每输出令牌时间TPOT有效缓解了高负载下的KV传输拥塞。PPD为多轮LLM服务提供了一种灵活高效的范式。1. 引言预填充-解码PD分离已成为LLM推理的标准架构 (Zhong et al., 2024; Patel et al., 2024; DeepSeek-AI et al., 2025; Sun et al., 2024)它将计算密集型的提示词处理预填充和内存受限的令牌生成解码分别放置在专用的GPU池中。尽管这种架构对于独立的单轮查询很有效但在多轮对话聊天机器人和代理系统中的主导使用模式 (Duan et al., 2023)下PD表现出严重的低效性。当一个典型的PD系统处理一个新轮次的查询时它会将提示词连同上一轮的响应字符串一起路由到预填充节点。经典PD设计的一个微妙但重要的特性是KV传输严格遵循 P→D 的方向P节点作为生产者D节点作为消费者没有反向路径。尽管上一轮响应的令牌KV已存在于D节点上但P节点无法访问因此预填充节点必须为整个对话历史之前的响应加上新的提示词重新计算KV缓存然后才能将其传输回D节点。最近对真实聊天工作负载的测量发现这种重计算占了多轮预填充成本的99% (Gao et al., 2024)。我们在多轮对话普遍存在的场景下重新审视了PD并发现标准的PD策略导致即使输入更短第2轮及以后的TTFT仍然很高并且这些重复的KV传输会饱和网络带宽第6节。我们的关键洞察是第一轮和后续轮次的预填充操作行为存在显著差异这启发了一种专门的策略。在图2中我们展示了并非所有预填充操作对解码的干扰都是同等的全预填充没有缓存上下文的新提示词造成的解码减速比追加预填充仅处理新的输入令牌重用缓存的KV大一个数量级。这个数量级的差距表明在解码节点上本地运行追加预填充AP可以高效地处理第2轮及以后的提示词且干扰极小。虽然同期工作 (He et al., 2026) 也持有将增量预填充路由到解码节点的高级直觉但我们的工作独特地将此方法建立在严格的微架构干扰分析基础上并将路由决策形式化为一个优化问题。一方面将AP操作路由到预填充节点可以维持高TPOT另一方面路由到解码节点可以提高整体吞吐量。因此核心问题是我们应该将AP操作路由到预填充节点还是解码节点我们用一个通用框架来形式化这个问题在该框架中PD是一种总是将AP路由到预填充节点的特殊情况。为了理解其中的权衡见第4节我们对每种策略将不同固定百分比的AP路由到解码节点并发现在固定策略下没有一种能满足所有服务等级目标SLO见表2。为此我们引入了预填充能力解码PPD分离架构第5节它提出基于当前工作负载估计、用户指定的SLO和初始节点分配动态地将AP操作路由到解码节点。PPD使用预计算的离线统计数据和一种简单而有效的算法来优化分离式服务目标并且可以在需要时始终恢复到默认的PD配置。在极端情况下PPD可以将所有AP操作路由到解码节点在那里本地缓存的KV状态可以被完全重用无需额外的重计算或KV传输。在合成数据集和真实数据集上我们评估了我们提出的PPD框架的有效性并表明与固定路由或默认PD相比PPD实现了最佳的帕累托前沿见图1。我们还进行了详细的消融研究以证明我们的设计选择的合理性并分析了具有不同需求的复杂服务场景。我们总结主要贡献如下(i) 我们识别了多轮对话中PD的低效性第4.1节在预填充节点上运行AP会导致额外的重计算并通过频繁的KV缓存传输使网络带宽饱和。(ii) 我们发现全预填充和追加预填充在解码干扰上相差一个数量级批量大小为200时TPOT减速分别为48% 对比 2%这启发我们选择性地将AP路由到D节点。(iii) 我们将多轮推理服务形式化为一个优化问题其中传统PD是特殊情况 x≡0并表明没有单一的固定策略能占据主导地位第4.4节。(iv) 我们提出了PPD一个动态路由系统它根据当前工作负载、操作员权重和初始节点分配为每个请求选择 x。(v) 详细的评估第6节表明PPD在合成扫描上优于标准PD和固定策略将第2轮及以后的TTFT降低了48-73%同时保持了具有竞争力的TPOT。2. 背景2.1. LLM推理与扩展LLM推理分两个阶段进行。预填充阶段并行处理输入提示词产生第一个输出令牌并填充KV缓存它是计算密集型的对于 n 个令牌注意力复杂度为 O(n2) (Liu et al., 2025a; Shi et al., 2024)尽管FlashAttention (Dao et al., 2022; Shah et al., 2024) 将内存复杂度从二次降低到线性。解码阶段随后自回归生成令牌为每个令牌加载完整的模型权重它是内存带宽受限的 (Yu et al., 2022; Kwon et al., 2023)。分组查询注意力 (GQA) (Ainslie et al., 2023) 在保持模型质量的同时减少了KV缓存的内存占用。KV缓存来自先前令牌的键值状态随上下文线性增长并与模型权重一起主导GPU内存。扩展LLM服务最直接的方法是复制在多个GPU上部署相同的模型实例每个实例独立处理请求。然而将预填充和解码放在同一GPU上会导致预填充-解码干扰 (Zhong et al., 2024)长时间运行的预填充计算会阻塞解码迭代导致正在进行的生成出现不可预测的延迟峰值。分块预填充技术 (Agrawal et al., 2024) 通过将预填充分割成较小的块与解码交错执行来缓解这一问题DeepSpeed-FastGen (Holmes et al., 2024) 进一步引入了Dynamic SplitFuse以实现高效的令牌组合。然而当预填充工作负载繁重时这些技术无法完全消除干扰我们在第4.1节量化了这一差距。2.2. 预填充-解码分离预填充-解码PD分离通过将预填充和解码物理上分离到不同的GPU池来缓解干扰 (Zhong et al., 2024; Patel et al., 2024)。预填充节点P处理传入的提示词并将生成的KV缓存通过网络传输给解码节点D然后D节点执行自回归生成而不中断。这种架构消除了干扰实现了P和D资源的独立扩展并允许硬件异构性 (Patel et al., 2024)。PD分离已迅速成为行业标准。所有主要服务框架vLLM (Kwon et al., 2023), SGLang (Zheng et al., 2024), TensorRT-LLM, LMDeploy (Contributors, 2023), 和 NVIDIA Dynamo (NVIDIA, 2025)都支持它并由DeepSeek (DeepSeek-AI et al., 2025) 和Gemini (Team et al., 2025) 等提供商在生产规模上部署。然而分离引入了一个基本成本每个请求都需要通过网络传输完整的KV缓存。对于Llama-3.1-8B模型和2K令牌的上下文每次传输约为256 MB。最近的工作探索了替代的分离策略DuetServe (Gao et al., 2025) 通过自适应SM分区在单个GPU内实现了分离级别的隔离Nexus (Shi et al., 2025) 主动在阶段之间重新分配GPU资源TaiChi (Wang et al., 2025) 统一了聚合和分离表明最优策略取决于SLO约束。单向KV传输协议。PD分离的一个定义性架构特性是其KV传输协议的方向性P节点充当KV生产者D节点充当消费者没有从D回到P的反向通道。这种生产者/消费者契约在所有主要生产引擎中都得到保留 (Zhong et al., 2024; Kwon et al., 2023; Zheng et al., 2024)。在多轮服务中的一个直接后果是在D节点上计算的任何KV状态包括所有解码出的响应都无法从P节点访问因此每一轮新请求都必须重新走一遍完整的 P→D 管道第1节。外部KV缓存层 (Qin et al., 2025; Hu et al., 2024a; Gao et al., 2024) 通过在分离拓扑之外添加一个独立的存储层来解决这个问题而不是改变生产者/消费者契约本身。2.3. 多轮服务与KV缓存重用现实世界的LLM部署以多轮对话为主聊天机器人和代理系统通常每个会话涉及多轮交互 (Jeong Ahn, 2026)。在PD分离架构下每个新轮次都被发送到P节点该节点重新计算整个对话的KV缓存包括之前的输出然后将其传输到解码节点进行自回归生成。在后续轮次中历史令牌主导输入长度 (Gao et al., 2024)这使得这种重计算成为多轮工作负载中主要的预填充成本。现有方法。越来越多的研究通过外部KV缓存存储来解决这个问题CachedAttention (Gao et al., 2024) 使用分层缓存Mooncake (Qin et al., 2025) 提供集群范围的分布式KV存储MemServe (Hu et al., 2024a) 统一了上下文缓存与分离LMCache (Liu et al., 2025b) 提供了一个模块化的KV缓存层。SGLang (Zheng et al., 2024) 和vLLM (Kwon et al., 2023) 中的前缀缓存使得重复前缀的KV重用成为可能。补充方法包括选择性重计算 (Yao et al., 2025)、CPU卸载 (Chen et al., 2024; Sun et al., 2025)、KV压缩 (Li et al., 2024; Liu Zhang, 2025)、流式传输 (Liu et al., 2024)、前缀感知注意力 (Ye et al., 2024) 和压缩内存 (Munkhdalai et al., 2024)。这些方法都有一个共同的策略将KV缓存存储在外部或者要求请求返回到同一个实例。我们采取了一种互补的方法调整路由使后续轮次直接在已经持有KV缓存的解码GPU上执行。一项同期工作AMPD (He et al., 2026) 也探索了基于路由的方法来缓解多轮低效但使用的是实时队列状态而不是我们的离线优化框架。我们在第7节讨论了与分布式KV存储和并发路由系统的关系。3. 将追加预填充操作的动态路由形式化为优化问题4. 干扰分析与全面权衡在本节中我们首先建立一个关键的经验结果它支撑了将AP路由到D节点的好处追加预填充造成的干扰比全预填充小一个数量级使得解码节点能够本地处理第2轮及以后的请求。然后我们进行了一项涵盖3,060种配置的全面基准测试以评估全AP到D配置x1的有效性并刻画其权衡。在本节中我们分析的是静态部署其中 x1 的解码节点总是本地处理第2轮及以后的请求第5节将此扩展到PPD即我们的动态每请求路由系统。4.1. 量化预填充干扰PD分离背后的核心假设是所有预填充操作都会严重干扰解码因此需要物理隔离。最近的工作 (Gao et al., 2025; Shi et al., 2025) 已经开始通过探索自适应隔离策略来挑战这一假设。我们通过区分两种类型的预填充来进一步推进这一方向。全预填充 vs. 追加预填充。全预填充处理没有任何缓存上下文的新提示词这是标准的第1轮场景对于 nn 个输入令牌注意力复杂度为 O(n2)。追加预填充在重用先前轮次缓存的KV的同时仅处理新的令牌。对于第2轮及以后假设有 mm 个新令牌追加到 n 个缓存令牌的上下文中追加预填充仅计算这 m 个新令牌的注意力每个令牌需要关注 nm 个键复杂度为 O(m(nm))。当 m≪n后续轮次的典型情况时追加预填充比处理相同总序列长度的全预填充大约便宜 n/m 倍。图2. 预填充-解码干扰。将一个全预填充操作与一个追加预填充操作均处理1,024个令牌共同放置时的解码TPOT退化。全预填充导致显著减速追加预填充则接近基线。关于4个并发预填充实验的结果见图7显示趋势一致。干扰测量。我们在单张H100 GPU上使用Llama3.1-8B模型进行受控微基准测试以隔离干扰效应遵循既定的天花板分析方法论 (Yuan et al., 2024)。我们测量了与全预填充或追加预填充共同放置时解码TPOT的退化图2。在批量大小为200时全预填充导致约48%的减速追加预填充仅导致约2%的减速相差一个数量级。在4个并发预填充的情况下见图7全预填充的干扰达到57%而追加预填充为21%因此在高并发下差距依然存在。这种差距在不同上下文长度下都持续存在在32K令牌时全预填充干扰增长到3-4倍而即使在64K令牌时追加预填充干扰仍低于25%附录图8。这些结果证实了解码节点可以安全地本地处理第2轮及以后的请求。4.2. 配置空间与方法论在本小节中我们描述了系统地评估不同P/D分配和路由参数如何影响多轮服务性能的配置空间和方法论。实验设置。所有实验均在内部集群节点上运行配备4块通过NVLink连接的NVIDIA H100 80GB HBM3 GPU。我们通过第6.4节的带宽模拟来评估较慢的节点间互连的影响。我们使用Llama-3.1-8B作为主要模型并在Qwen2.5-14B和Qwen3-30B-A3B上进行验证实验。每种配置在10个QPS每秒查询数水平0.5, 1, 2, 4, 6, 8, 10, 12, 16, 20下进行评估产生 17×18×103,060 个数据点。对于每个测试点我们运行固定的10秒时长对话按照目标QPS的泊松过程到达例如QPS4 产生约40个两轮对话。我们测量第1轮TTFT、第2轮TTFT、平均TPOT、吞吐量令牌/秒和成功率。4.3. 全AP到D的优势消除KV传输开销现在我们量化 x1 配置全AP到D相较于传统PD分离架构x0的优势。核心发现是从 x0 切换到 x1 通过消除后续轮次的KV传输将第2轮TTFT降低了48-73%。表1比较了匹配的配置x1 在第2轮TTFT上始终优于 x0其中1P_3D实现了高达73.3%的改进即使是3P_1D也显示了24.9-44.3%的提升。表1. 从 x0 切换到 x1 时第2轮TTFT的改进。负值表示改进。x1 的优势在P资源稀缺的配置1P, 2P中随负载增加而增加但在P资源充足时3P减弱。一个显著的规律是x1 的优势随负载增加而增加因为随着QPS上升传输排队加剧D节点本地缓存访问的价值越来越大。表格还揭示当P资源稀缺时x1 的优势最大化1P配置显示高达73.3%的改进而3P配置显示递减的回报。换句话说可用的预填充节点越少本地处理对D节点的好处就越大因为P节点成为瓶颈而 x1 完全绕过了它。当P节点稀缺时它们成为瓶颈。在 x0 模式下第2轮及以后的请求必须经过这个瓶颈P→D而 x1 完全绕过了P节点。这使得 x1 配置更具弹性在高QPS下它们的失败率更低见附录表5因为只有第1轮请求竞争P节点容量。当P节点充足时预填充容量不再是瓶颈本地AP开销变得相对更重要。验证轮次与模型扩展。x1 的优势不仅限于2轮对话和主要的8B模型。扩展实验见附录图10显示在2-16轮和三种模型大小8B, 14B, 30B上第2轮及以后的TTFT稳定提升约70%证实了这种优势源于架构特性而非模型特定特征。4.4. 没有普适的最佳方案依赖目标的优化前一节确立了 x1 在第2轮TTFT方面的明显优势。然而生产环境中的LLM服务必须平衡多个目标延迟TTFT、生成流畅度TPOT和系统效率吞吐量。当我们将分析扩展到这些维度时一个更微妙的图景出现了。核心发现。92.2% 的工作负载-QPS组合在优化第2轮TTFT与平均TPOT时具有不同的最优配置。这种基本矛盾意味着没有单一配置能在所有目标上占据主导地位。最优选择取决于正在优化的指标。表2通过显示每种配置类别在三个目标上的获胜百分比来量化这种权衡。三个规律凸显出来表2. 三个优化目标最小化第2轮TTFT、最小化TPOT、最大化吞吐量下的胜者分布。每个单元格显示该配置类别在该目标上取得最佳结果的工作负载QPS组合的百分比。列之和不为100%因为混合配置很少获胜被排除。全AP到Dx1配置展示了最均衡的竞争力在所有目标上实现了最高的平均胜率。5. PPD动态AP路由系统第4.4节的权衡分析揭示没有单一的静态 x 能在所有目标上占据主导。因此我们设计了PPD一个动态路由系统它根据工作负载特征和操作员权重为每个请求选择 x遵循工作负载感知调度原则 (Fu et al., 2024; Jain et al., 2025)。PPD分两个阶段运行算法1。离线阶段它通过直接在两个极端 x0 和 x1 下测量每个格子中工作负载的TTFT和TPOT在一个粗粒度的工作负载网格上构建查找表然后存储分数符号的决策结果。在线阶段每个第2轮及以后的请求沿三个轴累积上下文长度、输入/输出比率、系统QPS映射到最近的格子并在 1 毫秒内返回预计算的决策第1轮总是返回 x0因为尚无缓存的上下文。离散化阈值和请求特征模式见第B.1节。将配置规模确定与第2轮及以后的SLO调整解耦。PPD将多轮服务控制问题分解为两个独立的旋钮。在传统PD中P:D比例同时决定了第1轮预填充容量和第2轮及以后的延迟权衡迫使操作员在一个耦合的多目标参数上取得平衡。PPD将其解耦P:D比例管理第1轮吞吐量而操作员权重 ww 选择帕累托前沿上的第2轮及以后的操作点。经验上PPD在我们评估的所有三种P:D比例下都保持稳定图4而静态 x0 基线在P稀缺时会崩溃。我们的原型构建在vLLM的分离式服务基础设施之上重用了其KV传输协议和前缀缓存。实现细节包括会话管理和路由协议见第B节。6. 真实世界验证合成工作负载为系统地探索配置空间和隔离个别因素提供了良好控制的条件。为了验证这些发现能推广到真实流量中存在的异构分布我们进一步在真实世界的多轮对话数据集上评估PPD。6.1. 数据集与设置我们使用了两个公开的多轮对话数据集ShareGPT (Chiang et al., 2023)包含用户分享的ChatGPT对话主题和交互风格多样以及WildChat (Zhao et al., 2024)包含野外的用户对话具有不同的预填充-解码比率。我们从两个数据集中筛选多轮对话并在QPS水平1到20下评估三种代表性的PD配置1P_3D, 2P_2D, 3P_1D启用和不启用动态PPD时的性能。动态PPD模式使用均衡权重wtffwpot1.0。我们测量第2轮及以后的TTFT、平均查询延迟、吞吐量和成功率定义为 ≥95%≥95% 的请求在无超时情况下完成。6.2. PPD提升稳定性与降低延迟我们的真实世界实验图4揭示了两个关键发现1在两个数据集上PPD实现的平均查询延迟始终低于基线x02PPD解决了导致 x0 模式在多轮工作负载下性能下降的KV传输瓶颈问题。包含 x1 静态基线的完整三方比较见第C.5节。发现1更低的延迟。如图4所示在两个模式都成功的所有配置和QPS水平下PPD曲线实线始终位于基线曲线虚线下方。对于ShareGPT上稳定的1P_3D配置PPD在QPS范围内将平均查询延迟降低了15-25%。这种改进源于PPD消除了第2轮及以后请求的冗余KV传输后续请求不再每轮都经过 P→D 网络路径而是使用缓存的前缀在解码节点上本地执行。发现2解决服务不稳定性。除了延迟改进PPD将先前不可用的配置转变为稳定部署。基线0x0配置表现出服务降级定义为成功率 95%主要由KV传输饱和下的请求排队和超时引起而非内存耗尽或硬件故障在两个数据集的大多数QPS水平下2P_2D和3P_1D的 x0 基线均出现降级只有1P_3D保持稳定因为其拥有足够的D节点容量来吸收KV负载。相比之下启用PPD的配置在所有QPS水平和两个数据集上都实现了100%的成功率。图4中的 × 标记直观地展示了这种差距基线曲线是碎片化的带有许多失败点而PPD曲线则是完整且连续的。基线降级的根本原因。根本原因是KV传输饱和在 x0 模式传统PD下解码节点每轮都接收KV传输而PPD动态地将第2轮及以后的请求路由到具有更高 x 值的路径在观察到的平均每会话3.1轮的情况下KV传输负载减少了约75%。在平均每会话3.1轮的情况下这造成了约3倍的网络负载差异解释了为什么PD配置会降级而PPD保持稳定。6.3. 与最强静态基线 (x1) 的比较6.4. 跨网络速度的鲁棒性我们的实验使用节点内的NVLink但生产中的多节点部署依赖于InfiniBand或融合以太网RoCE上的RDMA通常慢2-8倍 (Patel et al., 2024; Qin et al., 2025)。由于PPD绕过第2轮及以后请求的P→D通道其优势应随着网络变慢而增长。为了在没有多节点硬件的情况下验证这一点我们遵循TetriInfer (Hu et al., 2024b) 的带宽仿真方法在每个PD路由的请求上注入一个校准的额外延迟而PPD的本地路径保持不变。确切的延迟模型和每令牌KV占用空间见第B.6节。图5扫描了从NVLink到100GbE的四种互连。随着有效带宽下降一个数量级PD基线的第2轮 TTFT上升了约19%而PPD保持在大约51毫秒相对TTFT缩减从64%扩大到70%TPOT和端到端延迟跟踪相同的趋势。因此基于NVLink的评估是PPD在真实多节点部署中优势的保守下限。6.5. 案例研究基于权重的TTFT-TPOT权衡7. 讨论与同期工作的关系及局限性。同期进行的AMPD (He et al., 2026) 也识别了PD分离中的多轮低效问题并提出了通过实时队列状态估计结合离线硬件规划来协调预填充工作负载。我们的工作在范围上是互补的PPD贡献了 (i) 一个微架构层面的解释说明为什么本地追加预填充是可行的即数量级的干扰差距第4.1节(ii) 一个清晰的优化公式其中传统PD是特殊情况 x≡0以及 (iii) 一个单旋钮的TTFT-TPOT控制曲面公式(1)操作员可以离线调整。PPD的主要局限性在于其查找表是离线构建的当硬件或工作负载分布严重偏离校准集时它会优雅地但次优地退化AMPD的在线队列状态估计是弥合这一差距的自然机制我们将PPD的原则性基础与AMPD的自适应循环视为可组合而非竞争的关系。其他自然扩展包括与更高级别的SLO控制器集成该控制器根据观察到的P99指标驱动 w、在异构GPU集群 (Tong et al., 2025) 或长上下文弹性并行 (Wu et al., 2024) 上的部署以及与分布式KV缓存层的联合使用见下文。与分布式KV缓存的关系。分布式KV缓存层例如Mooncake (Qin et al., 2025)MemServe (Hu et al., 2024a)在不同于PPD的层面运作它们决定前缀状态在整个集群中的存储位置而PPD决定如何调度命中缓存和未命中缓存的请求以避免相互干扰。两者是完全兼容的。分布式存储最大化前缀重用而PPD确保缓存命中的请求不会被缓存未命中的请求延迟我们预计联合部署将在大规模服务中放大两者的效果。8. 结论多轮对话暴露了单轮工作负载未曾揭示的PD分离的根本局限性。全预填充和追加预填充之间数量级的干扰差距开辟了一个新的设计维度解码节点可以安全地本地处理第2轮及以后的请求。然而我们对3,060种配置的系统性探索证实静态路由无法普遍优化TTFT、TPOT和吞吐量。PPD通过一个离线调优的单旋钮控制曲面公式(1)实现了一种工作负载感知的替代方案在真实世界工作负载上平均将第2轮及以后的TTFT降低了约68%同时保持了具有竞争力的TPOT且每请求开销小于1毫秒。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门