拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Beam Search 与贪心解码、随机采样在文本生成中的权衡是什么?

Beam Search、贪心解码与随机采样的权衡分析一、三种解码策略概览文本生成中模型在每一步输出一个概率分布解码策略决定如何从该分布中选择下一个 token。模型输出概率分布每步 词A: 0.50 词B: 0.30 词C: 0.15 词D: 0.05 贪心 → 选概率最高的 A 采样 → 按概率随机抽A 50%概率被选中B 30%... Beam → 同时保留多条候选路径最终选整体概率最大的二、贪心解码Greedy Decoding原理每一步选择当前概率最高的 token只保留一条路径不回溯。t1: P(A)0.5 ✓ P(B)0.3 P(C)0.15 → 选 A t2: P(X)0.4 ✓ P(Y)0.35 P(Z)0.25 → 选 X t3: P(M)0.6 ✓ P(N)0.4 → 选 M 最终输出: A → X → M特点维度表现质量局部最优非全局最优速度最快O(T)多样性最差同一输入永远输出相同结果实现最简单核心缺陷贪心可能错过全局最优路径 路径1: A(0.5) → X(0.4) → M(0.6) 总概率 0.5 × 0.4 × 0.6 0.120 路径2: B(0.3) → Y(0.9) → N(0.8) 总概率 0.3 × 0.9 × 0.8 0.216 ✓ 更优 贪心选了路径1第一步 A 概率最高但路径2 整体概率更大三、Beam Search原理每一步保留k 条概率最大的候选路径beam width k最终选择累积概率最大的完整序列。示例beam width 2t1: 候选路径 A (0.5) ✓ 保留 B (0.3) ✓ 保留 C (0.15) ✗ 淘汰 t2: 从 A、B 各扩展 A→X (0.5×0.40.20) ✓ 保留 A→Y (0.5×0.350.175) ✗ 淘汰 B→Y (0.3×0.90.27) ✓ 保留 ← 贪心会错过这条 B→Z (0.3×0.250.075) ✗ 淘汰 t3: 从 A→X、B→Y 各扩展 A→X→M (0.20×0.60.120) B→Y→N (0.27×0.80.216) ✓ 最优 最终输出: B → Y → N比贪心的 A→X→M 概率更高特点维度表现质量近似全局最优通常优于贪心速度O(k × T)比贪心慢 k 倍多样性较差beam 间容易趋同实现中等复杂度Beam Search 的已知问题问题1长度惩罚 短序列累积概率天然更高连乘次数少 → 需要 length normalization: score log P / length^α 问题2beam 内趋同 多条 beam 在前几步后容易收敛到相似路径 → 多样性 Beam Search (Diverse Beam Search) 对 beam 分组施加差异惩罚 问题3与训练目标不一致 训练时优化 token 级交叉熵推理时优化序列级概率 → Scheduled Sampling / MRT 等方法尝试缓解四、随机采样Random Sampling原理每一步按概率分布随机抽取token而非取最大值。t1: P(A)0.5, P(B)0.3, P(C)0.15, P(D)0.05 → 按概率随机抽假设抽到 B t2: 新的概率分布 → 随机抽假设抽到 Y ...温度采样Temperature Sampling引入温度参数 τ 控制分布的尖锐程度P(w_i) softmax(logit_i / τ) τ → 0: 分布趋近 one-hot → 退化为贪心 τ 1: 原始分布 τ → ∞: 分布趋近均匀 → 完全随机τ0.5更确定: A0.80 B0.15 C0.04 D0.01 τ1.0原始: A0.50 B0.30 C0.15 D0.05 τ2.0更随机: A0.35 B0.28 C0.22 D0.15Top-K 采样只从概率最高的 K 个 token 中采样截断长尾原始分布: A0.50 B0.30 C0.15 D0.03 E0.01 F0.005 ... Top-K3: A0.53 B0.32 C0.16 重新归一化后 → 只从 A、B、C 中采样排除低概率噪声Top-PNucleus采样从累积概率达到 P 的最小 token 集合中采样原始分布: A0.50 B0.30 C0.15 D0.03 E0.01 ... Top-P0.9: 累积 ABC 0.95 ≥ 0.9 → 从 {A, B, C} 中采样 Top-P0.8: 累积 AB 0.8 ≥ 0.8 → 从 {A, B} 中采样Top-P vs Top-KTop-P 自适应——分布集中时候选少分布分散时候选多。特点维度表现质量不稳定可能很差也可能很有创意速度快O(T)多样性最好同一输入每次输出不同实现简单五、三者权衡对比质量稳定性 多样性 速度 ←─────────────────────────────────────→ 贪心解码 ████████████ 高 ████ 低 ████████████ 快 Beam Search ████████████ 高 ████ 低 ██████ 中 随机采样 ████████ 波动大 ████████████ 高 ████████████ 快综合对比表维度贪心Beam Search随机采样决策方式每步取 argmax保留 k 条最优路径按概率随机抽取全局性局部最优近似全局最优无优化目标确定性完全确定完全确定随机可控输出多样性无低beam 趋同高计算开销O(T)O(k·T)O(T)重复风险高中低典型场景简单任务、实时要求高机器翻译、摘要对话、创意写作、故事生成六、不同任务的策略选择┌─────────────────────────────────────────────────────┐ │ 任务类型 推荐策略 原因 │ ├─────────────────────────────────────────────────────┤ │ 机器翻译 Beam Search (k4~6) 要求准确 │ │ length penalty 性和流畅 │ │ │ │ 文本摘要 Beam Search (k4) 忠实源文 │ │ │ │ 对话系统 Top-P (p0.9) 需要多 │ │ τ0.7~1.0 样性和 │ │ 自然感 │ │ │ │ 创意写作/故事 Top-P (p0.9~0.95) 鼓励创 │ │ τ0.8~1.0 意和发散 │ │ │ │ 代码生成 Beam Search (k1~4) 要求正确 │ │ 或贪心 性和确定性 │ │ │ │ 事实问答 贪心或 Beam (k1~2) 要求准确 │ │ 无需多样 │ └─────────────────────────────────────────────────────┘核心原则准确性优先翻译/摘要/代码/QA → Beam Search牺牲多样性换质量 多样性优先对话/创意写作 → Top-P 采样牺牲部分准确性换自然和创意 速度优先实时系统/边缘设备 → 贪心解码牺牲质量换速度七、实践中的组合策略现代 LLM 推理通常不是单一策略而是组合使用常见组合 1. Beam Search Length Penalty → 解决短序列偏好问题 → score log P(y) / |y|^α 2. Beam Search No Repeat N-gram → 解决 beam 趋同导致的重复 → 硬性禁止重复 N-gram 3. Top-P Temperature → Top-P 截断长尾 Temperature 调节锐度 → 对话系统最常用组合 4. Beam Search Diverse Beam Search → 对 beam 分组组间施加差异惩罚 → 兼顾质量和多样性 5. Contrastive Search较新 → 惩罚与历史表示过于相似的 token → 在保持连贯性的同时避免重复八、总结三种解码策略的本质权衡 贪心解码 极致的效率优先 → 局部最优快但可能差 Beam Search 极致的质量优先 → 近似全局最优质量高但多样性低 随机采样 极致的多样性优先 → 输出丰富但质量不可控 权衡轴 质量 ←──────────────────→ 多样性 Beam Search 贪心 Top-P采样 速度 ←──────────────────→ 质量 贪心/采样 Beam Search(k大)一句话概括贪心解码追求速度但牺牲全局最优Beam Search 追求质量但牺牲多样性和速度随机采样追求多样性但牺牲稳定性——选择取决于任务对准确性、多样性和效率的优先级排序。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门