Switchyard Advisor-Gate路由:让强模型当裁判,弱模型干活省一半钱
Switchyard Advisor-Gate路由让强模型当裁判弱模型干活省一半钱【免费下载链接】SwitchyardSwitchyard lets LLM applications route traffic across models and providers while preserving native OpenAI and Anthropic API compatibility - enabling flexible model selection, benchmarking, and cost/performance optimization.项目地址: https://gitcode.com/GitHub_Trending/switch/SwitchyardSwitchyard 是一个 LLM 流量路由代理它在保留 OpenAI 与 Anthropic 原生 API 兼容性的同时帮你把请求灵活分配到不同模型上。本文重点讲它最特别的 Advisor-Gate 路由模式让便宜的弱模型负责所有实际工作只在关键时刻请强模型当裁判审批一下——既能压住成本又能拦住弱模型没做完就说做完的毛病。解决什么问题弱模型快但容易偷工减料用便宜模型跑 Agent 任务最常见的问题是它会在任务没做完时过早宣布完成或者中途卡住空转。传统做法是把整段流量都切给强模型但强模型贵分类器路由如 LLM Classifier 路由是换模型干活而 Advisor-Gate 的思路完全不同弱模型executor全程干活客户看到的每一句话都来自它强模型advisor只当裁判只在关键节点审查一次从不直接对外输出。这样强模型的费用只花在这几次判卷上而不是花在每一轮对话上。工作原理什么时候请裁判出场流程很简单每一轮请求都路由给弱模型门控gate缓冲它的每一轮输出判断是否需要审查然后才放行给客户端。裁判出场由两类信号触发首次不动手轮默认触发器no_tool_callAgent 第一次没有调用任何工具的回复通常就是我有计划了或我做完了的时刻停滞检查点gate_stall_turns如果对话已经跑了很多轮却始终没有触发审查就强制在下一轮审查一次专治埋头空转不汇报。裁判拿到完整会话记录任务、操作、结果和被审查的那一轮按内置的审查契约回复第一个词必须是 APPROVE 或 REDO契约定义见 crates/libsy/src/prompts/advisor-gate/reviewer-system-prompt.mdAPPROVE这一轮原样放行给客户REDO这一轮直接丢弃客户永远看不到裁判给出的具体整改计划会作为反馈注入让弱模型带着方案继续干客户看到的是修正后的后续输出。每次审查消耗该会话的max_reviews预算弱模型被 REDO 打回后还能再触发新一轮审查所以打回重做本身就是受控的、有预算上限的。快速上手写好一份 advisor-gate 配置Switchyard 的部署是原生 TOML 三层结构llm_clients上游接入→ targets具体模型→ routes客户端可见的路由 ID。开启 Advisor-Gate 只需加一条type advisor的路由完整示例可参考 dev-server/config.toml[targets.executor] id small/model # 干活的弱模型 llm_client provider [targets.advisor] id frontier/model # 当裁判的强模型 llm_client provider [routes.gated] id switchyard/gated # 客户端请求时用的模型 ID type advisor executor_target executor advisor_target advisor max_reviews 3 gate_stall_turns 30 gate_min_tool_results 3客户端把请求的model字段填成switchyard/gated其余一切照旧——OpenAI Chat Completions、Anthropic Messages 端点都能直接用。参数速查三个最关键的旋钮参数默认值作用max_reviews1每个会话最多审查几次设为 3 允许被 REDO 后再审一次gate_stall_turns0关闭连续多少轮未触发后做一次中途检查捕捉空转型弱模型gate_min_tool_results0至少积累多少条工具结果才允许触发跳过开头的闲聊轮项目实测在 Agent 编码任务上表现最好的组合就是max_reviews 3gate_stall_turns 30gate_min_tool_results 3跳过开头废话轮、给磨工留中途检查点、打回后允许复审。完整参数表见 docs/routing_algorithms/advisor_gate_routing.md。另外两个贴心设计长会话的转录会中间截断、保留两头任务开头 最新进展裁判调用失败时默认fail_open true直接放行不会因为强模型掉线就把整个服务搞挂。实测效果弱模型任务完成度提升 11 分官方在 Terminal-Bench 2.1终端任务基准上用编码 Agent 做了对比一个较弱执行模型在开启 Advisor-Gate 后任务通过率从 43.8% 提升到 54.7%±0.7主要靠拦住过早说完成和中途停滞两类失误——而强模型的费用只花在审查上。但要客观如果你的执行模型本身已经是顶级水平它很少犯疏忽型错误Advisor-Gate 的提升就很有限此时更适合先试试 Stage-Router 路由。选型对照表都在 docs/routing_algorithms/overview.md。效果看得见/v1/stats 里的裁判记录门禁的所有行为都可观测审查判定按触发器分类统计、裁判咨询失败按原因统计、被 REDO 丢弃的轮次及其 token 数也单独记账这些轮次客户没看到普通用量统计会漏掉它们。快照逻辑实现于 crates/switchyard-server/src/stats/algorithms/advisor_gate.rs可以直接在 Prometheus 指标或/v1/stats面板上核对裁判到底拦下了多少活。适用场景小结✅适合用执行模型明显弱于你能调到的最强模型需要一份审查留痕而不是简单换模型想控制成本又不想在质量上裸奔。❌不适合用执行模型已是前沿水平审查收益小换 Stage-Router 更划算。算法核心源码在 crates/libsy/src/algorithms/advisor_gate.rs想深入实现可以从这里读起。【免费下载链接】SwitchyardSwitchyard lets LLM applications route traffic across models and providers while preserving native OpenAI and Anthropic API compatibility - enabling flexible model selection, benchmarking, and cost/performance optimization.项目地址: https://gitcode.com/GitHub_Trending/switch/Switchyard创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考