拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Claude Code Router(CCR)Fusion 组合模型完全指南:为稳定文本模型叠加视觉、联网搜索与媒体工具能力

Claude Code RouterCCRFusion 组合模型完全指南为稳定文本模型叠加视觉、联网搜索与媒体工具能力【免费下载链接】claude-code-routerOne local control plane for every AI agent: route across models, fuse new capabilities, orchestrate tools, and stay fully in control.项目地址: https://gitcode.com/GitHub_Trending/cl/claude-code-routerFusion 是 Claude Code RouterCCR中的虚拟模型组合机制把你已经在稳定使用的基础模型与独立的能力模型或工具组合成一个新的可选模型让原本只会说话的文本模型升级为会看图、能搜索、可生成图片视频、能调用内部 MCP 工具的增强型 Agent 模型。读完本文你将掌握 Fusion 的工作原理、五大内置能力的具体配置步骤、组合命名规范以及它在 CCR 源码中的实现脉络能够直接在自己的路由与 Agent Profile 中落地一个可复用的 Fusion 模型。Fusion 的工作方式保留手感补齐能力Fusion 的核心价值在于保留基础模型的手感同时补齐它缺少的能力。从架构上看它是一条清晰的职责链基础模型继续负责推理、写作、代码生成与最终输出——这部分行为与你熟悉的模型完全一致当请求中确实需要某种缺失能力看图、联网、生成媒体、调用内部工具时CCR 调用对应的能力模型或工具CCR 把能力层返回的结果整理进上下文最后把整理好的上下文交还给基础模型由它产出最终回答。关键设计是能力层是按需接入的。基础模型并不真正变成多模态模型或搜索模型而是通过工具调用间接获得这些能力因此组合后的模型在推理、写作、编码上的行为不会因为换用视觉模型而漂移。保存后的 Fusion 模型会像普通模型一样出现在路由和 Agent Profile 中可以被路由选择器直接命中也可以配置为 Agent 模型的执行目标。它是一个可复用的新模型资产典型用法包括把强文本模型升级成视觉模型GLM-5.2 GLM-5V-Turbo GLM-5.2V把稳定代码模型升级成可联网检索最新资料的模型把通用模型升级为可产出媒体素材图片、视频的 Agent 模型把 Agent 模型接入团队内部系统自定义 MCP 工具。五大能力矩阵Fusion 在 英文主文档 中定义了五类可叠加的能力能力入口效果内置图像能力ccr-fusion-builtins / vision_understand让不支持多模态的模型拥有视觉理解图片、截图、图表、OCR内置联网搜索ccr-fusion-builtins / web_search让模型获得实时检索能力把最新信息带入上下文生图工具FusionTools中的内置媒体工具让 Fusion 模型生成图片或基于 1–3 张本地图片进行编辑生视频工具FusionTools中的内置媒体工具让 Fusion 模型提交文生视频、图生视频、参考图生视频任务自定义 MCP 工具FusionTools中的Add custom MCP把本地脚本、内部系统或远程服务包装成模型可调用的工具其中生图与生视频属于媒体工具类别与内置搜索工具的使用方式一致不属于 ToolHub也没有单独的 Fusion 配置板块内置图像与联网搜索则直接对应 CCR 内置 Fusion 工具运行时 中FusionBuiltinToolKind vision | web_search两个分支。内置图像能力让文本模型拥有视觉能力组合内置图像能力会把视觉模型作为能力层接到基础模型前面不需要替换你原本熟悉的文本模型。视觉模型负责理解图片、截图、图表或 OCR 内容CCR 将视觉结果整理给基础模型基础模型继续负责推理、写作、代码生成和最终输出。典型组合形式GLM-5.2 GLM-5V-Turbo GLM-5.2V这一方式也适用于 Codex 的 computer use 场景将 GLM-5.2 与 GLM-5V-Turbo 组合后GLM-5.2 可以接收由视觉模型整理后的屏幕、截图和界面信息从而使用 Codex 的 computer use 能力完成观察、判断和后续操作规划。配置步骤新建或编辑 Fusion 模型选择能力ccr-fusion-builtins / vision_understand为Vision model选择真正支持图像理解的模型可选配置视觉模型自己的重试次数和备用视觉模型保存后即可作为路由目标或 Agent 模型使用。备用机制只作用于内置图像工具的调用如果 Vision model 在整理图片上下文时失败CCR 会先重试这个 Vision model再尝试配置的备用模型基础文本模型保持不变。模型分工与排查要点Vision model 决定图片、截图、图表和 OCR 内容的理解质量基础模型决定最终回答的风格、推理能力和代码能力。图像请求失败时重点检查 Vision model 是否支持视觉输入、视觉模型的重试次数与备用模型配置以及请求日志中的 Fusion 工具调用报错。从源码看CCR 为每个启用的 Profile 生成一个独立的fusion-vision-profileMCP serverstdio 子进程通过VISION_MODEL、VISION_FALLBACK_MODELS_JSON、VISION_RETRY_COUNT等环境变量把配置注入运行时见 packages/core/src/mcp/fusion-config.ts。retryCount在读取时会被限制在0 ~ ROUTER_FALLBACK_MAX_RETRY_COUNT之间。当请求携带[media_ref:...]图像引用时CCR 会注入提示词要求模型先调用视觉工具再回答对应withFusionVisionToolInstructions的实现packages/core/src/mcp/fusion-config.ts。内置联网搜索让模型拥有实时检索能力选择能力ccr-fusion-builtins / web_search然后配置搜索服务。支持In-app Browser、Brave、Bing、Google CSE、Serper、SerpAPI、Tavily、Exa 等搜索服务对应的 provider 枚举可在 packages/core/src/mcp/fusion-config.ts 中确认。In-app Browser 搜索In-app Browser通过 CCR Desktop 的隐藏内置浏览器窗口执行搜索打开搜索结果页面并提取可见内容再把证据提供给 Fusion 模型。它不需要外部搜索 API Key适合想用桌面端内置浏览器完成联网检索的场景。可配置项包括搜索引擎Bing、Google、DuckDuckGo语言例如en、zh-CN地区例如US、CN安全搜索级别默认、中等、严格或关闭。注意In-app Browser依赖 CCR Desktop 的 Electron 内置浏览器能力只在桌面端可用。CLI、服务器部署或纯 Web 环境没有内置浏览器集成请改用 Brave、Bing、Google CSE、Serper、SerpAPI、Tavily 或 Exa 等搜索服务。若在非桌面环境配置了 browser providerCCR 会注册一个 fallback 工具并在调用时返回明确的不可用说明见 packages/core/src/mcp/fusion-config.ts。搜索失败排查搜索失败时相关信息包括搜索服务 Key 是否有效以及请求日志里的 Fusion 工具报错。web_search 运行时支持count、language、country、safeSearch、freshness、includeDomains/excludeDomains等输入参数见 packages/core/src/mcp/fusion-vision-mcp.ts可按需在调用中指定。生图工具让文本模型直接产出图片资产与内置图像能力的区别能力用途内置图像能力理解用户提供的图片、截图、图表和 OCR 内容生图工具生成新图片或编辑 1–3 张本地输入图片两者是互补关系一个负责看一个负责画。配置步骤在Providers页面配置支持图片生成协议的供应商及模型或导入已登录的 Grok Agent新建或编辑 Fusion 模型在Tools下添加Image generation生图工具选择图片模型例如Provider/model保存 Fusion 模型并作为 Agent 模型或路由目标使用。导入 Grok Agent 后CCR 会自动提供grok-imagine-image-qualityai-gateway 复用已有的 OAuth 登录态访问api.x.ai不会启动 Grok CLI也不会再次要求输入 xAI API Key。生图工具有独立的重试次数和备用图片模型如果选中的图片模型因可重试的媒体供应商错误而失败CCR 先重试该模型再依次尝试配置的备用图片模型基础文本模型保持不变。请求协议与幂等CCR 通过 ai-gateway 的通用媒体协议调用供应商请求用途images/generations根据文本生成图片images/edits编辑本地图片输入工具调用接受可选的idempotency_key一次用户意图应复用稳定的 Key避免网络重试期间产生重复计费。底层实现由GatewayMediaExecutor完成见 packages/core/src/media/executors.ts图片编辑支持单图image与多图images两种载荷形态。本地图片输入安全图片编辑会校验真实路径、文件签名文件头和文件大小。CCR 默认允许范围明确的当前工作目录、系统临时目录和 CCR 配置目录文件系统根目录、用户主目录及其上级目录不会被隐式信任。确实需要扩大读取范围时请显式配置allowedInputRoots。产物生成的图片保存在 CCR 私有数据目录结果包含本地文件路径MIME 类型文件大小SHA-256限时访问 URL使用独立 token不复用 CCR API Key生视频工具异步视频任务生视频工具把文本模型升级为可提交视频生成任务的 Agent 模型支持文生视频、图生视频、参考图生视频三种任务。视频生成始终异步执行启动调用立即返回 Job ID工具随后轮询任务状态直到任务完成、失败或被取消。配置步骤在Providers页面配置支持视频生成协议的供应商及模型或导入已登录的 Grok Agent新建或编辑 Fusion 模型在Tools下添加Video generation选择视频模型例如Provider/model保存 Fusion 模型并作为 Agent 模型或路由目标使用。导入 Grok Agent 后自动提供grok-imagine-video。生视频同样拥有独立的重试次数与备用视频模型且与图片模型的配置彼此独立——不同 Fusion 模型也可以选择不同的媒体模型。请求协议与运行时行为请求用途videos/generations启动文生视频 / 图生视频 / 参考图生视频任务videos/{id}查询视频任务状态与结果运行时行为包括启动任务并返回 Job ID、轮询任务状态并向模型汇报进度、任务完成后返回视频产物元数据、用户取消请求时尝试取消或停止等待。请求超时与客户端取消仍然生效并发数、保留期和任务超时是 CCR 内部安全策略通常不需要在 Fusion UI 中配置。视频 URL 支持HTTP Range播放器可以按需加载内容。产物与排查视频产物同样包含本地路径、MIME、大小、SHA-256 和限时 URL。失败时检查供应商模型是否声明或实际支持视频生成、Fusion 工具是否绑定正确的视频模型、配置的重试次数与备用模型、ai-gateway 状态码与请求日志中的错误、以及图生视频/参考图生视频的输入是否位于允许的读取根目录内。自定义 MCP 工具接入内部系统在 Fusion 模型的Tools中选择内置工具或点击Add custom MCP接入自定义服务。自定义 MCP 支持stdio本地命令行工具streamable-http / sse远程 MCP 服务Discover tools读取 MCP server 暴露的工具。这样可以把本地脚本、内部系统或远程服务包装成模型可调用的工具让通用模型成为可访问内部系统的 Agent 模型。Fusion 工具循环的特性Fusion 工具循环不再设置轮次上限或工具调用次数上限请求超时和客户端取消仍然生效。每个工具配置一个主模型并可选配置重试次数与备用模型。保存 Fusion 模型后CCR 会为它生成独立的运行时工具名防止多个 Fusion 配置之间的模型绑定互相覆盖。直接接入 MCP 客户端需要绕过 Fusion、直接以 MCP 客户端接入媒体能力时可以连接http://127.0.0.1:3456/__ccr/media/mcp Authorization: Bearer CCR API Key该端点使用 CCR API Key 认证产物 URL 则使用独立的限时 token。旧/__ccr/grok-media/*路径仍作为迁移兼容入口保留。Fusion 内部通过随 Core 配置生成的stdioMCP 代理注册这些工具——代理直接返回当前 Profile 的确定工具清单再把实际调用转发到上述私有端点从而避免 HTTP MCP 发现失败或启动时序导致工具缺失。内部策略配置参考通常无需手动修改媒体工具的默认安全策略在配置中以mediaTools形式存在完整示例{ mediaTools: { enabled: true, artifactTtlHours: 24, jobTimeoutMs: 600000, maxImageConcurrency: 2, maxVideoConcurrency: 1, allowedInputRoots: [] } }各字段含义enabled是否启用媒体工具artifactTtlHours产物保留时长示例为 24 小时jobTimeoutMs视频任务超时示例为 600000ms即 10 分钟maxImageConcurrency图片任务最大并发示例为 2maxVideoConcurrency视频任务最大并发示例为 1allowedInputRoots允许读取的本地目录白名单默认空仅信任工作目录、临时目录与 CCR 配置目录。旧的grokMedia配置会在读取时迁移到mediaTools旧的grok-cli媒体绑定会解析到已导入的 Grok Agent 或已配置的 Grok API 模型不会再启动 CLI。媒体执行也不会再启动嵌套 Agent 或 CLI 进程。组合命名与落地建议用组合命名让团队一眼看懂模型能力来源例如GLM-5.2 GLM-5V-Turbo GLM-5.2V代码模型 Web Search 可检索最新资料的代码模型通用模型 生图/生视频工具 可产出媒体素材的 Agent 模型通用模型 自定义 MCP 工具 可访问内部系统的 Agent 模型落地时注意两点验证供应商能力先用一个测试 Fusion 模型验证供应商是否真正实现了对应的媒体端点图片/视频协议再投入生产路由——模型选择器显示的是声明或检测到对应媒体能力的供应商模型实际能力仍需以供应商实现为准分层排查任何能力层失败时先检查能力模型本身是否支持视觉输入 / 媒体协议、再检查重试与备用模型配置、最后看请求日志中的 Fusion 工具调用报错基础文本模型不会因能力层故障被替换。相关阅读Fusion 主文档英文 与 Fusion 组合模型中文内置图像能力配置内置联网搜索配置自定义 MCP 工具配置生图工具详解生视频工具详解核心实现Fusion 内置工具配置编译与 MCP 注册、内置 vision/web_search 工具运行时、通用媒体协议执行器【免费下载链接】claude-code-routerOne local control plane for every AI agent: route across models, fuse new capabilities, orchestrate tools, and stay fully in control.项目地址: https://gitcode.com/GitHub_Trending/cl/claude-code-router创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门