拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Claude Code Router 接入 Ollama 的 4 个关键步骤

Claude Code Router 接入 Ollama 的 4 个关键步骤【免费下载链接】claude-code-routerOne local control plane for every AI agent: route across models, fuse new capabilities, orchestrate tools, and stay fully in control.项目地址: https://gitcode.com/GitHub_Trending/cl/claude-code-router上个月一个典型场景Claude Code 每天产生约 200 次模型调用其中相当一部分是标题生成、提交信息、对话摘要这类后台任务却全部按云端主力模型的单价计费。用 Claude Code Router 把这部分请求路由到 Ollama 本地模型是最直接的降本方式——客户端只对接本地网关127.0.0.1:3456一个入口后台任务落在本地复杂推理继续走云端供应商这就是本文要落地的本地模型路由方案。一次请求如何被分流从网关到本地模型分流依据是请求所属场景和输入规模不是语义猜测。Claude Code 发出的请求先进入本地网关CCR 按内置路由识别客户端后交给 Router 配置做分发Default处理普通对话Think处理扩展思考Background接管 Claude Code 的后台小任务摘要、标题、轻量整理官方惯例由 Haiku 级小模型承担Long Context在输入超过阈值时接管。把Background指向 Ollama 供应商其余保留云端模型摘要类请求就落在本地、推理类请求走云端。下面是控制台里 Ollama 供应商与路由面板的实际样子这个后台任务交给本地模型的思路来自项目作者的原生设计见 blog/zh/项目初衷及原理.md。从零跑起来安装 Ollama 与最小配置三步走装 Ollama、装 CCR、配一条本地供应商。先安装 Ollama 并拉一个代码向模型本地模型只需一个能跑的后面可随时换curl -fsSL https://ollama.ai/install.sh | sh ollama pull qwen2.5-coder:latest再安装 CCR 的 npm CLI要求 Node.js 22并启动管理界面npm install -g musistudio/claude-code-router ccr ui打开http://127.0.0.1:3458在 Providers 里添加一个自定义供应商名称ollamaAPI 地址填 Ollama 的 OpenAI 兼容端点http://localhost:11434/v1/chat/completions协议选 OpenAI Chat模型填qwen2.5-coder:latest用检测连通性确认可用。然后在 Router 面板把各场景指到目标等价于配置中的这段{ Router: { default: openrouter,anthropic/claude-sonnet-4.5, background: ollama,qwen2.5-coder:latest, longContext: openrouter,gemini-2.5-pro, longContextThreshold: 60000 } }最后确认网关运行在127.0.0.1:3456在API 密钥页创建 CCR 客户端 Key把 Claude Code 的 Base URL 指向网关即可。关键配置详解4 个决定分流的字段每个字段只解释做什么、为什么这样设、可换什么值。background指向ollama,qwen2.5-coder:latest。这是唯一必须本地化的场景因为后台任务量最大、质量容忍度最高。可换成任意本地模型或一个便宜的云端小模型做双保险。longContextThreshold设为60000表示输入超过约 6 万 token 时切到长上下文模型。注意 Ollama 模型的默认上下文窗口很小常为 4k所以长上下文绝不能留给本地必须指向云端大窗口模型如果你的主力本地模型上下文更长这个阈值可以下调。default日常对话的主力模型保持云端中档以上模型这是保证核心编码体验的底线不建议为了省钱把它指到本地。think扩展思考/规划类请求。可以和default一致也可以指向更强的推理模型本地模型基本不适配这个场景。另外顶层API_TIMEOUT_MS默认是 60000010 分钟。Ollama 首次请求要加载权重明显偏慢这个默认值足够宽容不必调小反过来如果 Ollama 反复超时先检查服务而不是调超时。如何验证路由生效看日志与状态接口验证只看两个地方状态接口和请求日志的 resolved 字段。网关健康与本地模型加载状态curl -s http://127.0.0.1:3456/health ollama ps/health返回 200 说明网关就绪ollama ps里出现qwen2.5-coder说明请求确实打到了本地。然后在 Claude Code 里正常用一阵打开 CCR 的 Logs 页逐条检查request model、resolved provider、resolved model后台请求应显示resolved provider为ollama主对话仍指向云端供应商。如果发生失败降级响应头里会带x-ccr-fallback-model等字段日志详情里也能看到重试链——这条机制的完整字段说明见 docs/src/content/docs/zh/configuration/routing.md。只要后台请求的 resolved 目标是 Ollama 且状态 200配置就算生效了。进阶玩法与成本估算Docker 与自定义路由脚本两个进阶方向都点到为止细节以文档为准。常驻服务器部署时仓库自带docker-compose.ymldocker compose up -d --build即可容器内只暴露 8080 给 Nginx网关走内部端口注意事项见 docs/src/content/docs/zh/guides/docker.md。需要更细的分流逻辑按输入 token 数、按最后一条用户消息内容、按会话灰度时用路由页的 Node.js 脚本规则脚本拿到input.tokenCount、input.summary.lastUserText等只读字段返回目标模型即可不命中时return null继续走后续规则避免把所有请求都压给本地。成本上给个量级估算按每天 200 次调用、其中 60%120 次为后台/摘要类、单次输入约 2k token 计全部走云端中档模型按每百万 token 输入 $3、输出 $15 的量级每月费用大约是个位数到十美元级这部分全部转本地后云端账单只留下 40% 的核心调用。两个前提要说明如果你用的是固定费用订阅而非按量计费账单层面的收益会不明显本地推理的硬件耗电与折旧没有计入但相对 API 费用通常可忽略。常见坑与适用边界本地模型的能力上限先认账本地模型只接后台任务不是云端的替代品。现象原因处理Ollama 返回 model not found模型没拉取或 tag 写错ollama list核对ollama pull补拉后台请求明显偏慢甚至超时首次加载权重 默认上下文小提前ollama run预热长上下文交给云端摘要输出格式错乱、指令不遵循7B 级本地模型能力上限缩小本地承接的任务面提高质量要求的路由回云端网关连接被拒绝Ollama 服务未启动或端口被占curl localhost:11434/v1/models验证供应商连通性检测失败自定义端点协议没选 OpenAI ChatOllama 走的是 OpenAI 兼容协议检查协议字段硬件边界也摆清楚qwen2.5-coder这类 7B 级模型量化后大约需要 6~10 GB 内存/显存32B 级则要 20 GB 以上没有 GPU 的机器上 7B 勉强可用更大的模型基本跑不动。所以这个方案的适用边界很明确本地承接摘要、标题、轻量整理这类错了能重来的任务多文件重构、架构分析、高风险审查仍然留在云端强模型上。收尾做完这 4 步你的 Claude Code 日常调用里最烧钱的那一类请求已经落在本地复杂任务照旧享受云端模型的质量账单和隐私都可控。想继续深入可以从路由文档里的条件规则与失败降级入手docs/src/content/docs/zh/configuration/routing.md或者用 CLI 的前台模式观察实时日志docs/src/content/docs/zh/guides/cli.md。【免费下载链接】claude-code-routerOne local control plane for every AI agent: route across models, fuse new capabilities, orchestrate tools, and stay fully in control.项目地址: https://gitcode.com/GitHub_Trending/cl/claude-code-router创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门