ollama v0.32.3发布:模型下载卡顿修复、Windows ARM64 CUDA支持、Laguna工具调用全面升级

发布时间:2026/7/25 5:24:41
ollama v0.32.3发布:模型下载卡顿修复、Windows ARM64 CUDA支持、Laguna工具调用全面升级 2026年7月24日ollama 发布 v0.32.3 版本。本次更新覆盖模型下载、模型集成、GPU 支持、推理引擎、工具调用、聊天能力、命令行与终端交互等多个方面。从更新内容来看v0.32.3 的核心方向非常明确一方面修复影响实际使用体验的问题例如模型下载在尚未接收数据前发生停滞、GLM 工具调用在生成结尾被静默丢弃等另一方面持续扩大硬件与模型兼容范围包括 Windows ARM64 平台 CUDA 支持、通过 CUDA 12 支持 B200、Linux CUDA 与 ROCm 集成显卡降低内存使用以及 Laguna 2.1 模型的聊天、思考和工具调用能力支持。此外Claude Code Channels、Anthropic thinking 流、Hermes Desktop、MLX、llama.cpp 等相关集成与引擎也都迎来调整。对于本地模型部署、终端 AI 助手、模型工具调用以及多平台 GPU 推理场景而言这是一次兼顾稳定性、兼容性与体验的版本更新。版本信息版本号v0.32.3发布时间2026年7月24日提交数量29参与贡献者6变更文件数量107本次版本的更新并非单一功能的增加而是围绕模型运行链路进行了一系列优化。无论是下载模型、选择推理硬件、调用工具还是使用聊天和思考能力多个关键环节都获得了修复或增强。一、模型下载卡在开始阶段的问题得到修复v0.32.3 修复了模型下载在尚未发送任何数据之前发生停滞的问题。模型下载是使用 ollama 的基础流程之一。用户在拉取模型时如果下载任务长时间没有开始传输数据往往很难判断是网络问题、服务端问题还是客户端任务已经卡住。此次更新针对“首字节到来之前”的下载停滞场景进行了处理。对应的改动包括对下载停滞的检测优化重点是识别模型下载在第一段数据到达之前的异常等待状态。这一修复的重要性在于模型下载通常是后续运行、测试、部署的前提。下载任务在开始阶段停滞会直接阻断模型使用流程。v0.32.3 对这一问题的修复提升了模型拉取环节的稳定性与可用性。二、Claude Code Channels 恢复可用集成能力进一步完善本次更新恢复了 Claude Code Channels 的可用性。更新记录中包含“保持 Claude Code channels 可用”的调整意味着此前相关 Channels 在启动或使用过程中可能存在不可用、无法保留或被移除的情况。v0.32.3 对这一能力进行了恢复使其重新能够正常使用。对于依赖 Claude Code 相关工作流的用户而言这项修复能够避免因 Channels 状态异常造成的功能中断。与此同时版本中还移除了无效的 agent 提示词包装逻辑并对 agent 相关指令、流程代码、用户体验与开发体验进行了整理。这些调整虽然更多体现在内部结构和交互流程上但也表明 v0.32.3 持续在简化不再需要的逻辑减少冗余结构并优化终端与 agent 使用过程中的行为一致性。三、Anthropic thinking 流修复思考内容与文本输出顺序更准确v0.32.3 修复了 Anthropic thinking 流相关问题。更新内容显示本次调整包括在启动 thinking 块之前先关闭文本块。这个变化看似是输出结构层面的细节但对于流式响应而言非常关键。当模型同时输出普通文本与思考内容时输出块之间需要具备清晰、正确的边界。如果文本块没有结束就开始思考块可能导致流解析、前端渲染或下游调用处理出现异常。通过在开始 thinking 块前关闭文本块v0.32.3 改善了文本内容与思考内容之间的切换过程。这项修复能够让 Anthropic thinking 流在输出时具备更正确的块结构避免不同类型内容在流式过程中发生边界混乱。四、Hermes Desktop 现在能够正确遵守 force-build 参数本次版本更新了 Hermes 集成并修复 Hermes Desktop 对 force-build 参数的支持问题。此前Hermes Desktop 对 force-build 的处理可能无法按预期生效。v0.32.3 明确让 Hermes Desktop 尊重这一参数。对于需要强制执行构建流程的场景而言这项改动能够确保命令传入的构建意图被正确执行而不是被忽略或采用非预期行为。Hermes 集成的更新与 force-build 支持修复体现出本次版本不仅关注模型推理本身也同步完善了与外部桌面工具、构建流程相关的连接能力。五、Windows ARM64 平台正式支持 CUDA硬件支持方面v0.32.3 增加了 Windows ARM64 平台的 CUDA 支持。这是本次更新中非常值得关注的一项内容。此前Windows ARM64 环境下的 CUDA 使用支持可能受到限制而本版本通过相关改动为该平台加入了 CUDA 能力。随着不同架构设备的使用需求不断增加Windows ARM64 的 GPU 推理支持具有实际意义。v0.32.3 将 CUDA 支持扩展到这一平台进一步扩大了可运行 ollama GPU 推理环境的范围。对于使用 Windows ARM64 设备并希望借助 CUDA 加速模型运行的用户而言这次升级意味着硬件能力支持范围得到扩展。六、通过 CUDA 12 支持 B200v0.32.3 扩展了 CUDA 12 环境下的 GPU 支持其中包括对 B200 的支持。更新中涉及为 Linux 下 CUDA v12 增加计算能力 10.0 支持这项调整与 B200 支持直接相关。通过 CUDA 12 的能力扩展ollama 能够覆盖这一 GPU 相关支持需求。GPU 支持的增加并不只是简单增加一个设备名称更意味着推理环境在 CUDA 版本、计算能力与硬件适配方面持续演进。对于使用 CUDA 12 环境并部署相关 GPU 的场景这次更新提供了更完整的支持基础。另外本版本还修复了持续集成环境中缺失 CUDA v13.4 子包的问题。虽然这属于构建与持续集成层面的调整但同样与 CUDA 相关支持链路的完整性有关。七、Linux CUDA 与 ROCm 集成显卡进一步降低内存使用v0.32.3 针对 Linux 平台上的 CUDA 与 ROCm 集成显卡优化了内存使用。更新内容中提到启用 dio以降低 Linux CUDA 与 ROCm iGPU 场景下的内存占用。这项改动面向集成显卡推理环境重点改善资源使用表现。集成显卡场景与独立显卡场景不同其显存与系统内存使用关系往往更加紧密。因此降低内存使用对于提升实际运行可行性具有重要意义。尤其是在内存资源有限、需要控制占用的环境中这类优化能够减少模型推理对系统资源造成的压力。本次更新没有只关注高端 GPU 支持同时也对 Linux CUDA 与 ROCm 集成显卡场景进行优化体现出硬件兼容策略覆盖了不同层级的设备环境。八、Laguna 2.1 模型新增聊天、思考与工具调用支持模型能力方面v0.32.3 为 Laguna 2.1 模型增加了聊天、思考和工具调用支持。这意味着 Laguna 2.1 不仅能够用于基础文本生成也可以进入更完整的交互式使用链路包括聊天能力思考能力工具调用能力聊天支持使模型能够面向多轮交互场景进行工作思考支持对应模型输出中的相关内容处理工具调用支持则让模型具备与外部工具协作的能力。对于需要在统一运行环境中使用不同模型能力的用户而言Laguna 2.1 的这次适配非常关键。模型是否具备聊天、思考与工具调用支持会直接影响其能否进入终端助手、自动化流程、交互式对话等使用场景。本次更新还修复了 Laguna 的 Metal 推理问题。Metal 推理修复使该模型在相关环境中的运行支持更加完整。在提交记录中还包含将 Laguna 与上游 llama.cpp 对齐的改动以及 Laguna v8 聊天支持与 Metal 推理修复相关调整。这些变化共同构成了 Laguna 模型支持的持续完善。九、GLM 工具调用在生成结束时被静默丢弃的问题修复v0.32.3 修复了 GLM 工具调用在生成末尾可能被静默丢弃的问题。工具调用是模型接入外部能力的重要机制。如果模型已经生成了工具调用内容但因为生成过程接近结束而没有被正确解析或最终输出那么用户会看到模型似乎没有执行工具调用且可能没有明显报错提示。此次改动对不完整的 GLM 工具调用进行了最终处理核心目标是避免工具调用在生成结束阶段被直接丢弃。“静默丢弃”问题尤其影响排查体验。因为用户可能只发现模型没有调用预期工具却无法直接判断是模型没有生成调用意图还是调用内容在解析阶段丢失。v0.32.3 修复这一问题后GLM 工具调用在生成结尾的处理更加可靠。对于依赖工具调用执行操作的场景这是一项直接影响功能正确性的修复。十、MLX 与 llama.cpp 推理引擎完成更新本次版本更新了 MLX 和 llama.cpp 引擎。更新记录中包含 llama.cpp 更新同时 MLX 也进行了两次更新。作为模型运行的重要引擎组件MLX 与 llama.cpp 的版本变化关系到模型兼容性、推理行为和底层能力对齐。llama.cpp 相关更新之外Laguna 还进行了与上游 llama.cpp 的对齐调整。这说明本次版本不仅完成基础引擎升级也针对模型支持进行了相应适配。MLX 的多次更新也被纳入 v0.32.3 发布内容。对于使用 MLX 推理路径的场景而言这意味着底层引擎获得同步更新。引擎更新虽然不一定在表面交互中直接可见但它通常影响模型支持、运行稳定性以及后续功能适配能力。v0.32.3 将 MLX 与 llama.cpp 的更新纳入版本范围为整体模型运行能力提供了基础支撑。十一、云模型默认允许无限工具调用轮次agent 相关部分v0.32.3 调整了云模型的默认工具调用轮次策略。更新内容显示云模型默认允许无限工具调用轮次。此前工具调用轮数可能受到默认限制而本次调整改变了默认行为。对于需要多轮调用工具才能完成任务的场景工具轮次限制会影响任务是否能完整执行。云模型默认允许无限工具调用轮次后连续工具调用流程不再受默认轮数上限约束。这项调整与工具调用能力的发展方向一致。随着模型承担的任务逐渐涉及多步骤操作、反复查询、持续执行工具链工具调用轮次的默认限制可能成为流程中断点。v0.32.3 对默认策略进行调整使云模型工具调用流程更加连续。十二、agent 与终端交互流程持续精简除了模型和硬件支持本版本还对 agent、命令行和终端交互进行了多项整理。主要变化包括移除无效的 agent 提示词包装调整工作目录指令顺序清理语义、用户体验、开发体验和过程代码移除独立的 agent 命令删除事件循环中冗余的上下文窗口刷新在提交之前完成斜杠命令补全统一 Markdown 粗体强调的渲染表现将根命令的 server start 路由通过服务器心跳检查这些改动覆盖了终端使用、命令处理、交互显示、服务启动和 agent 流程等多个细节。例如斜杠命令在提交前完成补全可以改善命令输入过程中的交互体验Markdown 粗体强调统一渲染能够使聊天内容中的重点表达更一致删除冗余上下文窗口刷新则可以减少事件循环中不必要的处理。移除独立 agent 命令与清理无效提示词包装也说明 v0.32.3 在继续收敛命令与 agent 流程结构减少重复或不再需要的入口与逻辑。根命令的 server start 通过服务器心跳检查则让服务启动流程与服务状态检查机制更紧密地结合。十三、技能系统与从编码 agent 导入技能能力加入更新v0.32.3 的提交记录中还包括 agent 技能系统以及从编码 agent 导入技能的能力。技能系统属于 agent 能力组织相关的更新。与此同时从编码 agent 导入技能的改动为技能复用和接入提供了相应支持。这部分更新与前文提到的工具调用轮次、agent 流程整理共同构成了 v0.32.3 在 agent 方向上的变化。虽然本次发布说明的重点集中于下载、集成、GPU、模型支持与引擎更新但提交记录表明 agent 技能相关能力同样被纳入这一版本。十四、构建工具链与测试入口同步调整在构建与测试方面v0.32.3 包含以下调整Linux 工具链升级至 GCC 13修复持续集成中缺失的 CUDA v13.4 子包重构集成测试入口更新 API 文档中的 renderer 与 parser 字段更新 retirements 文档Linux 工具链升级至 GCC 13属于构建环境层面的更新。持续集成中 CUDA v13.4 子包缺失问题的修复则确保相关构建或测试链路具备所需组件。集成测试入口的重构表明测试体系本身也进行了整理。测试入口的组织方式会影响后续验证流程的维护与执行。文档方面API 文档增加 renderer 和 parser 字段说明同时 retirements 文档也进行了更新。这些文档调整使接口字段与相关状态信息得到同步维护。十五、v0.32.3 完整更新要点汇总为了便于快速查看以下是本次版本涉及的全部主要变化汇总。模型下载与服务稳定性修复模型下载在发送数据前发生停滞的问题增加下载首字节到来前的停滞检测根命令启动 server 时通过服务器心跳检查集成与模型协议恢复 Claude Code Channels修复 Anthropic thinking 流在开始 thinking 块前关闭文本块更新 Hermes 集成Hermes Desktop 正确遵守 force-build 参数修复 GLM 工具调用在生成结束时被静默丢弃的问题对不完整 GLM 工具调用进行最终处理GPU 与平台支持Windows ARM64 支持 CUDA通过 CUDA 12 支持 B200Linux CUDA v12 增加计算能力 10.0Linux CUDA 与 ROCm 集成显卡降低内存使用修复持续集成中缺失 CUDA v13.4 子包的问题Linux 工具链升级至 GCC 13Laguna 模型支持Laguna 2.1 新增聊天支持Laguna 2.1 新增思考支持Laguna 2.1 新增工具调用支持修复 Laguna Metal 推理问题Laguna 与上游 llama.cpp 对齐包含 Laguna v8 聊天支持与 Metal 推理相关调整推理引擎更新更新 llama.cpp更新 MLXMLX 在本次提交中进行了多次更新agent、命令行与终端体验云模型默认允许无限工具调用轮次增加 agent 技能系统支持从编码 agent 导入技能移除无效 agent 提示词包装调整工作目录指令顺序清理语义、用户体验、开发体验和过程代码移除独立 agent 命令删除事件循环中冗余上下文窗口刷新提交前完成斜杠命令补全统一聊天中 Markdown 粗体强调渲染测试与文档重构集成测试入口API 文档增加 renderer 和 parser 字段更新 retirements 文档结语代码地址github.com/ollama/ollamaollama v0.32.3 是一次覆盖范围较广的稳定性与兼容性更新。在基础体验上模型下载开始阶段停滞的问题得到修复在模型与协议支持上Claude Code Channels、Anthropic thinking 流、GLM 工具调用和 Laguna 模型能力均得到增强或修复在硬件支持上Windows ARM64 CUDA、CUDA 12 B200、Linux CUDA 与 ROCm 集成显卡内存优化成为重要亮点在底层引擎上MLX 和 llama.cpp 同步升级在终端与 agent 使用链路中工具调用轮次、技能系统、命令补全、渲染一致性和流程精简也都获得调整。