Ornith-1.5: From Self-Scaffolding to Self-Improvement——从自我脚手架搭建到自我改进
一、核心贡献Ornith-1.5 提出了一种端到端的自我改进框架让大语言模型能够通过持续自我生成任务、构建解决方案脚手架、产出训练数据形成一个闭环的自我提升系统。这是 Ornith-1.0 自我脚手架搭建框架的重大升级。二、技术核心三阶段自我改进循环每个训练周期包含三个环节且奖励信号会反向传播到所有环节阶段内容作用任务生成模型基于当前能力和历史表现提出比已解决任务更难的挑战持续推动训练前沿暴露能力短板自动构建课程脚手架生成模型为每个任务生成或优化专属的指令、工具、分解策略和编排方案更高效地激发模型能力解决方案生成模型产出具体的解决轨迹用于强化学习训练提供学习信号驱动参数更新三个环节通过 GRPO 算法联合优化形成“更强策略→更难任务→更好脚手架→更优轨迹→更强策略”的正反馈循环。三、任务奖励机制生成任务时系统综合评估三个信号有效性任务是否合法、可验证前沿难度当前模型在该任务上的成功率越接近 20% 越好既具挑战性又能产出足够成功轨迹用于 RL 训练新颖性与历史任务库的差异度防止重复生成相似任务四、模型规格版本架构特点Ornith-1.5-397BMoE混合专家旗舰版对标 Claude Opus 4.8Ornith-1.5-35BMoE每令牌激活 3B高效推理性能大幅超越同尺寸密集模型Ornith-1.5-9BDense密集模型含量化移动版可部署于手机端三者均基于 Ornith-1.0源自 Qwen3.5 Gemma 4进行额外的持续预训练、中期训练和后期训练。五、核心性能表现Ornith-1.5-397B旗舰级基准测试Ornith-1.5Claude Opus 4.8DeepSeek-V4-FlashGLM-5.2Terminal-Bench 2.186.185.082.782.7DeepSWE56.059.054.446.2SWE-bench Verified86.085.881.683.0与 Claude Opus 4.8 持平超越所有同规模开源模型Ornith-1.5-35BMoE在 Terminal-Bench 2.1 上达到68.5远超 Gemma 4-31B43.4在 SWE-bench Verified 上达到79.0大幅领先 Muse Glimmer76.0每令牌仅激活 30 亿参数效率极高Ornith-1.5-9B端侧部署Terminal-Bench 2.147.0SWE-bench Verified70.6性能达到甚至超越 Gemma 4-31B 和 Qwen 3.6-35B 等大模型量化版可部署于 iPhone/Android六、评估覆盖范围论文在三大类基准上进行了全面评估编码类Terminal-Bench 2.1、SWE-benchVerified/Pro/Multilingual、DeepSWE、NL2Repo、SWE Atlas 等推理类HLE含/无工具、GPQA Diamond智能体类MCP-Atlas、Toolathlon-Verified、WideSearch、BrowseComp、ClawEval七、技术亮点摆脱对人工数据与人工设计智能体的依赖完全由模型自主生成任务和策略课程自动演进前沿难度随模型能力动态调整反黑客保护评估中移除 Git 历史、禁用网络、屏蔽外部仓库访问防止奖励作弊跨规模可扩展从 9B 端侧模型到 397B 旗舰模型均验证有效Ornith-1.5 的核心突破在于让模型成为自身进步的工程师——它自己出题、自己想解题思路、自己练题形成可持续的自我进化闭环在编码、推理和智能体任务上达到或超越当前最先进的闭源与开源模型。今天我们推出 Ornith-1.5这是朝着通过端到端自我改进构建基础模型迈出的重要一步。Ornith-1.5 将 Ornith-1.0 中引入的自我脚手架搭建框架扩展为一个更完整的自我改进循环模型提出新任务生成针对特定任务的脚手架并生成用于强化学习的解决方案轨迹从而持续创造新的学习经验并从中进行自我提升。Ornith-1.5 涵盖三种模型规模397B MoE、35B MoE 和 9B Dense。它是在 Ornith-1.0 的基础上扩展而来后者基于 Qwen3.5 和 Gemma 4 开发并进行了额外的持续预训练CPT、中期训练和后期训练。Ornith-1.5 在广泛的推理、编码和智能体基准测试中在同等规模的开源模型中达到了最先进的性能。2026/8/20 13:32 Ornith-1.5从自我脚手架搭建到自我改进 | Ornith 博客Ornith-1.5-397B 在 Terminal-Bench 2.1 上得分为 86.1在 DeepSWE 上得分为 56.0性能与 Claude Opus 4.885.0 和 59.0相当同时优于同规模领先的开源模型包括 GLM-5.282.7 和 46.2和 DeepSeek-V4-Flash-073182.7 和 54.4。在另一端Ornith-1.5-9B 及其量化版本 Ornith-1.5-9B-Mobile 可轻松部署在 iPhone 和 Android 设备上同时性能显著优于 Gemma 4-31B 和 Qwen 3.6-35B 等更大规模的模型。在旗舰级规模上Ornith-1.5-397B 在 Terminal-Bench 2.1 上达到 86.1在 DeepSWE 上达到 56在两个基准测试中均与 Claude Opus 4.8 持平并优于同尺寸的领先开源模型包括 GLM-5.2 和 DeepSeek-V4-Flash-0731。2026/8/20 13:32 Ornith-1.5从自我脚手架搭建到自我改进 | Ornith 博客Ornith-1.5-35B 在所有编码和智能体基准测试中均显著优于其同尺寸竞品 Qwen 3.6-35B。尽管每个令牌仅激活 30 亿参数它在智能体编码任务上也大幅超越了密集模型——Gemma 4-31B 和 Meta 的 Muse Glimmer-30BTerminal-Bench 2.1 得分为 68.5 对比 43.4 和 51.7SWE-Bench Verified 得分为 79.0 对比 52.0 和 76.0。可边缘部署的 Ornith-1.5-9B 也交出了非常亮眼的成绩单在 Terminal-Bench 2.1 上达到 47.0在 SWE-Bench Verified 上达到 70.6。尽管是一个紧凑的 90 亿参数模型它的表现却达到甚至超越了 Gemma 4-31B 和 Qwen 3.6-35B 等大得多的模型。通过自生成任务、工具包和解决方案实现自我改进Ornith-1.5 扩展了 Ornith-1.0将自我改进循环从脚手架和轨迹优化扩展为联合优化任务生成、脚手架构建和解决方案轨迹生成。Ornith-1.5 不再依赖固定的人工策划任务集和手动设计的工具包而是持续生成新的训练任务发现解决这些任务的有效策略并通过强化学习改进策略。每个训练周期分为三个阶段。给定一个环境或代码库、关于任务类型的高级指令以及模型先前任务解决历史的访问权限系统会提出逐步更难的任务这些任务超出了模型已能解决的范围从而暴露能力差距持续推动训练前沿。对于每个任务模型随后会生成或改进一个针对特定任务的脚手架——即用于处理该问题的指令、工具、分解策略和编排方案。以任务和脚手架为条件策略生成一个解决方案轨迹。来自轨迹的奖励会反向传播到所有三个阶段因此系统不仅学会产生更好的解决方案还学会生成更有用的训练任务和构建更有效的脚手架。通过反复训练这就形成了一个封闭的自我改进循环更强的策略能够生成更难、信息量更丰富的任务不断演进的脚手架发现更好方法来激发模型能力更高质量的轨迹提供越来越有效的学习信号。Ornith-1.5 不再依赖于静态的训练数据分布或人工设计的智能体方案而是持续扩展自身的课程并调整其问题解决策略从而在推理、编码和智能体任务上驱动持续的能力提升。任务奖励其中V 衡量生成的任务和脚手架是否构成一个有效且可验证的学习环境D 基于轨迹执行表现衡量任务是否位于模型当前能力前沿附近N 衡量相对于先前生成或训练过的任务的新颖性。这种乘积形式的公式鼓励提议者生成同时满足所有三个属性的任务有效、难度恰当且非冗余。有效性与可验证性一个有用的任务必须形成一个定义良好的学习环境。问题应当连贯且可解而脚手架应当能够正确执行并可靠地评估候选解决方案。我们定义V(q,s)∈[0,1]基于以下检查脚手架是否成功运行、高置信度解决方案是否通过、明显错误的解决方案是否失败以及评估是否与任务规范一致。有效性也可以作为一个硬性门控条件V(q,s)0 ⟹ Rtask0.这可以防止格式错误的任务或不可靠的脚手架仅仅因为看似困难而获得奖励。前沿难度在有效的任务中最有用的那些既非微不足道也非不可能完成。我们直接从模型的轨迹执行结果来估算难度。对于每个任务我们采样 N 条轨迹并计算经验成功率新颖性与多样性仅靠前沿难度可能导致模型反复生成相同任务的微小变体。因此我们增加了一个新颖性项其中 B 是先前生成或训练过的任务的缓冲区。新颖性应当次于有效性和难度其作用是减少冗余而非奖励任意不寻常的任务。这些信号共同鼓励提议者生成有效、可验证、具有挑战性但可学习且足够多样化的任务。由于前沿难度是使用当前模型自身的轨迹来衡量的由此产生的课程将随模型能力自动演进。工具包与轨迹奖励对于生成的问题 q工具包 h 因提供一个与任务对齐、忠实反映解决方案质量、且对奖励黑客行为具有抵抗力的评估环境而获得奖励其中C 衡量工具包是否忠实地反映了任务规范F 衡量其奖励是否能追踪候选方案的真实质量H 衡量其对评估器失败、捷径和奖励黑客行为的抵抗能力。每个轨迹 τi 由生成的工具包直接评分对于可验证的任务这可以是一个二进制的通过/失败奖励对于更丰富的环境它可以结合正确性、任务完成度、效率和约束满足。问题生成、工具包生成和解决方案轨迹都使用各自的奖励通过 GRPO 进行优化使得这三个阶段能够在同一个自我改进循环中共同提升。结果评测Ornith-1.5-397BBenchmarkOrnith-1.5(397B)DeepSeek-V4-Flash-0731(284B)GLM-5.2(753B)Claude Opus 4.8Kimi K3(2.8T)Ornith-1.0(397B)CodingTerminal Bench 2.1 (Terminus-2)86.182.7818588.377.5Terminal Bench 2.1 (Claude Code)85.281.882.778.9–78.2SWE-bench Verified8681.68385.886.282.4SWE-bench Pro65.164.462.168–62.2SWE-bench Multilingual79.677.978.475.7–78.9DeepSWE5654.446.25967.58Frontier-Bench v0.113.56.15.121.1232.7NL2Repo59.554.248.969.7–48.2SWE Atlas – QnA55.651.65059.759.741.2ReasoningHLE (no tools)44.63540.549.843.530.2HLE (with tools)56.150.854.757.95647.5GPQA Diamond92.891.491.293.693.588.1AgenticMCP-Atlas8074.677.882.282.376.4Toolathlon-Verified71.270.348.276.273.243.2WideSearch80.877.37972.9–75.2BrowseComp86.684.885.684.391.279.7ClawEval81.477.678.880.2–77.1Ornith-1.5-35BBenchmarkOrnith-1.5-35B-A3BOrnith-1.0-35B-A3BQwen3.6-35B-A3BGemma-4-31B(dense)Muse-Glimmer-30B(dense)Qwen3.5-397B(397B)CodingTerminal Bench 2.1 (Terminus-2)67.864.252.542.151.753.5Terminal Bench 2.1 (Claude Code)68.562.849.2––48.6SWE-bench Verified7975.673.4527676.4SWE-bench Pro59.650.449.535.751.251.6SWE-bench Multilingual71.469.367.251.7–69.3DeepSWE2200––1Frontier-Bench v0.15.11.41.4––1.4NL2Repo46.234.629.415.5–36.8SWE Atlas – QnA39.837.115.5––20.4ReasoningHLE (no tools)25.620.821.419.52228.7HLE (with tools)33.430.128.926.5–48.3GPQA Diamond89.286.28684.383.588.4AgenticMCP-Atlas70.264.462.85575.572.3Toolathlon-Verified48.742.441.740.8–38.3WideSearch67.863.460.154.2–74BrowseComp67.663.562––78.6ClawEval72.569.868.748.5–70.7Ornith-1.5-9BBenchmarkOrnith-1.5-9BOrnith-1.0-9BQwen3.5-9BQwen3.6-35B-A3BGemma-4-31B(dense)CodingTerminal Bench 2.1 (Terminus-2)46.243.121.352.542.1Terminal Bench 2.1 (Claude Code)4740.618.949.2–SWE-bench Verified70.669.453.273.452SWE-bench Pro47.542.931.349.535.7SWE-bench Multilingual54.45239.767.251.7NL2Repo32.427.216.229.415.5SWE Atlas – QnA20.617.99.215.5–ReasoningHLE (no tools)20.216.814.721.419.5HLE (with tools)30.526.424.528.926.5GPQA Diamond86.482.581.78684.3AgenticMCP-Atlas54.249.446.862.855Toolathlon-Verified41.233.429.641.752.8WideSearch59.555.853.660.154.2BrowseComp56.444.841.562–ClawEval66.563.153.268.748.5脚注所有报告的 Ornith-1.5 结果是五次独立运行的平均值。Terminal-Bench 2.1 (Terminus-2):我们使用 Harbor/Terminus-2 框架评估 Terminal-Bench 2.1设置 parserjsontemperature1.0top_p1.0上下文窗口为 128K。每次运行使用 4 小时超时时间配备 32 个 CPU 核心和 48GB RAM结果取 5 次运行的平均值。我们调整了 Qwen 聊天模板以确保训练和推理之间的一致性并修改了 Harbor 以适配 vLLM 的 reasoning_content 键。Terminal-Bench 2.1 (Claude Code):我们使用 Claude Code 2.1.126 评估 Terminal-Bench 2.1设置 parserjsontemperature1.0top_p1.0max_new_tokens131072。结果取 5 次运行的平均值。同样需要修改 Qwen 聊天模板。SWE-Bench Verified, Pro 和 Multilingual:使用 OpenHands 工具包进行评估设置 temp1.0top_p0.95上下文窗口为 256K。整个评估过程中应用了反黑客保护措施从本地仓库镜像中移除 Git 历史记录以防止模型访问先前的解决方案或提交记录禁用网络访问防止模型检索外部信息或资源。DeepSWE:使用 Claude Code 工具包进行评估设置 temperature1.0top_p0.95上下文窗口为 256K。SWE Atlas QnA, RF, TW:使用 mini SWE agent 工具包进行评估设置 temp1.0top_p0.95上下文窗口为 128K。结果取 5 次运行的平均值。NL2Repo:设置 temperature1.0top_p1.0上下文窗口为 400K输出长度为 48K。阻止访问指定的 GitHub 仓库和 pip 包以防止奖励黑客行为。HLE:使用 Claude 4.6 Opus 作为评判模型进行评估。MCP-Atlas:所有模型均以思考模式在 500 个任务的公开子集上进行评估每个任务超时时间为 10 分钟。我们使用 Claude 4.8 Opus 作为评判模型。Tool-Decathlon:我们使用官方评估服务最大令牌限制设为 128K。ClawEval:一个基于真实用户任务分布的智能体编码基准测试设置 temp0.6上下文窗口为 256K。