拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Cognition SWE-2 与 Devin Voice 拆解:2.8 万亿参数强化学习把编程成本砍掉 70%,全双工语音结对编程

Cognition SWE-2 与 Devin Voice 拆解2.8 万亿参数强化学习把编程成本砍掉 70%全双工语音结对编程9 月 10 日Cognition 给 AI 程序员 Devin 装了一条电话线。同一天它发布了自研模型 SWE-2。SWE-2 在 FrontierCode 1.1 基准拿下 50.0%几乎追平 Anthropic Fable 5.1 的 50.9%。更关键的是成本同样一次工程任务它只花 Fable 5.1 大约三分之一的价格。这两个动作叠加Cognition 把 AI 软件工程师从编排层推向了模型自研层。本文从一次自动 bug 猎杀的账本切入拆开 SWE-2 的强化学习配方。再讲 Devin Voice 如何用 GPT-Live 全双工语音把你说我写变成真结对编程。为什么一家 AI 程序员公司要下场训模型2024 年 Devin 出道时Cognition 的核心资产是编排层。它自己不训模型而是给不同模型找最合适的组合。SWE-1.5 时代它在 SWE-bench 只有约 40%远低于 Claude Code 的 80%。外部模型再强也不是为端到端修仓库这件事优化的。每次更换底座整个编排层都要跟着重新调优。2025 年底Devin 编写的代码在部分客户项目里已占 89%。但这个数字掩盖了一个事实能力上限始终握在外部模型手里。模型涨价Cognition 的成本结构就跟着波动。模型换版行为漂移就要靠编排层去兜底。2026 年Cognition 决定把模型能力握回自己手里。它选了一个大胆的基座Kimi K32.8 万亿参数的 MoE 架构。这不是单纯堆参数而是把强化学习规模推到前所未有的量级。SWE-2 的故事就从这里开始。数据飞轮真实 Agent 日志是 SWE-2 的隐藏燃料SWE-2 的另一项资产是 Cognition 独有的数据飞轮。Devin 自 2024 年上线以来积累了海量真实执行轨迹。这些轨迹包含成功的修复也包含失败的尝试。失败轨迹恰恰是强化学习最珍贵的奖励信号来源。外部团队想复刻这套配方最难的不是算力而是数据。合成数据可以模拟表面行为却难以还原真实仓库的复杂度。真实项目里有模糊需求、历史包袱与团队约定。这些噪音让模型学会在不确定性里做决策。Cognition 把这份数据转成了奖励信号再喂回模型。数据、执行、奖励、再训练形成了一个闭环。这是 SWE-2 与普通微调模型拉开差距的底层原因。SWE-2 的强化学习配方五路奖励与沙盒训练SWE-2 不是拿代码做一轮监督微调就完事。它被放进数十万个拟真的软件工程沙盒里训练。每个沙盒都是一份真实的代码仓库与一张问题单。模型要读仓库、改代码、跑测试、验证结果。奖励函数有五路信号编译成功率、边界测试通过率、静态类型检查、执行效率、代码简洁度。编译不通过这一轮直接判负。边界测试漏掉关键分支得分打折。静态类型检查报错扣分。执行效率差扣分。代码冗长重复扣分。五路信号加权求和构成每一步的即时反馈。强化学习驱动下模型涌现出人类工程师的工作习惯。遇到未知终端报错它会先翻项目的 README。遇到类型报错它会主动查看关联包的 TypeScript 定义。遇到范围不明的 bug它用二分法逐步缩小嫌疑区。这些行为不是被写死的规则是 RL 训练里自己长出来的。官方把这次训练规模描述为 RL 扩展到多万亿参数。SWE-2 同时提供三段推理档位让用户按任务难度选成本。简单修复走低档架构级改造走高档。这和 GPT-5.6 的三层模型分层思路异曲同工。FrontierCode 1.1 为什么比 SWE-bench 更硬SWE-bench 只看最终单元测试是否通过。FrontierCode 1.1 加了三道更接近生产的关卡。第一道是测试完备性会动态生成边界案例。第二道是维护者标准细则由仓库维护者亲自写审查规则。第三道是自动化检查器Linter 与类型检查全量执行。一次改动要同时过这三关才算可合并。它覆盖命名规范、模块边界、异常处理完整度。还检查内存分配合理性与测试覆盖盲区。SWE-2 在这里拿 50.0%比 GPT-5.5-Codex 的 46.5% 高出 3.5 个百分点。和 Claude 3.7 Sonnet Thinking 的 44.8% 相比优势更明显。这说明 SWE-2 不是考试型选手而是贴近真实合并流程。成本账本50.0% 与 50.9% 之间差着三分之二价格一次全自动 bug 猎杀在 Fable 5.1 上大约花 5 美元。同样的任务交给 SWE-2花费不到 1.8 美元。差距来自 token 消耗与运算成本降低 64% 到 70%。下表给出各模型的 FrontierCode 1.1 得分与相对推理成本。模型FrontierCode 1.1 得分相对推理成本Anthropic Fable 5.150.9%100% 基准Cognition SWE-250.0%约 36%OpenAI GPT-5.5-Codex46.5%约 80%Claude 3.7 Sonnet Thinking44.8%约 70%DeepSeek-Coder-V3.541.3%约 25%Cognition 把这称为帕累托前沿的整体外推。能力持平的同时把整条成本曲线往下压。对企业来说同一预算可以跑大约三倍的自动修复任务。模型的三档推理档位进一步放大这个优势。低风险任务用低档日均 token 消耗显著下降。这是模型层面省钱而不是工程层面偷工减料。Devin Voice全双工语音把结对变成打电话Devin Voice 的语音前端是 OpenAI 的 GPT-Live。它支持边说边听毫秒级自然打断。你说话的同时后台的 SWE-2 已经在改代码。你探讨系统架构它同步在环境里验证方案。交互不再是一问一答而是并行协作。前端语音与后端执行是两条独立通道。慢任务不会堵住语音流语音流也不会打断执行。官方口号是你说Devin 交付。Devin Voice 在 Desktop 与 CLI 全面启用。Web 与 Fusion 企业版随后跟进。所有付费用户可免费试用 SWE-2 一个月。工程师可以戴着耳机像给同事打电话一样提需求。Devin 边听边在后台跑环境、改代码、过测试。语音反馈进度打断即调整方向。这是结对编程从文本聊天到语音协作的范式切换。语音委托架构对话界面与推理后端彻底解耦Devin Voice 的本质是语音层与执行层的分离。GPT-Live-1 只负责连续的语音交互决策。它每秒判断该听、该说、该停还是该打断。真正需要思考的任务被异步委托给 SWE-2。语音按分钟计费推理按 token 计费两者分开记账。对话界面变成了薄前端背后的大脑可以任意替换。这是 OpenAI 九月平台日释放的同一个信号。模型不再是你要围绕构建的东西而是你选择的一个组件。委托路径上还有一层延迟预算。语音模型可以短暂维持对话却无法掩饰过慢的后端。因此会话建立时后端推理会话就要预先填充上下文。提示词缓存与稳定的会话亲和性被用来压低响应时间。这套工程设计与 GPT-Live 的媒体路径优化一脉相承。语音定价拆解按分钟计价如何改变成本模型GPT-Live-1 语音按分钟统一计价按秒计费。连续接通一小时约 3 美元。每天一千通四分钟电话大约 200 美元。传统 Realtime 语音按 token 计费成本难预测。静音时长、打断次数都会改变 token 消耗。按分钟计价把这些不确定性变成一次乘法。后端推理仍按模型费率单独记账。这种双层定价让语音应用的预算变成线性模型。对构建语音编程工具的人这是可复用的财务结构。数据与合规ZDR 与 VPC 隔离语音流走 GPT-Live-1 API遵守零数据保留政策。音频与转写内容不会进入基础模型的预训练。后端 SWE-2 沙盒隔离在专属虚拟私有云里。私有代码库与 Git 历史不会被外部访问。企业可在管理后台设置语音会话保留期限。SAML 单点登录与角色权限控制覆盖整个工作流。审计日志可导出到企业合规平台。这解决了语音编程落地最敏感的合规问题。行业格局托管 Harness 时代的三个玩家SWE-2 与 Devin Voice 并不是孤立事件。它们背后是 AI 编程基础设施的赛道重排。Anthropic 有 Claude Code 与 Managed Agents。OpenAI 有 Codex CLI、App Server 与 Agents API。三家的共同点是把 Harness 变成可交付的服务。差异在于模型与数据资产的所有权归属。Anthropic 与 OpenAI 同时是模型厂与 Agent 平台。Cognition 则把执行数据与自研模型绑得更紧。谁的数据飞轮更厚谁的下一次迭代就更稳。这是托管 Harness 时代最值得关注的竞争变量。对独立开发者而言选择反而变简单了。想要开箱即用就选托管 Harness 服务。想要可控成本就把开源 Harness 与自选模型拼起来。想要极致性价比就盯紧 SWE-2 这类垂直优化模型。编程工具的分层比以往任何时候都清晰。给开发者的三点可迁移启发第一点奖励设计比模型选择更决定行为。编译、测试、类型、效率、简洁五路信号缺一不可。第二点基准要贴近你的合并流程而不是考试题。第三点语音层与执行层分离是实时交互的通用架构。下面给出一段真实可运行的 Python 代码模拟奖励聚合与成本估算。SWE-2 风格奖励聚合与成本估算仅用标准库直接可运行。 import math from dataclasses import dataclass dataclass class Verdict: 一次代码改动在 FrontierCode 1.1 三道关卡上的结果。 compile_ok: bool edge_tests_passed: int edge_tests_total: int maintainer_rubric_score: float # 0~1 lint_clean: bool type_check_clean: bool exec_efficiency: float # 0~11 为最优 def reward(v: Verdict) - float: 五路奖励聚合对齐 Cognition 对外披露的奖励维度。 base 0.0 if v.compile_ok: base 0.25 base 0.25 * (v.edge_tests_passed / max(v.edge_tests_total, 1)) base 0.20 * v.maintainer_rubric_score if v.lint_clean: base 0.10 if v.type_check_clean: base 0.10 base 0.10 * v.exec_efficiency return round(base, 4) def pareto_cost(frontier_score: float, frontier_ref: float, ref_cost_usd: float, savings: float) - float: 按帕累托外推估算同分数下的单任务成本。 ratio frontier_score / max(frontier_ref, 1e-9) base ref_cost_usd * ratio return round(base * (1 - savings), 2) if __name__ __main__: v Verdict( compile_okTrue, edge_tests_passed9, edge_tests_total10, maintainer_rubric_score0.95, lint_cleanTrue, type_check_cleanTrue, exec_efficiency0.9, ) r reward(v) print(reward:, r) # SWE-2 对标 Fable 5.1得分 50.0 vs 50.9成本降 70% cost pareto_cost(50.0, 50.9, 5.0, 0.70) print(estimated cost per task: $, cost)这段代码直接保存为文件即可运行。它把五路奖励的权重结构显式化方便你替换成自己的门禁。把 reward 函数接进你的 CI 管道就能给每次改动打分。把 pareto_cost 接进计费模块就能量化模型切换的收益。以 SWE-2 为参照系回看 2026编程层的竞争焦点已经转移。不再是谁的模型更聪明而是谁能用更低成本把活干完。Devin Voice 把真人拉回循环补上了最后一块交互拼图。SWE-2 与 Devin Voice 的组合正在重新定义编程工具的交付形态。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门