DeepSeek-V4正式版终于上线,但它真正想说的不是“我更强了“

发布时间:2026/8/1 13:06:28
DeepSeek-V4正式版终于上线,但它真正想说的不是“我更强了“ 7 月 31 日DeepSeek-V4-Flash 正式版 API 上线进入公测。如果你只看标题可能觉得哦又一个版本更新。但这次更新里有一句话比分数重要得多。DeepSeek 自己写的是正在将竞争重点从传统对话和代码补全进一步转向 Coding Agent、工具调用和自动化执行。这句话翻译过来就是模型不再满足于陪你聊天、帮你补全代码了。它想自己上手干活。还记得半年前那款爆款游戏吗我们之前拆解过一款叫 AgenTank 的 AI 游戏。它的玩法很反直觉你不是操作坦克你是训练一个 AI 坦克去打排位。你写提示词、看回放、改策略让 AI 越来越强。当时我们提炼过一个公式AI 爆款 经典玩法 × AI Agent 化 × 极低成本 × 竞技社交 × 玩家自带算力那篇文章里最重要的一句话是不要做 AI 陪玩做 AI 被玩——核心玩法是玩家训练 AI不是 AI 陪玩家。当时那只是对一个游戏的观察。现在回过头看整个大模型行业正在走同一条路从AI 陪你走向AI 替你干。DeepSeek-V4-Flash 正式版就是这句判断的最新证据。这次更新到底变了什么直接看官方数据。下面这张表来自 DeepSeek 官方 API 更新日志的完整对比同时加入了 GLM-5.2 和 Claude Opus-4.8 作参照基准测试Flash 0731 正式版Flash PreviewPro PreviewGLM-5.2Opus-4.8测的是什么Terminal Bench 2.182.761.872.181.085.0终端环境实际操作NL2Repo54.239.438.548.969.7代码仓库理解Cybergym76.738.752.7-83.1网络安全 Agent 任务DeepSWE54.47.312.846.258.0软件工程修复Toolathlon Verified70.349.755.959.976.2多工具协同调用Agents Last Exam25.215.816.523.825.7长程 Agent 推理AutomationBench (Public)25.110.812.812.927.2自动化执行DSBench-FullStack68.737.041.861.871.6全栈数据科学任务DSBench-Hard59.625.831.154.571.7高难度数据科学任务数据来源DeepSeek 官方 API 更新日志GLM-5.2 部分分数经 Hugging Face 模型卡交叉核对。几个一眼能看出的结论Flash 正式版 9 项全部超过预览版平均涨幅巨大。比如 DeepSWE 从 7.3 涨到 54.4Cybergym 从 38.7 涨到 76.7——这些不是小数点后波动是能力层面的质变。Pro Preview preview 也被正式版 Flash 反超。除了 NL2Repo 基本持平其余 8 项里 Flash 正式版都超过了 Pro 预览版。这说明后训练带来的 Agent 能力提升甚至能让轻量版反超自家旗舰预览版。和 GLM-5.2、Opus-4.8 比Flash 正式版不是每项都第一但差距已经很小。Terminal Bench 2.1 上Flash 82.7 对 GLM-5.2 的 81.0、Opus-4.8 的 85.0基本在同一梯队。DeepSWE、Toolathlon 上 Opus-4.8 仍领先但 Flash 的价格可能只有它的几分之一。Kimi K3 没在这张表里但顺手比一下Kimi K3 在 Terminal Bench 2.1 上拿了88.3DeepSWE 上拿了67.5两项都高于 Flash 正式版。K3 是 2.8 万亿参数的旗舰Flash 是 2840 亿参数的轻量版本就不是一个定位但国产模型在 Agent 赛道上确实都在往上拱。⚠️一个需要注意的口径问题Opus-4.8 的 Terminal Bench 2.1 分数这张图里是85.0但 llm-stats 等第三方引用的 Anthropic 官方口径是74.6%。两个数字差距不小大概率是评估 harness/设置不同导致的。读 benchmark 时同一个测试名字下可能藏着不同的跑法这是常见坑。模型结构没变参数没变只做了后训练。也就是说DeepSeek 没靠堆参数变强而是靠重新训练把 Agent 能力逼了出来。后训练post-training的红利比很多人以为的更大。几个关键点模型结构没变参数没变只做了后训练。也就是说DeepSeek 没靠堆参数变强而是靠重新训练把 Agent 能力逼了出来。原生支持 Responses API并针对 Codex 做了适配。这意味着它能直接接入智能体的工具调用框架不是一个裸模型。V4-Pro 正式版后续发布APP 和 Web 端模型暂时没动。普通聊天用户暂时无感但开发者的工作流已经可以用了。最值得注意的是官方那句原话——竞争重点的转移。这不是功能更新这是战略转向。会聊天和能干活是两代模型把两种模型放在一起区别一目了然维度会聊天的模型能干活的 Agent 模型核心能力生成文本、补全代码调用工具、执行任务、跑通流程交互方式一问一答多步推理 自主决策衡量标准文采、逻辑、知识量任务完成率、工具调用准确率典型场景写文章、答题、翻译自动化测试、数据清洗、部署上线失败代价答错了重问调错了可能删库所以需要强约束过去的模型你问它怎么写一个排序函数它给你代码。现在的 Agent 模型你告诉它把我这个项目从 PC 端移植到移动端它自己读代码库、改文件、跑测试、修 bug。从教你做到替你做这是本质区别。DeepSeek 这次的分数Terminal Bench 82.7、Toolathlon 70.3测的恰恰是后者——在真实环境里它能不能真的把事办成。这不是 DeepSeek 一家的事千万别以为这只是 DeepSeek 的动作。把视线拉宽一点OpenAIGPT 系列全力推 Operator、Codex让模型直接操作电脑、跑代码AnthropicClaude 的 Computer Use、MCP 协议主打模型接入真实工具链GoogleGemini 深度绑定 Workspace让 Agent 在文档、表格、邮件里干活国内智谱 GLM-5.2 主打工程级 AgentKimi K3 也把软件工程列为核心场景全行业在同一个方向上加速让模型从大脑变成手。DeepSeek 这次的转向只是把这个趋势又往前推了一步。对开发者来说这意味着什么如果你在用 AI 写代码或者正在做 AI 相关的产品这次更新释放的信号很明确写代码的门槛还会继续往下掉定义任务的能力会越来越值钱。以前你的竞争力是我代码写得好。以后你的竞争力变成我能把一个模糊的业务目标拆解成 AI Agent 能稳定执行的任务链。具体到 DeepSeek-V4-Flash 正式版如果你是做自动化测试、DevOps、数据管道的值得真的去测一轮——官方说 Terminal Bench 82.7但文章也提醒了真正需要关注的是它在真实项目中能否稳定完成任务、正确调用工具、减少无效重试。分数只是门票真实项目里的稳定性才是决赛。V4-Pro 正式版还没来如果你对推理深度要求高可以再等等。最后半年前我们写 AgenTank 的时候说AI Agent 化会是一个真实存在的品类。当时那只是对一个游戏的判断。现在 DeepSeek 用一次正式版更新告诉我们模型厂商自己也在把船头调向同一个方向。从会聊天到能干活不是一句口号。Terminal Bench 82.7 是Toolathlon 70.3 是原生支持 Responses API 也是。当模型开始自己读代码、调工具、跑任务——它不再是你的工具它开始变成你的同事。而这一程国产模型和海外巨头站在同一条起跑线上。V4-Pro 正式版还没来。但 Flash 这一步已经把Agent 化三个字从趋势变成了默认。