拓冰建站拓冰建站
首页 / 资讯中心 / 正文

换个环境就“开挂“?DeepSeek V4 模型没变但跑分飙到 99!

换个环境就开挂DeepSeek V4 模型没变但跑分飙到 992026 年 8 月 14 日和 15 日AI 社区有两个非常有意思的信息DeepSeek v4 Pro在同一个接口被曝出三种截然不同的思考风格同一任务分数可以从 91 跳到 99紧接着紧接着轻量级的 V4 Flash 又被测出超进化在物理仿真任务上进了一梯队。两件事表面独立最后指向同一个判断DeepSeek V4 的能力上限不是写死在权重里的是思考强度 × 环境对齐配出来的。这篇文章把来龙去脉讲清楚给开发者一个能直接落地的结论。TL;DR同一个 deepseek-v4-pro API换 IP、重开会话会出现三种思考链风格“Let me…”、“The user wants me…”、“we”社区一度怀疑官方在背后路由三个模型。对照实验显示V4 Pro 在 DSH Minimal2 个工具下拿到 99/96在 DSH Standard25 个工具下只有 91。工具越少分越高。原因指向 RL 训练环境对齐官方 8/10 的 commit 写着 “align minimal agent with RL composition”Minimal 模式复刻的是 V4 Pro 强化学习训练时的原始环境。社区插件 dsh-anchored-standard 用首轮模拟 Minimal、随后放开全部工具的两阶段策略连续跑出 98/99。8 月 15 日贴吧传出 V4 Flash 也可超进化内测插件按任务难度动态分配思考强度后Flash 在台风模拟、混沌摆等物理仿真任务上达到第一梯队。阶段结论V4 家族的表现由思考强度 × 环境对齐共同决定不是模型单方面的事。DeepSeek V4 Pro 的三种思考风格是怎么回事8 月 15 日凌晨博主 Max For AI 在 X 上爆料社区发现同样调用 deepseek-v4-pro换 IP、重新开会话后模型会出现三种截然不同的思维链指纹。这是社区观测到的原始现象官方至今没有承认任何多模型路由机制。三种指纹各有特征大量出现“Let me…”的版本能力接近此前的 V4 Pro Preview常以“The user wants me…”开头的版本风格更接近 V4 Flash大量使用“we”的版本能力明显更强被社区称作神版 V4 Pro且多在 Harness 的 Minimal 模式下出现。诡异的地方在于同一个会话一旦命中某种风格后面就基本稳定。你抽到的是中规中矩版还是神版像开盲盒。这个现象直接催生了官方在 API 后面路由了三个模型的猜测。后面挖源码、跑实验这个猜测基本被否定了下文会说清楚。思维链指纹为什么能当识别依据思维链指纹指的是模型在思考链CoT里流露出的习惯性措辞句式开头、口吻、用词偏好。它稳定、可统计、难以伪装像笔迹一样。大模型的思考模式本身不神秘。模型在给正式答案前会先生成一段内部推理文字拆问题、验假设、排步骤最后才输出结论。这段文字通过reasoning_content字段返回开发者可以选择展示或丢弃。问题在于措辞习惯是训练出来的。不同模型、不同 RL 配方会养成不同的句式偏好有的爱用 “let me”第一人称、试探性有的爱用 “we”集体视角、工程化。这些偏好足够稳定于是成了识别这段思考出自谁的指纹。7 月就有人用同样的逻辑抓过异常Stage1st 论坛有用户测某个模型时发现它的思维链里自称是 Claude。指纹既能证明身份也能拆穿伪装。为什么工具越少V4 Pro 分数反而越高GitHub 用户 xiaobright 在 8 月 14 日发布对照实验同一台 WSL、同一档 Think Max 下同一个 V4 Pro 跑同一个冻结任务预设工具面分数DSH Standard约 25 个工具skills、subagent、web search 等91DSH PTCStandard 的 Code Mode 变体单一 run_code 入口92DSH Minimal只有 2 个工具bash 编辑器99 / 96工具最全的 Standard 输给了只有两个工具的 Minimal差 7-8 分。轨迹统计更直观Standard 模式下思考链里 “let me” 出现 208 次得分 91Minimal 模式下 “let me” 几乎绝迹“we” 出现 165-179 次得分 99/96。思考风格跟着环境变分数也跟着变。原因藏在官方源码里。8 月 10 日也就是 V4 Pro 正式版发布前三天DeepSeek Harness 仓库有一条 commitfix(preset): align minimal agent with RL composition让 Minimal Agent 与强化学习训练时的 Agent 组合对齐。仓库里的快照测试命名更直白“sends the exact RL prompt and schemas”。也就是说Minimal 模式不是 Standard 的阉割版它复刻的是 V4 Pro 在 RL 训练阶段真实接触的交互环境极简 system prompt、两个训练对齐工具、训练时的上下文压缩策略。模型在训练时记住的不只是任务方法还有这套环境长什么样。运行环境对上了能力就发挥出来对不上就打折。这就是过拟合训练脚手架也叫训练分布对齐。那个 99 分插件是怎么做到的知道问题出在环境对齐解法就藏在问题里。xiaobright 写了社区插件 dsh-anchored-standard思路分两步第一次请求模拟 Minimal 环境用完整的 RL 对齐 system prompt只暴露 2 个工具剥掉自动注入的上下文第一次工具调用之后立刻恢复 Standard 的 25 个工具正常干活。“先锚定、后晋升”利用的是模型的启动惯性用最熟悉的姿态开局再放开手脚。插件连续跑出 98 / 99进了 Fable 598、Opus 597、GPT-5.6-sol99/98所在的顶端分数带。作者原话是“DeepSeek V4 Pro 对 API 可见的工具目录有强烈的条件依赖。”换句话说决定表现的未必是模型的能力上限而是它第一眼看到的 system prompt、工具 schema 和 Agent 脚手架。这也是给开发者最实用的一条提醒换框架之前先想想你的环境跟模型训练时的环境差多远。V4 Flash 的超进化又是怎么回事8 月 15 日百度贴吧一条帖子传开《deepseekv4 flash疑似超进化》。楼主贴出一个 B 站直播间deepseek v4核弹转述了 DeepSeek Harness 内测用户的做法他的插件能让 Flash 合理地调用思考强度该正常思考的正常思考该雷霆思考的雷霆思考。他的观点是 let me 思考是对的只是没有合理运用。**群里实测台风模拟、混沌摆都达到第一梯队水准台风模拟尤其强。**群友的评价是效果有点夸张。这里的关键词是let me 思考也就是思考模式Thinking Mode。V4 有三档推理强度Non-think 直出、Think High、Think Max。思考越深token 烧得越多。内测用户的直觉是强度不该一刀切应该按任务复杂度动态分配简单问题直出复杂任务拉满。Flash 拉满思考后这个便宜轻量的模型在硬核物理仿真上越级打进了第一梯队。对照组实验里有个细节值得注意V4 Flash 切换环境时成绩纹丝不动92-95 区间不像 Pro 那样大起大落。Flash 对接口依赖弱、泛化稳Pro 依赖强、上限高。一个靠吃强度释放实力一个靠环境对齐释放实力路数正好相反。模型的真实能力是固定的吗把两个现场放在一起看Pro 的变量是环境Flash 的变量是思考强度。一个是挑环境一个是吃强度表面是两件事实际上是同一枚硬币的两面。DeepSeek V4 家族的能力上限不是写死在权重里的而是思考强度 × 环境对齐配置出来的。这也能解释let me 思考插件为什么值得关注它从实践侧验证了思考强度是资源、需要调度这个理念。学术界那篇《Let Me Think!》的结论一条长思考链的收益可以指数级超过多条短思考正好互证深度思考有价值但值多少取决于用在什么任务上。我个人的看法这件事最值得玩味的不是DeepSeek 藏了什么而是整个行业开始意识到模型的成绩单从来不是模型一个人的事。基准分数、榜单排名都得问一句在什么环境、什么强度下测的开发者可以从中学到什么三件事都跟实际工作直接相关选 Harness 别只看模型榜单。同一模型在不同框架下能差 8 分、token 消耗差 3 倍。先拿自己的真实任务在两个框架里各跑一遍再决定用哪个。把reasoning_content当诊断数据用。发现思考链风格突变、句式异常可能不是玄学而是环境、路由或版本变了。思考强度也别一把梭哈 Think Max按任务调度更省钱。官方 benchmark 要打折看。官方分数是在自家 Harness、自家环境上测的自家模型。生产环境请以真实任务复测为准。对了还有个背景DeepSeek 8 月 6 日预告 API 涨价8 月 16 日 16:00UTC起执行峰谷定价高峰时段价格是低谷的 2 倍。发布、疑云、超进化、调价全挤在同一周这届 AI 圈的瓜密度确实高。截至本文写作官方还没回应 Flash 超进化的插件台风模拟第一梯队的基准也还没有公开复现。第二现场的调查刚开始后续有更新我会补一篇文章。FAQQDeepSeek V4 Pro 真的有三种模型吗A目前没有证据。社区最可信的解释是API 服务环境差异 是否命中 RL 训练分布叠加的结果同一模型在不同 Harness 模式下表现出不同的行为姿态。官方已开源 V4 Pro 0813 权重。Q为什么工具越少V4 Pro 分数越高A因为 Minimal 模式复刻了模型 RL 训练时的原始环境极简 prompt 两个训练对齐工具。模型对训练环境过拟合环境对上就发挥好对不上就打折。DSH Minimal2 工具99 分DSH Standard25 工具91 分。QV4 Flash 的超进化是真的吗A来自贴吧转述的 Harness 内测用户实测用插件动态分配思考强度简单任务直出、复杂任务 Think Max后Flash 在台风模拟、混沌摆上达到第一梯队。插件尚未开源基准未公开复现建议持保留态度看待。Q思维链reasoning_content可以关掉吗A可以。DeepSeek V4 支持三档思考强度Non-think / Think High / Think MaxNon-think 即直出模式不返回推理痕迹也省 token。参考来源贴吧帖子《deepseekv4 flash疑似超进化》2026-08-15。X MaxForAI 系列推文思维链指纹爆料2026-08-15。xiaobright《DeepSeek V4 Pro 正式版harness 对照分析》2026-08-14github.com/xiaobright/modeltest。dsh-anchored-standard 插件仓库github.com/xiaobright/dsh-anchored-standard。DeepSeek Harness 官方源码commit 47f9438“fix(preset): align minimal agent with RL composition”2026-08-10。BlockBeats、快科技等公开报道DeepSeek V4 发布与 API 定价调整2026-08。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门