DeepSeek 今天三件事:V4.1 Flash 发布、V4 Pro 被静默路由、科创板 IPO 尽调
DeepSeek 今天三件事V4.1 Flash 发布、V4 Pro 被静默路由、科创板 IPO 尽调TL;DR 速览模型 ID 不变行为变了V4 Pro 请求被全量路由到 V4.1 Flash计费跟着换按 V4.1 Flash 单价结算多数场景更便宜最大风险调优过的 prompt 可能悄悄失效你收不到通知IPO 线中信证券已入尽调最快明年二季度申报9 月 10 日DeepSeek 一口气放出了三条消息。单看每条都是独立新闻但连起来看它们指向同一个问题当平台方替你决定该用哪个模型时作为开发者你还能控制什么。先把事实摆清楚。一、今天同时发生的三件事第一件V4.1 Flash 正式发布。官方公告的说法是V4.1 Flash 采用新的模型结构原生支持多模态能力在性能、响应速度、计算费用、总处理用时四项核心指标上全面超越上一代 V4 Pro。第二件价格同步调整。自 9 月 10 日 12:00 起Flash 系列调用价格大幅下调。空闲时段输入缓存命中降至0.02 元/百万 token降幅 60%、输入缓存未命中降至1 元、输出降至4 元。高峰时段价格为空闲时段的两倍这条规则不变。第三件也是最容易被当成优惠忽略的一件V4 Pro 的请求会被全量路由到 V4.1 Flash。官方原文的意思是在 V4.1 Flash 正式上线之后、V4.1 Pro 上线之前所有指向 V4 Pro 的请求将被全部路由至 V4.1 Flash并按 V4.1 Flash 的单价计费。换句话说——你代码里的模型名一个字没改但实际回答你的模型已经换了账单也换了。二、静默路由在工程上意味着什么先把概念说清楚。所谓路由是平台在你的请求和真实推理服务之间加了一层转发你传model: deepseek-v4-pro平台既不报错、也不提示直接转给 V4.1 Flash 去执行。这和我们平时理解的模型下线/迁移有本质区别情况平台行为你要做什么模型下线请求报错必须改代码明确、可感知改完就好版本升级通常保留旧版本一段时间有过渡期可以灰度静默路由请求正常模型已换你可能完全不知道风险就在最后一格。你的服务不会报错、监控不会告警、日志里模型名还是那个熟悉的字符串——但输出风格、能力边界、甚至 token 消耗结构都可能变了。已经有开发者在社区表达了明确反对今天开源中国的讨论里用户的反馈是拒绝核心诉求很简单换模型可以但请让我知情也请让我选择。三、先算账路由之后你的成本怎么变按官方公布的 Flash 新价表空闲时段三档单价是计费项Flash 新价空闲时段输入·缓存命中0.02 元 / 百万 token输入·缓存未命中1 元 / 百万 token输出4 元 / 百万 token我按三个典型调用结构算一遍假设都是空闲时段、100 万 token 规模场景 A · 文档处理类输入为主、缓存命中率低输入 90 万未命中 输出 10 万0.9 × 1 0.1 × 4 1.3 元场景 B · 客服机器人缓存命中率高输入 100 万其中 80% 命中缓存输出 30 万 输入0.8 × 0.02 0.2 × 1 0.216输出0.3 × 4 1.2合计1.416 元场景 C · 批量生成输出为主输入 10 万 输出 100 万0.1 × 1 1 × 4 4.1 元这三档算下来能看出一个规律路由到 Flash 之后输入密集、缓存命中率高的应用省钱最明显输出密集的应用受益最小。因为 Flash 的降价主要砸在输入侧尤其是缓存命中那一档——0.02 元/百万 token 基本等于把重复上下文的价格抹平了。但请注意这套账只算了钱没算换模型的隐性成本。而后者往往更贵。四、比成本更该担心的你的应用有没有被换模型伤到我把可能受影响的场景按严重程度排了一下第一类prompt 调优过的应用风险最高。如果你为了让 V4 Pro 稳定输出某个格式反复调过 system prompt、few-shot 示例、温度参数——这些调优是针对特定模型做的。换模型后同一套 prompt 的表现可能变好也可能变差而你没有任何机制会告诉你它变差了。第二类有严格输出契约的应用。结构化抽取、JSON 输出、固定模板生成——这类应用对格式稳定性要求极高。新模型能力更强不等于更听话格式漂移是最常见的翻车点。第三类做评测对比的应用。如果你的产品里有模型横评、基准测试、A/B 对比路由会让你的对比数据失真——你以为是V4 Pro vs 某模型实际跑的是V4.1 Flash vs 某模型。第四类多模态调用。V4.1 Flash 原生支持多模态这对新增场景是好事但如果你的代码从来没传过图片多模态能力对你没影响反而可能带来行为差异。五、怎么验证你实际调用的是哪个模型这件事不能靠猜得让它自己说出来。多数兼容 OpenAI 协议的接口响应体里会带回实际执行推理的模型标识。所以你可以写一段很小的探针定期跑一遍importos,jsonfromopenaiimportOpenAI clientOpenAI(api_keyos.environ[DEEPSEEK_API_KEY],base_urlhttps://api.deepseek.com,)# 用固定 prompt 做探针同一批输入比对模型标识与输出PROBE把下面这句话改写成一句话摘要只输出摘要本身\n测试文本*20respclient.chat.completions.create(modeldeepseek-v4-pro,# 你代码里写的模型名messages[{role:user,content:PROBE}],temperature0,)print(你请求的模型:,deepseek-v4-pro)print(实际返回的模型:,resp.model)# ← 关键字段print(本次用量:,resp.usage)# ← 核对计费结构print(输出:,resp.choices[0].message.content[:80])这段代码的作用不是证明被路由了而是把它变成可观测的把resp.model和resp.usage打进你的日志跑一周你就能看到模型标识有没有变、缓存命中的比例是多少、单次调用的成本结构是什么样的。更进一步的做法是建一个回归测试集挑 30-50 条你业务里最典型的输入固定 temperature0每次平台发公告后跑一遍人工抽查输出质量。这套东西不复杂但它是唯一能在静默变更面前保护你的机制——平台不会通知你只能靠你自己盯。六、IPO 这条线和开发者有什么关系同一天有消息称 DeepSeek 已委托中信证券筹备科创板 IPO中信证券已接洽并进入尽职调查阶段但双方尚未签订正式的上市辅导协议。按流程即便最快速度也要到明年二季度才能申报。资本侧的背景是今年 4 月 DeepSeek 首次对外开放融资6 月完成首轮交割募资超 500 亿元投后估值超 3500 亿元。出资方里创始人梁文锋个人出资约 200 亿元腾讯 100 亿元宁德时代体系 50 亿元京东、网易、IDG 资本等也在列。这跟开发者有什么关系关系在于定价逻辑的动机。一家准备上市的模型公司需要同时讲两个故事技术领先V4.1 Flash 全面超越 V4 Pro 就是这句话的技术注脚和收入规模API 调用量、开发者数量。而这两个故事是有张力的——降价能换调用量但会压收入涨价能撑收入但会赶走开发者。所以我的判断是未来一段时间DeepSeek 的定价会更频繁地调整而且方向可能来回摆。8 月刚涨过、9 月就降这不是反复无常这是在抢份额和做收入之间找平衡点。对开发者的实际含义是不要把成本模型建立在某一次价格上要建立在价格会变这个前提上。七、我的建议三件事今天就该做第一把模型标识和用量写进日志。前面那段探针代码20 行就能落地。它的价值不是今天是下次静默变更时你第一个知道。第二给核心链路做一次回归验证。不用大动干戈挑 30-50 条典型输入跑一遍看输出有没有漂移。特别是结构化输出和格式敏感的场景优先验证。第三在架构上把模型变成配置项而不是硬编码。如果你现在的模型名散落在十几个文件里那你被路由时连换回去这个选项都没有。把模型选择收敛到一个配置中心是应对平台定价和模型策略波动最便宜的保险。说到底模型是别人的调用结构是你的。我的判断今天这三条消息里真正值得开发者警惕的不是价格是静默路由这个动作本身。它揭示了一个正在成型的行业惯例平台方保留随时替换你所用模型的权利而且不承诺通知。这在商业上可以理解——它需要快速把用户迁移到成本更优的新模型上——但对把生产系统建在上面的团队来说这是一条必须自己兜底的风险。价格方面Flash 的新价表对输入密集、缓存命中率高的应用是实打实的利好0.02 元/百万 token 的缓存命中价基本等于把重复上下文变成了免费资源。这次降价的正确用法不是省了多少而是现在可以做什么以前做不起的事——比如把更长的上下文、更完整的知识库塞进 prompt靠缓存命中把成本压住。至于 IPO我的看法是它会让 DeepSeek 的价格策略更不可预测而不是更稳定。一家在冲上市的公司需要在收入和份额之间反复找平衡开发者能做的只有一件事——把成本模型建起来、把模型选择做成配置、把变更监控做成习惯。平台怎么变你控制不了你的架构有多抗变你控制得了。