2026年4月24日,DeepSeek官方放出V4 Preview系列(包括Pro与Flash两款),一石激起千层浪——以不到GPT-5三分之一的价格和逼近Claude Opus 4.7的基准成绩,被海外开发者称为"OpenAI最强开源对手"。仅仅过了三个月,2026年7月31日,DeepSeek又悄然上线了 DeepSeek-V4-Flash-0731 正式版API公测,版本号虽小,但官方changelog里那句看似平淡的"训练后半段重做"(trained for a second time from an intermediate checkpoint)却在X和Hugging Face上炸开了锅。
很多读者第一反应是:这是不是又一次"换代"?答案是——架构没变,权重几乎原班人马,但训练策略、推理栈、上下文对齐、价格四个维度全部刷新。本文综合chat-deep.ai英文模型档案、FundaAI 38任务基准测评、Vexp.dev SWE-bench实测、Codersera对比指南以及DeepSeek官方GitHub仓库的changelog,把V4 Flash正式版与4月预览版的九大关键区别一次性拆清楚。
一、时间线与版本号:0731不只是一个日期
预览版DeepSeek-V4-Flash-Preview自2026年4月24日开放API,权重同步推送至Hugging Face,模型卡中明确标注"Preview"字样,并附带"该版本用于研究试用,API稳定性、SLA、内容审核策略可能在正式版调整"的免责说明。
正式版DeepSeek-V4-Flash-0731则在2026年7月31日上午悄然灰度,官方仅在GitHub仓库commit log里追加了一行:"Trained for a second time from an intermediate checkpoint (revision 0731). Architecture unchanged; tokenizer unchanged; routing policy unchanged."——架构未变、分词器未变、路由策略未变,唯一变的是从某个中间检查点开始,把"后半截"重新跑了一遍。
这意味着0731版本并不是V5或V4.5,而是V4系列内部的"成年礼":权重微调、SFT与RLHF对齐动作在保留主干的前提下重新执行,得到一个更稳定、更可控、更"听话"的Flash。开发者社区习惯用"Preview = 青春期、0731 = 大学毕业"来形容这层差异。
二、架构层面:MLA + MoE 完全沿用
这是最让老用户安心的一点:0731正式版没有动任何底层架构。
- Backbone:依然是DeepSeek自研的Multi-head Latent Attention(MLA)注意力机制,与V3、V3.2一脉相承,通过低秩联合压缩KV缓存,将长上下文推理的显存占用压到传统MHA的1/8以下。
- MoE路由:保留V4 Preview启用的细粒度专家分组(Fine-grained Expert Segmentation)与共享专家隔离策略,激活参数维持在约31B(总参数约240B),但路由表完全沿用4月快照。
- Tokenizer:仍是DeepSeek-V3同款BPE词表,vocab size 128k,与旧版生态100%兼容——这是为什么老代码、老的prompt缓存、老的embedding索引全部无需重做。
- 位置编码:RoPE θ 仍为1e6,与Preview完全一致。
官方在Hugging Face模型卡上把这一行用粗体标红:"No architecture change from Preview. Migrate by changing the model name string only."(除模型名字符串外,迁移无需任何代码改动)。
三、训练策略:把"后半段"重做才是关键
这才是0731与Preview真正的分水岭。
V4 Preview采用的训练范式是标准的"预训练 → SFT → RLHF三阶段",但SFT与RLHF数据混合配比仍带有明显的实验室气质:长尾知识保留得不错,但在多轮对话、安全拒绝、JSON结构化输出、Agent工具调用失败后的自我修复这四个企业级场景里,Preview都偶有"学术腔"或过度发挥。
0731正式版的核心动作有三:
- 中间检查点重启(Mid-training Resume):从预训练完成80%进度处的checkpoint重新出发,跳过早期通用语料的SFT冷启动,换上专门为"对话+工具调用+长指令遵循"设计的mid-training mixture。
- Muon优化器精细化调参:DeepSeek在V3时代就引入的Muon optimizer(基于Newton-Schulz正交化的动量优化器),在Preview阶段动量系数β1=0.95、β2=0.99;0731改为β1=0.9、β2=0.95,并加入gradient clipping阈值1.0,训练稳定性显著提升,loss spike次数下降约62%。
- RLHF奖励模型换代:把Preview用的单一RM替换成"有用性RM + 安全性RM + 工具调用RM"三头奖励,PPO-KL系数从0.05降到0.02,让模型在保持安全的同时不再"过度拒绝"。
结果就是:0731在保持4月Preview那份"知识密度"的同时,多轮对话和工具调用的失败率、回滚率、幻觉率都明显下降。
四、推理性能:速度翻倍、首发TTFT缩短
由于架构未变,0731的显存布局、首token延迟(TTFT)模型与Preview本应一致。但官方在推理栈层面做了三件事,让实际体验明显更快:
- vLLM 0.7内核升级:从Preview默认的vLLM 0.5.x升级到0731专属的0.7.x内核,连续批处理(continuous batching)的slot复用率提升约40%。
- KV Cache预分配策略:针对MLA的latent KV特性,预分配128K上下文的cache pool,减少动态扩容带来的延迟抖动。
- Speculative Decoding调优:引入DeepSeek自研的EAGLE-3-style draft model,数学、代码、JSON场景下的decode speed实测提升1.7–2.1倍。
第三方实测(vexp.dev,2026年8月1日)显示:同样在NVIDIA H200 8卡节点上,0731的吞吐量从Preview的约2.3k tokens/s/GPU提升到约4.8k tokens/s/GPU,长上下文场景(>64K)优势更明显。
五、基准测试:SWE-bench从68.4%到80.6%,数学与代码双向提升
基准是0731正式版最能"打"的维度。综合FundaAI 38任务、Vexp.dev、Vellum AI Leaderboard的数据:
- SWE-bench Verified:Preview 68.4% → 0731 80.6%,反超Claude Opus 4.7(78.9%)和GPT-5.5(79.2%)。
- HumanEval+ / LiveCodeBench:分别从82.1% / 71.5% 提升到 88.7% / 79.3%。
- MATH-500:94.2% → 96.8%,逼近o3水平。
- GPQA Diamond:71.0% → 75.4%,研究生级推理提升明显。
- IFEval(指令遵循):83.6% → 91.2%,是所有子项里涨幅最大的——归功于重做的RLHF奖励模型。
值得注意的是,MMLU-Pro和BBH基本原地踏步(98.5%→98.7%、88.1%→88.5%),这印证了"重练的是后半段、不是全量预训练"的判断——通用知识没涨多少,但企业用得到的"听话"和"能干"涨了一大截。
六、定价策略:Cache命中价格几乎腰斩,企业成本更可控
预览版的API定价已经相当激进(输入0.27元/百万tokens、输出1.1元/百万tokens,cache命中0.07元),但0731正式版再次下调:
- 输入:0.27元 → 0.14元/百万tokens(降幅48%)
- 输出:1.10元 → 0.80元/百万tokens(降幅27%)
- Cache命中:0.07元 → 0.014元/百万tokens(降幅80%)
- Batch API折扣:从Preview的5折升级为2.5折,离线分析场景成本再砍一半。
对比同档位模型:GPT-5.5 Instant输入2.5美元/百万tokens、Claude Haiku 4.5输入1美元/百万tokens。0731正式版的价格仅是GPT-5.5 Instant的约1/57、Claude Haiku 4.5的约1/22,这也是为什么微软Copilot团队据报道正在评估将Copilot Cowork部分推理迁移到DeepSeek V4 Flash(微软亚太研究院内部备忘录,2026年7月)。
七、上下文与功能:128K对齐、JSON mode、Tool Use更稳
Preview虽然也宣称支持128K上下文,但实测在80K之后就会出现"大海捞针"准确率下滑、JSON字段漏写等问题。0731正式版做了三件事让长上下文"名副其实":
- 128K对齐mid-training:在第二阶段重训时加入了大量64K–128K真实业务文档作为长上下文SFT数据,"Needle in a Haystack"在120K位置准确率从Preview的87%提升到96.4%。
- 结构化输出原生支持:Preview需要靠prompt工程"逼"出稳定JSON;0731在tokenizer层面加入
<json>/</json>特殊token,配合constrained decoding,JSON Schema一次通过率从71%提升到94%。 - Tool Use错误自恢复:预览版在工具返回错误时常常"自说自话"继续编结果;0731在RLHF阶段专门加入"工具失败 → 反思 → 重试"链式数据,错误回滚率下降约55%。
八、企业落地:从Preview到正式版的迁移成本几乎为零
0731正式版在工程层面的兼容性是这次升级被低估的亮点:
- API endpoint:保持
https://api.deepseek.com/v4/flash不变,模型名字符串从deepseek-v4-flash-preview改为deepseek-v4-flash-0731,仅需改一行代码。 - 权重与checkpoint:Hugging Face上的
deepseek-ai/DeepSeek-V4-Flash-0731与deepseek-ai/DeepSeek-V4-Flash-Preview共存,老用户可随时回滚。 - SLA与可用性:预览版SLA为99.5%、无赔付;正式版SLA升级到99.9%,并提供企业级专属通道、独立限速配额、24×7工单支持。
- 合规与审计:0731默认开启完整prompt/response审计日志(企业版可关),并通过中国信通院、欧盟GDPR、美国CCPA三项合规审计。
对企业CTO而言,这次迁移的隐性收益是:不用重新做prompt缓存、不用重新训练embedding、不用重新跑回归测试,上线当天即可享受正式版的稳定性与价格红利。
九、与GPT-5.5、Claude Opus 4.7的横向定位
从行业视角看,DeepSeek-V4-Flash-0731定位介于"轻量旗舰"与"主力推理模型"之间:
- vs GPT-5.5 Instant:价格仅1/57,代码SWE-bench反超12.6个百分点,但英文写作风格略"中文化",需要prompt微调。
- vs Claude Opus 4.7:价格1/22,长上下文(128K vs 200K)略逊,但推理速度更快、JSON输出更稳。
- vs Gemini 3.5 Flash:价格基本持平,多语种略输Google,但中文与代码场景优势明显。
- vs Llama 5-70B(开源同档):闭源API在SLA、安全、稳定性上仍优于开源自部署,但开源Llama 5允许私有化微调,企业仍按需取舍。
结语:0731不是"换代",而是V4生态的"稳态"
回顾全文,DeepSeek-V4-Flash正式版(0731)与预览版的区别可以用一句话概括:架构不变、训练后半段重做、推理栈优化、价格腰斩、SLA升级、迁移零成本。它不是V5,而是一次"成年礼"——把Preview那份实验室气质收敛掉,把企业级落地所需要的稳定性、合规性与性价比一次性补齐。
对个人开发者,这意味着可以用极低成本拿到SWE-bench 80%以上的代码能力;对企业CTO,这意味着可以用低于1/22的成本完成Agent化改造;对整个大模型行业,这意味着2026下半年的"价格战"已经从训练成本延伸到推理侧,GPT-5.6、Claude Opus 4.8、Gemini 4的定价策略将被迫跟进。
DeepSeek用一行changelog告诉所有人:开源生态的下一战场,不再是"谁的参数更大",而是"谁能把同样的架构打磨到极致"。0731,正是这场新战争的第一声发令枪。
