DeepSeek V4.1 Flash发布:缓存命中价降至¥0.02/M,V4 Pro将于14日下线

前不久智谱刚认领 Ox Alpha,宣布正式发布GLM-5.3-Flash,价格比 DeepSeek V4 Flash 还要低。9月10日 DeepSeek 就发布 V4.1 Flash,依旧是低调发布,只是邮件通知。

大致意思是 V4.1 Flash 性能、费用、速度、总用时等各项指标上全面超越 V4 Pro。V4.1 Flash 正式上线之后 V4.1 Pro 上线之前,V4 Pro 的请求会全部路由到 V4.1 Flash,按 V4.1 Flash 单价计费。

deepseek-v4.1-flash.png DeepSeek V4.1 Flash发布:缓存命中价降至¥0.02/M,V4 Pro将于14日下线 AI大模型

DeepSeek V4.1 Flash 参数及架构

552B 骨干参数 MoE,1M token 上下文,原生多模态,HF 上的 pipeline 标记是 image-text-to-text。官方口径里的 552B 不含另一个 196B 参数的 Engram 记忆模块,那个是稀疏访问的。

架构细节:

  • Causal Encoder-Decoder(CED)非对称架构:40 层 = 20 层因果编码器 + 20 层解码器

  • prefill 每 token 激活 8B,decode 每 token 激活 16B,输入输出不对称

  • MoE 每层 1 个共享专家 + 384 个路由专家,每 token 激活 6 个

  • 全局 KV Cache 890 bytes/token,约为 V4-Flash 的 1/4,相对 V1 缩小 437 倍;HBM 需求降到 1/4,SSD 需求降到 1/8

  • 预训练用 45T tokens 多模态语料,稀疏注意力在 64K 序列长度训练,训练到 34T tokens 时扩到 1M 上下文

  • 支持 reasoning_effort 整数 1–100,连续调节成本与准确率

项目

V4-Flash

V4-Pro

V4.1-Flash

骨干参数

284B

1.6T

552B

每 token 激活

13B

49B

8B(prefill) / 16B(decode)

上下文

1M

1M

1M

License

MIT

MIT

MIT

V4.1 Flash 总参数比 V4-Flash 大了近一倍,单次激活量反而更小,价格能降下来就是因为这个。

跑分

基准

Opus-5.0

GPT-5.6 Sol

K3

GLM-5.3

V4-Pro

V4.1-Flash

GPQA Diamond

93.4

94.1

92.9

88.1

92.4

90.9

HLE

56.3

44.5

43.5

42.0†

42.7†

36.8(39.1†)

Codeforces

3348

3471

Terminal-Bench 2.1

89.1

88.8

88.3

88.2

87.9

90.6

Terminal-Bench 3.0

43.3

34.4

17.7

28.3

11.8

30.0

DeepSWE v1.1

74.0

73.0

67.5

66.9

62.7

74.2

CyberGym

84.5

80.0

84.5

83.3

88.1

AutomationBench

50.3

45.8

46.7

48.8

43.2

54.8

Agent's Last Exam

28.6

26.7

27.6

28.5

25.7

31.8

HLE w/ tools

63.6

59.8

62.5

60.0

63.9

† 表示 HLE 的纯文本子集。推理档统一用 reasoning_effort=100。

DeepSeek 官方口径是「性能、费用、速度、总用时全面超越 V4 Pro」。分项看,Agentic 和代码类确实领先:DeepSWE 74.2 对 62.7,Terminal-Bench 2.1 90.6 对 87.9,CyberGym 88.1 对 83.3,AutomationBench 54.8 对 43.2。

但纯推理和知识类反过来落后。HLE 36.8 对 42.7,SimpleQA-Verified 42.3 对 55.2,都是 V4.1 Flash 更低。国盛证券复述官方数据,19 项测评里 14 项超过 Pro,约 74%,不是全部。

这些分数全部来自官方自测,没有中立第三方复核。 技术报告自己的表 4 显示,只是换 scaffold,DeepSWE v1.1 的分数就在 65.5 到 74.2 之间波动;官方多 Agent 的结果也标注为 preliminary。Artificial Analysis、LMArena 目前都还没有 V4.1 Flash 的独立评分。

速度

社区实测的生成速度分布很散,160 / 284 / 287 / 300+ / 355–427 / 507 t/s 都有人报,差异来自任务类型、上下文长度、并发、是否含工具调用。官方没有公布统一的吞吐数字。

  • 同一提示词写长文,V4.1 Flash 160 t/s、V4 Pro 50 t/s,约 3 倍;首 token 0.3s 对 1.1s

  • 另一组 355–427 t/s,TTFT 178ms,对比 V4 Pro 63 t/s、766ms

定价

9 月 10 日 12:00 生效,单位人民币 / 百万 tokens。闲时缓存命中 ¥0.02、未命中 ¥1.0、输出 ¥4.0;高峰价翻倍,也就是 ¥0.04 / ¥2.0 / ¥8.0。高峰时段是周一至周五 9:00–12:00、14:00–18:00,其余含周末全天算空闲。

和旧价比,降幅差别很大。缓存命中从 0.05 砍到 0.02,降 60%;未命中 1.5→1.0,降 33%;输出只从 4.5 动到 4.0,降 11%。缓存命中降幅最大,因为 Agent 场景里系统提示词、历史对话、RAG 前缀常占输入 90% 以上,缓存命中率能到 99%+,账单大头就在这一项。

GLM-5.3-Flash 价格对比

GLM-5.3-Flash 国内站标准价是 ¥0.8 输入 / ¥2.8 输出 / ¥0.23 缓存命中,没有峰谷。

口径

DeepSeek 闲时

GLM-5.3-Flash

谁便宜

缓存命中输入

¥0.02

¥0.23

DeepSeek 便宜约 10 倍

未命中输入

¥1.0

¥0.8

GLM 略便宜

输出

¥4.0

¥2.8

GLM 便宜,DeepSeek 贵 43%

峰值全项 ×2

×2

无峰谷

DeepSeek 明显更贵

缓存命中这一项 DeepSeek 便宜约 10 倍,但未命中输入和输出两项都比 GLM 贵,峰值时段还要再翻倍。整体谁更便宜,取决于缓存命中率和调用时段。

白天工时正好压在高峰上,批量任务、后台任务挪到晚间和周末能直接省一半。美洲团队要反过来算,01:00–04:00 UTC 等于美东 21:00–24:00,正是批处理时段,反而落在高峰里。

总用时

总用时由多轮推理、工具调用、文件读写一起决定,单价低的模型未必更快。实测里 V4.1 Flash 做 3D 城市生成器,LLM 推理只花 18 分钟,工具调用花了 83 分钟,总时几乎全被工具调用吃掉。

DeepSeek 把「总用时」和性能、费用、速度并列,盯的是工具调用正确率和步数。对 Agent 用户,总用时比 token 单价更影响体感。

V4 Pro 下线

DeepSeek 计划 9 月 14 日 12:00 下线 V4 Pro。届时 deepseek-v4-pro 的请求会自动路由到 V4.1 Flash,并按 Flash 单价计费。

争议的起点是一条推文:DeepSeek Harness 团队崔添翼 9 月 9 日在 X 上发消息,浏览量 70 万+,很多开发者是刷到这条推文才知道自己调用的 V4 Pro 要被换掉。

具体问题有三个:通知不到 48 小时、没有并行迁移期、消息通过社区群发布而不是 API changelog。

  • 有人直接回复「请不要这样做」

  • 要求新旧模型用不同 model ID,并给至少两周缓冲期

  • 有科研团队在用 DeepSeek-V4-Pro-0813 做研究,论文没完成,模型撤掉后实验无法延续和复现,希望保留独立端点

  • 有人认为只比了 Agent 性能,忽略了非 Agent 场景

  • Hacker News 上有人说「我需要又快又便宜又一致的东西」,也有人说「在 V4 Pro 上验证过工作流的用户,不想突然在生产上试 V4.1 Flash」

官方解释是「继续以更高价、更慢速度提供更弱的 V4 Pro 已不合适」。这个说法社区认,但接受不了执行方式。对比来看,OpenAI 关停 Sora API 提前 6 个月发了正式 deprecation notice,DeepSeek 只给了不到 48 小时。

也有人觉得这是免费升级还降价了,分歧在于手上有没有已经验证过的生产工作流。

内测期还有两个已知 bug:英文提问偶尔返回中文;开联网搜索时语言不一致,搜到什么语言就用什么语言回答。

使用方法

WorkBuddy 国内版已全量接入,两周限时折扣。据用户实拍,模型列表里 Deepseek-V4.1-Flash 的倍率是 0.03x,带独家优惠标签,GLM-5.3-Flash 是 0.06x。0.03x 是平台积分倍率不是 API 单价,换算不出「便宜一半」,以客户端实际显示为准。同一列表里的 Hy3、Hy4 preview 是腾讯混元,跟 DeepSeek 无关。

腾讯云 TokenHub、ima、CodeBuddy、OpenCode 同步接入,OpenCode Go 套餐提供 4 倍额度。

API 的 base_url 不变,还是 https://api.deepseek.com,保持 OpenAI 兼容。正式模型名简化为 deepseek-flash,旧名 deepseek-v4-flashdeepseek-v4-flash-vision-exp 会自动路由过来。

权重已按 MIT 协议开源,HF 和 ModelScope 都发了,48 个分片,技术报告一并放出。官方原话是自部署需要约 2000 张 GPU 加存储集群,对多数团队来说,552B MoE 是「能下载」而不是「能跑」。

注意事项

9 月 14 日之前,拿真实流量跑一遍回归测试,重点看结构化输出的格式漂移,JSON 和函数调用最容易出问题。还没在 V4 Pro 上验证过的非 Agent 场景,直接切生产有风险。跑分也都是官方自测,第三方评分还没出。


参考文献:

Hugging Face 模型卡:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash (2026-09-10,含完整评测表与架构说明)

技术报告:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf

官方公告《DeepSeek V4.1 Flash:更强、更快、更普惠》:https://www.deepseek.com/news/deepseek-v4-1-flash/ (2026-09-10)

DeepSeek API 定价页:https://api-docs.deepseek.com/quick_start/pricing

智东西/凤凰网科技(架构与生态最全):https://tech.ifeng.com/c/8wJ8zIXEntx (2026-09-10)

36氪·InfoQ(V4 Pro 静默路由争议):https://www.36kr.com/p/3977115918840065 (2026-09-10)

潮新闻/钱江晚报(WorkBuddy 全量接入与两周优惠):https://www.toutiao.com/article/7683819834974503443/ (2026-09-10)


未经允许不得转载:w3h5前端开发资源网 » DeepSeek V4.1 Flash发布:缓存命中价降至¥0.02/M,V4 Pro将于14日下线

9 月 10 日 DeepSeek 发布 V4.1 Flash,552B MoE 骨干、1M 上下文、原生多模态,prefill 每 token 只激活 8B,缓存命中价降到 ¥0.02/M(降 60%);但输出价仍比 GLM-5.3-Flash 贵 43%。另一件更急的事:V4 Pro 将在 9 月 14 日 12:00 下线,请求自动路由到 V4.1 Flash,不少开发者是刷到推文才知道。 (0)