DeepSeek V4.1 Flash发布:缓存命中价降至¥0.02/M,V4 Pro将于14日下线

前不久智谱刚认领 Ox Alpha,宣布正式发布GLM-5.3-Flash,价格比 DeepSeek V4 Flash 还要低。9月10日 DeepSeek 就发布 V4.1 Flash,依旧是低调发布,只是邮件通知。

大致意思是 V4.1 Flash 性能、费用、速度、总用时等各项指标上全面超越 V4 Pro。V4.1 Flash 正式上线之后 V4.1 Pro 上线之前,V4 Pro 的请求会全部路由到 V4.1 Flash,按 V4.1 Flash 单价计费。

deepseek-v4.1-flash.png DeepSeek V4.1 Flash发布:缓存命中价降至¥0.02/M,V4 Pro将于14日下线 AI大模型

DeepSeek V4.1 Flash 参数及架构

552B 骨干参数 MoE,1M token 上下文,原生多模态,HF 上的 pipeline 标记是 image-text-to-text。官方口径里的 552B 不含另一个 196B 参数的 Engram 记忆模块,那个是稀疏访问的。

架构细节:

  • Causal Encoder-Decoder(CED)非对称架构:40 层 = 20 层因果编码器 + 20 层解码器

  • prefill 每 token 激活 8B,decode 每 token 激活 16B,输入输出不对称

  • MoE 每层 1 个共享专家 + 384 个路由专家,每 token 激活 6 个

  • 全局 KV Cache 890 bytes/token,约为 V4-Flash 的 1/4,相对 V1 缩小 437 倍;HBM 需求降到 1/4,SSD 需求降到 1/8

  • 预训练用 45T tokens 多模态语料,稀疏注意力在 64K 序列长度训练,训练到 34T tokens 时扩到 1M 上下文

  • 支持 reasoning_effort 整数 1–100,连续调节成本与准确率

项目

V4-Flash

V4-Pro

V4.1-Flash

骨干参数

284B

1.6T

552B

每 token 激活

13B

49B

8B(prefill) / 16B(decode)

上下文

1M

1M

1M

License

MIT

MIT

MIT

V4.1 Flash 总参数比 V4-Flash 大了近一倍,单次激活量反而更小,价格能降下来就是因为这个。

跑分

基准

Opus-5.0

GPT-5.6 Sol

K3

GLM-5.3

V4-Pro

V4.1-Flash

GPQA Diamond

93.4

94.1

92.9

88.1

92.4

90.9

HLE

56.3

44.5

43.5

42.0†

42.7†

36.8(39.1†)

Codeforces

—

—

—

—

3348

3471

Terminal-Bench 2.1

89.1

88.8

88.3

88.2

87.9

90.6

Terminal-Bench 3.0

43.3

34.4

17.7

28.3

11.8

30.0

DeepSWE v1.1

74.0

73.0

67.5

66.9

62.7

74.2

CyberGym

—

84.5

80.0

84.5

83.3

88.1

AutomationBench

50.3

45.8

46.7

48.8

43.2

54.8

Agent's Last Exam

28.6

26.7

27.6

28.5

25.7

31.8

HLE w/ tools

63.6

—

59.8

62.5

60.0

63.9

† 表示 HLE 的纯文本子集。推理档统一用 reasoning_effort=100。

DeepSeek 官方口径是「性能、费用、速度、总用时全面超越 V4 Pro」。分项看,Agentic 和代码类确实领先:DeepSWE 74.2 对 62.7,Terminal-Bench 2.1 90.6 对 87.9,CyberGym 88.1 对 83.3,AutomationBench 54.8 对 43.2。

但纯推理和知识类反过来落后。HLE 36.8 对 42.7,SimpleQA-Verified 42.3 对 55.2,都是 V4.1 Flash 更低。国盛证券复述官方数据,19 项测评里 14 项超过 Pro,约 74%,不是全部。

这些分数全部来自官方自测,没有中立第三方复核。 技术报告自己的表 4 显示,只是换 scaffold,DeepSWE v1.1 的分数就在 65.5 到 74.2 之间波动;官方多 Agent 的结果也标注为 preliminary。Artificial Analysis、LMArena 目前都还没有 V4.1 Flash 的独立评分。

速度

社区实测的生成速度分布很散,160 / 284 / 287 / 300+ / 355–427 / 507 t/s 都有人报,差异来自任务类型、上下文长度、并发、是否含工具调用。官方没有公布统一的吞吐数字。

  • 同一提示词写长文,V4.1 Flash 160 t/s、V4 Pro 50 t/s,约 3 倍;首 token 0.3s 对 1.1s

  • 另一组 355–427 t/s,TTFT 178ms,对比 V4 Pro 63 t/s、766ms

定价

9 月 10 日 12:00 生效,单位人民币 / 百万 tokens。闲时缓存命中 ¥0.02、未命中 ¥1.0、输出 ¥4.0;高峰价翻倍,也就是 ¥0.04 / ¥2.0 / ¥8.0。高峰时段是周一至周五 9:00–12:00、14:00–18:00,其余含周末全天算空闲。

和旧价比,降幅差别很大。缓存命中从 0.05 砍到 0.02,降 60%;未命中 1.5→1.0,降 33%;输出只从 4.5 动到 4.0,降 11%。缓存命中降幅最大,因为 Agent 场景里系统提示词、历史对话、RAG 前缀常占输入 90% 以上,缓存命中率能到 99%+,账单大头就在这一项。

GLM-5.3-Flash 价格对比

GLM-5.3-Flash 国内站标准价是 ¥0.8 输入 / ¥2.8 输出 / ¥0.23 缓存命中,没有峰谷。

口径

DeepSeek 闲时

GLM-5.3-Flash

谁便宜

缓存命中输入

¥0.02

¥0.23

DeepSeek 便宜约 10 倍

未命中输入

¥1.0

¥0.8

GLM 略便宜

输出

¥4.0

¥2.8

GLM 便宜,DeepSeek 贵 43%

峰值全项 ×2

×2

无峰谷

DeepSeek 明显更贵

缓存命中这一项 DeepSeek 便宜约 10 倍,但未命中输入和输出两项都比 GLM 贵,峰值时段还要再翻倍。整体谁更便宜,取决于缓存命中率和调用时段。

白天工时正好压在高峰上,批量任务、后台任务挪到晚间和周末能直接省一半。美洲团队要反过来算,01:00–04:00 UTC 等于美东 21:00–24:00,正是批处理时段,反而落在高峰里。

总用时

总用时由多轮推理、工具调用、文件读写一起决定,单价低的模型未必更快。实测里 V4.1 Flash 做 3D 城市生成器,LLM 推理只花 18 分钟,工具调用花了 83 分钟,总时几乎全被工具调用吃掉。

DeepSeek 把「总用时」和性能、费用、速度并列,盯的是工具调用正确率和步数。对 Agent 用户,总用时比 token 单价更影响体感。

V4 Pro 下线

DeepSeek 计划 9 月 14 日 12:00 下线 V4 Pro。届时 deepseek-v4-pro 的请求会自动路由到 V4.1 Flash,并按 Flash 单价计费。

争议的起点是一条推文:DeepSeek Harness 团队崔添翼 9 月 9 日在 X 上发消息,浏览量 70 万+,很多开发者是刷到这条推文才知道自己调用的 V4 Pro 要被换掉。

具体问题有三个:通知不到 48 小时、没有并行迁移期、消息通过社区群发布而不是 API changelog。

  • 有人直接回复「请不要这样做」

  • 要求新旧模型用不同 model ID,并给至少两周缓冲期

  • 有科研团队在用 DeepSeek-V4-Pro-0813 做研究,论文没完成,模型撤掉后实验无法延续和复现,希望保留独立端点

  • 有人认为只比了 Agent 性能,忽略了非 Agent 场景

  • Hacker News 上有人说「我需要又快又便宜又一致的东西」,也有人说「在 V4 Pro 上验证过工作流的用户,不想突然在生产上试 V4.1 Flash」

官方解释是「继续以更高价、更慢速度提供更弱的 V4 Pro 已不合适」。这个说法社区认,但接受不了执行方式。对比来看,OpenAI 关停 Sora API 提前 6 个月发了正式 deprecation notice,DeepSeek 只给了不到 48 小时。

也有人觉得这是免费升级还降价了,分歧在于手上有没有已经验证过的生产工作流。

内测期还有两个已知 bug:英文提问偶尔返回中文;开联网搜索时语言不一致,搜到什么语言就用什么语言回答。

使用方法

WorkBuddy 国内版已全量接入,两周限时折扣。据用户实拍,模型列表里 Deepseek-V4.1-Flash 的倍率是 0.03x,带独家优惠标签,GLM-5.3-Flash 是 0.06x。0.03x 是平台积分倍率不是 API 单价,换算不出「便宜一半」,以客户端实际显示为准。同一列表里的 Hy3、Hy4 preview 是腾讯混元,跟 DeepSeek 无关。

腾讯云 TokenHub、ima、CodeBuddy、OpenCode 同步接入,OpenCode Go 套餐提供 4 倍额度。

API 的 base_url 不变,还是 https://api.deepseek.com,保持 OpenAI 兼容。正式模型名简化为 deepseek-flash,旧名 deepseek-v4-flash、deepseek-v4-flash-vision-exp 会自动路由过来。

权重已按 MIT 协议开源,HF 和 ModelScope 都发了,48 个分片,技术报告一并放出。官方原话是自部署需要约 2000 张 GPU 加存储集群,对多数团队来说,552B MoE 是「能下载」而不是「能跑」。

注意事项

9 月 14 日之前,拿真实流量跑一遍回归测试,重点看结构化输出的格式漂移,JSON 和函数调用最容易出问题。还没在 V4 Pro 上验证过的非 Agent 场景,直接切生产有风险。跑分也都是官方自测,第三方评分还没出。


参考文献:

Hugging Face 模型卡:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash (2026-09-10,含完整评测表与架构说明)

技术报告:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf

官方公告《DeepSeek V4.1 Flash:更强、更快、更普惠》:https://www.deepseek.com/news/deepseek-v4-1-flash/ (2026-09-10)

DeepSeek API 定价页:https://api-docs.deepseek.com/quick_start/pricing

智东西/凤凰网科技(架构与生态最全):https://tech.ifeng.com/c/8wJ8zIXEntx (2026-09-10)

36氪·InfoQ(V4 Pro 静默路由争议):https://www.36kr.com/p/3977115918840065 (2026-09-10)

潮新闻/钱江晚报(WorkBuddy 全量接入与两周优惠):https://www.toutiao.com/article/7683819834974503443/ (2026-09-10)


未经允许不得转载:w3h5前端开发资源网 » DeepSeek V4.1 Flash发布:缓存命中价降至¥0.02/M,V4 Pro将于14日下线

9 月 10 日 DeepSeek 发布 V4.1 Flash,552B MoE 骨干、1M 上下文、原生多模态,prefill 每 token 只激活 8B,缓存命中价降到 ¥0.02/M(降 60%);但输出价仍比 GLM-5.3-Flash 贵 43%。另一件更急的事:V4 Pro 将在 9 月 14 日 12:00 下线,请求自动路由到 V4.1 Flash,不少开发者是刷到推文才知道。 (0)