一句话总结
2026 年 9 月 10 日,DeepSeek 正式上线 DeepSeek-V4.1-Flash:一个 552B 参数的 MoE 新架构模型,输入侧只激活 8B、输出侧 16B,原生支持图片理解;KV 缓存压到上一代的 1/4(HBM)、1/8(SSD),缓存命中价低到 0.003 美元/百万 token。官方表示它已在性能、成本、速度和总时长上「全面超越 V4-Pro」,并把 V4-Pro 的峰值价格直接砍掉约 77%——这不是一次常规的模型换代,而是一次针对 Agent 工作负载的定价重构。
数据来源
本文事实依据来自:
- DeepSeek 官方发布说明《DeepSeek-V4.1-Flash: Smarter, Faster, More Efficient》(2026-09-10)
- DeepSeek 官方文档《Models & Pricing》脚注(2026-09-10 起生效)
- Hugging Face 模型卡
deepseek-ai/DeepSeek-V4.1-Flash与随附技术报告 - 第三方报道与评测:The Rundown AI、Apidog、Coursiv、Chosun(转引 Bloomberg)、Artificial Analysis
先把三个数字记住
| 指标 | 数字 | 为什么重要 |
|---|---|---|
| 总参数 / 激活参数 | 552B / 8B(输入)· 16B(输出) | 推理时只唤醒一小部分参数,单位算力产出更高 |
| KV 缓存占用 | HBM 1/4 · SSD 1/8 | 长上下文、多轮 Agent 会话能同时塞进同一张卡 |
| 缓存命中价 | 0.003 美元/百万 token(闲时) | 让「反复重读上下文」从成本项变成忽略项 |

图片来源:DeepSeek 官方发布说明(api-docs.deepseek.com/news/news260910)
架构:552B 的壳,8B 的魂
V4.1-Flash 不是 V4-Pro 的缩小版,而是 DeepSeek 新架构家族里最小的那个成员。官方描述它是「新的 Causal Encoder-Decoder(因果编码器-解码器)架构」——顾名思义,把「读懂输入」和「写出答案」拆成了两套参数:
- 输入侧(Encoder):prefill 阶段只激活约 8B 参数,负责把长上下文快速读进来;
- 输出侧(Decoder):生成阶段激活约 16B 参数,负责把答案一个字一个字写出来;
- 总数 552B 的 MoE 专家池,则保证能力上限不会被激活量拖累。
这种「读写分离」的设计对 Agent 场景特别对味。真实工作负载里,读的量远大于写的量:一个 coding agent 每执行一步都要把整个上下文重新读一遍,而真正生成的代码可能只有几百 token。把 prefill 的价格打下来,等于直接砍掉 Agent 账单里最大的一块。
官方还特别强调:这是家族里最小的模型,架构可以继续往上放大——也就是说,V4.1-Pro 大概率会沿着同一条路走下来。

缓存瘦身:为什么「1/4」比基准分数更值钱
DeepSeek 在发布说明里单独用了一段讲缓存:
相比上一代,V4.1-Flash 的 KV 缓存只需要 1/4 的 HBM 和 1/8 的 SSD 存储。缓存命中的费用往往占 Agent 成本的很大一部分,压缩缓存等于大幅砍掉这部分开支。
第三方测算给出的具体数字是约 890 字节/token,大约是上一代 V4-Flash 的四分之一。对普通聊天用户来说,这只是个技术细节;但对跑长会话的团队来说,它是部署能力问题:
- 同样的显存,能同时容纳的并发会话数翻了数倍;
- 1M 上下文的长任务不再因为「缓存太胖」被挤下机器;
- 缓存命中价 0.003 美元/百万 token,意味着「重读一遍 100 万 token 的仓库」只要三分钱人民币不到。
新浪科技给这款模型起了个外号叫「内存杀手」——这个名字很快被市场用股价验证了。

图片来源:DeepSeek 官方发布说明
价格:把 V4-Pro 的账单砍掉约 77%
新价格于 2026 年 9 月 10 日 04:00 UTC 生效,闲时价格是峰时的 50%。峰时为周一至周五 01:00-04:00 与 06:00-10:00 UTC(对应北京时间 09:00-12:00、14:00-18:00),其余时间都是闲时。
| 计费项(每 100 万 token) | V4-Pro(峰时) | V4.1-Flash(峰时) | 降幅 |
|---|---|---|---|
| 缓存命中输入 | 0.044 美元 | 0.006 美元 | 约 -86% |
| 缓存未命中输入 | 1.32 美元 | 0.30 美元 | 约 -77% |
| 输出 | 3.96 美元 | 1.20 美元 | 约 -70% |
闲时再打五折:缓存命中 0.003 美元、缓存未命中 0.15 美元、输出 0.60 美元。
即便是和半个月前的 V4-Flash(8 月 21 日价)相比,这一轮也在继续降价:缓存命中降约 57%(0.007 → 0.003)、缓存未命中降约 32%(0.22 → 0.15)、输出降约 9%(0.66 → 0.60)。输出价格几乎没动,被砍得最狠的是「读」的那一端——这恰好印证了前面的判断:这是一次针对输入密集型负载的定向降价。
配套的还有一条容易被忽略的改动:并发上限从 V4-Pro 的 500 提到 2,500。对做批量任务、或者是被限流卡过脖子的团队来说,这条比降价更实用。

图片来源:DeepSeek 官方发布说明(原图为英文)
基准:超过了 V4-Pro,也压过了 Claude Opus 5 和 GPT-5.6 Sol
官方给出的对照表里,V4.1-Flash 在多个 Agent 类基准上大幅领先 V4-Pro:
| 基准 | V4-Pro | V4.1-Flash |
|---|---|---|
| Terminal-Bench 2.1 | 82.7 | 90.6 |
| Terminal-Bench 4.0 | 7.0 | 31.2 |
| DeepSWE v1.1 | 54.4 | 74.2 |
| GPQA Diamond | 92.4 | 90.9 |
第三方整理的数据里,V4.1-Flash 在最大推理强度下的 DeepSWE v1.1 拿到 74.2,高于 Claude Opus 5 的 74.0 与 GPT-5.6 Sol 的 73.0;在 AutomationBench、CyberGym 上也有官方口径的胜利。
截至发稿时,V4.1-Flash 的 OpenRouter 定价也已同步上线,作为统一入口可以省掉一层比价工作。

图片来源:DeepSeek 官方发布说明
必须说清的口径问题:以上全部是 厂商自跑(vendor-reported) 的成绩,DeepSeek 自己也没有回避两处落后——Terminal-Bench 4.0 上仍落后于两家美国旗舰模型,GPQA Diamond 也低于 V4-Pro。所以正确的读法是:在代码 Agent 类任务上确实进入了第一梯队,而不是「全面吊打所有人」。上线前请用你自己的 prompt 做一次 A/B。
市场反应:内存股跳水,与 Artificial Analysis 说的「死亡地带」
这次发布最出圈的其实不是分数,而是它把 HBM 与 SSD 的需求预期往下拽了一把:
- 消息公布当日,美光(Micron)与 SK 海力士的 ADR 一度跌超 5%;
- 韩国媒体直接以「内存杀手」为题报道,Bloomberg 跟进;
- 模型评测机构 Artificial Analysis 用「death zone(死亡地带)」形容当下的竞争格局——在价格和性能上拿不出明确差异化的公司,将很难活下去;
- Bloomberg Intelligence 的判断更直接:技术门槛降低正在加速商品化,没有一家公司握有定价权。
对使用方来说,这当然是好消息:模型层的价格战,最终会体现在你的账单上。
V4-Pro 怎么办?官方口径已经改口
发布说明原本写得很明确:9 月 14 日 04:00 UTC 起,所有 deepseek-v4-pro 请求都会自动路由到 V4.1-Flash,并按 Flash 的价格计费,直到 V4.1-Pro 上线为止;同时 deepseek-v4-flash 与 deepseek-v4-flash-vision-exp 两个旧名字对应的模型已下线,但保留名称兼容、实际由 V4.1-Flash 提供服务。
不过,官方定价页最新的脚注(2)写的是另一番话:
应广大用户需求,我们决定在 2026 年 9 月 14 日之后继续提供 DeepSeek V4 Pro 的 API 服务,计费方式保持不变。
两处口径并不完全一致(一处说自动路由、一处说保留服务)。稳妥做法只有一条:9 月 14 日之后,用你的账号实际调一次 deepseek-v4-pro,看返回的 model 字段和账单,再决定要不要改代码。 如果你对输出风格敏感,这一步尤其别省——自动路由意味着你的 prompt 会在不通知你的情况下被换一个模型来执行。
怎么换:三步落地
- 改模型名:把请求里的 model 换成
deepseek-flash(旧名deepseek-v4-flash仍兼容)。 - 把重活排到闲时:批量任务、数据清洗、离线评测尽量避开工作日 01:00-04:00 / 06:00-10:00 UTC;闲时价格直接减半。
- 优先吃满缓存:把稳定的系统提示、仓库上下文、知识库放在请求前缀,让缓存命中率上去——命中价 0.006(峰)/0.003(闲)美元,比未命中便宜 50 倍。
已经宣布全面支持 V4.1-Flash 的官方合作伙伴包括 WorkBuddy(含 CodeBuddy)与 OpenCode;自部署团队可以在 Hugging Face 上取权重(MIT 许可)和技术报告,官方同时表示欢迎联合探索大规模推理方案。
注意事项
- 基准是自跑的,且明确有两项落后;营销结论别直接当验收结论。
- 缓存命中价的前提是前缀命中。如果你的请求每次都变,实际成本会更接近 0.15/0.30 美元那一档。
- 视觉理解是新加的,与上一代
deepseek-v4-flash-vision-exp的能力边界未必一致,图像类任务需要重新验证。 - 并发提升不等于无限:2,500 仍是上限,超大规模批处理依然要自己做队列和退避。
总结
- V4.1-Flash 的核心不在「更大」,而在「更省」:读写分离架构 + 缓存压缩,把 Agent 最贵的那部分成本按下去。
- 价格表里被砍得最狠的是缓存命中输入(-86%),这是给长上下文 Agent 的定向优惠。
- 基准上它进入了代码 Agent 第一梯队,但厂商自跑、且有两项落后,要自己验。
- V4-Pro 的去留官方口径不一,9 月 14 日之后务必实测确认。
- 连带影响已经外溢到硬件侧:内存股当日跳水,模型层的价格战还在加速。
(本文配图来自 DeepSeek 官方发布说明与技术报告,已下载至本站本地引用;其余图表由本站据官方数据绘制。)