展开目录
#DeepSeek#开源模型#MoE#KV缓存#Agent#API定价#国产AI

DeepSeek-V4.1-Flash 发布:552B 参数只激活 8B,KV 缓存砍到 1/4,Agent 账单降了七成

9 月 10 日,DeepSeek 上线 DeepSeek-V4.1-Flash:552B 参数的 MoE 新架构,输入侧只激活 8B、输出侧 16B,KV 缓存压到上一代的 1/4(HBM)与 1/8(SSD),缓存命中低至 0.003 美元/百万 token。峰值输入价格从 V4-Pro 的 1.32 美元降到 0.30 美元,并发从 500 提到 2,500,官方称已全面超越 V4-Pro。

预计阅读 11 分钟

一句话总结

2026 年 9 月 10 日,DeepSeek 正式上线 DeepSeek-V4.1-Flash:一个 552B 参数的 MoE 新架构模型,输入侧只激活 8B、输出侧 16B,原生支持图片理解;KV 缓存压到上一代的 1/4(HBM)、1/8(SSD),缓存命中价低到 0.003 美元/百万 token。官方表示它已在性能、成本、速度和总时长上「全面超越 V4-Pro」,并把 V4-Pro 的峰值价格直接砍掉约 77%——这不是一次常规的模型换代,而是一次针对 Agent 工作负载的定价重构。

数据来源

本文事实依据来自:

  • DeepSeek 官方发布说明《DeepSeek-V4.1-Flash: Smarter, Faster, More Efficient》(2026-09-10)
  • DeepSeek 官方文档《Models & Pricing》脚注(2026-09-10 起生效)
  • Hugging Face 模型卡 deepseek-ai/DeepSeek-V4.1-Flash 与随附技术报告
  • 第三方报道与评测:The Rundown AI、Apidog、Coursiv、Chosun(转引 Bloomberg)、Artificial Analysis

先把三个数字记住

指标数字为什么重要
总参数 / 激活参数552B / 8B(输入)· 16B(输出)推理时只唤醒一小部分参数,单位算力产出更高
KV 缓存占用HBM 1/4 · SSD 1/8长上下文、多轮 Agent 会话能同时塞进同一张卡
缓存命中价0.003 美元/百万 token(闲时)让「反复重读上下文」从成本项变成忽略项

DeepSeek 官方发布的 V4.1-Flash 基准总览图

图片来源:DeepSeek 官方发布说明(api-docs.deepseek.com/news/news260910)


架构:552B 的壳,8B 的魂

V4.1-Flash 不是 V4-Pro 的缩小版,而是 DeepSeek 新架构家族里最小的那个成员。官方描述它是「新的 Causal Encoder-Decoder(因果编码器-解码器)架构」——顾名思义,把「读懂输入」和「写出答案」拆成了两套参数:

  • 输入侧(Encoder):prefill 阶段只激活约 8B 参数,负责把长上下文快速读进来;
  • 输出侧(Decoder):生成阶段激活约 16B 参数,负责把答案一个字一个字写出来;
  • 总数 552B 的 MoE 专家池,则保证能力上限不会被激活量拖累。

这种「读写分离」的设计对 Agent 场景特别对味。真实工作负载里,读的量远大于写的量:一个 coding agent 每执行一步都要把整个上下文重新读一遍,而真正生成的代码可能只有几百 token。把 prefill 的价格打下来,等于直接砍掉 Agent 账单里最大的一块。

官方还特别强调:这是家族里最小的模型,架构可以继续往上放大——也就是说,V4.1-Pro 大概率会沿着同一条路走下来。

架构示意:总参数 552B,输入侧 8B、输出侧 16B,KV 缓存 HBM 1/4、SSD 1/8


缓存瘦身:为什么「1/4」比基准分数更值钱

DeepSeek 在发布说明里单独用了一段讲缓存:

相比上一代,V4.1-Flash 的 KV 缓存只需要 1/4 的 HBM1/8 的 SSD 存储。缓存命中的费用往往占 Agent 成本的很大一部分,压缩缓存等于大幅砍掉这部分开支。

第三方测算给出的具体数字是约 890 字节/token,大约是上一代 V4-Flash 的四分之一。对普通聊天用户来说,这只是个技术细节;但对跑长会话的团队来说,它是部署能力问题

  • 同样的显存,能同时容纳的并发会话数翻了数倍;
  • 1M 上下文的长任务不再因为「缓存太胖」被挤下机器;
  • 缓存命中价 0.003 美元/百万 token,意味着「重读一遍 100 万 token 的仓库」只要三分钱人民币不到。

新浪科技给这款模型起了个外号叫「内存杀手」——这个名字很快被市场用股价验证了。

官方 KV 缓存对比图:HBM 1/4、SSD 1/8

图片来源:DeepSeek 官方发布说明


价格:把 V4-Pro 的账单砍掉约 77%

新价格于 2026 年 9 月 10 日 04:00 UTC 生效,闲时价格是峰时的 50%。峰时为周一至周五 01:00-04:00 与 06:00-10:00 UTC(对应北京时间 09:00-12:00、14:00-18:00),其余时间都是闲时。

计费项(每 100 万 token)V4-Pro(峰时)V4.1-Flash(峰时)降幅
缓存命中输入0.044 美元0.006 美元约 -86%
缓存未命中输入1.32 美元0.30 美元约 -77%
输出3.96 美元1.20 美元约 -70%

闲时再打五折:缓存命中 0.003 美元、缓存未命中 0.15 美元、输出 0.60 美元。

即便是和半个月前的 V4-Flash(8 月 21 日价)相比,这一轮也在继续降价:缓存命中降约 57%(0.007 → 0.003)、缓存未命中降约 32%(0.22 → 0.15)、输出降约 9%(0.66 → 0.60)。输出价格几乎没动,被砍得最狠的是「读」的那一端——这恰好印证了前面的判断:这是一次针对输入密集型负载的定向降价。

配套的还有一条容易被忽略的改动:并发上限从 V4-Pro 的 500 提到 2,500。对做批量任务、或者是被限流卡过脖子的团队来说,这条比降价更实用。

官方价格表:V4.1-Flash 的峰时/闲时价格

图片来源:DeepSeek 官方发布说明(原图为英文)


基准:超过了 V4-Pro,也压过了 Claude Opus 5 和 GPT-5.6 Sol

官方给出的对照表里,V4.1-Flash 在多个 Agent 类基准上大幅领先 V4-Pro:

基准V4-ProV4.1-Flash
Terminal-Bench 2.182.790.6
Terminal-Bench 4.07.031.2
DeepSWE v1.154.474.2
GPQA Diamond92.490.9

第三方整理的数据里,V4.1-Flash 在最大推理强度下的 DeepSWE v1.1 拿到 74.2,高于 Claude Opus 5 的 74.0 与 GPT-5.6 Sol 的 73.0;在 AutomationBench、CyberGym 上也有官方口径的胜利。

截至发稿时,V4.1-Flash 的 OpenRouter 定价也已同步上线,作为统一入口可以省掉一层比价工作。

官方基准对照表(含 V4-Pro / 旗舰模型对比)

图片来源:DeepSeek 官方发布说明

必须说清的口径问题:以上全部是 厂商自跑(vendor-reported) 的成绩,DeepSeek 自己也没有回避两处落后——Terminal-Bench 4.0 上仍落后于两家美国旗舰模型,GPQA Diamond 也低于 V4-Pro。所以正确的读法是:在代码 Agent 类任务上确实进入了第一梯队,而不是「全面吊打所有人」。上线前请用你自己的 prompt 做一次 A/B。


市场反应:内存股跳水,与 Artificial Analysis 说的「死亡地带」

这次发布最出圈的其实不是分数,而是它把 HBM 与 SSD 的需求预期往下拽了一把:

  • 消息公布当日,美光(Micron)与 SK 海力士的 ADR 一度跌超 5%
  • 韩国媒体直接以「内存杀手」为题报道,Bloomberg 跟进;
  • 模型评测机构 Artificial Analysis 用「death zone(死亡地带)」形容当下的竞争格局——在价格和性能上拿不出明确差异化的公司,将很难活下去;
  • Bloomberg Intelligence 的判断更直接:技术门槛降低正在加速商品化,没有一家公司握有定价权

对使用方来说,这当然是好消息:模型层的价格战,最终会体现在你的账单上。


V4-Pro 怎么办?官方口径已经改口

发布说明原本写得很明确:9 月 14 日 04:00 UTC 起,所有 deepseek-v4-pro 请求都会自动路由到 V4.1-Flash,并按 Flash 的价格计费,直到 V4.1-Pro 上线为止;同时 deepseek-v4-flashdeepseek-v4-flash-vision-exp 两个旧名字对应的模型已下线,但保留名称兼容、实际由 V4.1-Flash 提供服务。

不过,官方定价页最新的脚注(2)写的是另一番话:

应广大用户需求,我们决定在 2026 年 9 月 14 日之后继续提供 DeepSeek V4 Pro 的 API 服务,计费方式保持不变。

两处口径并不完全一致(一处说自动路由、一处说保留服务)。稳妥做法只有一条:9 月 14 日之后,用你的账号实际调一次 deepseek-v4-pro,看返回的 model 字段和账单,再决定要不要改代码。 如果你对输出风格敏感,这一步尤其别省——自动路由意味着你的 prompt 会在不通知你的情况下被换一个模型来执行。


怎么换:三步落地

  1. 改模型名:把请求里的 model 换成 deepseek-flash(旧名 deepseek-v4-flash 仍兼容)。
  2. 把重活排到闲时:批量任务、数据清洗、离线评测尽量避开工作日 01:00-04:00 / 06:00-10:00 UTC;闲时价格直接减半。
  3. 优先吃满缓存:把稳定的系统提示、仓库上下文、知识库放在请求前缀,让缓存命中率上去——命中价 0.006(峰)/0.003(闲)美元,比未命中便宜 50 倍。

已经宣布全面支持 V4.1-Flash 的官方合作伙伴包括 WorkBuddy(含 CodeBuddy)与 OpenCode;自部署团队可以在 Hugging Face 上取权重(MIT 许可)和技术报告,官方同时表示欢迎联合探索大规模推理方案。


注意事项

  • 基准是自跑的,且明确有两项落后;营销结论别直接当验收结论。
  • 缓存命中价的前提是前缀命中。如果你的请求每次都变,实际成本会更接近 0.15/0.30 美元那一档。
  • 视觉理解是新加的,与上一代 deepseek-v4-flash-vision-exp 的能力边界未必一致,图像类任务需要重新验证。
  • 并发提升不等于无限:2,500 仍是上限,超大规模批处理依然要自己做队列和退避。

总结

  • V4.1-Flash 的核心不在「更大」,而在「更省」:读写分离架构 + 缓存压缩,把 Agent 最贵的那部分成本按下去。
  • 价格表里被砍得最狠的是缓存命中输入(-86%),这是给长上下文 Agent 的定向优惠。
  • 基准上它进入了代码 Agent 第一梯队,但厂商自跑、且有两项落后,要自己验。
  • V4-Pro 的去留官方口径不一,9 月 14 日之后务必实测确认
  • 连带影响已经外溢到硬件侧:内存股当日跳水,模型层的价格战还在加速。

(本文配图来自 DeepSeek 官方发布说明与技术报告,已下载至本站本地引用;其余图表由本站据官方数据绘制。)

Related

相关文章

延伸阅读

查看全部 →
AI安全

阿莫代伊发文《We Must Pace the Frontier》:Anthropic 单方面承诺「嵌入式评估员」,Altman 说同意,Musk 说 Dario 是对的

2026 年 9 月,Anthropic CEO 达里奥·阿莫代伊发表长文《We Must Pace the Frontier》,首次把「放慢前沿能力进步」提为具体方案:三步走——嵌入式第三方评估员、民主国家内部协调、全球协调,Anthropic 单方面承诺第一步。两件事让他改主意:递归自我改进加速,以及 OpenAI-Hugging Face 的 Agent 蜂群越界事件。Sam Altman 表示同意,Elon Musk 说「Dario 是对的」,也有记者批评这是「监管俘获」。

OpenAI

GPT-6 Astra 需求爆表:OpenAI 暂停 200 美元 Pro 新订阅,Altman 说 2026 年不上市

9 月 3 日发布的 GPT-6 Astra 需求「前所未有」,OpenAI 在 9 月 10 日暂停了 200 美元 ChatGPT Pro 的新订阅——Go、Plus 与 API 不受影响。三天后,Sam Altman 又说「考虑到安全方面正在发生的一切,现在上市是不明智的时机」,被追问是否指 2026 年时回答「不是 2026,对」。一个模型,同时顶住了 OpenAI 的产能与 IPO 时间表。

OpenAI

OpenAI 把 GPT-Live-1 放进 API:0.05 美元/分钟的语音层,把三级级联砍成一个模型

9 月 10 日,OpenAI 在 API 上线 GPT-Live-1 全双工语音模型:边听边说、能被打断、支持电话场景,前端语音层 0.05 美元/分钟且按秒计费,复杂推理与工具调用委派给 GPT-6 Astra 等后端模型。Full Duplex Bench 比 GPT-Realtime-2.1 高 30 个百分点,Speak 称假打断减少约 80%,Solace Health 删掉了 23,000 行级联代码。