2026 年 9 月 10 日 DeepSeek 发布 V4.1-Flash,官方与中信证券研究发布于 2026 年 9 月 17 日的解读材料,把推理降本归因于 CED 架构、KV Cache 精度下调与 CSA2 共享机制三条线索。以下梳理仅基于该来源材料,其中产品能力、评测分数与降本幅度均为来源方引述或判断,未经独立核验。
降本依赖的三项已知机制
架构层面:40 层 Transformer 被划分为前 20 层因果编码器与后 20 层解码器,编码器末层输出直接投影生成解码器所需的全局 KV,无需逐层生成,因此大多数输入 token 仅需完成编码器计算;解码器额外处理提示末尾 128 个 token 以近似重建 SWA 缓存。据官方技术报告,预填充阶段每 token 激活参数由解码阶段的 160 亿降至 80 亿,模型主干参数为 5520 亿。
缓存精度:全局主 KV Cache 由前代 FP8 降至 FP4,并在后训练中引入量化感知训练控制精度损失,SWA KV 保留 FP8。
共享机制:结合 CSA2 跨层缓存共享,全局 KV Cache 占用降至 V4-Flash 的约 1/4,HBM 需求降至 1/4,SSD 需求降至 1/8。
长上下文与定价的公开口径
据 DeepSeek 官方技术论文,上下文由 4K 扩展至 1M 时,单 Token 解码 FLOPs 仅增加约 25%。定价方面,官方口径为每百万 Token 闲时缓存命中输入 0.02 元、未命中输入 1 元、输出 4 元,较前代的 0.05 元、1.5 元、4.5 元分别下降 60.0%、33.3%、11.1%,高峰时段价格为闲时的两倍。
| 项目 | V4.1-Flash | 前代 |
|---|---|---|
| 缓存命中输入 | 0.02 元 | 0.05 元 |
| 未命中输入 | 1 元 | 1.5 元 |
| 输出 | 4 元 | 4.5 元 |
来源方的判断与边界
来源方认为,Flash 系列以较低激活参数量和调用成本覆盖日常编程、办公及通用 Agent 需求,大参数量旗舰模型则继续提升复杂推理与长程任务上限;并判断高性价比推理将加速 FDE 及企业级 Agent 落地,具备行业知识积累或垂直私域数据壁垒的专业软件公司有望率先转化产品价值。这些均为来源方观点,不是已发生事实。
来源方同时列示风险:AI 核心技术发展与应用拓展不及预期、算力降本不及预期、AI 被不当使用、数据安全与信息安全风险、行业竞争加剧等,并声明分析意见可能随后续研究报告更改。
常见问题
V4.1-Flash 的降本是否有官方数据支撑?
部分有。预填充激活参数、4K 至 1M 扩展下单 Token 解码 FLOPs 增幅约 25%、以及 API 定价,来源材料标注为官方技术报告、官方技术论文与官方定价;KV Cache 与 HBM、SSD 需求的降幅则由来源方引述。
评测分数能否说明模型整体更强?
来源材料显示结果并不一致:Terminal-Bench 2.1 得 90.6 分高于 Opus 5 的 89.1 分,但 Terminal-Bench 4.0 得 31.2 分,低于 GPT-6 Astra 的 57.9 分。单项领先不等于全面领先,需按具体测试分别看待。
V4-Pro 是否已下线?
据 DeepSeek 官方微信公众号,公司计划有序下线 V4-Pro,但截至 2026 年 9 月 15 日 V4-Pro 仍维持服务状态。该状态为特定时点快照,不代表此后情况。