让旗舰下线的「最小模型」:DeepSeek V4.1 Flash 把成本压到四分之一

2026年9月11日 · zknr

DeepSeek V4.1 Flash 发布

9 月 10 日,深度求索发布 DeepSeek V4.1 Flash。官方给出的定位是「全新模型结构系列中的最小尺寸模型」,但同一份公告里还有另一句话:V4 Flash 与 V4 Flash Vision Exp 即日下线;9 月 14 日 12:00 之后,访问 deepseek-v4-pro 的请求会被全部路由到 V4.1 Flash,并按 V4.1 Flash 单价计费。

一个标着「最小尺寸」的模型,把自家两条更贵的线一起送走。这件事比参数表更值得看。

552B 的体量,8B 的账单

V4.1 Flash 是 552B 参数的 MoE 模型,采用新的 Causal-Encoder-Decoder 结构,输入和输出不对称,输入激活 8B,输出激活 16B。官方称这套结构的设计初衷是能力上限更高、推理速度更快、吞吐更大,并且可以扩展到更大参数规模的模型。

稀疏激活在 MoE 里并不新鲜,值得关注的是输入侧 8B 与输出侧 16B 的差异。生成侧背更重的计算,读取侧保持轻量,这正对应 Agent 场景里「长上下文输入、短结果输出」的典型负载。

配套数字更能说明问题。KV Cache 大幅压缩之后,对 HBM 的需求降到上一代的 1/4,对 SSD 的需求降到 1/8;相对初代模型,KV Cache 体积是原来的 1/437。Agent 任务的账单里,缓存命中往往占据大头,把 KV Cache 压下去,省掉的不只是推理费。

定价降 60%,还留着峰谷价

官方公告显示,V4.1 Flash 定价最高下调 60%,新价格从 9 月 10 日 12:00 起生效;同时保留峰谷定价,闲时价格为高峰时段的一半,用来引导用户错峰调度。

调用侧的过渡处理得比较轻。模型名改成 deepseek-flash 即可用上 V4.1 Flash;旧名 deepseek-v4-flash、deepseek-v4-flash-vision-exp 会被暂时路由到新模型,给存量集成留出缓冲期。官方还提到,经多方测试,V4.1 Flash 在性能、费用、速度、总用时等指标上已全面超越 V4 Pro,因此计划有序下线 V4 Pro。腾讯(WorkBuddy、CodeBuddy)与 OpenCode 作为官方合作伙伴,已全量接入。

需要打个折扣的地方

「全面超越」这个结论来自官方与多方测试,公开的基准仍是自选口径,现阶段缺少独立第三方的复现数据。模型能力评测的可比性一向有限,框架不同、采样参数不同,结论会跟着漂移。

更值得观察的是价格信号本身。同一家公司用一个更小的模型取代旗舰,同时把单价往下压,它表达出的判断是:大量实际负载里,用户真正在意的是每 token 成本,榜单名次排在后面。这条评价轴一旦立住,后续所有模型的性价比都会被拿出来重算一遍。

写在最后

V4.1 Flash 的看点落在成本结构上。KV Cache 压缩、非对称激活、峰谷定价三件事叠起来,指向的是一类具体用户:跑长上下文 Agent、对延迟不敏感、对账单敏感。对这类用户来说,模型是不是「最强」并不关键,能不能把单次任务的成本压进可接受区间才关键。至于它能不能撑住「全面超越 V4 Pro」这个说法,等第三方复现结果出来再下结论更稳妥。

配图说明:本文封面为 AI 生成图像。

参考:IT之家《DeepSeek V4.1 Flash 模型正式发布:全面超越 V4 Pro、原生多模态视觉理解,最高降价 60%》报道,本文为基于公开信息的独立评述。

← 返回首页