Model & Benchmarks

DeepSeek V4.1 Flash——一场两天内测,验证 Flash 能否取代 Pro

DeepSeek 于 2026 年 9 月 8 日开启 V4.1 Flash 两天限时内测:新架构 + 原生多模态,社区实测普遍超 300 token/s。随测反馈问卷直接询问该模型能否全面替换 V4 Pro。在 9 月 10 日过期前,这篇拆解内测透露的产品策略。

Judy4 min read
DeepSeek V4.1 Flash——一场两天内测,验证 Flash 能否取代 Pro

TL;DR

  • DeepSeek V4.1 Flash 是 2026 年 9 月 8 日悄悄上线的中间版内测模型,调用名为自带过期时间的 deepseek-v4.1-flash-expires-on-0910——没有公告、没有技术报告,并预定 9 月 10 日自动下线。

  • 这是 V4 家族自 2026 年 4 月发布以来第一次架构级改版:采用全新模型结构、原生支持多模态输入(文本/图像/语音一体化处理),取代 8 月 V4-Flash-Vision-Exp 的外挂式视觉方案。

  • 目前唯一的性能数据来自开发者实测,且数值高度集中:持续输出普遍超过 300 token/s、峰值报到 507 token/s,约为 V4 Pro 持续吞吐的 5.7 倍、同任务端到端比 V4-Flash-Vision-Exp 快 3.9–6 倍——全部为社区量测,未经官方背书。

  • 内测的真正意图是策略性的:随测发放的反馈问卷直接询问用户,V4.1 Flash 能否「全面替换」线上 V4 Pro——这是对「以 Flash 价格提供 Pro 级能力」的一次公开压力测试。

  • 9 月 9 日官宣的 Flash 系列降价恰与内测同时到期(北京时间 9 月 10 日 12:00 生效),两件事拼在一起,等于预告了 DeepSeek 最便宜档位接下来的重新定位。

1. 为什么一个 48 小时的模型,是本周最重要的信号

DeepSeek 发布 V4.1 Flash 的方式,和它发布 V4 家族大部分产品时一样:没有仪式感。2026 年 9 月 8 日下午,公司团队在官方交流群发了一则简短通知,称新模型的「中间版本」deepseek-v4.1-flash-expires-on-0910 已开放限时测试,任何持有 API key 的开发者只需替换 model 名即可调用。没有落地页、没有 changelog 条目、没有 model card、也没有在 X 上发布任何内容——这种沉默在几小时内就被独立追踪者注意到了(Sahil Panhotra 在 X 上指出模型已上线「但奇怪的是……DeepSeek 甚至还没在 X 上宣布」)。

恰恰是这种沉默,让这次内测变得重要。DeepSeek 自 4 月发布 V4 以来的习惯是:先在真实 API 环境里放出一个中间版本、在严格受限的时间窗内收集真实流量数据,再发布正式版。2025 年底的 V3.2-Speciale 就沿用了同一套打法,把过期时间写进 endpoint。V4.1 Flash 把这个逻辑又推进一步:过期时间直接写进模型名,而计时从北京时间 9 月 8 日 15:00 左右开始,测试窗口不足 48 小时。

两条背景让这个时间点不像一次例行迭代。其一,这次内测距 V4-Flash 于 7 月 31 日进入公测仅约 40 天,距 V4 Pro 于 8 月 13 日以 0813 版本转正更是只有三周——关于那场无声 GA 到底改变了什么,我们写过一篇 DeepSeek V4 Pro 0813 拆解,DeepSeek 官方 API changelog 也记录了两轮发布(DeepSeek changelog)。任何前沿实验室在这个节奏上做架构级改版都不寻常,它说明 DeepSeek 把 V4 一代当成快速迭代的平台,而非一个做完就收工的产品线。其二,同一周既有 Flash 系列降价公告(北京时间 9 月 10 日 12:00 生效),又有路透社报道 DeepSeek 已聘请中信证券筹备科创板 IPO。一个便宜、快速、多模态的模型,正是 DeepSeek 想同时讲给开发者和资本市场听的产品故事。

这篇文章是对那个两天窗口的现场记录:V4.1 Flash 到底是什么、架构改动意味着什么、社区在截止前测到了什么——以及最重要的,藏在问卷里的那个问题,透露出 DeepSeek 模型线的下一步走向。

2. DeepSeek V4.1 Flash 到底是什么

先给实操定义:DeepSeek V4.1 Flash 是 DeepSeek 下一代 Flash 档模型的限量中间测试版本,通过标准 DeepSeek API 提供服务,模型 ID 于 2026 年 9 月 10 日过期。 它不是生产模型、不是正式发布、也不是某个既有 checkpoint 的改名。DeepSeek 自己的口径——通过交流群通知传达,并被多家中文科技媒体一致转述——是这是一次「中间版本」开放给用户测试,正式版稍后发布(凤凰网科技36氪/APPSO)。

接入方式刻意做到零门槛:保留原有 base_url 和 API key,只改 model 参数即可。没有候补名单、没有独立 endpoint、没有新控制台、不需要内测资格申请。内测期间计费与 deepseek-v4-flash 完全一致,不为抢先体验加价。唯一硬性约束是并发:每个账号上限 20 路并发请求,而 DeepSeek 官方公布的正式 Flash 模型并发上限是 2500(DeepSeek Models & Pricing)。

已知信息未披露信息
模型 ID deepseek-v4.1-flash-expires-on-0910base_url 不变总参数 / 激活参数规模
计费与 deepseek-v4-flash 相同上下文长度(V4 家族标准为 1M)
每账号 20 路并发官方基准成绩
2026 年 9 月 10 日自动过期训练方式与数据配比
原生多模态输入(文本/图像/语音一体化)该架构是否会延伸到 Pro 档
全新模型结构(据 DeepSeek 官方描述)正式版发布日期与定价

20 路并发上限就是答案本身。这个数字不是任何生产流量会用的量级,而是为功能验证与负载采样设计的。把「过期时间写进模型名」和 20 并发放在一起,等于强制所有调用方把它当作评测工具而非依赖。多家媒体得出了同样的判断——Cocoloop 形容这个 48 小时窗口是「一次压力测试而不是一次发布」(Cocoloop),OrcaRouter 的现场笔记则称它是「投进真实 API 环境、限定测试期的一个构建……这不是发布」(OrcaRouter)。

对任何想要评测该模型的人来说,没披露的信息和已披露的信息同样重要。截至 9 月 9 日,官方 Models & Pricing 页仍只列出 deepseek-v4-flashdeepseek-v4-prodeepseek-v4-flash-vision-exp,changelog 也没有 V4.1 条目。参数规模、上下文长度、评测数据一概未公开——这意味着下文所有能力判断,都建立在社区量测与开发者报告之上,而不是厂商规格表。

3. 新架构——「原生多模态」到底改变了什么

DeepSeek 对 V4.1 Flash 的描述只有三个形容词:能力更强、速度更快、成本更低——而这一切,官方称来自「新的模型结构」加上原生多模态支持。架构这一条值得展开,因为它标志着 DeepSeek 处理视觉能力的方式发生了真正的转向。

V4 家族此前的多模态路径是「外挂」,不是「重构」。2026 年 8 月 21 日发布的 DeepSeek-V4-Flash-Vision-Exp,是在纯文本的 V4-Flash-0731 底座上外接视觉编码器与对齐层,让模型在文本管线之外额外接受图片输入(DeepSeek changelog)。V4.1 Flash 则被描述为把文本、图像、语音处理直接集成进模型架构本身——输入模态走统一的处理通路,而不是经由外挂的视觉扩展包路由。中文报道反复强调同一个区分点:这是架构迭代而非参数调优,多模态能力「出厂自带」而非外接(36氪/字母榜)。

这个区别对用户的意义是成本与可靠性问题,而不只是工程美学。外挂式视觉管线会在 API 边界引入额外延迟与复杂度——文本模型跑一遍、视觉编码器跑一遍、对齐层再把两者拼起来。原生多模态的模型在训练与服务时共用一条通路,这也是「更强、更快、更省」三个主张同时成立唯一可信的来源:成本下降必然来自结构性的地方,而在官方未披露任何其他成本杠杆的前提下,把多模态融合进单一架构是最合理的解释。

两个独立信号支持「这不是营销话术」的判断。其一,参与内测的博主报告,模型的多模态行为相比 Vision-Exp 有质的提升——一位测试者把一张穿西装的人像照发给 V4.1 Flash,它正确说出了对方穿的是条纹西装,而此前外挂版本在这个细节上出现过幻觉(36氪/字母榜)。其二,第一财经报道称,开发者怀疑该模型是在 V4 底座上做了大规模预训练而非仅仅后训练——是「重做」而非「打磨」,这与 Flash 公测后仅 40 天就出现架构级改版的现象相互印证(第一财经,新浪转载)。两者都不是实锤,但方向上都与 DeepSeek 自己的描述一致。

4. 截止前,社区实测到的速度

由于 DeepSeek 没有公布任何基准表,V4.1 Flash 的性能全貌完全来自开发者用自己的 key 在两天窗口里点出来的数据。值得注意的一点是,不同独立测试者的数值高度收敛——这本身就是有用的信号——但它们终究是社区数据:条件各异,最夸张的数字尚未在受控条件下复现。

最详细的一组测试来自 X 用户 @riba2534,其数据在中文科技媒体中被广泛引用(电脑王阿达):

  • 首字延迟:178 毫秒,短问答稳定在 160 毫秒左右
  • 持续输出:稳定约 355 token/s,峰值超过 365 token/s
  • 长代码生成:一个完整 1500-token 的双向链表 LRU 实现,耗时 4.40 秒
  • 思考阶段:内置推理约 1.1 秒完成,随后无缝切入正文

其他测试者与媒体的数值落在同一区间。华尔街见闻引用的开发者实测输出峰值达 507 token/s,在实时 SVG 动画生成任务上为 328 token/s,平均「普遍超过 300 token/s」(华尔街见闻)。字母榜的实测记录了一条「你好」对话:思考时间 0.3 秒、瞬时速率 159.3 token/s、整轮端到端 0.8 秒;另一组重度长文本推理则达到 420 token/s,端到端吞吐 409.5 token/s(36氪/字母榜)。V2EX 与 LINUX DO 的首夜实测普遍落在 350–530 token/s。

更有决策参考价值的,是与 DeepSeek 自家产品线的对比——那才是开发者真正在做的选择。在同一批端到端任务上,社区量测显示:49k 超长上下文检索比 V4-Flash-Vision-Exp 快约 5.2 倍、SVG 代码生成快 6.0 倍、Manacher 回文算法题快 4.6 倍、大型 SQL 生成快 5.0 倍、asyncio 异步重构快 3.9 倍。对照 V4 Pro,同一批测试者测得持续吞吐 5.7 倍(355 vs 63 token/s)、首字延迟低 77%(178ms vs 766ms),生成 1500 token 从 24.7 秒压缩到 4.4 秒(电脑王阿达)。

这些数字对一个实际开发者意味着什么,值得直说:在 300–400 token/s、首字延迟低于 200 毫秒的量级下,V4.1 Flash 这类吞吐把 Agent 工作的实际瓶颈从「模型慢」移到了「你自己的循环设计」。迭代式编程、批量代码生成、子 Agent 扇出——这些让慢模型每次重试都付出昂贵墙钟时间的场景,正是速度改变经济学的地方。这也是为什么多位 V2EX 测试者第一时间把这款模型定位成 subagent 材料——某条帖子的共识大意是:「跑这么快,智力不用顶级,能准确执行指令就行」(V2EX 讨论帖)。如果你正在更大的 Agent 栈里评估 DeepSeek 模型,我们的 什么是 DeepSeek Agent 指南 梳理了 Flash 档吞吐在四种原型中的位置。

注意事项同样值得同等篇幅。以上每个数字都是社区在降并发、中间版本上量出来的;部分测试者猜测最高的读数来自单独部署的版本,未必反映最终服务栈(电脑王阿达)。把方向当作可信、把具体峰值当作未经验证,直到 DeepSeek 在正式版发布时公布自己的数字。

5. 问卷泄露了策略:「能全面替换 V4 Pro 吗?」

整场内测最耐人寻味的物件不是基准,而是一份问卷。随模型一同发放的《V4.1 Flash 中间版本邀测反馈问卷》里,核心一题让用户在「可以 / 不可以 / 不确定 / 其他」中作答,题目是:「你觉得这个模型能全面替换线上的 DeepSeek V4 Pro 么?」36氪/字母榜电脑王阿达)。

照字面读,这个问题很奇怪:为什么一家实验室要问公众,它便宜的那档能不能取代贵的那档?从策略上读,这是 DeepSeek 对 V4.1 世代定位最直白的一次表态。它不是在做一个「更好一点的 Flash」。它在测试的是:一个 Flash 价格、Flash 速度的模型,能否吸收目前支撑 V4 Pro 溢价的那些负载——而且它想在押注这个定位之前,先拿到市场的答案。字母榜的报道把这个意图概括为「Flash 的模型,Pro 的野心」,OrcaRouter 则把底层问题描述为「DeepSeek 最便宜的档位,开始瞄准它最贵的那一档」(OrcaRouter)。

如果只把 DeepSeek 的档位当成固定结构,这套策略逻辑很容易被忽略。自 V4 家族发布以来,官方口径一直是:Flash 在简单 Agent 任务上推理接近 Pro,复杂任务归 Pro。V4.1 Flash 的架构改版是从便宜的那一侧压缩这条鸿沟:如果新结构真的能以 Flash 定价给出接近 Pro 的能力,产品线就不再是「能力阶梯」,而会变成「同一能力加一个速度与价格旋钮」。对开发者而言,今天「要快选便宜、要强选贵」的二元选择将坍缩成一个问题:对当前这个任务,Flash 够不够?

支撑这次重定位的经济学很直白,而且写在官方价目表里。按现行价格,V4 Pro 的输出定价约为 V4 Flash 的 3 倍(低谷时段每百万 token 输出 $1.98 vs $0.66),这个差距意味着即使 Pro 的质量优势真实存在,它也不适合作为高流量 Agent 流量的默认选择(DeepSeek Models & Pricing)。如果 V4.1 Flash 以 Flash 价格承接了目前发给 Pro 的大部分负载,DeepSeek 的单位 token 收入会下降,但可寻址的工作量会急剧放大——这是一次以量补价的押注,而问卷就是 DeepSeek 拿「必须迁移的人」来压力测试这个押注的方式。

6. 在同一分钟落地的降价

内测到期并不是 9 月 10 日唯一的截止时间。9 月 9 日,DeepSeek 开放平台宣布 Flash 系列调价,生效时间恰为北京时间 9 月 10 日 12:00——也就是 V4.1 Flash 内测 ID 停止解析的同一分钟。两个公告几乎可以确定是同一场发布的两半(钛媒体快科技)。

新价格表下,Flash 系列(当前为 deepseek-v4-flashdeepseek-v4-flash-vision-exp)空闲时段降至:输入缓存命中每百万 token 0.02 元、缓存未命中 1 元、输出 4 元;高峰时段价格为空闲时段两倍(DeepSeek 公告,经钛媒体报道)。对比原价:缓存命中输入降幅 60%、缓存未命中输入降 33.3%、输出降 11.1%。高峰时段定义为北京时间周一至周五 9:00–12:00 与 14:00–18:00,周末全天执行空闲价。

这次降价有三点值得注意。其一,它部分逆转了 8 月 16 日峰谷计费上线时对高峰时段的大幅提价——这轮先涨后降的价格摆动,中文开发者社区直言不讳地表达过不满,创始人的昵称也随着每周价格方向在「梁圣」与「梁子」之间反复横跳(V2EX 讨论帖36氪/字母榜)。其二,降价范围是 Flash 系列——也就是 V4.1 Flash 所属的档位——这更接近「为 V4.1 Flash 正式版清路」,而不是对这次内测的回应。其三,即便降价后,空闲时段输出仍为每百万 token 4 元,约为 8 月前促销价的两倍,所以这次「降价」针对的是被抬高后的基线,而非回到旧价目表。时间点对任何想从内测计费读出价格信号的人也很重要:测试期间 V4.1 Flash 按 deepseek-v4-flash 同价计费,而 9 月 10 日起这条基线本身会下降——因此内测测出的单任务成本会略高于正式版口径,不过差距有限,因为输出(Agent 负载的主要成本)只降 11%。

7. 9 月 10 日之前做什么、之后看什么

内测的剩余寿命按小时计,实际窗口已经很窄。如果你有 DeepSeek API key,也对模型经济学走向感兴趣,接下来一天最高价值的用法是「聚焦评测」而不是「生产迁移」——模型 ID 会在 9 月 10 日失效,之后的请求会失败,任何建在内测之上的东西都活不过截止时间,除非你预留了回退路径。

一套能在 20 并发限制与有限时间内跑完的评测协议并不复杂。拿你的一两个真实负载(而不是通用 prompt)对着 deepseek-v4.1-flash-expires-on-0910 跑基准,记录三个数字:单任务端到端耗时、单任务 token 消耗、相对你当前模型的输出质量。速度提升只有在不伴随质量回退时才有价值,而两天窗口足够在真实任务上验证这一点,即使不足以跑完整评测矩阵。按 Flash 价格记录你自己的单任务成本,便于 9 月 10 日之后与新价目表而不是降价前的基线比较。回退逻辑现在就要建好:任何指向这个即将过期 ID 的集成,都必须准备随时切回 deepseek-v4-flash 或等待正式版——因为过期是由模型名本身强制执行的。

9 月 10 日之后,问题从「这个内测怎么样」转向路线图。DeepSeek 没有给出 V4.1 Flash 正式版的日期、没有说明新架构是否也会出现在 Pro 档、除 Flash 系列降价外也没有任何定价承诺(Cocoloop)。基于 DeepSeek 的发布史——V4-Flash 从预览到公测、再到 V4-Pro GA,每一步间隔都只有数周——合理的预期是正式版很快到来而非长期空窗。真正悬而未决的是:正式版能否在完整生产并发下保持内测的速度曲线、权重是否沿用 V4 家族其余成员的 MIT 许可开源、以及 DeepSeek 会不会顺着问卷的逻辑,把 V4.1 Flash 正式定位成「可迁移负载的 Pro 平替」。

对独立开发者与 Agent 构建者来说,策略层面的读法比基准报道更简单。DeepSeek 正用一场两天内测,试探市场对一个「自我坍缩价格阶梯」的模型的接受度。内测的社区量测——无论有多少保留——至少说明这套架构真实到让问题不再是「能力差距能不能缩小」,而是「DeepSeek 打算以多快的速度、什么价格把它收窄」。你在截止前要做的,是在自己的负载上确认一件事:Flash 档的速度与价格够不够用。如果够,9 月 10 日的两则公告会精确告诉你,这份能力要花多少钱。

8. 结论

用两天内测来发布一个模型并不寻常,但用它来跑一场策略实验,非常 DeepSeek。这家公司放出一个顶着过期名字的中间版本、把并发卡在排除生产用途的量级、不发布任何基准,然后让社区制造了唯一的性能数据。在这些数据里,架构级改版看起来是真的:300–500 token/s 的速度区间、原生而非外挂的多模态输入、以及留在 Flash 价目表上的成本结构。而在问卷里,DeepSeek 问出了比任何单个数字都重要的问题——这个便宜又快的模型,能不能取代那个贵的。与内测同一分钟落地的降价则暗示,DeepSeek 心里可能已经有了答案;9 月 10 日会告诉我们市场同不同意。

常见问题

什么是 DeepSeek V4.1 Flash?
DeepSeek V4.1 Flash 是 DeepSeek 下一代 Flash 档模型的中间测试版本,2026 年 9 月 8 日开放限时 API 内测、预定 9 月 10 日自动过期。它采用新架构并原生支持多模态输入,计费与 `deepseek-v4-flash` 相同。它不是正式发布,官方也未公布技术报告或基准表。
内测期间如何调用 DeepSeek V4.1 Flash?
保留现有 API `base_url` 与 key,只把 `model` 参数改为 `deepseek-v4.1-flash-expires-on-0910`。无需独立 endpoint 或内测资格。每账号并发上限 20 路,模型 ID 于 2026 年 9 月 10 日失效。
V4.1 Flash 比 V4 Pro 快吗?
内测期间的社区实测约为 V4 Pro 持续吞吐的 5.7 倍(约 355 vs 63 token/s),首字延迟低约 77%。这些是开发者在中间版本上的量测而非官方数据;DeepSeek 尚未公布自己的基准。
V4.1 Flash 比 V4 Pro 便宜吗?
内测期间它与 `deepseek-v4-flash` 同价,输出价格约为 V4 Pro 的三分之一。9 月 10 日生效的 Flash 系列降价使缓存命中输入降 60%,输出降约 11%,因此正式版若沿用 Flash 价目表,仍会远低于 Pro 定价。
DeepSeek V4.1 Flash 能取代 V4 Pro 吗?
这正是 DeepSeek 内测反馈问卷让用户回答的问题。该模型的定位就是测试 Flash 档的速度与价格能否承接 Pro 级负载;能否全面取代,取决于正式版在完整生产并发下的质量——而这一数据官方尚未公布。
DeepSeek V4.1 Flash 开源吗?
V4.1 Flash 尚未开放权重。V4 家族其他成员(V4 Pro 与 V4 Flash)在 Hugging Face 上以 MIT 许可发布,但 DeepSeek 对新架构是否开源没有任何表态——答案要等正式版发布时揭晓。

https://floatboat.ai/zh/blog/deepseek-v4-1-flash