Model & Benchmarks

DeepSeek V4 Pro 0813——悄无声息的 GA,与它真正改变的东西

DeepSeek V4 Pro 0813 在没有发布公告的情况下悄悄转正(GA)。本文整理其完整规格、官方声称的 Agent 基准成绩、8 月 16 日涨价前的定价窗口、与预览版相比的真实变化,以及它与同周发布的 Grok 4.6 的正面较量。

Judy4 min read
DeepSeek V4 Pro 0813——悄无声息的 GA,与它真正改变的东西

TL;DR

  • DeepSeek V4 Pro 0813 是 DeepSeek 旗舰模型的正式(GA)版本,2026 年 8 月 12–13 日被悄然替换到 deepseek-v4-pro 端点——没有博客文章、没有更新日志、没有新闻稿,只有定价页上的一处版本号变更。

  • 架构不变(1.6T 参数 MoE、49B 激活、100 万 token 上下文、38.4 万最大输出)。变的是后训练:DeepSeek 声称智能体编码能力获得纸面上很夸张的提升——DeepSWE 从 12.8 涨到 62.7,Terminal-Bench 2.1 涨到 87.9。

  • 以上每一个分数都是厂商自报,产自 DeepSeek 尚未公开的基准测试框架。独立追踪机构迄今没有记录到任何关于 0813 的第三方结果。

  • 目前定价维持每 100 万 token 输入 $0.435 / 输出 $0.87,但 8 月 16 日(UTC)起将执行峰谷时段计费,高峰时段输出成本最高可放大约 4.5 倍。

  • 对预算有限的智能体负载而言,0813 是本周前沿级模型中性价比最可信的选择——而它恰与 xAI 的 Grok 4.6 同一周发布,买家难得获得一次同周正面对比的机会。

1. 为什么一场无声的 GA 依然是件大事

DeepSeek 习惯不打锣鼓就发货,但 V4 Pro 0813 的这次上线把这一点推到了极致。2026 年 8 月 12 日,公司的 API 定价页悄然把 DeepSeek-V4-Pro-0813 列为既有 deepseek-v4-pro 端点背后的模型。没有发布页、没有版本说明条目——截至本文发布那一周——也没有博客文章。这个模型自 4 月 24 日起一直以预览版运行,这次切换只是定价表里的一个单元格,把它翻成了生产检查点。

这种低仪式感,一半是 DeepSeek 行事方式的症状,一半是刻意的选择。公司对 V4 Flash 已经承诺过同一套模式:V4 Flash 于 7 月 31 日转正,当时的更新日志注明 Pro 正式版将「很快跟上」。当这个「很快」到来时,恰好落在 xAI 发布 Grok 4.6 的同一周——对任何追踪前沿模型发布的人来说,这是拥挤的 48 小时。在这样的语境里,一次无声的版本升级不代表缺乏野心,而是 DeepSeek 在告诉开发者:生产版本就是那个端点,而端点本来就是你正在用的东西。

让这次发布即便无声也意义重大的,是时机。V4 Pro 0813 到来之时,正是 DeepSeek 迄今最强的一次表态:它的模型是为智能体工作而造的——工具调用、多步编码、长时任务——而不是为聊天。这个定位与公司自 4 月以来的信号一致,而且对单人创业者很重要,因为 V4 的成本结构让 Agent 循环变得用得起,而在高端闭源模型上这是做不到的。GA 让这份「用得起」变成了生产级:团队不再需要担心自己测的是一个随时可能在脚下改变的预览版。

2. 用数字看 V4 Pro 0813

GA 版本的规格表与预览版一致——这个事实本身就很有用:这是一次后训练发布,不是新架构。下面的数字取自 DeepSeek 官方模型文档与 DeepSeek API 文档定价页

规格

数值

架构

混合专家(MoE),1.6T 总参数 / 49B 激活参数

注意力机制

混合式:压缩稀疏注意力(CSA)+ 深度压缩注意力(HCA)

上下文窗口

1,000,000 token

最大输出

384,000 token

输入模态

仅文本(此版本不支持视觉、音频或视频)

推理模式

Non-think、Think High、Think Max(reasoning_effort 扩展为 low / high / max)

API 兼容性

OpenAI Responses API、Chat Completions、Anthropic 兼容格式

工具调用

JSON 输出、工具调用、beta 前缀续写、FIM(仅非思考模式)

并发数

500(V4 Flash 允许 2,500)

权重

MIT 许可;Hugging Face 上托管的仍是 4 月预览版,而非 0813

那张表里有三件事值得关注。其一,扩展后的 reasoning_effort 阶梯——low / high / max——给了开发者一个直接对应任务复杂度的成本旋钮,这正是 DeepSeek 在 V4 Flash 转正时加的同一套控制。其二,Anthropic 兼容端点意味着,任何已经把 Claude Code 指向 api.deepseek.com 的人,无需改一行代码就能拿到生产检查点。其三,输入模态仅限文本:0813 没有加入原生图像推理,尽管有些报道暗示相反——Artificial Analysis 的模型卡和 DeepSeek 自己的文档都把输入列为仅文本。

架构本身值得比参数数量更深一层地理解,因为它解释了模型的经济学。V4 采用混合注意力设计——压缩稀疏注意力(CSA)加深度压缩注意力(HCA)——对长上下文记忆的压缩激进到:在同样的 100 万 token 上下文下,模型的单 token 推理 FLOPs 约为 DeepSeek V3.2 的 27%,KV 缓存占用压到大约十分之一。这正是 100 万 token 上下文窗口能负担得起的原因:稀疏注意力让长输入的新增成本保持很小,而这恰恰是智能体工作负载——上下文会随多步累积——最看重的性质。这也是为什么模型对 MoE 专家用 FP4 精度、其余用 FP8:缩小的占用直接降低服务成本,而 DeepSeek 自己的发布材料还提到该格式与国产加速器支持对齐,暗示随着这些硬件在 2026 年放量,推理成本还会进一步下降。

3. Agent 基准:好的、声称的、未经证实的

DeepSeek 官方为 GA 发布写的更新日志公布了一张看起来像阶跃变化的基准表。标题数字:Terminal-Bench 2.1 达到 87.9(预览版为 72.1)、DeepSWE 62.7(预览版 12.8,约 4.9 倍跳升)、Cybergym 83.3(预览版 52.7)、NL2Repo 61.5(预览版 38.5)、Toolathlon-Verified 74.1。在表中两项 Agent 基准上,DeepSeek 声称的成绩略超 Anthropic 的 Claude Fable 5——Cybergym 83.3 对 83.1,AutomationBench(Public)31.8 对 29.1——而 Terminal-Bench 2.1 以 0.1 分之差落后于 Fable 5(87.9 对 88.0)。

这些数字需要更新日志没有提供的背景。Agent 基准是通过「DeepSeek Harness minimal mode」跑出来的——一个公司没有公开的基准框架——这意味着框架的强弱已经烙进每一个分数里。这次不透明的代价比平时更高,因为预览版有前科:在一次独立运行的 DeepSWE 评测里(用误报率 0.3% 的验证器),预览版 pass@1 大约只有 8%——而 DeepSeek 在自家 SWE-bench Verified 上、用误报率高得多的框架跑出 80.6%。如果 0813 的后训练真能在更严的 DeepSWE 基准上拿到 62.7,那是实打实的能力跃迁;如果它只是宽松框架的产物,那就是噪音。独立追踪机构至今没有仲裁出结果——截至撰稿时,benchable.ai 上 0813 的第三方结果是零条,厂商的评测框架也仍未公开。

诚实的读法是这样的:改进方向指向智能体能力,这一点可信;幅度未经证实;任何人仅凭这些数字选模型,等于凭信仰选择。想更深入理解 DeepSeek Agent 如何分类、四种原型有何差异,可看「什么是 DeepSeek Agent」。务实的姿态——也是无论独立验证结果如何都站得住的那种——是把 0813 当作智能体编码上「又强又便宜」的候选,在投入之前先用你自己的负载验证它。

4. 与预览版相比,到底变了什么

对一直跑预览版的团队来说,问题是该不该迁移——诚实的答案是:迁移已经替你发生了。因为 GA 是同一端点上的检查点替换,每一次对 deepseek-v4-pro 的 API 调用现在返回的都是 0813 构建。没有迁移步骤、没有新模型串、没有配置变更。如果你想确认自己拿到的确实是新构建,响应里的版本指纹已随定价页的列表一起变了。

实质变化全部发生在后训练行为上,独立评测者已经开始勾勒它们。通过 Anthropic 兼容端点、在真实 Agent 环境(而非聊天 UI)里做的测试发现:GA 版在那些过去总让预览版露馅的创意前端任务上大幅变好——「一看就是 AI 合成的网页前端」的模式基本消失,长周期工程任务能带着可用的测试循环与自我修复跑完,而不是卡死。同一批评测者也标记了持续存在的边界 bug,包括一个如今已出名的图像任务——天上飘着两轮新月。换句话说:明显更能干了,依然不完美——而,这是反复出现的主题——同一个模型,更成品化了。

这对特定一群人很重要:任何在 4–7 月测过预览版、并基于其行为建立了假设的人。官方表里预览分与 GA 分的落差——DeepSWE 从 12.8 到 62.7 是极端例子——意味着早先的评估已经过期。如果你 5 月判定 V4 Pro「做智能体工作不够好」,那个判定是针对另一个模型做出的。GA 是一个重新评估的时间点,不是同一条判定的延续。

5. 定价:涨价之前的时间窗

定价故事,是这场无声发布变响的地方。截至 GA,API 费率与 5 月那笔转为永久折扣时一致:cache miss 时每 100 万输入 token $0.435、cache hit 时 $0.003625、每 100 万输出 token $0.87。在这个价位上,V4 Pro 仍比高端闭源模型便宜大约一个数量级——Anthropic 的 Claude Fable 5 标价每 100 万 token 输入 $10 / 输出 $50,GPT-5.6 Sol 输出约 $30。

这个窗口在 2026 年 8 月 16 日 16:00 UTC 关闭。DeepSeek 公布的峰谷计费方案把高峰时段定为 UTC 01:00–04:00 与 06:00–10:00,谷时价格为高峰的一半。对 V4 Pro,实际新费率是高峰输入 $1.32 / 输出 $3.96,谷时 $0.66 / $1.98——高峰输出相比现行统一费率是 4.5 倍跳升。标题党式的「最高涨 1,100%」只在特定 token 类型与特定时段上才是技术性正确的;更有用的框架是:覆盖一天大部分时间的谷时约等于现行价翻倍,高峰时段则让输出成本大约翻两番。

对跑长 Agent 循环的团队,经济含义既具体又可执行。智能体工作负载很吃 token,成本随输出 token 线性放大——而输出恰恰是高峰时段涨得最狠的那项费率。把重活批量调度进谷时(一天 24 小时里的大部分),能保住旧经济性的大部分;而高峰时段的实时交互式 Agent 使用,则要全额吸收涨幅。再叠加新的 reasoning_effort 旋钮,V4 的成本管理工具箱现在同时有了「价格-时间」与「推理深度」两个维度——而这两者,在预览版统一费率时代都不存在。

6. 与 Grok 4.6 的对比(同周发布)

就在 DeepSeek 把 V4 Pro 0813 悄悄放进生产的同一周,xAI 为 Grok 4.6 办了场正式发布会——这是两家实验室开始以重叠节奏发货以来,最清晰可见的一次同周前沿发布。两款模型的定位比它们截然不同的发布风格所暗示的更接近:都是后训练升级而非新架构;都把长时智能体工作当作招牌用例;定价都远低于闭源高端档——Grok 4.6 每 100 万 token 输入/输出 $2 / $6,V4 Pro 为 $0.435 / $0.87。

权衡按工作负载切分,而不是按「哪个模型更好」。Grok 4.6 在智能体知识工作上有优势——它的 GDPval-AA v2 Elo 为 1753,紧随 Claude Opus 5 之后——在 CursorBench 等某些编码基准上也领先。DeepSeek 的还手在价格(约为 Grok 输入价的四分之一、输出价的七分之一)与超长输入时的原生上下文经济性。在复合的 Artificial Analysis Intelligence Index 上,Grok 4.6 的 61 与 GPT-5.6 Sol 持平,而 V4 Pro 0813 的独立分数上次测量时为 53——这个差距反映的是 Grok 更强的知识推理基线,而不是对智能体编码的裁决,在这件事上两者接近得多。那场同周对决,我们在 Grok 4.6 分析里拆得更细。

7. 对单人创业者意味着什么

对一个单人经营者,GA 从三个方面改变了这笔账。第一,生产稳定性:你今天测的模型就是将来服务你调用的那个模型,版本钉在定价页上,而不是漂在一个预览标签下。第二,成本结构:即便在 8 月 16 日涨价之后,V4 Pro 的谷时定价仍让长 Agent 循环——那种每个任务要跑几百次工具调用的循环——以高端模型零头的成本存活,前提是你把重活挪进谷时。第三,生态信号:DeepSeek 自己的基准说明,是经由其内部执行框架 DeepSeek Harness 产出的,该框架已随 GA 以开源开发者预览版的形式发布。第一方 harness 改变了「模型 + 工具」的算式——你不必再借道 Claude Code 或 OpenCode、活在别人家的产品里,而是可以用厂商自己的 Agent 循环来跑这个模型。我们的 DeepSeek Harness 解析讲了那个框架做什么、用在哪。

诚实的告诫,还是这篇文章反复回到的那些:基准提升未经第三方验证,所以投入前先造一个验证任务;模型只支持文本,图像负载还得另找工具;定价窗口是真的但很窄——你今天锁定的经济性,不是 9 月的经济性。对 2026 年 8 月、预算有限、要做智能体编码的人来说,V4 Pro 0813 是同级别里最便宜的可信选项;它是不是最适合你那具体负载的那个,只有上手实测才能回答。

结论

DeepSeek V4 Pro 0813 是一种奇特的里程碑:旗舰模型的 GA,没有发布会、没有更新日志、没有新闻稿——只有定价页上的一串版本号。这种低仪式感符合公司的行事风格,也不改变这次发布的实质:一个在预览里待了 111 天的模型的生产版本,带着纸面上戏剧性、但仍待独立验证的智能体后训练改进。

这给买家留下的决策框架很直接。如果你已经在用 deepseek-v4-pro,你就在新构建上——重新测一遍你在预览时代量过的任何东西。如果你在为智能体工作对比模型,把官方基准表当作方向性参考,在你自己任务上验证。如果你对成本敏感,理解 8 月 16 日的价格变化,把重活排进谷时。如果你在纠结本周两个前沿级发布,Grok 4.6 对比是下一个正确的阅读——因为在智能体 AI 里,真正的竞争不再是谁的记分卡更好看,而是谁的经济性能让长跑 Agent 真正用得起。

常见问题

DeepSeek V4 Pro 0813 是新模型还是更新?
它是 V4 Pro 的生产构建,与 4 月预览版架构相同(1.6T 参数 MoE、49B 激活、100 万上下文),后训练做了更新。DeepSeek 于 2026 年 8 月 12–13 日把 deepseek-v4-pro 端点切换到这一检查点;无需任何集成变更。
怎么访问 DeepSeek V4 Pro 0813?
在 DeepSeek API 上继续使用 deepseek-v4-pro 这个模型名即可。它兼容 OpenAI 与 Anthropic 格式,现有集成——包括指向 [api.deepseek.com](<http://api.deepseek.com>) 的 Claude Code——无需修改即可工作。
0813 的基准成绩经过独立验证了吗?
还没有。所有 Agent 基准成绩(DeepSWE 62.7、Terminal-Bench 2.1 87.9、Cybergym 83.3 等)均为厂商自报,且产自 DeepSeek 未发布的 Harness minimal mode。截至撰稿时,独立追踪机构没有记录到任何 0813 的第三方结果。
DeepSeek 涨价什么时候生效?
2026 年 8 月 16 日 16:00 UTC。届时开始峰谷计费:高峰时段为 UTC 01:00–04:00 与 06:00–10:00,谷时为高峰价的一半。V4 Pro 高峰输出将涨到每 100 万 token $3.96,现行统一费率是 $0.87。
DeepSeek V4 Pro 0813 支持图像吗?
不支持。此版本仅支持文本:接受文本输入、产生文本输出,不原生支持图像、音频或视频输入——尽管有些报道暗示相反。
DeepSeek V4 Pro 0813 是开源的吗?
V4 系列权重采用 MIT 许可,但截至撰稿时,0813 构建的权重尚未公布——Hugging Face 上托管的仍是 4 月预览版。API 是访问 0813 的可靠途径。

https://floatboat.ai/zh/blog/deepseek-v4-pro-0813