DeepSeek V4 Pro 0813——悄无声息的 GA,与它真正改变的东西
DeepSeek V4 Pro 0813 在没有发布公告的情况下悄悄转正(GA)。本文整理其完整规格、官方声称的 Agent 基准成绩、8 月 16 日涨价前的定价窗口、与预览版相比的真实变化,以及它与同周发布的 Grok 4.6 的正面较量。

TL;DR
-
DeepSeek V4 Pro 0813 是 DeepSeek 旗舰模型的正式(GA)版本,2026 年 8 月 12–13 日被悄然替换到 deepseek-v4-pro 端点——没有博客文章、没有更新日志、没有新闻稿,只有定价页上的一处版本号变更。
-
架构不变(1.6T 参数 MoE、49B 激活、100 万 token 上下文、38.4 万最大输出)。变的是后训练:DeepSeek 声称智能体编码能力获得纸面上很夸张的提升——DeepSWE 从 12.8 涨到 62.7,Terminal-Bench 2.1 涨到 87.9。
-
以上每一个分数都是厂商自报,产自 DeepSeek 尚未公开的基准测试框架。独立追踪机构迄今没有记录到任何关于 0813 的第三方结果。
-
目前定价维持每 100 万 token 输入 $0.435 / 输出 $0.87,但 8 月 16 日(UTC)起将执行峰谷时段计费,高峰时段输出成本最高可放大约 4.5 倍。
-
对预算有限的智能体负载而言,0813 是本周前沿级模型中性价比最可信的选择——而它恰与 xAI 的 Grok 4.6 同一周发布,买家难得获得一次同周正面对比的机会。
1. 为什么一场无声的 GA 依然是件大事
DeepSeek 习惯不打锣鼓就发货,但 V4 Pro 0813 的这次上线把这一点推到了极致。2026 年 8 月 12 日,公司的 API 定价页悄然把 DeepSeek-V4-Pro-0813 列为既有 deepseek-v4-pro 端点背后的模型。没有发布页、没有版本说明条目——截至本文发布那一周——也没有博客文章。这个模型自 4 月 24 日起一直以预览版运行,这次切换只是定价表里的一个单元格,把它翻成了生产检查点。
这种低仪式感,一半是 DeepSeek 行事方式的症状,一半是刻意的选择。公司对 V4 Flash 已经承诺过同一套模式:V4 Flash 于 7 月 31 日转正,当时的更新日志注明 Pro 正式版将「很快跟上」。当这个「很快」到来时,恰好落在 xAI 发布 Grok 4.6 的同一周——对任何追踪前沿模型发布的人来说,这是拥挤的 48 小时。在这样的语境里,一次无声的版本升级不代表缺乏野心,而是 DeepSeek 在告诉开发者:生产版本就是那个端点,而端点本来就是你正在用的东西。
让这次发布即便无声也意义重大的,是时机。V4 Pro 0813 到来之时,正是 DeepSeek 迄今最强的一次表态:它的模型是为智能体工作而造的——工具调用、多步编码、长时任务——而不是为聊天。这个定位与公司自 4 月以来的信号一致,而且对单人创业者很重要,因为 V4 的成本结构让 Agent 循环变得用得起,而在高端闭源模型上这是做不到的。GA 让这份「用得起」变成了生产级:团队不再需要担心自己测的是一个随时可能在脚下改变的预览版。
2. 用数字看 V4 Pro 0813
GA 版本的规格表与预览版一致——这个事实本身就很有用:这是一次后训练发布,不是新架构。下面的数字取自 DeepSeek 官方模型文档与 DeepSeek API 文档定价页。
规格 | 数值 |
架构 | 混合专家(MoE),1.6T 总参数 / 49B 激活参数 |
注意力机制 | 混合式:压缩稀疏注意力(CSA)+ 深度压缩注意力(HCA) |
上下文窗口 | 1,000,000 token |
最大输出 | 384,000 token |
输入模态 | 仅文本(此版本不支持视觉、音频或视频) |
推理模式 | Non-think、Think High、Think Max(reasoning_effort 扩展为 low / high / max) |
API 兼容性 | OpenAI Responses API、Chat Completions、Anthropic 兼容格式 |
工具调用 | JSON 输出、工具调用、beta 前缀续写、FIM(仅非思考模式) |
并发数 | 500(V4 Flash 允许 2,500) |
权重 | MIT 许可;Hugging Face 上托管的仍是 4 月预览版,而非 0813 |
那张表里有三件事值得关注。其一,扩展后的 reasoning_effort 阶梯——low / high / max——给了开发者一个直接对应任务复杂度的成本旋钮,这正是 DeepSeek 在 V4 Flash 转正时加的同一套控制。其二,Anthropic 兼容端点意味着,任何已经把 Claude Code 指向 api.deepseek.com 的人,无需改一行代码就能拿到生产检查点。其三,输入模态仅限文本:0813 没有加入原生图像推理,尽管有些报道暗示相反——Artificial Analysis 的模型卡和 DeepSeek 自己的文档都把输入列为仅文本。
架构本身值得比参数数量更深一层地理解,因为它解释了模型的经济学。V4 采用混合注意力设计——压缩稀疏注意力(CSA)加深度压缩注意力(HCA)——对长上下文记忆的压缩激进到:在同样的 100 万 token 上下文下,模型的单 token 推理 FLOPs 约为 DeepSeek V3.2 的 27%,KV 缓存占用压到大约十分之一。这正是 100 万 token 上下文窗口能负担得起的原因:稀疏注意力让长输入的新增成本保持很小,而这恰恰是智能体工作负载——上下文会随多步累积——最看重的性质。这也是为什么模型对 MoE 专家用 FP4 精度、其余用 FP8:缩小的占用直接降低服务成本,而 DeepSeek 自己的发布材料还提到该格式与国产加速器支持对齐,暗示随着这些硬件在 2026 年放量,推理成本还会进一步下降。
3. Agent 基准:好的、声称的、未经证实的
DeepSeek 官方为 GA 发布写的更新日志公布了一张看起来像阶跃变化的基准表。标题数字:Terminal-Bench 2.1 达到 87.9(预览版为 72.1)、DeepSWE 62.7(预览版 12.8,约 4.9 倍跳升)、Cybergym 83.3(预览版 52.7)、NL2Repo 61.5(预览版 38.5)、Toolathlon-Verified 74.1。在表中两项 Agent 基准上,DeepSeek 声称的成绩略超 Anthropic 的 Claude Fable 5——Cybergym 83.3 对 83.1,AutomationBench(Public)31.8 对 29.1——而 Terminal-Bench 2.1 以 0.1 分之差落后于 Fable 5(87.9 对 88.0)。
这些数字需要更新日志没有提供的背景。Agent 基准是通过「DeepSeek Harness minimal mode」跑出来的——一个公司没有公开的基准框架——这意味着框架的强弱已经烙进每一个分数里。这次不透明的代价比平时更高,因为预览版有前科:在一次独立运行的 DeepSWE 评测里(用误报率 0.3% 的验证器),预览版 pass@1 大约只有 8%——而 DeepSeek 在自家 SWE-bench Verified 上、用误报率高得多的框架跑出 80.6%。如果 0813 的后训练真能在更严的 DeepSWE 基准上拿到 62.7,那是实打实的能力跃迁;如果它只是宽松框架的产物,那就是噪音。独立追踪机构至今没有仲裁出结果——截至撰稿时,benchable.ai 上 0813 的第三方结果是零条,厂商的评测框架也仍未公开。
诚实的读法是这样的:改进方向指向智能体能力,这一点可信;幅度未经证实;任何人仅凭这些数字选模型,等于凭信仰选择。想更深入理解 DeepSeek Agent 如何分类、四种原型有何差异,可看「什么是 DeepSeek Agent」。务实的姿态——也是无论独立验证结果如何都站得住的那种——是把 0813 当作智能体编码上「又强又便宜」的候选,在投入之前先用你自己的负载验证它。
4. 与预览版相比,到底变了什么
对一直跑预览版的团队来说,问题是该不该迁移——诚实的答案是:迁移已经替你发生了。因为 GA 是同一端点上的检查点替换,每一次对 deepseek-v4-pro 的 API 调用现在返回的都是 0813 构建。没有迁移步骤、没有新模型串、没有配置变更。如果你想确认自己拿到的确实是新构建,响应里的版本指纹已随定价页的列表一起变了。
实质变化全部发生在后训练行为上,独立评测者已经开始勾勒它们。通过 Anthropic 兼容端点、在真实 Agent 环境(而非聊天 UI)里做的测试发现:GA 版在那些过去总让预览版露馅的创意前端任务上大幅变好——「一看就是 AI 合成的网页前端」的模式基本消失,长周期工程任务能带着可用的测试循环与自我修复跑完,而不是卡死。同一批评测者也标记了持续存在的边界 bug,包括一个如今已出名的图像任务——天上飘着两轮新月。换句话说:明显更能干了,依然不完美——而,这是反复出现的主题——同一个模型,更成品化了。
这对特定一群人很重要:任何在 4–7 月测过预览版、并基于其行为建立了假设的人。官方表里预览分与 GA 分的落差——DeepSWE 从 12.8 到 62.7 是极端例子——意味着早先的评估已经过期。如果你 5 月判定 V4 Pro「做智能体工作不够好」,那个判定是针对另一个模型做出的。GA 是一个重新评估的时间点,不是同一条判定的延续。
5. 定价:涨价之前的时间窗
定价故事,是这场无声发布变响的地方。截至 GA,API 费率与 5 月那笔转为永久折扣时一致:cache miss 时每 100 万输入 token $0.435、cache hit 时 $0.003625、每 100 万输出 token $0.87。在这个价位上,V4 Pro 仍比高端闭源模型便宜大约一个数量级——Anthropic 的 Claude Fable 5 标价每 100 万 token 输入 $10 / 输出 $50,GPT-5.6 Sol 输出约 $30。
这个窗口在 2026 年 8 月 16 日 16:00 UTC 关闭。DeepSeek 公布的峰谷计费方案把高峰时段定为 UTC 01:00–04:00 与 06:00–10:00,谷时价格为高峰的一半。对 V4 Pro,实际新费率是高峰输入 $1.32 / 输出 $3.96,谷时 $0.66 / $1.98——高峰输出相比现行统一费率是 4.5 倍跳升。标题党式的「最高涨 1,100%」只在特定 token 类型与特定时段上才是技术性正确的;更有用的框架是:覆盖一天大部分时间的谷时约等于现行价翻倍,高峰时段则让输出成本大约翻两番。
对跑长 Agent 循环的团队,经济含义既具体又可执行。智能体工作负载很吃 token,成本随输出 token 线性放大——而输出恰恰是高峰时段涨得最狠的那项费率。把重活批量调度进谷时(一天 24 小时里的大部分),能保住旧经济性的大部分;而高峰时段的实时交互式 Agent 使用,则要全额吸收涨幅。再叠加新的 reasoning_effort 旋钮,V4 的成本管理工具箱现在同时有了「价格-时间」与「推理深度」两个维度——而这两者,在预览版统一费率时代都不存在。
6. 与 Grok 4.6 的对比(同周发布)
就在 DeepSeek 把 V4 Pro 0813 悄悄放进生产的同一周,xAI 为 Grok 4.6 办了场正式发布会——这是两家实验室开始以重叠节奏发货以来,最清晰可见的一次同周前沿发布。两款模型的定位比它们截然不同的发布风格所暗示的更接近:都是后训练升级而非新架构;都把长时智能体工作当作招牌用例;定价都远低于闭源高端档——Grok 4.6 每 100 万 token 输入/输出 $2 / $6,V4 Pro 为 $0.435 / $0.87。
权衡按工作负载切分,而不是按「哪个模型更好」。Grok 4.6 在智能体知识工作上有优势——它的 GDPval-AA v2 Elo 为 1753,紧随 Claude Opus 5 之后——在 CursorBench 等某些编码基准上也领先。DeepSeek 的还手在价格(约为 Grok 输入价的四分之一、输出价的七分之一)与超长输入时的原生上下文经济性。在复合的 Artificial Analysis Intelligence Index 上,Grok 4.6 的 61 与 GPT-5.6 Sol 持平,而 V4 Pro 0813 的独立分数上次测量时为 53——这个差距反映的是 Grok 更强的知识推理基线,而不是对智能体编码的裁决,在这件事上两者接近得多。那场同周对决,我们在 Grok 4.6 分析里拆得更细。
7. 对单人创业者意味着什么
对一个单人经营者,GA 从三个方面改变了这笔账。第一,生产稳定性:你今天测的模型就是将来服务你调用的那个模型,版本钉在定价页上,而不是漂在一个预览标签下。第二,成本结构:即便在 8 月 16 日涨价之后,V4 Pro 的谷时定价仍让长 Agent 循环——那种每个任务要跑几百次工具调用的循环——以高端模型零头的成本存活,前提是你把重活挪进谷时。第三,生态信号:DeepSeek 自己的基准说明,是经由其内部执行框架 DeepSeek Harness 产出的,该框架已随 GA 以开源开发者预览版的形式发布。第一方 harness 改变了「模型 + 工具」的算式——你不必再借道 Claude Code 或 OpenCode、活在别人家的产品里,而是可以用厂商自己的 Agent 循环来跑这个模型。我们的 DeepSeek Harness 解析讲了那个框架做什么、用在哪。
诚实的告诫,还是这篇文章反复回到的那些:基准提升未经第三方验证,所以投入前先造一个验证任务;模型只支持文本,图像负载还得另找工具;定价窗口是真的但很窄——你今天锁定的经济性,不是 9 月的经济性。对 2026 年 8 月、预算有限、要做智能体编码的人来说,V4 Pro 0813 是同级别里最便宜的可信选项;它是不是最适合你那具体负载的那个,只有上手实测才能回答。
结论
DeepSeek V4 Pro 0813 是一种奇特的里程碑:旗舰模型的 GA,没有发布会、没有更新日志、没有新闻稿——只有定价页上的一串版本号。这种低仪式感符合公司的行事风格,也不改变这次发布的实质:一个在预览里待了 111 天的模型的生产版本,带着纸面上戏剧性、但仍待独立验证的智能体后训练改进。
这给买家留下的决策框架很直接。如果你已经在用 deepseek-v4-pro,你就在新构建上——重新测一遍你在预览时代量过的任何东西。如果你在为智能体工作对比模型,把官方基准表当作方向性参考,在你自己任务上验证。如果你对成本敏感,理解 8 月 16 日的价格变化,把重活排进谷时。如果你在纠结本周两个前沿级发布,Grok 4.6 对比是下一个正确的阅读——因为在智能体 AI 里,真正的竞争不再是谁的记分卡更好看,而是谁的经济性能让长跑 Agent 真正用得起。
常见问题
DeepSeek V4 Pro 0813 是新模型还是更新?
怎么访问 DeepSeek V4 Pro 0813?
0813 的基准成绩经过独立验证了吗?
DeepSeek 涨价什么时候生效?
DeepSeek V4 Pro 0813 支持图像吗?
DeepSeek V4 Pro 0813 是开源的吗?
https://floatboat.ai/zh/blog/deepseek-v4-pro-0813