Model & Benchmarks

Grok 4.6 解析:Agentic 前沿模型、基准数字与现实检验

Grok 4.6 深度解读:50 万 token 上下文、$2/$6 定价背后藏着 20 万 token 的价格陷阱、官方基准与独立评测的数字差异,以及它与 DeepSeek V4 Pro 0813 同周对垒时的选型逻辑。

Jade4 min read
Grok 4.6 解析:Agentic 前沿模型、基准数字与现实检验

TL;DR

  • Grok 4.6 是 xAI 于 2026 年 8 月 12 日发布的版本——它是在 Grok 4.5 基础上做的训练后升级,而非新架构,聚焦长时运行 Agent、编程与知识工作,上下文窗口 50 万 token。

  • 它在 Artificial Analysis 智能指数上追平 GPT-5.6 Sol(61 分),仅次于 Claude Opus 5 与 Claude Fable 5——同时保持 Grok 4.5 每百万 token 输入 $2 / 输出 $6 的定价,另有一个 2 倍速的更快变体。

  • 头条定价并不完整:提示词达到或超过 20 万 token 时,整个请求翻倍为每百万 token $4 / $12——这重写了真正长上下文 Agent 工作的成本结构。

  • 它最强的独立分数集中在 Agentic 知识工作——GDPval-AA v2 Elo 1753,仅落后 Claude Opus 5——而软件工程成绩好坏参半,且存在基准版本混淆夸大某些对比的问题。

  • Grok 4.6 与 DeepSeek V4 Pro 0813 GA 同周发布,让买家罕见地能在同一周内,对两款面向 Agent、又都定在预算价位的前沿模型做正面比较。

1. Grok 4.6 是什么、不是什么

Grok 4.6 是 Grok 4.5 之上的一个「点版本」,xAI 对策略说得非常直白:基础模型保持不变,把投入花在更长的训练、重新生成的监督微调轨迹,以及 Agentic 环境里的强化学习上。结果是,这个模型被调校成能在很多步骤上持续不跑偏——调研一个主题、跨代码库工作、把一个想法做成一件打磨好的成品——而不是更擅长回答更难的单轮问题。这与「规模升级型」发布是不同的一注,而它直接体现在这个模型在哪些地方领先、哪些地方不领先。

Grok 4.6 不是的东西是开放权重。与以 MIT 许可发布权重的 DeepSeek V4 系列不同,Grok 4.6 没有权重发布、也没有自托管路径——只能通过 xAI API、Grok Build、Cursor 以及 OpenRouter、Vercel、Cloudflare 等合作伙伴使用。对单人创始人来说,这个区别和基准表一样重要,因为它决定了:如果价格变动或产品方向改变,你的 agentic 工作流能否离开厂商的 API。

这次发布还带了一套深思熟虑的接入策略:Grok 4.6 立即上线 Cursor 与 Grok Build,首周附带 2 倍用量。Cursor 这一手尤其亮眼——这是 xAI 迄今最明确的信号:它竞争的是编程 Agent 负载,而不仅是聊天。同一周 DeepSeek 把 V4 Pro GA 悄悄推进了生产,xAI 却为瞄准同样工种的一个模型办了正式发布会——这让两次发布天然适合放在一起评估。

2. 规格、上下文与 20 万 token 价格陷阱

Grok 4.6 的技术规格表在纸面上很强:50 万 token 上下文窗口、文本与图像输入 + 文本输出且未声明输出上限、推理力度阶梯现在覆盖 low / medium / high(默认)/ xhigh。API 模型 ID 是 grok-4.6,速率限制为每秒 150 个请求、每分钟 5000 万 token。xAI 没有公布参数数量,知识截止日期为 2026 年 2 月 1 日——如果你用这个模型做时事研究,这一点值得知道。

定价表是多数报道写得最不完整的地方。xAI 的头条——每百万输入 token $2、每百万输出 $6——只适用于 20 万 token 以下的提示词。请求一旦达到这个阈值,整份请求的费率就翻倍为输入 $4 / 输出 $12,缓存输入也由每百万 token $0.50 涨到 $1.00。翻倍适用于请求里的所有 token,而不仅仅是超线的那部分——所以一份 20 万 token 的提示词与一份 50 万 token 的提示词按 token 计完全同价,不存在「前 20 万便宜」的区间。

这套结构对 Agentic 工作有直接影响——这类工作的意义恰恰在于长上下文。一个把大型仓库内容保持在上下文里的编程 Agent,或一个在会话中不断累积文档的研究 Agent,可能很快就越过 20 万 token。一旦越过,会话的实际成本就跳升 2 倍,「便宜的前沿模型」叙事随之塌向高端定价。务实的缓解手段正是 xAI 自家文档建议的做法:设置 prompt_cache_key,让重复上下文以每百万 token $0.50–$1.00 的价格走缓存——这对缓存输入是 75% 的折扣,对多轮循环意义极大。

推理力度阶梯作为一个成本杠杆值得细看。既然 reasoning_effort 参数提供 low、medium、high、xhigh 四档,xAI 等于给了开发者一个像 DeepSeek V4 扩展力度设置那样的旋钮:常规提取与格式化用 low,典型 Agent 步骤用 medium,规划与调试用 high(默认),把 xhigh 留给最难的题。由于 token 消耗随力度档位放大,这个旋钮实际上是披着外衣的价格选择器——习惯性地把所有东西都跑在 xhigh 上,会把一个预算模型悄悄变成一个高端价位模型。按任务类型分流力度档位的团队反馈说,可以把单任务的有效成本压到等于或低于短上下文头条费率。

还有一个极少出现在发布报道里的部署考量:速率限制。Grok 4.6 的 API 上限是每秒 150 个请求、每分钟 5000 万 token,可用区域为 us-east-1us-west-2。对只跑一两条 Agent 循环的单人创业者来说,这是很宽裕的空间。对要并行跑一批长上下文任务的团队来说,每分钟 token 上限会比价格更早成为实际约束——而 20 万阈值又会与这个上限相互作用,因为一旦跨入长上下文区间,同一分钟内能结算的 token 数就翻倍了。为突发负载做预算,意味着要同时规划这两条限制。

3. 基准:数字说明了什么

读 Grok 4.6 最干净的方式是看独立评测,因为发布材料用了两个容易混淆的不同基准版本来呈现数字。在 Artificial Analysis 智能指数(九个基准的综合)上,Grok 4.6 得 61 分,追平 GPT-5.6 Sol Max,落后于 Claude Opus 5(63)与 Claude Fable 5(62)。独立测量在 60.92 处验证了这一说法,在二十个模型中排名第四。这是真实的前沿位置:这个模型最强的成绩在 Agentic 知识工作,而不是静态推理。

分基准的画面更细。在 GDPval-AA v2(Artificial Analysis 对真实世界 Agentic 知识工作的度量)上,Grok 4.6 的 Elo 为 1753——仅次于 Claude Opus 5,与 Claude Fable 5 在统计上无差异。在 AA-Briefcase(一个长视野 Agentic 知识基准)上,它落在 Elo 1577,处于 Fable 5 的区间。在基于终端的软件任务(Terminal-Bench v2.1)上,它拿 88.4%,与领先者持平。发布表格里真正有误导性的唯一一处是编码工程侧:xAI 自家图表显示 Grok 4.6 在 Terminal-Bench v3.0(一个更难版本)上为 26%、DeepSWE v1.1 上为 65.9%,而 GPT-5.6 Sol 在两者上都领先——同时一个 v2.1 的 88.4% 数字一直在坊间流传,仿佛它就是同一个测试。不同基准版本,不可比;这个模型在 Agentic 知识工作上很强,在最难的软件工程评测上居中游。

这些数字背后的规律讲出了一个自洽的故事,说明 xAI 优化了什么。Grok 4.5 的弱点是长视野下的一致性——它可能开局强劲,却在中途跑偏。Grok 4.6 对 Agentic 环境的训练侧重正是冲着这个故障模式去的,而提升最大的基准恰恰是那些惩罚跑偏的:AA-Briefcase、GDPval、τ³-Banking 奖励的都是「按顺序完成一个多步任务」,而不是「给一个漂亮但孤立的答案」。代价在同一张表里也看得见——纯推理与最难的编程评测没有同样上升,这与「牺牲部分广度换取持续工作上的可靠性」的训练后路线是一致的。

4. Grok 4.6 赢在哪里、输在哪里

Grok 4.6 的赢面集中在 Agentic 知识工作与长视野交互任务。除了 GDPval 与 AA-Briefcase 的分数,它还在客服式工具调用上领先全场(τ³-Banking 50.7%,前二),并在法律推理基准上拿出了所有模型里最大的单项提升(Harvey LAB 15.8%,高于 Grok 4.5 的 12.9%,对比 GPT-5.6 Sol 的 2.5%)。在视觉与交互工作上——从单条提示词产出打磨好的前端成品——xAI 说这个模型的首版尝试比前代更强,独立评测者也报告,过去困扰 AI 前端的「一眼假」观感已基本消失。

输面是软件工程的深度。DeepSWE v1.1 的 65.9% 落后于 GPT-5.6 Sol 的 73% 和 Fable 5 的 70%;Terminal-Bench v3.0 的 26% 落后于 GPT-5.6 Sol 的 34.6%。如果你的负载以终端为主或要做仓库级重构,Grok 4.6 不是领先者。这个模型在部分 vibe-coding 与 Web 开发排行榜上也位居中游。想了解它与另一个多模态重心在视频生成而非 Agent 的模型相比如何,我们的 MiniMax H3 解析覆盖了邻近地带——但对 Agentic 工作而言,两者并不互相替代。

5. Grok 4.6 vs DeepSeek V4 Pro 0813

与 DeepSeek V4 Pro 0813 的同周配对,是本月最有价值的对比,因为两个模型用同样的价格哲学瞄准同样的负载。Grok 4.6 标价每百万 token $2 / $6;V4 Pro 则是 $0.435 / $0.87——输入约为 Grok 的四分之一、输出约为七分之一,不过两者都比高端闭源档低一个数量级。两者都是为了长时运行 Agent 做的训练后升级,而且在 8 月中旬的 24 小时内先后到达。

它们的差别在于各自优化什么。Grok 4.6 赢在 Agentic 知识工作与原始综合分——它的智能指数 61 追平 GPT-5.6 Sol,而 V4 Pro 0813 的独立综合分上次测量时是 53。DeepSeek 赢在价格、MIT 许可权重(可以自托管),以及生态里存在第一方 harness。单看编程,两者比综合分差距所暗示的更接近,而且双方官方分数都尚未被完全独立验证。对买家来说,诚实的问题是按负载优先:知识密集的 Agent 任务指向 Grok,规模化且成本最小化的 agentic 编程指向 DeepSeek。我们的 DeepSeek V4 Pro 0813 分析从另一面深入覆盖了这次对比。

6. 实用要点

如果 Grok 4.6 在你的评估池里,四个事实应该影响你的决策。第一,按 20 万+ 的费率、而不是头条费率为长上下文工作做预算——一个不断累积上下文的研究 Agent 会跨过阈值、按每百万 token $4 / $12 付费,所以在投入之前就要定好会话规模与缓存 key。第二,使用 reasoning_effort 旋钮:多数常规 Agent 任务由 low 与 medium 覆盖,把 xhigh 留给最难的题,token 账单才能受控。第三,以版本纪律对待编程基准——88.4% 的 Terminal-Bench 数字和 26% 的数字是不同的测试,谁也不支持谁的话术。第四,记住没有开放权重这条路:你的 Grok Agent 工作流跑在 xAI 的 API 上,即便今天很便宜,这也是一个厂商锁定决策。

对 Agentic 知识工作本身——研究、法律式推理、长视野文档任务——Grok 4.6 是 2026 年 8 月可得的最具性价比前沿选项,而且支持这一点的独立证据比它编程方面的说法更强。想了解在成本是硬约束时 DeepSeek 四种 Agent 原型如何对比的框架,见什么是 DeepSeek Agent。而想要同一 Agentic 能力等级、更低价格点与开放权重的单人创业者,DeepSeek 的 V4 家族这一周仍是性价比替代。

还有一个供无人值守跑 Agent 的团队考虑的要点:长期可靠性正是 Grok 4.6 的 Agentic 训练在实践里显现的地方。用编程 Agent harness 跑这个模型的独立评测者报告说,它完成长多步会话所需的重启次数比 Grok 4.5 更少;xAI 自家发布材料也强调视觉与交互成品「更强的首版尝试」。对无人值守的 Agent 来说,强的首版尝试不是奢侈——它是「一次跑完的任务」和「不断重新请求、打补丁烧 token 的循环」之间的差别。如果你在睡觉时自动化工作,单凭这一条特性,可能就足以让这个模型值回票价——与任何基准表无关。

结论

Grok 4.6 是 xAI 迄今最锋利的发布,而它的锋利是具体的:一个在 Agentic 知识工作上领先的前沿模型,价格与前代持平,并且自家基准表诚实到细心的读者能直接看到它输在哪里。这个模型本周真正的对手,不是指数顶部的 Claude Opus 5 或 Fable 5——而是价格曲线底部的 DeepSeek V4 Pro:以零头的价格提供相近的 Agentic 负载适配。

两者之间的选择是一个负载路由问题,而不是选模型的问题。Grok 4.6 凭 GDPval 与 AA-Briefcase 那些真正前沿的分数,在知识密集的 Agent 任务上挣回自己的 $2/$6。DeepSeek 在 token 量大、成本有硬约束的地方胜出,因为输出价是七分之一这个差距,会在一长条 Agent 循环里快速复利。无论你选谁,都请按真实成本结构做预算——20 万阈值、推理力度旋钮、缓存 key——并在信任任何一方的记分卡之前,用你自己的任务去验证。

常见问题

Grok 4.6 是什么?
Grok 4.6 是 xAI 于 2026 年 8 月 12 日发布的旗舰模型——在 Grok 4.5 基础上做的训练后升级,聚焦长时运行 Agent、编程与知识工作,带 50 万 token 上下文窗口,以及最高到 `xhigh` 的推理力度阶梯。
Grok 4.6 多少钱?
20 万 token 以下的提示词按每百万输入 token $2、输出 $6 计费(缓存输入 $0.50)。达到或超过 20 万 token 时,整份请求翻倍为 $4 / $12。另有一个按基础费率 2 倍计价的更快变体。
Grok 4.6 支持图像吗?
输入支持、输出仅文本。Grok 4.6 接受文本与图像输入,产出文本输出,没有声明的输出长度上限。
Grok 4.6 开源吗?
不是。与 DeepSeek 的 V4 系列(MIT 许可权重)不同,Grok 4.6 没有开放权重发布、也没有自托管选项。它只能通过 xAI API、Grok Build、Cursor 以及 OpenRouter、Vercel 等合作伙伴使用。
Grok 4.6 比 GPT-5.6 Sol 更好吗?
两者在 Artificial Analysis 智能指数上同为 61,但综合分掩盖了负载分野:Grok 4.6 在 Agentic 知识工作(GDPval-AA v2)上领先,而 GPT-5.6 Sol 在最难的软件工程基准(DeepSWE v1.1、Terminal-Bench v3.0)上领先。
Grok 4.6 与 DeepSeek V4 Pro 0813 相比如何?
两者同周发布,都瞄准预算价位的 Agentic 负载。Grok 4.6 综合智能与知识工作分数更强($2/$6);DeepSeek V4 Pro 输入便宜约 4 倍、输出约 7 倍($0.435/$0.87),且带 MIT 许可权重与第一方 harness。选哪个,取决于对你的负载来说,是成本更要紧,还是基准余量更要紧。

https://floatboat.ai/zh/blog/grok-4-6