Model & Benchmarks

GLM-5.3:后训练扩展、开放权重的编码能力,与网络安全意外

GLM-5.3 沿用 GLM-5.2 基座,仅靠后训练扩展就换来约 50% 的编码能力提升。本文拆解 Terminal-Bench、DeepSWE 成绩、网络安全意外、开放权重节奏、定价与局限。

Ketd3 min read
GLM-5.3:后训练扩展、开放权重的编码能力,与网络安全意外

TL;DR

  • GLM-5.3 于 2026 年 8 月 14 日发布,直接复用了 GLM-5.2 约 7430 亿参数的同一基座,全部性能提升都来自后训练(post-training)扩展——这是对"不重新预训练、能否抬高基座模型智能上限"的一次现场检验。Z.ai 称,提升来自多出数十倍的长程(long-horizon)环境、更丰富的环境类型,以及基于 IndexShare、SAO 和 Slime 强化学习技术栈、时长大幅拉长的后训练过程。

  • 编码能力是头号看点。Z.ai 报告相对 GLM-5.2 有约 50% 的内部提升,并在 Terminal-Bench 3.0(4.6 → 28.3)、DeepSWE v1.1(46.2 → 66.9)和 Agents' Last Exam CLI(23.8 → 28.5)上拿出开源优先的结果,据 Z.aiGLM-5.3 发布说明,它缩小了与 Claude Fable 5 之间大部分可测差距,同时每个输出 token 的可测成本仍明显低于 Claude Opus 4.8。

  • 意外之喜在网络安全。GLM-5.3 在 CyberGym 上拿到 84.5%——领先 Claude Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%),OfficeChai 有报道——而 Z.ai 称这项能力并非刻意训练出来的。开放权重发布之前,它参加了一场红队演练,在 269 个项目中发现 2,436 个漏洞,其中 1,097 个属于中危或高危。

  • 权重约两周后开放(预计沿用 GLM-5.2 的 MIT 许可)。在此之前,GLM-5.3 通过 GLM Coding Plan(Lite ¥118 / Pro ¥538 / Max ¥1078 每月)以及 ZCode、Cursor、Cline、Claude Code 等工具对外提供。它也已与 DeepSeek、Kimi、Gemini、Claude、MiniMax 一起内置进 Floatboat 的模型名单。

1. 为什么一个没有新基座的次版本依然重要

旗舰模型发布的常规叙事是新一轮预训练:更多参数、更多数据、更大的架构,以及随之移动的基准榜单。GLM-5.3 打破了这套模板。Z.ai 明确表示基座模型与 GLM-5.2 完全相同,所有可测提升都来自后训练阶段——更长的训练、更多样的环境,以及经过其强化学习技术栈处理的、多得多长程任务数据,这一点记录在 Z.ai发布公告里。这个框架的意义超出具体数字本身,因为它检验了业界从第一代大模型起就抱持的一个假设:一旦预训练结束,模型的智能就大致定型,微调只能打磨行为、无法抬高天花板。

支持这个假设的证据一整年都在变弱。DeepSeek 的 V4 系列同样通过后训练投入在版本之间大幅进步,而我们的 DeepSeek V4 Pro 0813 分析所记录的同周对比,展示了现代模型进步如今有多少来自 RL 阶段而非架构。GLM-5.3 是这个主张迄今最强硬的一版——因为它刻意把架构锁死,把数月的算力与环境工程全部砸在扩大后训练阶段上。结果是:没有任何新预训练,模型就在长程任务上大幅胜过自己的前辈。这给所有构建 Agent 的人抛出一个实际问题——当一个实验室能从同一个基座里挤出 50% 的编程提升时,模型能力的刷新周期可能就不再依附于昂贵的预训练节奏了。

发布时间点里还藏着一个市场信号。ZCode 官网在 8 月 3 日短暂泄露了一个"ZCode for GLM-5.3"页面,智谱股价当天上涨超过 8%;高盛随后把对该公司营收的预期上调 35%,网易科技有此报道。市场的反应提醒我们:在当下这个周期里,模型能力公告会直接牵动发布方的公司价值,而开放权重实验室之间的竞争,如今拼的是后训练执行,而不只是基座规模。

2. GLM-5.3 是什么——同一基座,极限后训练

GLM-5.3 是一个与 GLM-5.2 同源的混合专家(MoE)模型:总参数约 7430 亿、每个 token 只激活其中一小部分,上下文窗口继承自 GLM-5 家族。Z.ai 没有改动基座、tokenizer 或架构。它改的是预训练之后发生的事。公司的发布文档描述了一段比上一版长得多的后训练过程:跑在更大规模的模拟任务环境集上——终端、工具调用循环、长时运行的代码仓库、agentic 工作流——优化目标是任务完成度,而不是下一个 token 的准确率。

背后的强化学习基础设施值得点名,因为它解释了为什么提升集中在那个位置。IndexShare 负责长上下文处理;SAO(更早期长程 RL 工作的继任者)负责跨扩展任务序列的强化学习;Slime 训练框架(Z.ai 已开源)负责编排整条 pipeline。三者都出现在 GLM-5.2 的后训练里。GLM-5.3 增加的是规模与多样性:更多环境、更长的回合、更多的算力,全部对准同一个基座。公司自己的话——"我们可能离这个基座的智能上限还远得很"——等于承认:他们自己也不知道这个特定底座还能被推多远。

有一个设计细节会影响模型在实际使用中的行为:GLM-5.3 保留了 GLM-5.2 引入的努力档位(effort-level)控制,让调用方在推理深度与延迟、token 成本之间做取舍。在 Z.ai 的内部 Code Bench 上,公司报告称在高推理档下,GLM-5.3 平均约用 50,000 个输出 token 完成 31.5% 的端到端任务——完成率高于 Claude Opus 4.8 的 29.5%,而后者达到这个成绩需要约 120,000 个 token,见 MarkTechPost 的报道。这是同一类任务上 2 比 1 的 token 效率优势,对任何按 token 付费跑长 Agent 任务的人来说,它和头版头条的完成率数字一样重要。和所有厂商自报的结果一样,这些数字在被独立复现之前都应视为声明而非事实,但效率主张的方向与 Z.ai 对整个 GLM-5 产品线的报告是一致的。

3. 编程数字——提升实际落在哪里

读懂 GLM-5.3 最干净的途径,是看那些度量 Agent 实际行为的基准,因为后训练扩展正是在那里显形。在测试"模型在真实终端环境里完成复杂任务"的 Terminal-Bench 3.0 上,GLM-5.3 从 4.6 跳到 28.3。在度量长程软件工程与持续代码修改的 DeepSWE v1.1 上,它从 46.2 升到 66.9。在覆盖跨工具协作与长程专业任务的 Agents' Last Exam(CLI)上,它从 23.8 提到 28.5——Z.ai 指出,这一结果在单项测试上超过了 GPT-5.6 Sol。在横跨 44 个职业的知识工作基准 GDPval-AA v2 上,它拿到 1,769 分,公司把这一数字当作"强编码能力会迁移到专业任务执行中"的证据。以上均出自 Z.ai发布说明

这些全部是 Z.ai 自报的数字,阅读时应该带着这层保留。更引人注目的是提升曲线的形状:增益在短的单轮测试上最小,在最长程的评测上最大。Terminal-Bench 3.0 是这套基准里最难也最长的,提升超过六倍;而 Agents' Last Exam 只动了不到 20%。这个形状,正是"在 agentic 环境里做后训练"会预测的结果——模型变强的是持续多步执行,而不是孤立的问答——也是社区今年从其他实验室重 RL 发布里看到的同一个模式。

对要决定"这事跟我有没有关系"的单人开发者来说,相关对比对象不是 GLM-5.2,而是 GLM-5.3 在当下市场上紧挨着的那款模型。Z.ai 把它定位为截至 2026 年 8 月中旬最强的开源编码模型,编码与 agentic 能力"逼近"Claude Fable 5,并在自家评测上领先其他国产模型。独立验证还没追上这次发布——模型公开还不到一周——这正是"等两周开放权重"之所以重要的原因。权重不像厂商图表,任何人都能重跑,社区在 8 月底的独立 Terminal-Bench 和 DeepSWE 跑分才是真正的考试。

4. 网络安全意外——涌现能力及其双刃性

发布当天登上头条的基准不是编码测试。在"从白盒源码出发、考察模型能否发现并验证真实漏洞"的 CyberGym 上,GLM-5.3 拿下 84.5%,以微弱优势压过 83.8% 的 Claude Mythos 5 和 83.6% 的 GPT-5.6 Sol,见 OfficeChai 的分析Z.ai 表示,它把漏洞发现数据加入后训练配比时只预期小幅提升,结果却观察到模型开始跨整条利用链推理,而不只是发现孤立的 bug。在测试"对真实漏洞如何被利用做更深推理"的 ExploitBench 上,GLM-5.3 把 GLM-5.2 的分数提高了一倍多,从 24.4 爬到 54.4。在吞吐测试 ExploitGym 上,它两小时完成 105 个任务、六小时完成 130 个,而 GLM-5.2 分别是 29 和 39 个。

这些数字伴随着 Z.ai 自己给出的诚实保留:测试离利用链越往上走,与闭源前沿模型的剩余差距就越大。Mythos 5 在 ExploitBench 上拿 78.0,并在 ExploitGym 的六小时预算内完成了远超 180 个任务;GPT-5.6 Sol 紧随其后。CyberGym 是 GLM-5.3 唯一完全追平甚至反超的基准,但漏洞发现只是安全工作流的第一步;验证、利用与修复每一步都更难,而模型恰恰在最危险的地方最弱。Z.ai 自己的措辞很直接:完整的利用能力越深,与 Mythos 5 这类模型的差距就越大。

安全能力是一把双刃剑,Z.ai 在公开场合也是这么对待它的。防御侧:发布前公司与清华、南开及多家中国安全厂商联合跑了一场红队项目,在 269 个项目中发现 2,436 个漏洞——覆盖 Android、Windows、macOS 和广泛使用的应用——最老的一个大约有 45 年历史,ForkLog 有此报道。风险侧:一个带真实利用能力的开放权重模型,会降低那些能在本地部署中移除安全护栏的攻击者的门槛。Z.ai 的应对是:把开放权重发布推迟两周做安全评估与加固、公开一份安全披露台账,并主张防御能力不应继续成为少数闭源厂商的专利。评测本次发布的 DARKNAVY 团队认为,它在风险缓解与能力发布之间取得了比前几代更好的平衡。这种平衡在真实世界里是否站得住,要等权重发布后由社区来回答。

5. 开放权重、定价与生态

GLM-5.3 尚未开放。按 Z.ai 的计划,安全评估与加固之后约两周发布权重;社区的普遍预期——基于 GLM-5.2 在 Hugging Face 上以 MIT 许可发布——是 GLM-5.3 会走同一条路。在权重落地之前,访问通道是 GLM Coding Plan 订阅(国内 Lite ¥118、Pro ¥538、Max ¥1078 每月;国际版 $18/$80/$168,见智谱 Coding Plan 文档),按积分计量用量、每五小时重置、按档位设每周上限。相较旧方案国内价格上涨——Pro 从 ¥149 涨到 ¥538——曾引发争议,但它也释放了一个信号:经过一年在中国市场激进的低价竞争后,智谱相信这个模型的能力撑得起高端定价。

对开发者来说,生态故事和价格一样重要。GLM-5.3 首发在 Z.ai 自家的 ZCode 环境和 AutoClaw 效率工具里,并在 TraeWork、WorkBuddy、Qoder、CatPaw、JoyCode、OpenCode 提供早期访问。由于 Z.ai 的 API 兼容 Anthropic-Messages,模型只要改 base-URL 和模型名就能插进 Claude Code,也能通过 OpenAI 兼容端点接入 Cursor、Cline 和 Roo Code。这套兼容性正是当初让 GLM-5.2 作为更便宜的 Claude Code 后端流行起来的同一套模式,也意味着 GLM-5.3 继承的是现成的集成生态,而不是从零起步。

模型明显缺少的一个能力是原生视觉。GLM-5.3 是纯文本模型,而社区呼声最高的功能——Z.ai 首席科学家唐杰发起的一次公开意见征集获得超过 40 万次浏览,截图、PDF 和 UI 稿是呼声最高的请求,量子位有报道——是原生多模态输入。智谱历来把视觉能力放在独立的 GLM-V 产品线里,而不是放进文本旗舰,GLM-5.3 延续了这个分工。对读设计稿或要靠眼睛验证前端输出的单人创业者来说,这仍然是一个需要拿来和模型编码优势一起权衡的缺口。对以文本为主的编码与 agentic 工作流,它是当前可用的最强开放权重选项。

6. GLM-5.3 对 Agentic 工作流意味着什么

抛开基准不谈,GLM-5.3 对 Agent 构建者的实际意义,在于它证明:后训练扩展可以在不换基座的情况下大幅抬高模型上限。这会从三个方面改变规划。第一,能力刷新周期可能不再跟随预训练节奏——一个实验室可以每两个月在同一基座上交付一个实质更好的 Agent 模型,GLM 5.x 产品线如今已经反复做到。第二,token 效率正在与完成率一起成为一等一的差异化指标——一个在端到端任务完成率上持平或超越高端竞品、输出 token 却用不到一半的模型,会改变长运行 Agent 的经济账,尤其对那些每月跑几十个 Agent 驱动事件的单人创业者。第三,安全维度是真实的、必须纳入预算——那种能在你的依赖里找漏洞的能力,一旦权重公开,也可能被攻击者对准你的代码库,所以评估应当包括"你实际跑的东西",而不只是"模型宣称的东西"。

对当下市场里做选择的单人运营者来说,GLM-5.3 相对同周发布的竞品处在一个有趣的位置。对比 Grok 4.6 和 Gemini 3.7 Flash——后者在我们的 Gemini 3.7 Flash 分析里有专门拆解——GLM-5.3 的优势是开放与 token 效率,闭源模型则以速度和生态成熟度回击。对比自家前辈,结论更清楚:GLM-5.3 就是 GLM-5.2 本应成为的样子,而且 Coding Plan 会自动把旧模型调用路由给它。与闭源前沿模型不同,它还提供一扇逃生门——MIT 式权重、可自托管、无厂商锁定——这对任何承受不起 API 突然调价的 Agent 基础设施都至关重要。在 Floatboat 里,GLM 已经是内置模型家族,不需要 API key 或路由配置,所以实际问题只是负载匹配,而非集成成本。对最难的编码与长程 agentic 工作,配合安全加固的部署姿态,GLM-5.3 是截至 2026 年 8 月最强的开放权重默认选项。

结语

GLM-5.3 是目前最清楚的证据:后训练扩展不是舍入误差——它是一套生产策略。模型沿用 GLM-5.2 的 7430 亿参数基座,仍实现了约 50% 的内部编码提升、Terminal-Bench 3.0 六倍进步、与最新闭源模型同档次的 DeepSWE 分数,以及一项在漏洞发现上胜过两家最强闭源模型的涌现式网络安全能力。局限同样清楚:没有原生视觉、独立测试者认为粗糙的审美判断、在最深层的利用工作上与 Mythos 5、GPT-5.6 Sol 存在真实差距,以及"开放权重 + 进攻性能力"固有的风险。

未来两周将讲出更有意思的故事。权重落地时,社区会重跑基准、微调模型,并检验安全加固在野外是否站得住。眼下,这个模型是"通往前沿能力的开源路径,不需要每隔几个月就来一次新预训练"这一主张的最强论据——而且对规模化 agentic 编码来说,"每完成一个任务的成本"这笔账,天平正在倒向开源一侧。

常见问题

GLM-5.3 比 GLM-5.2 强吗?
在 [Z.ai](<https://Z.ai>) 报告的所有基准上都更强,而且长程任务的差距很大:Terminal-Bench 3.0 从 4.6 提升到 28.3,DeepSWE v1.1 从 46.2 提升到 66.9,CyberGym 从 77.2% 提升到 84.5%。基座模型完全相同——所有提升都来自后训练扩展。等开放权重的两周会让社区独立核验这些数字,但方向与模型的设计是一致的。
GLM-5.3 多少钱?
在开放权重落地之前,GLM-5.3 通过 GLM Coding Plan 提供:国内 Lite ¥118、Pro ¥538、Max ¥1078 每月,国际版 $18/$80/$168。套餐按积分计量用量、每五小时重置、按档位设每周上限。API 访问在发布后不久跟进,权重本身将以预计与 GLM-5.2 相同的 MIT 许可开放。
GLM-5.3 为什么有网络安全能力?
[Z.ai](<https://Z.ai>) 表示,它把漏洞发现数据加入后训练配比时只预期小幅提升,结果观察到的却是一项涌现能力——模型开始跨整条利用链推理,而不只是发现孤立 bug。CyberGym 得分(84.5%)小幅压过 Claude Mythos 5 和 GPT-5.6 Sol,但在更深的 ExploitBench 和 ExploitGym 测试上,它仍明显落后于这两款闭源模型。
GLM-5.3 支持图片吗?
不支持。GLM-5.3 是纯文本模型,原生视觉是社区呼声最高的功能——首席科学家唐杰的公开意见征集获得超过 40 万次浏览,视觉相关请求在评论区占主导。智谱历来把视觉放在独立的 GLM-V 产品线里,GLM-5.3 延续了这个分工。
Floatboat 里能用 GLM-5.3 吗?
能。GLM 是 Floatboat 里与 DeepSeek、Kimi、Gemini、Claude、MiniMax 并列的内置模型家族——不需要 API key、不需要路由配置、没有外部计费。GLM-5.3 会像之前各代 GLM 一样出现在模型选择器里,Auto Mode 也会在事件复杂度需要时路由到它。
考虑到 GLM-5.3 的安全能力,用它安全吗?
[Z.ai](<https://Z.ai>) 推迟两周发布权重做安全评估与加固:发布前红队项目在 269 个项目里找到 2,436 个漏洞,并公开了安全披露台账;DARKNAVY 团队评价它在风险缓解与能力之间取得了良好平衡。固有权衡仍在——带真实利用能力的开放权重模型可以被指向任一方向,部署时应与对待任何能访问你基础设施的模型同等加固。

https://floatboat.ai/zh/blog/glm-5-3