随笔 / AI 与模型训练

GLM 5.3 没换底座,只换了训练方式,这才是它比跑分重要的地方

· AI/Agent 后训练 GLM RLVR

昨天智谱发了 GLM 5.3。又是一个国产开源模型,跑分很好看,各大社区又吵了起来。但这次有个动作把我拉住了:它和上一代用的是同一个底座,全部能力提升都来自后训练。这句话比任何一张跑分表都值得看。这篇我想把这件事讲清楚:GLM 5.3 是什么,大家怎么反应,以及我最感兴趣的那一点,为什么"只换训练方式"就能带来这么大的提升。

昨天智谱发了 GLM 5.3。又是一个国产开源模型,跑分很好看,各大社区又吵了起来。

说实话,这种发布我已经有点麻了。过去一年,几乎每周都有一个模型号称"开源领先""追平闭源",数字一个比一个漂亮,真用起来又常常是另一回事。我本来没打算写。

但这次有个动作把我拉住了。智谱在官方博客里把话说得很白:GLM 5.3 和 GLM 5.2 用的是同一个底座,没有换更大的模型,没有重新烧一轮天价预训练,全部的能力提升都来自后训练(post-training)。原话是 "Scaling post-training is all we did for GLM-5.3."

这句话比任何一张跑分表都值得看。它指向的是一件比"又一个开源模型超了谁"大得多的事:大模型能力提升的主战场,正在从"把模型造得更大",挪到"给模型造更好的训练环境和反馈信号"。预训练决定模型懂多少,后训练才决定它能把多少潜力变成可靠的本事。这篇我想把这件事讲清楚:GLM 5.3 是什么,大家怎么反应,以及我最感兴趣的那一点,为什么"只换训练方式"就能带来这么大的提升。

插图:同一个运动员没去升级身体,而是换了一套更狠的训练方法,脚印越来越稳地走向目标

GLM 5.3 到底做了什么

先把事实摆清楚,数字我只挑最说明问题的几个。

底座没变。GLM 5.3 沿用的还是 5.2 那个约 744B 总参数、约 40B 激活的 MoE 底座。上下文 1M tokens,最大输出 128K,thinking 分 low/high/max 三档(默认 max,而且这一版不再支持彻底关掉 thinking,算个 breaking change)。权重没立刻放,官方说大约两周后、八月底才发,先走自家的 Coding Plan。

那提升有多大?官方自报里最能说明问题的是两个数:Terminal-Bench 3.0(一个偏真实命令行 agent 任务的基准)从 4.6 跳到 28.3;网络安全方向的 CyberGym 从 77.2 提到 84.5。配合这些数字,智谱还联合清华、南开和几家安全厂商的红队,用模型初筛去重出了 2436 个漏洞,覆盖 269 个项目,最早的一个能追溯到 1981 年,平均潜伏了 26 年多。

丑话先说在前面:这些全是官方自报,权重没发,还没有任何第三方平台复核。所以上面的数字先当"厂商主张"看,别当结论。这一点后面还会回来讲。

各社区怎么反应:吵的其实不是跑分

我翻了一圈海外和中文社区,发现一个挺有意思的现象:真正在讨论 GLM 5.3 跑分的人不多,大家借这个由头吵的是另外两件事。

海外那边,Hacker News 主帖冲到了 1147 分、569 条评论,但热度最高的主线不是"这模型多强",而是"终于有个能用来做安全研究、又不被拒绝的模型"。有人调侃"这只是 5.2 加了点 post-training magic,权重还得等两周";一位叫 LeonidBugaev 的用户说,他连自己项目的 issue triage 都被美国模型拒绝,只好转去 Kimi 和 GLM;还有一条被很多人附议的评论讲得更直白:"如果防御者拿不到好模型而攻击者能拿到,那开放才是平衡。"网络安全这东西攻防两用,这一派明显站"开放盾"这边。

真正值钱的对照来自独立实测。安全公司 Semgrep 拿统一的漏洞检测基准复测了一遍,结论是:GLM-5.3 大致到了 Opus 4.8 那一档的检测水平,成本却只有七分之一左右,但存在一个他们还在追查的方差问题,有时候像顶级黑客,有时候又在很基础的逻辑上失手;而且对着当前真正的前沿(Opus 5、GPT-5.6 Luna)还是够不着。另一家 D-Central 说得更直接:CyberGym 那个 84.5 只测的是"单点漏洞发现",恰好是利用链最前端、也是 GLM 提升最大的方向,真正的差距在更靠后的链式利用上(ExploitBench 54.4 对 Mythos 5 的 78)。

把这些声音放在一起,你会发现海外吵的其实不是"28.3 高不高",而是两件更实质的事:一是美国厂商越来越严的护栏,正把一部分做安全研究的人推向开放模型;二是厂商自己报的数字到底能不能信。

中文社区的反应则更"实测向"。钛媒体、腾讯沃垠、智东西几家横评的结论相当一致:GLM 5.3 偏科,编码和网安很强,但通用表达、审美、创意写作明显弱一截,还有个毛病是"陷进去出不来",在长程任务里钻牛角尖。界面新闻直接说"K3 仍是第一梯队"。倒是科创板日报引的分析师白润轩给了句背书:"后训练这条路线,工程上成立。"Nathan Lambert 那句评价我觉得最到位:"Z.ai 强在后训练,Kimi 强在预训练。"

后训练到底是什么

要讲清"为什么不换底座也能大提升",得先把"后训练"这个词从行话翻译成人话。

我的理解是:预训练教知识,后训练教做事。

预训练是拿海量文本让模型做"预测下一个词"。读完这一整座图书馆,它肚子里装了很多东西,决定了潜力上限。但你真去问它问题,它多半只会顺着你往下接话,而不是"回答"你。就像一个把技术文档倒背如流的应届生,第一次坐到终端前面对一片红字的报错,依然会手足无措。它懂很多,但还不会干活。

插图:一个把整本书背下来的应届生,第一次坐到满是红字报错的终端前手足无措

后训练就是在这个底座之上,用更少但更精心的数据和信号,把它塑造成一个真正有用、听话、对齐的助手。它决定了"潜力有多少能被可靠地兑现出来"。

这套技术这几年演化得很快,我用一句话带过每一代:

最早是 SFT(监督微调),给它一堆"问题 + 标准答案",让它照着模仿。问题是它超不过示范数据的上限。

然后是 RLHF,不再给标准答案,只告诉它"这一版比那一版好",把人的偏好本身当训练信号。这个思路特别朴素,我之前写过一篇《你改的那四份评语,就是手工版 RLHF》,讲的就是普通人怎么在不知不觉中干过同样的事。

再往后是关键的一步,RLVR(可验证奖励的强化学习)。它的奖励不再看"人喜不喜欢",只看"程序能不能自动判对错":数学题答案对不对、代码能不能跑过测试。这是整个故事的转折点,下面细说。

最新的方向是把 RL 拉进多轮、长程的 agent 任务,让模型学会"先想再答",在推理时多花时间换准确率。

为什么不换底座,也能有这么大的提升

这是全文我最想讲清的一点。答案拆成三层。

第一层:能力是激发出来的,不是新造出来的。 Nathan Lambert 给后训练下过一个精辟的注解:后训练做的不是"教模型新东西",而是"把底座里已经潜在存在的行为提取出来、放大"。他自己有句话我印象很深:过去我们用上百万条监督样本教模型数学,现在只让它在几千道题上自己去试不同解法,反而达到了更高的峰值。底座里其实早就有这些东西,只是没被点亮。

第二层:这个提升的数量级是真的,不是营销。 METR 做过一个很干净的实证:拿同一个 GPT-4 base model,只做后训练,把 agent 任务的成功率从 5% 左右拉到了 30% 左右,这个幅度相当于把 agent 框架从 GPT-3.5 整个换成 GPT-4。注意,这是 GPT-4 身上的实验,不是 GLM;但它证明了"不换底座、只靠后训练",在受控条件下确实能带来代际级别的提升。

第三层,也是最关键的机制:可验证奖励把"偶尔做对"压成了"稳定做对"。 这里有个反直觉的事实:底座模型在你允许多试几次(pass@k 里 k 很大)的时候,其实偶尔是能解出难题的,说明能力潜在地在那儿;但你正常只用一次(k 很小)的时候,它就不可靠了。RLVR 干的事,就是把这种"偶尔能蒙对"压成"每次都稳定做对"。

插图:同一个射手,箭的落点从稀稀拉拉偶尔中靶,练到密集收拢每发都中

而可验证奖励之所以是转折点,是因为它扛得住长时间优化。道理很简单:数学题答案对不对、代码过没过测试,这种奖励没法作弊,所以你可以放心让模型在上面跑很长很长的优化,不用担心它学会钻空子骗奖励。相比之下,RLHF 那种"看人高不高兴"的奖励很容易被 hack:模型会学会讨好而不是做对,所以只能短跑。Karpathy 在 2025 年的年度回顾里把这事说得最透:RLVR 吃掉了原本打算投给预训练的算力,2025 年能力进步的主力,其实是"大小差不多的模型,配上更长的 RL 训练"。

GLM 5.3 就是这条路走得很极端的一个样本。它搭了一条环境合成流水线:让 research agent 从真实工程工作里收集模式,转成可以跑起来的多步任务环境;judge 验证这环境可解;verifier 在没有标准答案的情况下合成判断;再用 solver 的轨迹去发现和堵掉"作弊捷径"。整套 RL 跑在他们开源的 slime 框架上。官方那句话点得很透:"随着 agent 能力提升,scale 后训练的难点,正从'模型'转移到'环境'。"

但这条路有它的天花板

如果文章停在上一节,那就成了软文。这条"只靠后训练"的路,天花板其实很清楚,GLM 5.3 一个都没躲掉。

第一堵墙是偏科,而且偏科是有机制原因的。 RLVR 只在"能自动判对错"的领域管用:数学、代码、形式证明。可一旦到了开放领域,"怎样算好"根本没法写成程序去判,奖励就造不出来。这正是中文社区实测出"偏科"的根子:GLM 5.3 在可验证的编码、网安上暴涨,在难验证的通用表达、审美、创意上原地踏步。这不是它做得不好,是这条路天生就长这样。

插图:一台自动判分机器只把能判对错的科目喂得很壮,接不上管子的开放科目瘦弱地原地站着

第二堵墙是"引出还是涌现"的学术争议。 NeurIPS 2025 有一篇 Oral 论文系统实测后提出:RLVR 提升的可能只是"采样效率",而不是"创造新能力"。当你允许底座模型多试很多次,它的上限反而更高,RLVR 只是让你更快抽到那个对的;真正引入新模式的,可能是蒸馏而不是 RL。这个争论还没定论,也有论文持相反观点。我自己倾向"引出"这一派,预训练定了能力的上限,后训练定的是你能把上限兑现出几成,但我得承认这事目前谁也没法一锤定音。它至少提醒我们:别把"后训练带来的提升"全当成"模型变聪明了"。

第三堵墙是安全这把双刃剑。 网安能力攻防两用,同一个模型既能帮防御者堵漏洞,也能帮攻击者找漏洞,这也是智谱把权重推迟两周的官方理由。海外吵的"开放还是护栏",本质就是这个僵局,没有标准答案。上个月 Hugging Face 那起入侵事件里,美国的闭源模型因为护栏拒绝分析攻击日志,最后是 HF 自己部署了 GLM-5.2 把攻击还原出来的。这个细节很能说明问题:护栏护住了一头,也可能松开了另一头。

最后一堵墙是数字本身。 这些基准全是厂商自报,版本口径没法严格横向对比,官方对比表还刻意跳过了 Opus 5 和 Grok 4.6 这两个最强的对手,Semgrep 实测里那个没查清的方差也还没解决。所以对"28.3""84.5"这些数,我的态度是:参考可以,全信不行。等权重放出来、第三方平台跑过,才算数。

最后

把这几堵墙和开头那个判断放在一起,我自己得到的结论是:

当"把模型造得更大"这条路越来越难、越来越贵,能把同一个模型逼到极限的,就不再是参数,而是那套能持续造出好训练环境、给出诚实反馈信号的流水线。模型会越来越像商品,大家都能拿到差不多的底座;真正的护城河,是谁的环境造得好、谁的反馈给得准。这也是为什么"能力提升从模型转移到环境"这句话,比 GLM 5.3 本身更值得记住。

这条路上,GLM 5.3 是走得最激进的一个样本。但它撞上的每一堵墙,偏科、安全双刃、还有"数字到底信不信得过",都是这条路上所有玩家迟早要撞的。

一句话:GLM 5.3 没有换一个更大的脑子,它只是换了一种更狠的训练方式。而这,恰恰是它最值得看的地方。

订阅 / 联系

下一篇继续从这里接上

新文章会同步到 RSS;也可以直接发邮件给我。