同一块基座,分出两种未来:GLM-5.3 揭开国产大模型"后训练效率战争"

发布时间:2026年8月15日


核心事件

8月14日,智谱(2513.HK)正式发布旗舰大模型 GLM-5.3。官方给出的三个标签是:最强安全模型、最强编程模型、最强开源模型。

最值得关注的数据不在参数规模上,而在"提升效率"上:与半年前发布的 GLM-5.2 使用完全相同的 7430 亿参数基座,GLM-5.3 通过数十倍规模的长程任务环境、更丰富多样的环境类型、超长的后训练时间,配合新一代 Slime 强化学习框架,将编程体感评测分数提升了 50%。


关键 Benchmark 表现

测试项目 GLM-5.2 GLM-5.3 提升幅度
Terminal Bench 3.0 4.6 28.3 +516%
DeepSWE v1.1 46.2 66.9 +45%
AutomationBench 26.2 48.2 +84%
CyberGym(漏洞发现) 77.2% 84.5% +9.4%
Agents' Last Exam 23.8 28.5 +20%
GDPval-AA v2 1769 开源最高

在 CyberGym 网络安全漏洞发现测试中,GLM-5.3 得分 84.5%,超过 Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%。智谱表示,上述全部提升均来自后训练,基座模型本身没有变化。


我的观察

1. 后训练 Scaling 取代参数竞赛,成为国产模型新分水岭

GLM-5.3 最大的信号意义在于:它证明,在相同的基座模型上,通过强化学习、数据飞轮和长周期训练,可以将智能上界大幅推开。这与中国 AI 行业此前"谁的参数万亿谁赢"的叙事形成了鲜明对比。对于资源有限的中小玩家来说,这条路径的示范意义远大于结果本身。

2. 开源权重的"安全前置"策略值得关注

GLM-5.3 计划在发布两周后开放完整模型权重,但前提是先完成安全评估与模型加固,包括限制模型的潜在攻击能力、保留防御价值。智谱强调与国内顶级安全团队合作(DARKNAVY 团队),试图在"开源影响力"和"安全责任"之间找到平衡。这是业内少见的"先加固、后开源"节奏,可能成为后续国产开源模型的参考模板。

3. 网络安全能力成为模型新卖点,但攻防不对称风险仍然存在

GLM-5.3 的网络安全能力数据亮眼,但也暴露了一个事实:模型的攻击链前半段(代码审查、漏洞发现)能力已接近顶级闭源模型,而智谱自己承认"优势主要集中在攻击链上游"。这意味着模型的"盾"在变强,但"矛"的潜在风险并未消除。当最强模型开源两周后,全球开发者都能获得这些能力,安全责任边界将变得极其模糊。

4. 国产旗舰模型的竞争节奏已进入"月抛级"密度

8 月 13 日 DeepSeek 发布 V4 Pro 0813,8 月 14 日 GLM-5.3 紧随其后。两个月前 GLM-5.2 才发布,如今已迭代到 5.3。更重要的是,竞争焦点已从"模型谁更强"转移到"谁的 Coding 能力更强""谁的 Agent 执行更可靠""谁的 API 价格更低"。这条赛道的终局,可能不是一家赢家通吃,而是"工具化生存"——即谁能将模型深度嵌入开发者工作流,谁才能留住用户。


一句话总结

GLM-5.3 的发布标志着国产大模型竞争正式进入"后训练效率战争"阶段:参数规模不再是护城河,调教技术和开源策略才是。而对于整个行业而言,模型越强、开源越快,安全红线就越需要前置——这一次,智谱选择了先加固、后开源,但这个平衡能维持多久,仍需持续观察。