2026年8月14日,智谱AI(国际品牌Z.ai)正式发布GLM-5系列最新版本GLM-5.3。这天的科技圈格外热闹——前一天DeepSeek刚放出最新模型,智谱紧随其后亮出底牌,国产开源大模型已经进入每周一赛的节奏。
GLM-5.3最反常识的地方在于:基座模型一行代码没动。参数规模仍是约744B的MoE架构,每次前向激活约40B参数,上下文窗口200K。所有能力跃升全部来自后训练阶段的极致Scaling。智谱基于IndexShare、SAO以及持续演进的新一代Slime框架,在与GLM-5.2完全相同的基座上推进强化学习,构建了数十倍规模的长程任务环境、更丰富多样的环境类型、超长的后训练时间。换句话说,智谱可能远未触达这个基座的智能上界。
编程能力:从垫底到开源第一
数据最能说明问题。Terminal-Bench 3.0衡量模型在真实终端环境中完成复杂任务的能力,GLM-5.2得分仅4.6,GLM-5.3直接飙到28.3,6.2倍跃升,拿下开源模型第一。聚焦长程软件工程与持续代码修改能力的DeepSWE v1.1,得分从46.2提升到66.9。覆盖多类真实专业场景、强调跨工具协作的Agents’ Last Exam,得分从23.8提升到28.5,同样位列开源第一。覆盖44种职业、考察真实高价值知识工作的GDPval-AA v2中,GLM-5.3拿到1,769分,展现出基于编程能力涌现的专业任务执行能力。
智谱自研的Z.ai Code Bench更接近开发者实际使用Coding Agent的体验。模型被置于复杂的本地开发环境,在不同思考档位下执行端到端任务。High档位下GLM-5.3达到31.4%准确率,超过Claude Opus 4.8最高档位的29.5%。更关键的是Token利用率——GLM-5.3每项任务平均输出约5万tokens,Opus 4.8需要约12万tokens。同样的活,GLM-5.3用更短的执行路径完成。智谱官方表述编程与智能体能力”接近Claude Fable 5″,编程体感超过其他国产模型。这个”接近”用得很克制,没有说”匹配”。
网络安全:意外涌现的开源新卖点
GLM-5.3在白盒代码审查与漏洞发现等安全任务中表现持平Mythos 5。CyberGym测试中拿到84.5%,微弱领先Claude Mythos 5和GPT-5.6 Sol。ExploitBench得分54.4%,仍落后于前沿模型。漏洞开发考验深度多步推理与模糊环境下的判断力,这个差距说明最难的推理密集型任务上前沿模型仍有优势。
智谱对安全能力的处理很谨慎。完整模型权重将在发布两周后开放,此前需完成必要的安全加固,尽可能限制潜在攻击能力,保留防御价值。这是智谱迄今最全面的风险评估。开源权重预计8月28日左右上线Hugging Face。
开发者怎么用
API采用OpenAI兼容格式,端点为`https://api.z.ai/api/paas/v4/chat/completions`,发布时未公布5.3专属定价。GLM-5.3即日起上线智谱官方编程工具ZCode、效率工具AutoClaw,GLM Coding Plan全量用户额度重置回满。TraeWork、TraeCode、扣子、WorkBuddy、CodeBuddy、Qoder、QwenWork、CatPaw、JoyCode、OpenCode等编码平台开放抢先体验。智谱API用户已接近700万,启用超5万块国产算力芯片。
后训练Scaling:第三条曲线的实战样本
GLM-5.3的发布给行业抛出一个清晰信号:基座模型迭代周期正在拉长,后训练成为能力跃迁的主战场。同一个744B基座,GLM-5.2到GLM-5.3编程能力提升50%,全部来自后训练环境的规模扩张。这条路对算力 hungry 的预训练依赖更低,对高质量任务环境的设计要求更高。
对开发者的实际意义很明确:想要强的自主编程行为加开源模型经济性,GLM-5.3是目前最值得评估的选项。权重开放后可以自主部署在自己的硬件上。那些最亮眼的数字——50%编程提升、SWE-Marathon翻倍——来自智谱内部评测,没有公开测试框架可复现。权重落地、独立评测机构重跑测试套件之前,这些数字保持未验证状态。4.6到28.3的Terminal-Bench跳跃不是噪音,这个基准测试衡量模型能否串联shell命令、读取输出、从错误中恢复,GLM-5.2此前在这里很弱,一个点版本从近底部跃升到开源第一,足以改变Agent流水线里你伸手拿哪个模型的决定。
开源模型竞赛的节奏已经快到以周计。DeepSeek、智谱交替出牌,国产开源阵营正在用后训练Scaling这条新曲线追赶前沿。GLM-5.3站在了一个有意思的位置:基座没换,能力却跨了一级台阶。
苏公网安备32010502011527号
发表回复