2026年8月的大模型圈出现一个反常识现象。
智谱发布GLM-5.3,基座模型与GLM-5.2完全相同,参数一个没动,只重做了后训练。结果Terminal-Bench 3.0得分从4.6飙到28.3,翻了6倍。DeepSWE v1.1从46.2冲到66.9。智谱在发布材料里直接喊话:这个基座的智能上界,可能还远远没摸到。
DeepSeek也在玩同一套打法。V4-Flash-0731与预览版模型结构完全一致,仅仅重新进行后训练,Agent能力就大幅增强。V4-Pro-0813更狠:Terminal Bench 2.1得分87.9,预览版只有72.1;Cybergym从52.7涨到83.3,小幅超过Claude Fable 5;DeepSWE从12.7干到62.7,一年前这个数字想都不敢想。
一句话总结这轮变化:预训练的Scaling放缓了,后训练的Scaling刚起步。
后训练为什么突然值钱了
过去几年,行业默认的提升路径是堆参数、堆数据、堆算力。GPT-4到GPT-5时代,单次预训练成本涨到数亿美元,性能增益却越来越薄。海外闭源厂商背着巨额沉没成本,只能靠高API单价回收投入——GPT-5.6 Sol Max输出价格30美元每百万tokens,Claude Fable 5开价50美元,Grok 4.6也要6美元。
国产厂商换了一条路。MoE稀疏化架构加推理侧优化,把成本压到另一个数量级,再用规模化调用摊薄研发投入。DeepSeek-V4-Pro输出价格0.87美元每百万tokens,不足Grok 4.6的七分之一,是Claude Fable 5的五十七分之一。Artificial Analysis测过,V4-Flash跑复杂工作负载平均成本约0.03美元,Claude Fable 5要3.15美元,价差超过百倍。
价格战只是表面。真正的分水岭在于:能力提升的重心从预训练阶段挪到了后训练阶段。中科大与上海AI实验室联合团队的实证研究已被ACL 2026收录,系统验证了强化学习后训练存在独立的Scaling行为。ICLR 2026专门开了SPOT工作坊,主题就一个——后训练正在变成一个独立的、算力密集的全新阶段。
RLVR:机器给机器打分的游戏
后训练Scaling的技术核心是RLVR,可验证奖励的强化学习。
传统RLHF依赖人类标注偏好,标注速度和一致性都是瓶颈。RLVR换成自动验证:数学答案对错可以验证,代码能不能通过单元测试可以验证,终端任务有没有完成可以验证。奖励信号由机器生成,训练数据理论上无限扩展。
这条路线的战绩摆在那里。DeepSeek-R1用GRPO加RLVR直接在V3基座上训练,跳过SFT阶段照样跑出顶级推理能力。夸克的高考大模型以通义千问MoE为基座,后训练链路由增量预训练、SFT、RLVR、RLHF四段组成,成绩同样能打。
成本结构的变化更值得单独拎出来讲。智谱GLM-5.3在同一个基座上推进强化学习,顺手涌现出白盒代码审查与漏洞发现这类网络安全能力。DeepSeek-V4-Flash重新后训练一次就完成一次大版本升级。单次迭代的训练成本和周期都被压缩,厂商才有底气小步快跑——过去70天里,9家国产厂商密集发布了10款旗舰级更新,36氪形容大模型进入了”月抛时代”。
竞争天平正在倾斜
数据能说明问题。
Hugging Face《2026年春季全球开源AI生态报告》显示,中国开源模型下载量占比达到41%,首次超过美国,累计下载突破100亿次。斯坦福《2026人工智能指数报告》给出另一个数字:中美顶尖模型综合性能差距收窄至2.7%,技术迭代时差压缩到6至9个月。
有意思的是海外阵营的态度转变。英伟达CEO黄仁勋7月发公开信支持开源生态,说世界既需要前沿闭源模型,也需要前沿开源模型。扎克伯格公开呼吁美国放宽开源AI限制,理由很实在:本土实验室的枷锁太多了。还有美国投资机构统计,多达八成的美国AI初创公司在融资路演材料里使用中国开源模型。Counterpoint的判断更尖锐:西方巨头坚持围墙花园,开发者和企业自然流向开放权重模型。
冷静看三个变量
热潮之下,三个风险点需要盯紧。
开源边界参差不齐。MiniMax H3的Context-IR与2K超分模块没有开源,GLM-5.3权重晚了两周才放出。部分厂商只开放权重或部分模块,”开放权重加商业许可”成为新惯例——月之暗面对Kimi K3设了门槛,年收入超2000万美元的MaaS提供商要签约分成,比例最高30%;阿里云给Qwen3.8-Max也配了定制协议。
定价的可持续性存疑。DeepSeek已在8月6日公告计划整体上调API价格,低价策略能否长期维持,没人敢打包票。
闭源厂商没坐以待毙。海外旗舰模型的迭代速度同样在加快,GPT-5.6三变体已经落地,竞争天平会不会持续倾斜,要看后续版本的实际表现。
给开发者的三点建议
第一,选模型别只看通用基准分数。后训练Scaling时代,各家模型在终端任务、代码任务上的分化极大,Terminal Bench、DeepSWE这类专项基准比综合榜单更有参考价值。
第二,盯住后训练配方而非参数量。Qwen3.8-27B用Apache 2.0许可开放,单卡可部署,262K上下文,编程办公能力超过上一代Plus版本。参数量小一档,后训练做得好,实用价值反而更高。
第三,给业务流量的底座留退路。美国企业因成本考量切换中国模型流量的案例已经出现,API价差百倍的现实面前,多模型适配层不再是可选项。
预训练烧钱换能力的旧剧本正在翻篇。同一个基座,重做一遍后训练,编程分就能翻6倍——这笔账,每家厂商都会算。后训练Scaling的竞赛才刚开场,2026下半年还有得看。
苏公网安备32010502011527号
发表回复