9月18日,智谱发布高速推理模型GLM-5.3-FlashX,API与体验中心同步开放,开发者调用时认准Model Key:GLM-5.3-FlashX。官方标注的最高输出速度为200 tokens/s,较前代GLM-5.3-Flash提升5倍,定价上调至原版的2.5倍。同日,港股智谱股价应声上涨。
5倍提速的地基:10万张国产芯片
FlashX的底子是GLM-5.3-Flash。这款模型此前以”Ox Alpha”之名先与海外开发者见面,凭同尺寸最能打的智能水平圈了一波口碑,调用量持续攀升。
需求涨得太快,智谱把资源砸向了Infra基建与推理优化。撑起这次提速的算力,来自超过10万张国产AI加速器。智谱CEO唐杰披露,GLM-5.3-Flash的全部生产推理已经跑在这批国产芯片上,从模型首次跑通到承接全量线上流量,用时不到两周,端到端吞吐量提升3.2倍。
干活的主力,是模型自己
这份成绩单里最扎眼的部分:完成大量优化工作的主力,是一个由GLM-5.3驱动的AI智能体。
国产加速器的部署条件相当苛刻。显存容量和带宽有限,软件生态不成熟,很多该有文档的地方只能靠猜。GLM-5.3-Flash还要同时支持100万token上下文和多模态请求。每一步优化都在做交换:用计算换显存(ReplaySSM),用通信换显存(节点内张量并行),用精度换容量(INT8/FP8/BF16混合缓存),用架构分离换调度自由度(编码-预填充-解码分离)。
靠这套组合拳,国产芯片的单token成本对标了主流英伟达GPU。
三个真实的工程问题
Infra Agent发现并修复了三个具体故障。
第一个是精度漂移。KDA内核在上下文并行路径中,TF32的舍入误差通过链式状态矩阵合并不断累积,上下文越长漂移越大。修复已合并进开源项目Flash Linear Attention。
第二个是并发瓶颈。KV缓存传输本该与计算并行,Agent发现两者从未重叠。它沿调用链追到Python与C++的边界,发现DeepEP的节点内路径没有释放全局解释器锁(GIL),传输线程一直拿不到执行权。修复后,开销从超过30%降到1%以下。
第三个是重复计算。一个解码内核因分块方式,把同一归一化运算重复做了四遍。Agent重组计算结构,单点加速1.71倍。优化思路来自它阅读SGLang、FLA、DeepGEMM等项目内核代码后提炼出的”优化骨架”。
密集反馈:把老师傅的隐性经验显性化
唐杰总结,智能体卡住的时候,几乎都栽在同一处:不知道事情为什么变差了。”吞吐量下降20%”只告诉你出了问题,不告诉你问题在哪一层、该验证什么假设。用强化学习的话说,这属于稀疏奖励加信用分配难题,一次端到端基准测试要跑几个小时,试错成本极高。
资深工程师定位问题,靠脑中一套隐性的”过程奖励”。智谱把这套经验显性化,构建分层验证接口供智能体直接调用:正确性反馈回答”算对了吗”,系统行为反馈回答”时间花在了哪”,性能反馈回答”哪个方案在什么条件下更优”。每类信号都要求足够局部、获取成本低、可客观验证。
目标设定、反馈环境搭建、高风险变更审查仍由人负责。工程师的角色正在变化:从解决问题的人,变成设计反馈的人。唐杰的判断很清醒——离递归自我改进还很远,但最小的循环已经存在:模型优化系统,系统运行模型。相关细节写在官方文章《Toward Recursive Self-Improvement: How GLM Built Its Own Inference Infrastructure》里。
2.5倍价格,值不值
FlashX的账本需要摊开看。速度提升5倍,价格上调2.5倍,单位吞吐的实际成本在下降。实时交互、高频调用场景是它的主场:客服对话流式输出、代码补全逐字上屏、Agent多轮工具调用,每一段等待都被压缩。
对延迟不敏感的批处理任务,GLM-5.3-Flash仍然够用,价格更低。横向看,9月10日起DeepSeek对flash系列启用峰谷分时计费,空闲时段输出4元/百万Token;9月18日千问也上线了Qwen3.8-Omni-Flash,主打1M多模态上下文。极速赛道上的对手正在增多。
同期刷屏的还有DeepSeek算子工程师的一篇推文:AI算子能力快速追上顶尖工程师,手工写底层算子的价值持续下滑,工程师转向设定约束、校验AI输出。国产大模型与国产AI芯片的双向奔赴,正在改写底层算力的游戏规则。
写在最后
FlashX的发布,表面看是一次常规的版本提速。往里看一层,10万张国产芯片上的生产推理,由AI智能体亲手调优,这件事的分量比200 tokens/s更重。下一代模型训练最需要的分层可验证反馈环境,正在真实的基础设施任务中长出来。技术开发者值得把这篇技术报告找来精读一遍。
苏公网安备32010502011527号
发表回复