GLM-5.1实现8小时自主编程:大模型赛道从“比谁聪明”转向“比谁能干活”

2026年4月,智谱AI发布并开源旗舰模型GLM-5.1。这款模型做了一件前所未有的事——在单次任务中持续自主工作超过8小时,期间自行规划、执行、测试、修复,最终交付完整工程成果。

这标志着大模型行业正在经历一次方向性转变。过去两年,所有人都在追问“模型有多聪明”。METR(AI安全研究机构)在2025年3月提出了一个改变行业认知的新指标:任务完成时间线(Task-Completion Time Horizon)。这个指标不再衡量模型在基准测试中的得分,而是衡量它能独立完成多长时间的人类任务。

数据令人震惊。前沿模型的时间线每7个月翻一倍。MIT Technology Review称这条指数曲线为“AI领域最重要的一张图”。Sequoia Capital据此在2026年初宣称“这就是AGI”。

GLM-5.1的8小时到底干了什么

智谱给出了三个具体场景。

第一个场景:GLM-5.1在8小时内从零构建了一个完整的Linux桌面系统。模型自行完成系统架构设计、组件编译、依赖处理、界面调试全流程,没有人类介入。

第二个场景更硬核。在KernelBench Level 3优化基准上,GLM-5.1对50个真实机器学习计算负载逐一进行持续优化。模型自主完成多轮“编译-测试-分析-重写”循环,超过24小时不间断迭代,最终取得3.6倍的几何平均加速比。作为对比,PyTorch官方的torch.compile max-autotune模式仅实现1.49倍加速。

第三个场景:GLM-5.1自主进行655轮迭代,将一个向量数据库的查询吞吐量提升到初始版本的6.9倍。

这些数字背后有一个关键能力——策略切换。此前的模型在面对复杂优化任务时,往往在早期快速取得收益后进入瓶颈,反复尝试已知手段却无法突破。GLM-5.1能够在一条路走不通时主动切换策略,这让它从“代码生成器”进化为“系统优化器”。

基准测试中的硬核表现

在SWE-bench Pro基准测试中,GLM-5.1刷新全球最佳成绩,超越GPT-5.4和Claude Opus 4.6。SWE-bench Pro要求模型在真实GitHub仓库中定位并修复高难度工程Bug,是衡量模型能否胜任专业软件开发的最硬指标。

GLM-5.1在综合能力上对齐Claude Opus 4.6,成为首个在综合能力上实现全面对齐的中国模型。在全球权威的Artificial Analysis榜单中,GLM-5位居全球第四、开源第一。

GLM-5采用混合专家(MoE)架构,总参数约7450亿,每token激活440亿参数,稀疏率仅5.9%。预训练数据量达28.5万亿token,上下文窗口扩展至200K。这些规格支撑了模型在长程任务中的信息处理需求。

为什么“能工作多久”比“多聪明”更重要

红杉资本给出了一个务实的AGI功能定义:AGI is the ability to figure things out。一个系统需要具备三个能力——自主推进、从失败中恢复、坚持到任务完成。

长程任务对模型提出了更深层次的挑战。在8小时的执行过程中,模型面对的不只是更大的代码量。它需要处理一连串复杂的工程决策点:主动跑benchmark、定位瓶颈、修改方案、再跑测试。任何一个环节出错,都可能导致后续工作全部白费。

这正是此前开源模型与顶尖闭源模型之间最大的差距所在。单轮对话中,开源模型已经能给出高质量回答。但在需要持续数小时的复杂任务中,模型容易发生策略漂移、错误累积和无效试错。

GLM-5.1通过multi-turn SFT(多轮监督微调)、强化学习与过程质量评估体系,强化了长任务中的稳定性、一致性与工具调用能力。智谱自研的Slime框架支持异步智能体强化学习算法,使模型能够持续从长程交互中学习,充分激发预训练模型的潜力。

价格信号:从价格战到价值定价

GLM-5.1发布的同时,智谱宣布提价10%。这已经是2026年内的第二次提价。在Coding场景的缓存命中Token价格已接近Anthropic旗下Claude Sonnet 4.6。

智谱CEO张鹏在回应涨价时表示,完成一个长程任务所需的Token量可能是回答简单问题时的十倍甚至百倍,价格调整本质上是价值变化的自然结果。

数据印证了需求端的爆发。智谱MaaS API平台实现ARR约17亿元(约2.5亿美元),同比提厀60倍。即便提价83%,调用量仍增长400%,市场供不应求。

整个行业也在转向。2026年开年以来,腾讯云、阿里云、百度智能云先后上调AI算力和模型服务价格,幅度在5%到34%之间。一年前行业还深陷价格战普遍降价九成,如今风向已变。

对开发者的实际影响

对于开发团队,长程任务能力意味着工作模式的改变。你可以给模型一个目标,然后去做别的事。8小时后回来,拿到一个可交付的工程成果。

Devin已经合并了数十万个Pull Request。Cursor支持长达一周的自主运行。这些产品验证了长程Agent在生产环境中的可行性。Goldman Sachs报告显示,使用长程Agent的团队获得了20%的效率提升。

企业部署预计从2025年初到2026年底将增长8倍。到2028年,模型预计能处理完整工作周(40小时)的任务。到2029年,这一数字可能达到167小时——超过一个整月的工作量。

长程自主也带来了新的安全挑战。OpenAI在2026年7月发表的研究中指出,能够长时间自主工作的模型有更多机会采取非预期行动,而且针对短程模型设计的安全评估可能无法发现这些问题。传统的逐个动作审批模式在8小时任务中不再可行,需要转向基于整体轨迹的监控方式。

成熟的实践模式正在涌现:让系统自主运行,但保持足够近的距离,在它开始偏离时及时纠正。这正在成为2026年AI开发者的标准工作流。

写在最后

GLM-5.1的8小时自主工作能力,把大模型竞争从“刷分时代”拉入“干活时代”。METR的时间线指标、红杉的AGI定义、智谱的工程实践,都在指向同一个方向:模型的终极价值在于它能独立完成多复杂、多持久的真实任务。

对于开发者和企业来说,现在该关注的问题已经变了。别再只看enchmark分数。问问你的模型:你能连续帲8小时不出错吗?


评论

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

苏ICP备2025163703号-2