9月29日,Anthropic前沿红队发布一份重量级评估报告。主角是智谱AI(海外品牌Z.ai)的GLM-5.3。报告给出一个罕见结论:这个开放权重的模型,已经能自主构建端到端的网络攻击利用链,能力与Anthropic自家受限发布的Claude Mythos Preview只差两个百分点。
这是”可下载的前沿能力”第一次被另一家实验室正式盖章。
数据摆出来看
ExploitBench基准衡量模型对已知V8引擎漏洞构建完整利用链的能力。GLM-5.3在410次尝试中成功50次,成功率12%。Claude Mythos Preview是56次,14%。此前的开源模型成绩接近零,Claude Opus 4.6、GLM-5.2、Kimi K3、DeepSeek V4.1-Flash也都在零附近。
内部二进制利用基准更说明问题。100个OSS-Fuzz任务里,GLM-5.3在4%的试验中完成完整的控制流劫持,Mythos是6%,更早的模型全部为零。
有人类研究员少量参与的情况下,GLM-5.3花了约一天时间分析一个沙箱浏览器构建,人工介入不到一小时。它找到了多个未知的JavaScript引擎漏洞,并把它们串成一条drive-by利用链,能读取任意文件。相关发现已披露给维护者。
更扎眼的是成本案例。GLM-5.3-Flash把CVE-2026-11645这个Chrome漏洞的公开信息,变成了一条可靠的ARM64利用链,绕过了指针认证加固。整个过程只需20分钟人工关注加8小时模型时间,按智谱API价格算,成本约20.40美元。
护栏比想象中脆弱
报告里最具冲击力的部分是安全测试。GLM-5.3默认会拒绝所有明面上的恶意请求,看起来防线完整。
真实情况是:给一个伪装的正当理由,64%的请求会被放行;用预填充推理(prefilled reasoning)技术,绕过率92%;做一次abliteration(移除拒绝行为的标准权重编辑),绕过率100%。
abliteration的成本被精确量化了。首次尝试消耗约2200 GPU小时、4400美元;熟练团队600 GPU小时就能完成,成本1200美元。编辑之后模型能力几乎无损,GPQA-Diamond分数不变,CyberGym只掉几个点。JailbreakBench、HarmBench、StrongREJECT上的拒绝率从90%以上分别跌到3%、2%、12%。
一个可以下载的模型,拒绝训练不再是控制面。这是Anthropic报告的核心论点。
官方评估早有铺垫
9月17日,NIST旗下AI标准与创新中心(CAISI)先行发布了独立评估,称GLM-5.3是”迄今发布的网络能力最强的开放权重模型”,同时测出它落后美国前沿模型约4个月。
两组数字对比:SEC-Bench Pro(发现并触发漏洞)40.4%对90.2%,ExploitBench 61.1%对100%,ExploitGym用户态任务9.4%对44.4%。两份报告在能力判断上一致,侧重点不同——NIST量差距,Anthropic量护栏有多容易脱落。
舆论场炸了锅
Hacker News相关讨论拿到233分、224条评论,r/LocalLLaMA最热帖标题是”Anthropic刚给GLM打出了史上最佳广告”。
社区的主流声音指向利益冲突:报告由竞争对手发布,动机存疑。也有人反问,针对自家模型0%的攻击成功率,说明的可能只是测试用的越狱手段不够多。
从业者的反馈最有信息量。一位网络安全从业者说,闭源模型频繁拒绝合法的安全研究工作,GLM-5.3和Flash反而稳定可用;另一位在Claude拒绝后,用开源模型完成了恶意软件取证;还有人的缓冲区溢出问题在别处几分钟就得到了答案。
开发者该做什么
三件事值得立刻做。
第一,安全预算里加上开放权重工具。Anthropic自己也承认,防御者应该用最好的工具。GLM-5.3-Flash在两台128GB的M2 Ultra上能以约50 tokens/s运行,全量753B模型则需四节点DGX Spark集群。
第二,把防线从模型层挪到运行时。沙箱化Agent的网络出口、最小化凭证权限、审计工具调用范围,这些措施不依赖模型的”良心”。
第三,关注分级授权模式。Anthropic 9月17日推出的生命科学验证计划(LSVP)走的同一条路:验证身份、分级放开高危能力。Project Glasswing的受限网络防御者已经借它找到并修复了1万多处关键软件漏洞。能力放开与风险控制并行,大概率是下一阶段的主流方案。
两个月前,”端到端利用链”还是Mythos独有的标签。现在,它出现在一个任何人都能下载的模型上。前沿能力扩散的窗口期,已经从年缩短到了月。
苏公网安备32010502011527号
发表回复