2026年6月12日,美国政府对Anthropic最新模型Claude Fable 5和Mythos 5实施了出口管制。这在大模型行业史无前例。Anthropic被迫暂停所有用户访问,无法实时验证国籍导致全量封锁。
7月1日,Fable 5重新上线。Anthropic同时发布了一套全新的越狱严重性分级框架,参与方包括Amazon、Microsoft、Google在内的Glasswing合作伙伴。这件事暴露出AI安全治理的核心矛盾:模型能力越强,安全边界越难拿捏。
Amazon发现的安全漏洞始末
导火索来自Amazon研究团队的一份报告。他们找到了绕过Fable 5安全防护的方法:通过特定提示词引导模型识别软件漏洞,其中一次甚至生成了漏洞利用代码。
Anthropic的测试结果令人意外。包括Claude Opus 4.8、GPT-5.5、Kimi K2.7在内的多款主流模型都能识别相同漏洞。在漏洞利用演示环节,从Claude Haiku 4.5到GPT-5.4、GPT-5.5、Kimi K2.7,所有受测模型都能复现Fable 5的行为。这说明问题本身并不局限于Fable 5,而是整个行业需要面对的共性挑战。
Anthropic随后与政府和Amazon紧密合作,训练了新的安全分类器来精准拦截报告中描述的行为。被拦截的请求会转交给Opus 4.8处理。代价是日常编码和调试任务中误报率上升。
安全边际:防御纵深中的取舍
Anthropic为Fable 5设计了超以往的安全边际。简单说,模型会主动拒绝一部分明显安全的请求,用更保守的策略换取整体安全性。这套纵深防御体系包括训练模型拒绝危险请求、事后分析滥用模式、以及实时分类器拦截。
越狱攻击往往只能解锁非常窄的行为范围。Glasswing框架正是基于这一观察,提出了四维度评分体系:前两个维度描述越狱给攻击者提供了什么能力,后两个维度衡量越狱多快能转化为现实威胁。
最严重的越狱级别,比如正在被用于攻击关键电网或银行系统的情况,Anthropic承诺在确认严重性后立即部署初步缓解措施,同时组建7×24小时监控团队盯紧越狱提交渠道。
Glasswing框架:行业合作还是各自为政
Anthropic正在与Amazon、Microsoft、Google及其他Glasswing伙伴共同起草AI越狱严重性评估的共识框架,并邀请更多行业伙伴加入。
这套框架的核心价值在于标准化。在此之前,各家AI公司对什么算严重越狱的定义各不相同。Meta在Llama系列上的越狱响应策略与OpenAI对GPT系列的策略缺乏可比性。Glasswing试图建立统一标尺:按照攻击者获得的能力、可利用范围、扩散速度、潜在影响四个维度量化评估。
Cognizant的案例从侧面验证了企业级部署的复杂性。这家IT服务巨头将Claude嵌入Flowsource、Neuro AI Engineering等平台,3万名员工完成Claude培训。CEO Ravi Kumar S直言:AI能力增长的速度超企业吸收的速度,这个差距是当下最核心的问题。企业要的不只是能用,更要可信赖。
开放权重模型的立场
Anthropic CEO Dario Amodei同期发表了关于开放权重模型的立场声明。他没有呼吁全面禁止开放权重模型,而是主张将注意力集中在三个方向:阻止先进芯片流入威权政府手中、遏制工业级蒸馏、对所有具备足够能力的模型(无论开源还是闭源)强制安全测试。
这与Fable 5的出口管制事件形成呼应。能力越强的模型,管控的必要性越高,但管控方式需要行业共识而非单方面封锁。Mythos 5在网络安全攻防方面的能力超过几乎所有人类安全专家,这使得它对恶意行为者格外有吸引力。
对开发者和企业的实际影响
Fable 5在生物学领域的安全策略也在同步调整。新版分类器大幅减少了误报,用户在解读化验结果、理解症状、学习生物学知识时不再频繁被拦截。医疗专业人士能获得更多临床任务支持。双用途研究,如病毒学、毒理学、分子设计,仍会回退到Opus 5处理。
对企业决策者来说,Glasswing框架提供了一个评估AI供应商安全成熟度的参考。选择合作伙伴时,可以关注对方是否参与标准化安全框架、是否具备7×24越狱监控能力、安全边际策略是否公开透明。
Anthropic即将推出水印检测API,配合C2PA元数据标准,企业将能验证内容是否由Claude参与生成。这些基础设施正在逐步补齐。
AI安全治理进入深水区。Fable 5的出口管制开了先例,Glasswing框架给出了行业合作的模板。接下来的问题是:这套框架能否真正落地,还是各家公司继续各说各话。
苏公网安备32010502011527号
发表回复