Anthropic团队公布了其旗舰模型Claude在生物安全系统中的关键漏洞数据。这一持续近一年的故障影响了约5万名外部承包商,涉及约1.33亿次与人工智能的交互。这些信息包含在我关于行业防护机制状况的最新分析报告中。

系统故障:11个月无阻断分类器

在11个月期间——从2025年5月到2026年4月——所有通过反馈收集平台处理的流量均未激活阻断性生物分类器。这些系统旨在识别并阻止模型被用于潜在危险的化学或生物用途。关键错误在于,流量被标记为内部标志,该标志同时禁用了过滤器并关闭了其触发记录功能。

最令人担忧的方面是,大多数参与者能够与模型进行开放式对话,而不仅仅是评估现成的回答。这意味着潜在危险的请求不仅未被阻断,还完全脱离了后续审计系统的视野。此外,报告承认,在收紧要求之前,许多承包商缺乏可靠的人员审查程序,这使得恶意行为者有可能渗透进红队。

审查规模:1197份转录本受到怀疑

发现错误后,Anthropic成功恢复了几乎全部数据,仅有一个平台上1%的对话记录丢失,因为该平台在未点击发送按钮时不会保存信息。为对所有请求进行回顾性分析,公司启用了Claude Sonnet 5模型,该模型为1197份转录本分配了高风险等级。

详细分析显示,其中大多数(757份)属于Anthropic内部团队。在剩余的440个案例中,378个是有意的红队测试——为验证防护可靠性而进行的专门破解尝试。因此,仅有62个外部对话与测试无关。对这些对话及30个红队对话随机样本的手动审查未发现明显危险的使用行为,这些行为可能显著增强攻击者制造生物武器的能力。

尽管公司评估化学-生物风险显著上升的可能性为“极不可能”,但发现如此大规模漏洞的事实本身促使官方评估被重新审视。CB-1场景(利用AI制造已知威胁)的风险等级被追溯性地从“极低”上调至“低”。类似的调整也涉及高风险情境下的误导风险评估。

值得注意的是,报告还揭示了Anthropic自身对其AI系统的依赖程度:Claude已编写了公司大部分生产代码。然而,在我看来,这一事件凸显了整个行业的一个根本性问题:即使是拥有多层防护的领先实验室,其基础设施中也可能存在未被察觉的“盲区”。这是对整个市场的一次严重警示,表明AI安全并非一套静态的过滤器,而是一个持续审计和重新审视自身假设的过程。