加密新闻

17.08.2026
09:58

Anthropic承认Claude生物防护出现大规模故障:1.33亿段对话未经过滤

ii-startap-Anthropic-AI

Anthropic的开发者们披露了其Claude模型生物安全系统中的一起严重事件。这次持续近一年的故障,影响了约5万名外部承包商的池子以及约1.33亿次与AI的交互。这一信息成为该公司发布的新版《风险报告》中的关键内容。

系统性故障:11个月无阻断分类器

在11个月的时间里——从2025年5月到2026年4月——第三方专家通过这些平台与模型进行的所有流量处理,均未激活阻断性生物分类器。这些系统旨在拦截化学和生物领域中潜在危险的请求。经查明,流量携带了一个内部标志,该标志同时禁用了阻断功能和防护机制触发记录的登记。

这意味着,潜在有害的请求不仅未被拒绝,而且也没有进入后续审计系统。此外,该公司承认对承包商的访问控制薄弱:在收紧要求之前,许多供应商没有可靠的人员审查程序,这使得渗透进入红队成为可能。

审查规模:1197个可疑对话

发现错误后,Anthropic恢复了几乎所有的通信数据,仅有一个平台上的1%流量除外,该平台在未点击发送按钮的情况下不保存信息。为了分析数据量,该公司动用了Claude Sonnet 5模型,该模型识别出1197个高风险级别的转录本。

分布情况颇具说明性:757个对话属于Anthropic内部团队,378个是故意的红队测试——即专家们试图诱导模型给出危险回答的尝试。最终,只有62个外部通信与测试无关。对这些案例以及红队对话随机样本的手动审查,未发现明显的危险使用情况,即能够显著增强攻击者制造生物武器的能力。

风险评估的重新审视与对自身AI的依赖

这一事件迫使Anthropic事后重新评估CB-1场景(利用AI制造已知生物威胁)的风险等级,从“极低”调整为“低”。该公司将当前灾难性损害的风险水平描述为“低,但并非可忽略不计”。同时,高风险情境下的错位风险评级也被上调。

值得注意的是,该报告还揭示了Anthropic自身对其模型的深度依赖:Claude编写了该公司生产仓库中接受的大部分代码。虽然这加快了开发速度,但目前提升幅度不到两倍。

我的评论:这一案例生动地说明,即使是AI安全行业的领导者也存在“盲区”。故障持续了近一年且仅被追溯发现,这一事实对监控系统的可靠性提出了严重质疑。对市场而言,这是一个信号:防护环的审计必须是持续且多层次的,而不能依赖一次性检查。投资者和用户应更加审慎地对待公司关于其平台安全性的承诺。