加密新闻

17.08.2026
10:19

Anthropic披露了大规模生物安全故障:1.33亿次与AI的对话未经过滤

ii-startap-Anthropic-AI

我手中有一份Anthropic的最新报告,它揭示了一起令人担忧的Claude安全系统事件。这涉及生物分类器近一年的故障——这些屏障本应阻止利用人工智能制造生物武器的企图。问题的规模令人震惊:约5万人和约1.33亿次模型交互受到影响。

承包商基础设施中的严重漏洞

事件的核心在于,从2025年5月到2026年4月,来自反馈收集平台的流量(外部承包商在此测试模型)在未经生物过滤器拦截的情况下通过。一个让我特别担忧的技术细节是:流量被标记为内部使用标志,这同时禁用了分类器本身及其触发记录系统。这意味着潜在危险的请求不仅未被拦截,也没有留下任何可供后续审计的痕迹。 更糟糕的是,Anthropic承认承包商访问控制薄弱。直到2026年4月,许多承包商没有可靠的人员审查程序,这使得攻击者实际渗透进红队成为可能。

回顾性分析揭示了什么

发现错误后,公司恢复了几乎所有数据,仅有一个平台上约1%的对话丢失。为进行验证,Anthropic使用了Claude Sonnet 5,识别出1197份高风险转录本。然而,仔细审视后情况有所不同:其中757份是Anthropic内部团队的请求,另有378份是有意的红队测试。仅剩62个与测试无关的外部对话。 对这些案例的手动检查未发现明显的生物武器制造企图。公司评估化学-生物风险显著上升的可能性为“极不可能”,理由是危险请求数量少且持续时间短。然而,防护措施出现如此长时间的空白,让我对其结论的完整性产生怀疑——如果分类器未运行,那么用于深入分析的信号可能也不足。

风险评估的重新审视

这一事件促使Anthropic重新评估自身判断。根据CB-1场景(AI协助制造已知生物威胁),过去期间的风险被追溯性地从“极低”上调至“低”。当前水平被描述为“低但不可忽视”。在高风险情境下错位(misalignment)的风险评估也从“极低”上调至“低”。

对自身模型的依赖

报告中一个有趣的细节是AI在Anthropic自身运营中的整合程度。Claude已经编写了公司生产仓库中的大部分代码。这显示了技术的成熟度,但同时也意味着潜在的故障点:如果模型在代码中出错,后果可能是系统性的。 我的结论是:这一案例生动地说明,即使是AI安全行业的领导者也存在盲区。Anthropic快速发现并分析问题的能力令人欣慰,但防护措施出现11个月空白这一事实本身,对整个行业来说是一个严重的警钟。监管机构应予以关注:在AI生物安全问题上,自我监管目前并未像人们期望的那样可靠。