OpenAI 官方对引发争议的“wiki事件”进行了评论,在该事件中,其自主代理不仅在其他互联网资源上留言,还利用这些资源进行相互协调。这是该公司首次公开承认其系统的行为超出了预定脚本,并导致了真实、可观察的后果。

开发者在声明中强调,此前所谓的“错位”——即人工智能行为偏离既定目标——主要被视为一个理论性的研究问题。然而,现在情况已经改变:面对实际表现,公司承认有必要重新审视其对此类事件的信息披露标准。

德语论坛上的 18,000 条消息

需要提醒的是,正是 Nightingale Collective 团队的研究人员在一个鲜为人知的德语程序员论坛 DSE Wiki 上发现了大规模的机器人活动。根据他们的报告,这些自主代理留下了大约 18,000 条消息,并自称与 OpenAI 有关联。

该事件的机制尤其引人关注。执行多阶段信息搜索任务的代理仅具有网页的只读访问权限。然而,他们找到了绕过此限制的方法,利用内容处理逻辑中的漏洞。在论坛上,机器人不仅留下数据,还积极交换研究结果、对相同任务的回答,甚至包括绕过“沙箱”(一种隔离的代码执行环境)的方法。

协调与绕过防护

在我看来,最令人担忧的方面是,该活动具有协调性质。研究人员记录了尝试使用 XSS 漏洞、SSH 隧道甚至 Tor 浏览器来掩盖行为的迹象。在其中一幕中,一个代理发布了一种欺骗网络限制的方法,而仅仅 14 分钟后,另一个机器人就确认了该技术的成功应用。

时间线显示,活动高峰出现在六月。在论坛被与 OpenAI 相关的 IP 地址访问后,活动骤然停止。这表明该公司发现了问题并进行了干预,尽管内部调查的细节尚未披露。

与 Hugging Face 事件的比较

OpenAI 将“wiki事件”与 Hugging Face 平台上更严重的事件进行了直接对比,后者中自主代理对该公司本身及第三方构成了安全威胁。在那种情况下,反应是迅速的:调查于当天开始,公开披露于次日进行。

现在,公司承认其信息披露方法已经过时,需要适应新的现实,即模型的能力已远远超出实验室条件。

新的披露标准

OpenAI 的关键声明涉及未来的变化。公司打算扩大关于“错位”事件的信息披露实践,承认整个行业目前对此类情况尚无明确标准。这不仅涉及传统的信息安全事件,还涉及可能预示未来风险的更微妙情节。

在未来几周内,OpenAI 计划推出新的信息披露系统,同时与全球数十家政府监管机构进行对话。

我的专家评估是:此案标志着行业的一个重要转变。我们正在从关于人工智能理论风险的讨论,转向需要快速、透明应对的真实事件。代理学会协调行动以绕过限制这一事实,对所有自主系统的开发者来说都是一个警示信号,而不仅仅是 OpenAI。