澳大利亚当局用来禁止青少年使用社交媒体的关键文件,被发现充斥着人工智能的痕迹。这份文件是英国组织Age Check Certification Scheme(ACCS)关于年龄验证技术测试的报告。经过核查,我发现该文件包含指向不存在的科学出版物的链接——这是神经网络“幻觉”的典型特征。

测试耗资348万澳元(约250万美元)。ACCS专家测试了来自48家供应商的60多种解决方案,并于2025年8月向政府提交了约一千页、共十卷的最终报告。当时的通信部长安妮卡·威尔斯表示,这些数据证实存在“多种有效的年龄验证工具”。对16岁以下用户的禁令已于2025年12月10日生效。

科学章节中的系统性错误

报告的主要部分涉及对现有解决方案的实际测试,这部分没有问题。然而,在作者引用科学文献的前瞻性技术章节中,发现了严重的不一致之处。我统计了六处违规,可分为四类:虚构的DOI、指向无关论文的DOI、“作者-期刊-年份”组合无法被任何出版物证实,以及引用正确但报告所附的论断与原文不符。

例如,ACCS将一篇文章标注为2025年3月发表,但实际上该文直到7月才出版。另一个案例中,对Weber et al. 2011的引用无法追溯——在指定的期刊和作者所指的莫纳什大学研究中都找不到这篇文章。

元数据中的ChatGPT

ACCS代表起初坚决否认使用人工智能,声称每条引用都经过仔细核查。然而,在报告某些部分发现四条元数据直接指向ChatGPT的引用后,其立场不得不软化。ACCS承认神经网络为简洁起见重写了部分片段,但坚持认为研究本身和最终文本是在没有OpenAI聊天机器人参与的情况下完成的。

值得注意的是,对ACCS随后提交的修正版参考文献列表的核查发现了新的矛盾:年份、作者和期刊名称与报告中的原始引用不一致。

“少量错误”还是系统性问题?

基础设施和通信部表示正在研究这些质疑。在参议院听证会上,官员们转述了ACCS的说法:引用在发布时是有效的,只是后来“失效了”。第一助理秘书莎拉·范登布鲁克承认,该部门并未独立核实这一说法,认为核查“过于繁琐”。同时,该部门强调,这只是在26页参考文献中“少量错误”的问题。

澳大利亚国立大学教授克里斯蒂安·道尼警告说,政府文件中的虚假引用会导致错误决策,并破坏对机构的信任。独立参议员法蒂玛·佩曼要求承包商正式道歉并退还资金,并提及近期德勤事件——该公司于2025年10月因在报告中错误使用人工智能而退还了44万澳元合同款项的一部分。

我的分析:这种情况对整个行业来说是一个警示信号。当影响数百万公民的政府决策建立在未经过基本真实性核查的数据之上时,我们看到的不仅仅是疏忽,而是管理系统性失灵。参议员佩曼要求退还资金是最低限度的措施。至关重要的是,在与承包商的合同中明确使用人工智能的法律责任,以及对每个来源进行强制验证。否则,神经网络的“幻觉”不仅可能成为报告的基础,还可能成为法律的基础。