里约3.5:里约热内卢市政府"独特"AI模型丑闻

里约热内卢市政IT公司IplanRIO发布了Rio 3.5 Open 397B,声称这是一款使用公共资金训练的开源AI模型,在多项基准测试中超越了DeepSeek V4 Pro和Qwen 3.7 Plus。然而,次日AI开发团队Nex便指出,该工具实际上是其自有模型Nex-N2-Pro与Qwen3.5-397B-A17B的直接融合。
面对这些指控,IplanRIO迅速更新了Hugging Face上的模型卡片。新版本显示,Rio 3.5是通过融合Nex-N2-Pro和Qwen3.5-397B-A17B,并随后从更强大的模型进行蒸馏而构建的。
Rio 3.5最初如何呈现
IplanRIO于2026年6月13日以MIT许可证在Hugging Face上发布了Rio 3.5 Open 397B。最初的描述称该项目为“前沿级别”的通用AI系统,并指出该模型基于Qwen3.5-397B-A17B进行了微调。其特性包括3970亿参数(其中处理每个token时激活170亿参数,采用混合专家架构)、101万token的上下文窗口,以及使用SwiReasoning框架。第一版模型卡片展示了测试结果,显示Rio 3.5在多项测试中超越竞争对手:Terminal-Bench 2.1得分70.8%,而Qwen 3.7 Plus为70.3%,DeepSeek V4 Pro为67.9%;在Humanity's Last Exam中得分为36.5%,Qwen 3.7 Plus为34.7%;在IMOAnswerBench中得分为89.5%。
Nex的声明
6月14日,Nex在GitHub上的Nex-N2仓库中发布声明,指出Rio 3.5的权重看起来像是Nex-N2-Pro与Qwen3.5-397B-A17B的直接逐元素融合。据Nex评估,Rio 3.5大约60%来自Nex-N2-Pro,40%来自Qwen3.5-397B-A17B。该公司未发现IplanRIO自主训练的迹象。两个关键论据是:移除系统提示“You are Rio”后,模型在79%的回复中自称“Nex, from Nex-AGI”;并且Rio的每个权重张量在所有60层模型中都重复了Nex与Qwen之间0.6/0.4的比例。Nex在声明中表示:“对此没有合理的解释。”
基准测试为何引发质疑
Nex-N2-Pro在自身测试中表现优于Rio 3.5:Terminal-Bench 2.1得分75.3%,而Rio 3.5为70.8%;GDPval得分1585,而Rio 3.5为1533。如果Rio确实是混合模型,其较弱的表现也在意料之中。更新模型卡片后,这些基准测试结果已从主要描述中移除。
IplanRIO的回应
面对指控,IplanRIO修改了模型的README文件,指出Rio 3.5是通过融合Nex-N2-Pro和Qwen3.5-397B-A17B构建的,随后进行了蒸馏。更新后的README写道:“我们对造成的混淆深表歉意,并致以歉意。”团队正在努力重新上传正确的模型。截至发稿时,尚未发布单独的详细公开评论。
争议的实质
使用开源模型(Nex-N2-Pro采用Apache 2.0许可证,Qwen3.5-397B-A17B为开源模型)本身并不构成违规。争议源于展示方式:最初的模型卡片给人留下了基于Qwen进行自主开发和微调的印象,但未将Nex-N2-Pro列为来源之一。在开源社区中,这被视为透明度问题。融合开源权重和蒸馏已成为常见做法,但开发者被期望披露原始模型和第三方团队的贡献。
我的评论:这一事件生动地展示了在AI领导地位竞争中,透明度如何受到损害。对于以验证和证据为信任基础的加密社区而言,这种做法是不可接受的。如果IplanRIO从一开始就诚实地注明来源,这场争议本可避免。相反,我们看到的是试图将开源模型的组合包装成自身突破的行为,这不仅损害了项目的信誉,也削弱了该领域政府倡议的公信力。