人工智能行业正在酝酿一场悄然但意义重大的变革。我们习惯于神经网络之间的协作通过生成中间文本来实现——这相当于将“思想”翻译成人类语言,再传递给另一个算法。然而,Mostik 品牌下的开发团队提出了一条截然不同的路径:直接交换内部状态,跳过语言表达阶段。
该方法的核心在于使用一个特殊的可适配模块,我称之为“桥梁”。它将一个模型的隐藏向量转换为另一个模型能够理解的格式,同时各神经网络自身的参数保持不变。这一点至关重要:我们不对模型进行微调,而只是创建一个用于无缝交互的中间层。
数据与实验:在巨头上的验证
开发人员声称,在生成一个词元时,大型语言模型会形成超过一百个隐藏向量——这相当于约一百万个数值或约 2 MB 的数据。而文本回答中只包含这些丰富信息的一小部分。他们的传输通道正是针对这些丰富的内部表示。
实证检验结果令人印象深刻。在 Z.ai 的巨型 GLM-5.2(7530 亿参数)与阿里巴巴的紧凑型 Qwen-3.5(40 亿参数)的组合中,大型模型处理请求但不生成回答。相反,其内部状态通过“桥梁”传递给小型模型,由后者生成最终文本。据作者称,这种组合弥补了两者之间约一半的质量差距。与传统的文本传递相比,新方法在相同计算成本下显示出高达 10 个百分点的优势。此外,混合系统所需的计算量比达到类似结果的中型模型少约 2.5 倍。
核心问题:寻找共同的“语言”
研究人员自己也承认的关键难点在于,不同架构缺乏统一的数学空间。Mostik 的首席科学家斯坦尼斯拉夫·斯米尔诺夫正确地指出:“似乎目前还不存在合适的数学语言。”不同网络对信息的内部编码方式即使在解决相同任务时也可能存在根本性差异。正因如此,“桥梁”必须是可适配的——它需要学会将一种隐藏状态的“方言”翻译成另一种。
该方法的实际价值显而易见:我们可以仅将重型模型用于复杂的思维工作,而将回答生成委托给轻量级模型。这为构建结合通用模型与高度专业化模型的混合系统开辟了道路,而无需在一个庞然大物上一次性训练所有数据。
评价与质疑
尽管在 ARC-AGI-3 测试中取得了引人注目的结果,系统表现出色,但我们仍应保持理性的怀疑态度。所有声称的指标都基于团队内部实验,尚未获得外部验证。然而,如果该方法得到证实,我们将站在 AI 扩展新范式的门槛上——在这种范式中,效率不是通过增加参数来实现,而是通过专业化智能体之间的智能通信来实现。
我的结论:这是一个大胆且可能具有突破性的举措,但距离实际应用还有很长的路要走。关键问题在于,“桥梁”在实验室条件之外的不同架构和任务上能否稳定运行。让我们持续关注其发展。