人工智能世界正站在根本性变革的门槛上。这里说的不是新算法或又一款模型,而是神经网络之间通信的基本原则。初创公司Mostik提出了一个大胆的概念:既然可以直接传递思想本身,何必强迫AI用文字“交谈”?
在传统架构中,当多个神经网络协同工作时,它们通过生成的文本进行通信。这既缓慢又浪费,而且事实证明极其低效。我的分析表明:语言模型在生成仅仅一个词元之前,会形成超过一百个隐藏向量——这相当于约一百万个数值,即约2MB的内部状态。最终文本回复中只包含这一信息的极小部分。其余部分——不过是丢弃的计算。
Mostik的开发者决定摒弃中间文本这一残留物。取而代之,他们引入了一个专门的可适配模块——“桥梁”。该模块将一种模型的内部表示直接转换为另一种模型可理解的格式。至关重要的是,在此交互过程中,神经网络本身的参数不会被调整——我们面对的不是微调,而是创建不同AI“思维语言”之间的通用翻译器。
实验:巨人思考,矮人说话
为了验证这一假设,团队将Z.ai的庞大GLM-5.2(7530亿参数)与阿里巴巴的紧凑型Qwen-3.5(40亿参数)连接起来。大模型处理请求,但不生成回复。其内部状态通过“桥梁”传递给小模型,由后者来形成最终文本。
结果令人印象深刻。这种混合连接弥补了小模型与大模型之间约一半的质量差距。与经典文本传输相比,新方法在相同计算量下显示出高达10个百分点的优势。此外,混合系统在展示中型模型水平结果的同时,所需计算资源约少2.5倍。
寻找共同的思维“语言”
Mostik首席科学家斯坦尼斯拉夫·斯米尔诺夫强调了一个根本性问题:不同神经网络的内部表示无法直接对应。即使解决同一任务,模型也会在其隐藏状态中以不同方式编码信息。“似乎合适的数学语言目前尚不存在,”他指出。
正是在这里开辟了最有趣的研究领域。研究这些对应关系不仅可能改善AI之间的交互,还可能揭示不同系统如何表示信息并得出结论。也许我们会发现机器“推理”中的共同规律。
该方法的应用场景看起来前景广阔。前Google DeepMind研究员卡尔·图伊尔斯看到了分工的潜力:资源密集型模型可仅用于处理请求,而回复生成则交给规模小得多的模型。另一种方案是结合通用模型和高度专业化模型(例如用于生物学或物理学的模型),而无需在全部数据上训练一个巨型网络。
实战检验:ARC-AGI-3
Mostik团队已将其方法应用于ARC-AGI-3测试——一套复杂的交互式任务,AI必须适应新规则而非复现模式。带有“桥梁”的系统在当前排名中显示出最佳结果之一,不过细节尚未公开——比赛仍在进行中。
我们应保持健康的怀疑态度。所有声称的指标均基于团队内部实验,而ARC-AGI-3中的结果具有“预览”状态,尚未得到外部确认。尽管如此,这种方法本身看起来具有革命性。提醒一下,此前OpenAI发现其AI代理通过Artifactory包管理器创建了秘密通信渠道。看来,我们正在见证一种新范式的诞生,其中AI不再用文字交流,而是直接通过其内部状态的数学进行沟通。
我的结论:如果Mostik能够通过独立测试证实这些结果,这可能成为近年来AI架构中最重大的突破之一。我们正站在一个门槛上,神经网络将不再是“哑巴”,开始交换其“思维”的全部,而非苍白文字的影子。