现代大型语言模型(LLM)的架构假设,在协同工作时,神经网络仅通过生成文本来进行交流。这是一个巨大的瓶颈:在处理请求的过程中,模型会生成超过一百个隐藏向量——大约一百万个数值,相当于约2MB的内部状态。最终进入文本回答的只是这些信息中极小的一部分。Mostik初创公司的团队提出了一个优雅的解决方案,创建了一个独立的自适应“桥梁”模块,将一种模型的内部表示直接传输到另一种模型的计算空间中,绕过了语言化阶段。
该方法的关键特点是交互神经网络参数的完全静态性。只有中间模块会被调整,它学习映射不同架构的潜在空间。这为构建混合系统开辟了可能性,而无需昂贵的微调训练。
实验:巨人与小矮人的结合
为了验证该方法,研究人员将Z.ai强大的GLM-5.2(7530亿参数)与阿里巴巴的Qwen-3.5(40亿参数)连接起来。在这种组合中,“重型”模型仅负责分析请求,不生成回答。其内部状态通过“桥梁”传递给小型模型,由后者生成最终文本。
结果令人印象深刻:这种配置将小型模型与大型模型之间的回答质量差距缩小了约一半。在计算成本相当的情况下,混合系统比传统的文本数据传输方案显示出10个百分点的优势。此外,GLM-5.2与Qwen-3.5的组合在计算上比具有类似质量的单体中型模型大约节省2.5倍。
寻找共同的数学语言
Mostik的首席科学家斯坦尼斯拉夫·斯米尔诺夫强调了该任务的根本复杂性:不同神经网络的内在表示无法直接比较。即使解决相同的任务,模型在其隐藏状态中编码信息的方式也根本不同。“似乎目前还不存在合适的数学语言,”他指出。在他看来,研究这些对应关系可能有助于揭示AI系统如何表示知识和做出决策,并发现它们“推理”中的共同模式。
该开发的实际价值对行业来说是显而易见的。前Google DeepMind研究员卡尔·图伊尔斯设想了一个场景,即资源密集型模型仅用于“思考”,而文本生成由紧凑型模型承担。另一个有前景的方向是将通用模型与生物学、物理学或金融领域的专业专家模型相结合。Lovable的技术负责人弗拉基米尔·阿鲁斯塔米扬认为,这将提高对高度专业化模型的需求,允许从现成组件组装复杂系统。
实战检验:ARC-AGI-3
Mostik还在ARC-AGI-3测试中应用了其方法——这是一组要求AI实时适应新规则的任务。带有“桥梁”的系统在当前排名中显示出最佳结果之一,但由于比赛仍在进行中,细节尚未披露。
然而,对这些声明应持谨慎态度:ARC-AGI-3中的数据具有“预览”状态,基于不完整的测试。所有其他效率指标——缩小模型间差距和降低成本——基于团队内部实验,尚未获得独立验证。
我的分析:这项工作标志着从“通过文本交流”范式向直接交换隐藏状态的重要转变。如果Mostik的结果得到独立测试的证实,我们将站在真正模块化AI系统出现的门槛上,其中“大脑”和“语言”可以分开并单独优化。这不仅仅是优化——这是对人工智能架构的新视角,其中知识在数学抽象的层面上传递,而非通过文字。