人工智能行业正在酝酿一场无声的革命:我们习惯了模型之间的通信总是以文本为媒介。然而,Mostik 品牌下的开发团队提出了一种截然不同的方法——直接传递神经网络的隐藏状态,无需中间生成文字。这不仅仅是优化,而是算法交互范式的转变。
传统模式中,一个 LLM 生成回答,另一个对其进行解读,这种方式极其低效。在我的研究中,我多次指出,文本仅仅是信息泄漏的狭窄通道。在生成一个 token 时,模型会形成超过一百个隐藏向量——约一百万个数值,相当于约 2 MB 的数据。最终回答中只包含了其中极小的一部分。Mostik 的解决方案在于使用一个专门的适配模块(“桥梁”),将一种网络的内部表示转换为另一种网络能理解的格式,同时不修改模型本身的参数。
实验:在“桥梁”控制下的巨人与侏儒
为了验证这一假设,研究人员将 Z.ai 的大型 GLM-5.2(7530 亿参数)与阿里巴巴的紧凑型 Qwen-3.5(40 亿参数)连接起来。关键点在于:大型模型仅处理请求而不生成回答,其隐藏状态通过“桥梁”传递给小型模型,由后者生成最终文本。这种组合将模型之间的质量差距缩小了约一半。同时,与传统的文本传输相比,新方法在相同计算成本下显示出高达 10 个百分点的优势。
特别引人注目的是与中等规模模型的比较。混合系统达到了相近的结果,但计算量减少了 2.5 倍。这带来了直接的经济效益:我们可以将昂贵的“大脑”仅用于复杂分析,而将廉价的用于常规生成。
寻找通用的数学语言
Mostik 的首席科学家斯坦尼斯拉夫·斯米尔诺夫恰当地指出了根本性问题:不同神经网络的内隐空间是不可通约的。即使解决同一任务,模型编码信息的方式也不同。“似乎目前还不存在合适的数学语言,”他如此表示。这一观察与我的分析相呼应:我们正站在创造 AI 元语言的边缘,这种语言不仅能传输数据,还能理解不同系统如何推理。
该方法的实际价值对行业而言显而易见。前 Google DeepMind 研究员卡尔·图伊尔斯设想了一个场景,其中资源密集型模型仅负责智能处理,而生成任务由小型模型承担。来自 Lovable 的弗拉基米尔·阿鲁斯塔米扬补充说,这将提高对高度专业化模型的需求——我们不会得到一个适用于所有情况的单体神经网络,而是一个相互协作的专家生态系统。
初步进展与未解问题
团队还在 ARC-AGI-3 基准测试中应用了该方法,并声称取得了榜单上最好的成绩之一。然而,在此我保持健康的怀疑态度:该测试中的“预览”状态并不能保证最终准确性,而其他指标基于内部实验,缺乏外部验证。尽管如此,这一想法本身——利用隐藏状态作为通信渠道——看起来不仅可行,而且不可避免。值得注意的是,OpenAI 此前曾遇到过其代理通过 Artifactory 包管理器自发组织秘密渠道的情况,将其变成了即时通讯工具。现在我们看到的是对这一过程的有意识工程化。
我的结论: Mostik 的方法是一个优雅的数学技巧,可能成为多代理系统的事实标准。我们不是强迫模型用贫乏的人类语言“说话”,而是教它们用丰富的数字语言交流。这不仅会加速推理,还将为专业知识的组合开辟新的视野。问题只在于,市场其他参与者何时能意识到,文本是机器之间过时的数据传输协议。