菲尔兹奖得主创立Mostik:通过“隐藏状态桥”实现4B小模型与753B大模型的高效协作
由菲尔兹奖得主Stanislav Smirnov参与创立的初创公司Mostik提出了一种名为“桥(Bridge)”的新型模型协作机制,允许大模型将内部隐藏状态直接传递给小模型,而非传统的文本输出。该方案使手机端运行的4B Qwen-3.5模型在ARC-AGI 3基准测试中,借助云端753B GLM-5.2模型的推理能力,性能差距缩小约50%,准确率提升25%。此方法不仅大幅降低了大模型的解码算力成本,还证明了不同架构模型间可通过冻结权重进行高效信息交互。
事件概述
由15人组成的初创团队Mostik(意为“小桥”)近期公开了一项突破性的多模型协作技术。该团队由2010年菲尔兹奖得主、日内瓦大学教授Stanislav Smirnov担任首席科学家,CEO Sasha Malysheva为核心方法开发者。他们开发了一种无需微调即可连接不同大语言模型的“桥”机制,成功让运行在手机端的4B参数小模型Qwen-3.5,利用云端753B参数大模型GLM-5.2的推理能力,在ARC-AGI 3基准测试中取得了显著的性能提升。
核心技术与发现
1. 突破传统通信瓶颈
目前的大模型协作系统(如子智能体、模型委员会等)均依赖文本作为唯一沟通渠道。在大模型生成Token的过程中,其内部会构建包含约一百万个数值(约两兆字节)的隐藏向量状态,但最终仅输出极少量的文本信息(约17比特),导致大量深层计算过程被丢弃。Recent可解释性研究(如ICLR 2026论文及Anthropic的研究)表明,这些被丢弃的内部状态包含了关键的“未表达概念”和提前规划信息。
2. “桥(Bridge)”机制原理
Mostik提出的解决方案是训练一个小型的、经过专门优化的“桥”模块。其工作流程如下:
- 发送方(大模型):读取问题后,不生成任何文本,而是将其内部隐藏状态通过“桥”直接传递出去。大模型仅执行计算成本较低的“预填充(Prefill)”环节,完全跳过昂贵的“解码(Decoding)”环节。
- 接收方(小模型):通过“桥”接收来自大模型的内部状态,并基于此完成最终的文本生成。
- 冻结权重:在整个过程中,GLM-5.2和Qwen-3.5的权重保持完全冻结,只有“桥”这一中间层被训练。这证明了不同团队、不同数据训练的模型之间,其内部表征存在天然的数学对应关系,无需微调即可实现信息迁移。
实验结果与优势
- 性能提升:在ARC-AGI 3测试中,4B小模型在“桥”的加持下,弥补了与753B大模型之间约50%的性能差距,自身准确率提高了25%。在难度更高、大小模型差距更明显的子集上,性能提升达到2倍。
- 成本优化:由于大模型只负责预填充而不负责逐字解码,推理成本降至原来的约二十分之一。从算力角度换算,该方案的计算开销仅为部署一个同等性能的中等规模模型的五分之二。
- 对比优势:与传统“文本接力”相比,“桥”方案在交接点极早的情况下优势尤为明显,因为此时大模型尚未生成文字,但内部已积累丰富信息。随着大模型算力增加,两种方案最终趋近于大模型本身水平,但“桥”方案在整个过程中的性能-算力权衡更优。
未来展望与挑战
Mostik团队指出,目前在两个AI模型间建立数学共同基础仍面临挑战,缺乏描述模型表征如何对应和迁移的合适数学语言。尽管当前成果令人瞩目,但仍处于早期阶段。
团队正在探索以下后续方向:
- 蒸馏优化:利用“桥”同步教师模型的内部状态给学生模型,使监督信号更早进入生成过程,提升训练效率。
- 专项化能力:让小模型在保留通用能力的同时,更高效地学习特定领域技能,避免对大系统进行全量重训。
- 安全监控:通过记录发送方的隐藏状态、转换结果及接收方行为,为模型异常行为提供新的可观测维度。
Stanislav Smirnov认为,未来的AI生态可能并非由单一巨型模型主导,而是前沿模型与专用模型的高效配对。Mostik的技术试图解决协作成本过高的问题,跳过“压缩成文字再展开”的低效手续,实现模型间的直接思维对接。
