4B手机模型+753B云端大模型组合刷爆ARC-AGI 3,技术细节尚未公开
Mostik团队称,通过一个经过训练的“桥”传递隐藏状态,让4B的Qwen-3.5弥补了与753B的GLM-5.2之间50%的性能差距,大模型推理成本降至约二十分之一。
AI解读:这条新闻的核心不是某个模型变强了,而是模型之间协作的方式可能被改写。过去,无论多少AI模型协同工作,它们唯一沟通渠道就是文字——大模型生成一个词,内部有一百万个数值的隐藏状态被丢弃,只有十几个比特的文本能传给下一个模型。Mostik的做法是训练一个极小的“桥”,让大模型的隐藏状态直接流进小模型,全程不生成文字,两个模型的权重都冻住不动。结果是手机能跑的4B小模型,准确率提升了25%,在难题上甚至翻倍,而大模型的推理成本被压到约二十分之一。对普通用户来说,这意味着未来手机端可能跑出接近云端大模型的推理能力,不必为每次提问付高额API费;对开发者和云厂商,这可能改变成本结构——但要注意,结果只来自ARC-AGI 3这一基准,具体技术细节和泛化能力都未公开,团队也拒绝披露,因为这些都是在比赛进行中。真正受影响的是那些在大模型调用成本与能力之间做权衡的开发者,以及探索模型组合的公司。别急着把资金或架构押在这条路上,等论文或开源代码出来再评估更稳妥。
9月7日,一家成立仅4个月、共15人的团队Mostik声称,用“4B Qwen-3.5(手机端)+753B GLM-5.2(云端)”的组合刷爆了ARC-AGI 3基准,但技术细节未公开,团队拒绝披露,称“比赛还没结束”。
核心方法:用“桥”传隐藏状态,不生成文字
Mostik团队称,他们让大模型的隐藏状态通过一个小型、经过训练的“桥”直接传递给小模型,接收方拿到内部状态后直接使用。整个过程不产生文本,两个模型的权重完全冻结,桥是系统中唯一被训练的部分。
在演示中,GLM-5.2(智谱,753B参数)作发送方,Qwen-3.5(阿里,4B参数)作接收方。大模型只读取问题,隐藏状态经桥传出后停止,所有文字由小模型生成。
团队称,这套方案让4B模型补上与753B模型约50%的性能差距,自身准确率提高25%;在大小模型差距更明显的难题子集上,提升达到2倍。大模型侧推理成本被压到约二十分之一。
团队背景与公共信息
Mostik在俄语中意为“小桥”,成立仅4个月,团队15人,其中12人为博士。首席科学家Stanislav Smirnov是日内瓦大学教授、2010年菲尔兹奖得主,他称“在两个AI模型之间找到可用的数学共同基础极难,目前似乎缺少合适的数学语言”。CEO Sasha Malysheva是核心方法开发者之一。
公开演示中选用的模型经过严格冻结测试。团队称,若有用信息能在不微调的情况下通过桥,说明桥所利用的结构是模型训练中自然产生的。
后续方向包括:蒸馏(用小模型带桥同步教师内部状态,早期结果显示学生模型在相同训练预算下更接近教师);专项化(小模型带桥训练专业能力时效率更高);以及安全监控(桥在两个模型间增加观察面)。团队称这些方向仍处早期阶段。