Thinking Machines发布首款从零训练模型Inkling:9750 亿参数、百万上下文、Apache 2.0开源
Inkling采用 256 专家混合架构,每次仅激活 6 个路由专家和 2 个共享专家;模型权重以Apache 2.0协议发布在Hugging Face上。
Thinking Machines于 2026 年 7 月 15 日发布模型Inkling。该公司由OpenAI前CTO Mira Murati创立,其使命是构建“延伸人类意志和判断力”的AI。Inkling是公司首款从零训练的模型,权重以Apache 2.0协议发布在Hugging Face上,任何人都可以下载并用自己的数据重新训练。
混合专家架构:9750 亿总参数,每次仅激活约 410 亿
Inkling采用混合专家(Mixture of Experts)架构。该模型总共有 9750 亿参数,但处理每个token仅涉及约 410 亿参数,约占总量的 4%。
模型有 66 层,每层含 256 个专家(expert),其中仅 6 个对每个token激活。此外,还有 2 个共享专家(shared experts)在每个token上都会运行,因此每个token实际激活 8 个专家。Thinking Machines称其实现“很大程度上遵循DeepSeek发布的方法”。
全精度checkpoint至少需要 2 TB组合GPU内存(模型卡给出的配置为 8 张NVIDIA B300或 16 张H200)。量化版checkpoint(参数以较低数值精度存储)约需 600 GB,可装在 4 张B300卡上。
为避免路由崩溃(routing collapse,即少数专家被过度使用而其余专家未充分训练),Thinking Machines采用Wang及其同事引入的方法(DeepSeek也采用):为每个专家维护一个独立的偏置值,该偏置仅影响选择、不影响加权,通过一个独立于反向传播的计数规则更新。
百万token上下文:55 层滑动窗口 + 11 层全注意力
Inkling支持 100 万token的上下文窗口。其注意力层以 5:1 的比例交替:每 6 层中有 5 层是滑动窗口注意力(仅访问有限数量的最近token),1 层是全注意力(可访问全部上下文)。根据vLLM项目的集成说明,66 层具体拆分为 55 层滑动窗口层和 11 层全注意力层。
远距离信息通过这 11 个全注意力层传递:例如第 6 层的全注意力层可以直接从远处的token获取信息,随后信息在局部表示中向前传递,并每 6 层刷新一次。
Inkling还使用 8 个KV头(key-value heads),减少生成文本时所需的内存。
位置编码:选择较旧的方法而非RoPE
与大多数近期开源模型使用旋转位置编码(RoPE)不同,Inkling采用Shaw等人提出的相对位置编码方案。该方法学习每对token间距离的一个值,并直接加到注意力分数上;超出某个截断距离(例如 128)的token对共享同一个学习值,因此无需外推模型从未见过的位置角度。
vLLM的说明将其描述为在注意力分数转换为权重之前添加一个“学习的相对位置项”。Thinking Machines称,在内部测试中,该方法比RoPE表现更好,且对更长序列的外推更好。
轻量卷积与多模态输入
Inkling在注意力层的键和值上,以及在注意力与前馈步骤的输出上(在重新汇入主路径之前),添加了一个窗口大小为 4 的卷积操作。该操作将每个位置与其前几个位置混合,使局部上下文预先混合,让注意力专注于需要学习的连接。
该模型支持图像和音频输入,但当前公开来源未完整描述其多模态输入处理方式。文章提及“Inkling接受图像和音频,无需单独预训练的编码器”,但具体机制未展开。
- 注:以上事实基于ByteByteGo文章《The New American AI Model Designed to be Customized》所引用的公开信息,包括Thinking Machines的发布说明和vLLM项目集成笔记。