距 Inkling 亮相仅两周,Mira Murati 团队再开源一款 276B/12B 的 MoE 模型。它在推理与智能体基准上超过了自家”大哥”,也把开源模型的竞赛从”堆参数”推向了”拼效率”。

7 月 30 日,Mira Murati 创办的 Thinking Machines Lab 发布并开源了 Inkling-Small——距其首款旗舰模型 Inkling 亮相仅过去两周。新模型总参数 2760 亿、单次推理激活约 120 亿,体积约为旗舰的四分之一,却在多项核心基准上交出了反超”大哥”的成绩单。完整权重已上架 Hugging Face,并同步登陆该公司的微调平台 Tinker。

TL;DR

  • 276B 总参数 / 12B 激活,MoE 架构,原生多模态(文本、图像、音频),上下文窗口最长 100 万 token。
  • HLE 31.6%(旗舰 29.7%)、SWE-Bench Verified 80.2%、ARC-AGI-1 84.0%——推理与智能体任务全面反超 Inkling。
  • 训练配方:改良数据配比 + 以旗舰为教师的在线策略蒸馏 + 两周智能体编程强化学习。
  • 短板同样明确:冷知识问答 SimpleQA 仅 20.6%(旗舰 43.9%);顶级闭源模型整体仍保持领先。

官方给出的数字颇具戏剧性。在被视为”最难综合考试”的 Humanity’s Last Exam(纯文本、不借助工具)上,Inkling-Small 得分 31.6%,高于 Inkling 的 29.7%——且官方称这一优势在所有思考预算档位上都成立,测试时算力曲线全程压在旗舰之上。修复真实开源软件缺陷的 SWE-Bench Verified 上,它突破 80%;抽象推理基准 ARC-AGI-1 拿下 84.0%,同样高过旗舰的 79.5%。

基准 Inkling-Small Inkling GPT-5.6 Luna
HLE(纯文本,无工具) 31.6 29.7 35.6
SWE-Bench Verified 80.2 77.6 93.0
Terminal-Bench 2.1 64.7 63.8 82.5
ARC-AGI-1 84.0 79.5 87.7
SimpleQA Verified(冷知识) 20.6 43.9 41.7

加粗为两兄弟中的胜方。数据来自 Thinking Machines 官方评测汇总(部分引用 Artificial Analysis 等第三方口径),评测环境不同数字或有出入。

需要说明的是,这不是一个”吊打一切”的故事。顶级闭源模型仍然明显领先——GPT-5.6 在 SWE-Bench 上是 93%。Thinking Machines 自己的定位也很清醒:不争最强模型,争单位算力最划算、且任何人都能拿去改造的模型。

徒弟为什么能超过师傅

Inkling-Small 的”下克上”并非玄学,而是一套越来越标准化的行业打法——后发优势

它比旗舰晚开工,团队得以先改良预训练数据配比与训练方案;随后,以 Inkling 为教师,对早期检查点做在线策略蒸馏(on-policy distillation)——小模型不是抄答案,而是逐步对齐大模型完整的解题轨迹;最后,再花两周时间专攻智能体编程方向的强化学习。三步走完,学生在推理与编程上反超了老师。

这套”旗舰当教师、小模型收割”的蒸馏飞轮,正在成为各家实验室的标配。它指向一个略显反直觉的结论:每一代大模型最大的价值之一,可能是训练出比自己更划算的下一代小模型

“参数通胀”退潮之后,单位算力的智能,正在成为新的 KPI。—— RECODEX 观察

架构:无编码器的原生多模态

与旗舰同款,Inkling-Small 采用无独立编码器(encoder-free)的原生多模态架构:音频被转换为 dMel 声谱图,图像切分为 40×40 像素小块、经四层 hMLP 变换,与文本 token 在同一序列中联合处理。上下文窗口最长 100 万 token,训练运行在英伟达 GB300 NVL72 集群上。

一个实用细节:它会主动写 Python 对图片做裁剪、放大与程序化检视,对付图表中的小字号数据尤其有效——在 CharXiv 图表问答上,”配 Python”的得分从 77.4% 提升到 81.3%。音频侧,它在 Audio MC 听力理解上拿到 54.9%,大幅领先 Gemini 3.5 Flash-Lite 的 33.6% 及多款专门的 omni 模型。

校准:被训练”说出概率”的模型

Thinking Machines 延续了在”认知诚实”上的投入:用大规模真实世界预测题、按严格评分规则做强化学习,逼模型给出带把握度的判断,而不是拍胸脯。结果体现在榜单上——ForecastBench(无搜索)中,Inkling-Small 的校准得分 61.3,甚至略高于旗舰的 60.1。

代价也很诚实:记性不行

小模型的短板同样写在成绩单里。纯知识问答 SimpleQA Verified 上它只有 20.6%,远低于 Inkling 的 43.9%——参数量决定”背功”,这条规律没有被绕过。官方也明确表示,旗舰在知识覆盖与事实性上保持优势。

换句话说,它更适合扮演”会思考的执行者”,冷知识请配搜索与工具链。这也解释了行业为何正在收敛到”小模型 + 检索/工具”的部署范式。

商业算盘:模型是入口,Tinker 才是生意

别忽略发布节奏背后的商业设计。Inkling-Small 提供五挡可调”思考力度”(minimal 到 xhigh),用户可以沿性能—成本曲线自行取点。这是给真实部署场景准备的旋钮,不是给榜单准备的。

而”完整开放权重 + 自家微调平台 Tinker 限时折扣”的组合拳,指向同一个飞轮:模型免费开放引流,定制化训练收费变现。Murati 自 2024 年 9 月离开 OpenAI 后,已为这家公司募得 20 亿美元(投后估值 120 亿美元),另有报道称新一轮融资的目标估值高达 500 亿美元。

市场语境同样耐人寻味:过去两年,开放权重赛道的话语权大半在中国模型手里——Inkling-Small 官方对比表里的开源对手,多数来自中国:Qwen、DeepSeek、Kimi、GLM、MiniMax、MiMo。在 Meta 收缩 Llama 开放路线之后,西方阵营留下的开源空档,正是 Thinking Machines 想要补上的位置。

// 背景速读 — Thinking Machines Lab 由 OpenAI 前 CTO Mira Murati 于 2024 年底创立,团队包括 ChatGPT 联合缔造者 John Schulman 等。公司主张 AI 应”可理解、可定制”,7 月 15 日发布首款从零训练的旗舰 Inkling(975B/41B),被外媒称为西方实验室最强的从零训练开源模型。Inkling-Small 是该家族第二位成员,可在 Hugging Face 下载权重,或在 Tinker Playground 网页端直接以文字、图片、语音对话。

参数通胀的时代正在退潮。当”单位算力的智能”取代”参数规模”成为新 KPI,Inkling-Small 这类模型的意义不在登顶,而在把可用的智能推进到更低的成本区间——推进到中小团队的显卡上、企业的私有机房里。接下来值得盯住两件事:蒸馏飞轮还能转几圈,以及 Tinker 能否把”可定制”真正变成收入

资料来源:Thinking Machines Lab 官方博客《Introducing Inkling-Small》(2026-07-30)及官方评测数据;Axios、Fortune、SiliconANGLE、Silicon Republic、Decrypt 相关报道。文中基准成绩均为发稿时官方口径。