蒸馏出来的学生模型,把当老师的反超了。
Thinking Machines 今天放出 Inkling-Small,总参数 276B、激活 12B,体量大约是 Inkling 大杯板的四分之一。

通用推理和智能体编程两条线上,学生都站到了老师前面。

过去说 " 小模型超过大模型 ",大概率是挑了一个最有利小模型的思考强度档位,和一个最有利的基准。
这次不太一样。
Humanity ’ s Last Exam 上,Inkling-Small 得 31.6%,高于 Inkling 的 29.7%,
而且在同等算力成本下几乎都成立,小模型的 test-time compute 曲线自始至终位于大模型之上。


大模型在知识覆盖和事实性上依然占优,Inkling-Small 的预览版阶段 SimpleQA Verified 是 20.9%,Inkling 那边是 43.9%,差了一倍还多。
预览版在 Terminal Bench 2.1 上是 52.7%,同期 Inkling 是 63.8%,而且 Inkling 那个成绩里还有少量被判定为受网页搜索污染的解答被直接记了 0 分。
所以更适合这样理解:小模型追上来的是推理和编程这类靠训练强化的能力,追不上的是靠参数量的硬知识含量。
Inkling-Small 是在 Inkling 之后才开始训练的,这个时间差被团队完整地利用了。
第一步在预训练,团队调整了 Inkling-Small 的预训练数据配比和机器学习 recipe。
第二步在后训练,预览版检查点的后训练部分用了以 Inkling 作为教师的在线策略蒸馏。
第三步是从预览检查点接着往下走,专门针对智能体编程又扩展了两周的强化学习。

说明在同一套 post-training 方法上继续投算力,回报还没到边际递减的位置。
参考链接:
[ 1 ] https://thinkingmachines.ai/model-card/inkling-small/
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见