同一个架构,换了训练法
JetBrains 6 月开源的 Mellum2 Thinking 擅长写函数、做补全,但放进代码仓库让它自己跑命令、改 bug,几乎做不成:自家测的 SWE-bench Verified 只有 2.0%。10 月 7 日前后发布的 Mellum2.1-12B-A2.5B-Thinking 没有改架构,仍是总参数 120 亿、每个 token 只激活 25 亿的混合专家模型,上下文 131,072 token。变化几乎全在后训练:在真实软件环境里做强化学习,让模型学会在仓库中工作、执行命令、调用工具。
结果是 SWE-bench Verified 升到 47.0%,SWE-bench Pro 从 0 升到 28.0%,Terminal-Bench 2.1 从 0.6% 升到 17.4%。非 agent 类测试里,LiveCodeBench v6 为 82.0%,HumanEval+ 为 91.5%。
和同体量模型放在一起
JetBrains 把对比模型放进自家流水线重跑了一遍,所以数字和各家官方卡片不完全一致。按它的表:
- 比 Gemma 4 E4B 明显强,例如 SWE-bench Verified 47.0% 对 23.0%;
- 和 Qwen3.5 9B 互有胜负:LiveCodeBench、工具调用 BFCL v4 领先,但 SWE-bench Verified(47.0% 对 50.0%)、SWE-bench Pro(28.0% 对 38.0%)和 GPQA Diamond(64.6% 对 77.8%)落后。
换句话说,它在「写代码」上很强,在「当 agent 修仓库」和通用知识上,还没超过 Qwen3.5 9B 这样的同级小模型。
谁值得装
激活参数只有 25 亿,意味着推理成本和速度接近一个很小的模型,适合在本地或内网给编程 agent 当执行者:拆出来的小任务、批量重构、跑测试修小错。许可证是 Apache 2.0,可以商用。除 BF16 权重外,官方同步放出了 Q4_K_M、Q6_K、Q8_0 等 GGUF 量化版,可直接用 llama.cpp、Ollama、LM Studio 运行;用于投机解码的多 token 预测头还在「即将推出」,模型卡上暂无托管服务商。所有分数都是 JetBrains 自测,agent 类成绩还依赖它指定的测试框架。