JetBrains 开源 Mellum 2.1 Thinking:12B 混合专家、每次只激活 2.5B,SWE-bench Verified 从 2% 拉到 47%,仍略低于 Qwen3.5 9B

JetBrains 于 10 月 7 日前后在 Hugging Face 以 Apache 2.0 许可证发布 Mellum2.1-12B-A2.5B-Thinking:总参数 120 亿、每个 token 激活 25 亿的混合专家推理模型,上下文 131,072 token,面向在代码仓库里执行命令、调用工具的编程 agent,也可做自托管的私有部署。架构与 6 月的 Mellum2 Thinking 相同,提升主要来自在真实软件环境中的强化学习后训练。JetBrains 自测的 SWE-bench Verified 从上一版的 2.0% 升到 47.0%,LiveCodeBench v6 为 82.0%;同一张表里 Qwen3.5 9B 的 SWE-bench Verified 为 50.0%、SWE-bench Pro 为 38.0%(Mellum 2.1 为 28.0%)。官方 GGUF 量化版已同步上架,可用 llama.cpp、Ollama 等运行;用于投机解码的多 token 预测头标注为「即将推出」。

同一个架构,换了训练法

JetBrains 6 月开源的 Mellum2 Thinking 擅长写函数、做补全,但放进代码仓库让它自己跑命令、改 bug,几乎做不成:自家测的 SWE-bench Verified 只有 2.0%。10 月 7 日前后发布的 Mellum2.1-12B-A2.5B-Thinking 没有改架构,仍是总参数 120 亿、每个 token 只激活 25 亿的混合专家模型,上下文 131,072 token。变化几乎全在后训练:在真实软件环境里做强化学习,让模型学会在仓库中工作、执行命令、调用工具。

结果是 SWE-bench Verified 升到 47.0%,SWE-bench Pro 从 0 升到 28.0%,Terminal-Bench 2.1 从 0.6% 升到 17.4%。非 agent 类测试里,LiveCodeBench v6 为 82.0%,HumanEval+ 为 91.5%。

和同体量模型放在一起

JetBrains 把对比模型放进自家流水线重跑了一遍,所以数字和各家官方卡片不完全一致。按它的表:

  • 比 Gemma 4 E4B 明显强,例如 SWE-bench Verified 47.0% 对 23.0%;
  • 和 Qwen3.5 9B 互有胜负:LiveCodeBench、工具调用 BFCL v4 领先,但 SWE-bench Verified(47.0% 对 50.0%)、SWE-bench Pro(28.0% 对 38.0%)和 GPQA Diamond(64.6% 对 77.8%)落后。

换句话说,它在「写代码」上很强,在「当 agent 修仓库」和通用知识上,还没超过 Qwen3.5 9B 这样的同级小模型。

谁值得装

激活参数只有 25 亿,意味着推理成本和速度接近一个很小的模型,适合在本地或内网给编程 agent 当执行者:拆出来的小任务、批量重构、跑测试修小错。许可证是 Apache 2.0,可以商用。除 BF16 权重外,官方同步放出了 Q4_K_M、Q6_K、Q8_0 等 GGUF 量化版,可直接用 llama.cpp、Ollama、LM Studio 运行;用于投机解码的多 token 预测头还在「即将推出」,模型卡上暂无托管服务商。所有分数都是 JetBrains 自测,agent 类成绩还依赖它指定的测试框架。

via: Hugging Face 模型卡、JetBrains 官方博客、MarkTechPost 报道