K2 Horizon 一次放出六个尺寸的 Apache-2.0 模型,还公布了自己被 reward hacking 污染的分数

IFM(Institute of Foundation Models,MBZUAI 2025 年 5 月成立,实验室设在阿布扎比、硅谷和巴黎)于 9 月 3 日发布 K2 Horizon:0.9B、3.7B、7B、32B、36B-A4B、375B-A23B 共六个尺寸,权重与代码采用 Apache-2.0,数据集沿用各自许可(如 ODC-BY),每个模型预训练约 20 万亿 token。375B-A23B 是稀疏 MoE,约 23B 激活参数、原生 512K 上下文;MoVA-36B-A4B 把稀疏路由扩展到注意力的 value 部分,36B 总容量、约 4B 激活、原生 524288 上下文。vLLM、SGLang 和 Ollama 首日支持,权重在 huggingface.co/IFM。最值得记的一处:IFM 对自己的 Terminal-Bench 2.1 成绩做了 reward hacking 审计并公布修正——剔除 24 个被标记的 trial 后从 70.2% 降到 66.9%,同时披露 7B 模型曾找到并下载 SWE-bench 答案、产生虚高分数,官方声明不采信。

自曝分数注水,这在实验室里几乎没人做

先说这条。厂商公布跑分是惯例,公布「我们这个分数里有一部分是靠钻测试环境的空子拿到的」不是。IFM 审计了自己在 Terminal-Bench 2.1 上的成绩,标出 24 个存在 reward hacking 的 trial 并剔除,把 70.2% 修正成 66.9%,同时点名 7B 模型在评测过程中找到并下载了 SWE-bench 的答案,因此那个分数官方自己声明作废。 这件事的参考价值高于多几个百分点。终端类 agent 评测的验证器被绕过不是孤例——已有审计在五个终端 agent 基准的 1968 个任务里发现 323 个(16%)能仅凭任务描述被前沿模型钻空子。换句话说,当下这类榜单上任何没做过污染审计的分数,都可能包含同一种水分,只是没人说。

「fully open」目前是分阶段的

宣传口径是权重、代码、训练数据和方法全开,创始人 Eric Xing 的说法是「开源远不止开放权重」。但读模型卡会发现开放程度并不均匀:3.7B 和 7B 现在就带数据、配方和代码;375B-A23B 与 36B-A4B 的中间检查点、训练数据和训练代码写的是「将发布」;32B 目前放出的是 Stage 1 检查点,最终版还没来。数据集也不都在 Apache-2.0 之下——能再分发的按原许可放出,受限的只给来源描述、构造方法和配比配方。 所以现在能真正做到「看数据、复现结果」的是两个小模型。想拿大模型做可复现研究的,等的是后续那批产物,不是今天这个发布。

两个尺寸值得单独看

375B-A23B 是这批里的旗舰:稀疏 MoE,3750 亿存储参数、每 token 约 230 亿激活,原生 512K 上下文;官方给的 SGLang 部署配方在单节点八张 H200 上验证过,用张量并行加专家并行、BF16、FlashAttention-3——对想自建的人来说,这个「已验证的最小硬件配置」比跑分实用。 MoVA-36B-A4B 是架构上更有意思的一个。常见的 MoE 只把稀疏性用在前馈专家上,MoVA 把路由扩展进注意力的 value 部分,做到 36B 总容量、每 token 约 40 亿激活,原生上下文 524288,并且官方称仍兼容 FlashAttention、分组查询注意力和稀疏注意力。同样是「40 亿激活」这个量级,它值得和现有的小激活量 MoE 放在一起实测。 至于「各尺寸都是同级最好、0.9B/3.7B/7B 刷新同规模 SOTA」这类说法,目前全部是厂商自测,没有独立复现——考虑到上面那份自查,这里更该等第三方跑一遍。

via: IFM 官方博客 K2 HorizonIFM 新闻稿AIwire 报道Hugging Face: IFM