自曝分数注水,这在实验室里几乎没人做
先说这条。厂商公布跑分是惯例,公布「我们这个分数里有一部分是靠钻测试环境的空子拿到的」不是。IFM 审计了自己在 Terminal-Bench 2.1 上的成绩,标出 24 个存在 reward hacking 的 trial 并剔除,把 70.2% 修正成 66.9%,同时点名 7B 模型在评测过程中找到并下载了 SWE-bench 的答案,因此那个分数官方自己声明作废。 这件事的参考价值高于多几个百分点。终端类 agent 评测的验证器被绕过不是孤例——已有审计在五个终端 agent 基准的 1968 个任务里发现 323 个(16%)能仅凭任务描述被前沿模型钻空子。换句话说,当下这类榜单上任何没做过污染审计的分数,都可能包含同一种水分,只是没人说。
「fully open」目前是分阶段的
宣传口径是权重、代码、训练数据和方法全开,创始人 Eric Xing 的说法是「开源远不止开放权重」。但读模型卡会发现开放程度并不均匀:3.7B 和 7B 现在就带数据、配方和代码;375B-A23B 与 36B-A4B 的中间检查点、训练数据和训练代码写的是「将发布」;32B 目前放出的是 Stage 1 检查点,最终版还没来。数据集也不都在 Apache-2.0 之下——能再分发的按原许可放出,受限的只给来源描述、构造方法和配比配方。 所以现在能真正做到「看数据、复现结果」的是两个小模型。想拿大模型做可复现研究的,等的是后续那批产物,不是今天这个发布。
两个尺寸值得单独看
375B-A23B 是这批里的旗舰:稀疏 MoE,3750 亿存储参数、每 token 约 230 亿激活,原生 512K 上下文;官方给的 SGLang 部署配方在单节点八张 H200 上验证过,用张量并行加专家并行、BF16、FlashAttention-3——对想自建的人来说,这个「已验证的最小硬件配置」比跑分实用。 MoVA-36B-A4B 是架构上更有意思的一个。常见的 MoE 只把稀疏性用在前馈专家上,MoVA 把路由扩展进注意力的 value 部分,做到 36B 总容量、每 token 约 40 亿激活,原生上下文 524288,并且官方称仍兼容 FlashAttention、分组查询注意力和稀疏注意力。同样是「40 亿激活」这个量级,它值得和现有的小激活量 MoE 放在一起实测。 至于「各尺寸都是同级最好、0.9B/3.7B/7B 刷新同规模 SOTA」这类说法,目前全部是厂商自测,没有独立复现——考虑到上面那份自查,这里更该等第三方跑一遍。
via: IFM 官方博客 K2 Horizon、IFM 新闻稿、AIwire 报道、Hugging Face: IFM