IBM 放出 Granite 4.2:3B / 8B / 30B 全部 Apache 2.0,思考模式可开可关,还附了完整训练配方

IBM 于 8 月 25 日发布 Granite 4.2,三个尺寸 3B、8B、30B,全部以 Apache 2.0 开放权重。每个模型都带「思考/不思考」开关,另有低强度模式让简单问题少花推理 token;8B 和 30B 额外做了面向 SWE、终端和搜索的 agentic 强化学习,在真实沙箱里学工具调用、写代码和联网检索。30B 在 SWE-Bench Verified 拿到 57.00、Terminal-Bench 2.1 拿到 29.24。三档分别对应笔记本、单张现代 GPU 和 A100/H100 级别,权重同时发在 Hugging Face、Ollama 与 GitHub,并公开了训练配方、数据配比和各阶段超参。

尺寸分档是照着部署位置切的

三个尺寸对应三种机器,不是三档性能梯度:3B 面向笔记本,走 Ollama 或 LM Studio,有量化到 Q4_K_M 的 GGUF;8B 面向单张现代 GPU;30B 需要 A100/H100 级别的算力,或者在 vLLM 上用 FP8/NVFP4 服务。工具链侧支持 OpenAI 兼容的 function calling,以及 vLLM 和 SGLang。 推理控制这块给了三挡而不是两挡:思考、不思考,外加一个低强度模式,让简单问题少烧几个推理 token。对按 token 计费或者跑在本地的场景,这个开关比基准分更有用——它直接决定同一个模型在你这儿的实际成本。

8B 和 30B 才做了 agentic 训练

需要分清的一点是:基础强化学习覆盖全部三个尺寸,但面向 SWE、终端和搜索的 agentic RL 只做了 8B 和 30B。这两档模型是在真实沙箱环境里学会用工具、写代码并运行、联网检索的。也就是说,如果你冲着 agent 能力去,3B 这一档拿到的不是同一套训练。 公开的成绩是 30B 在 SWE-Bench Verified 上 57.00、Terminal-Bench 2.1 上 29.24。IBM 把这一代定位成「面向推理」的版本,说法是为当下企业用例所需的 agentic 工作流而造。同批还发了两个 470M 参数的 Granite Speech 5.0 Turbo CTC 语音模型,IBM 称单张 H200 上 RTFx 吞吐接近 12600。

真正的差异化在许可证和配方

Apache 2.0 意味着可以下载、微调、直接上生产,没有附加限制——这在企业本地部署场景里是硬条件,很多同尺寸的开放权重模型卡在许可证上。更少见的是 IBM 把完整训练配方、数据配比和各阶段超参一起公开了,这让复现和继续训练成为可能,而不只是拿到一份权重。 一处需要说明的口径分歧:上下文长度各家报道不一致,有的写 128K,有的写 512K(多阶段预训练扩展到的上限)。IBM 官方博客里没有直接给这个数字,选型前建议以模型卡为准,不要照抄二手报道。 对在挑本地模型的团队,这一代值得进候选名单的理由不是某个基准分,而是「许可证干净 + 有 agentic 训练 + 三档尺寸覆盖笔记本到服务器」这个组合——同时满足这三条的开放模型不多。

via: IBM Research 官方博客The DecoderThe New StackMarkTechPost