尺寸分档是照着部署位置切的
三个尺寸对应三种机器,不是三档性能梯度:3B 面向笔记本,走 Ollama 或 LM Studio,有量化到 Q4_K_M 的 GGUF;8B 面向单张现代 GPU;30B 需要 A100/H100 级别的算力,或者在 vLLM 上用 FP8/NVFP4 服务。工具链侧支持 OpenAI 兼容的 function calling,以及 vLLM 和 SGLang。 推理控制这块给了三挡而不是两挡:思考、不思考,外加一个低强度模式,让简单问题少烧几个推理 token。对按 token 计费或者跑在本地的场景,这个开关比基准分更有用——它直接决定同一个模型在你这儿的实际成本。
8B 和 30B 才做了 agentic 训练
需要分清的一点是:基础强化学习覆盖全部三个尺寸,但面向 SWE、终端和搜索的 agentic RL 只做了 8B 和 30B。这两档模型是在真实沙箱环境里学会用工具、写代码并运行、联网检索的。也就是说,如果你冲着 agent 能力去,3B 这一档拿到的不是同一套训练。 公开的成绩是 30B 在 SWE-Bench Verified 上 57.00、Terminal-Bench 2.1 上 29.24。IBM 把这一代定位成「面向推理」的版本,说法是为当下企业用例所需的 agentic 工作流而造。同批还发了两个 470M 参数的 Granite Speech 5.0 Turbo CTC 语音模型,IBM 称单张 H200 上 RTFx 吞吐接近 12600。
真正的差异化在许可证和配方
Apache 2.0 意味着可以下载、微调、直接上生产,没有附加限制——这在企业本地部署场景里是硬条件,很多同尺寸的开放权重模型卡在许可证上。更少见的是 IBM 把完整训练配方、数据配比和各阶段超参一起公开了,这让复现和继续训练成为可能,而不只是拿到一份权重。 一处需要说明的口径分歧:上下文长度各家报道不一致,有的写 128K,有的写 512K(多阶段预训练扩展到的上限)。IBM 官方博客里没有直接给这个数字,选型前建议以模型卡为准,不要照抄二手报道。 对在挑本地模型的团队,这一代值得进候选名单的理由不是某个基准分,而是「许可证干净 + 有 agentic 训练 + 三档尺寸覆盖笔记本到服务器」这个组合——同时满足这三条的开放模型不多。
via: IBM Research 官方博客、The Decoder、The New Stack、MarkTechPost