Meta 重开权重:30B 的 Muse Glimmer 按 Apache 2.0 放出,单张消费级显卡就能跑本地智能体

8 月 10 日,Meta Superintelligence Labs 发布并开放了 Muse Glimmer 的权重——30B 稠密模型、Apache 2.0 许可、131K 上下文,官方 4-bit 量化后体积压到 20GB 以内,24GB 或 32GB 显存的单卡就能跑。它从 8 月 5 日发布的闭源旗舰 Muse Spark 1.2 蒸馏而来,主打常驻本地的智能体工作流;扎克伯格同时表示 Muse Spark 1.2 的权重也会跟着开放。这是 Meta 今年 4 月转向闭源旗舰之后的一次路线回摆。

放出来的到底是什么

30B 稠密架构,每个 token 激活全部参数,没有 MoE 的路由开销,官方说法是换取长上下文下的稳定性和可预测的延迟。131K 上下文,支持工具调用与图像输入。全精度要 55GB 以上显存,官方 4-bit 量化版压到 20GB 以内,给 KV cache、图像编码器和投机解码的草稿模型留出余量后仍塞得进 24GB / 32GB 的单卡。Meta 用了 DFlash 投机解码,官方数据是 RTX 5090 上提速 3.1 倍、M5 Max 1.8 倍、M4 Max 1.5 倍。权重在 Hugging Face,Ollama、LM Studio、llama.cpp、MLX、ExecuTorch、vLLM、SGLang 都已支持。训练路径是先从 Muse Spark 1.2 做 logit 蒸馏,再补长上下文与智能体数据,最后混合监督微调、on-policy 蒸馏和强化学习。

从闭源旗舰回摆

Meta 今年 4 月发布首个闭源旗舰 Muse Spark,被普遍读作告别 Llama 时代的开放路线。这次不只放出 Glimmer,扎克伯格还说更强的 Muse Spark 1.2 权重也会开放,并同时发表长文,主张 AI 能力应当分散、而不是集中在少数几家手里。Apache 2.0 是这次真正的关键细节:可商用、可修改、可再分发,没有 Llama 系列附带的那些使用限制。

需要留意的地方

基准数据目前全是厂商自测——Meta 拿 Glimmer 对比 Gemma4-31B 和 Qwen3.6-27B,跑的是 DeepSearch QA、MCP-Atlas、SWE-Bench,第三方复现尚未出现。安全侧有个值得盯的数字:提示注入测试 Siren AgentDojo 上,Glimmer 的攻击成功率 28.4%,介于 Gemma 的 25.6% 与 Qwen 的 40.3% 之间,同时效用分 94.2 是三者最高。The Register 的评价则是,30B 这个量级对「夺回开放权重的领先位置」影响有限。

影响判断

对想把智能体跑在本地的开发者,这次给的组合很实在:许可证够开放、单卡放得下、工具调用和多模态都在,选型时的顾虑主要不在能力而在部署成本。但近三成的提示注入成功率意味着,本地智能体一旦接上文件系统或联网,沙箱和人工审批环节仍然省不掉——能跑起来和能放心跑,是两件事。

via: Meta AI Research 官方发布NVIDIA 开发者博客的本地部署说明VentureBeat 报道The Register 报道;核实于 2026-08-12