放出来的到底是什么
30B 稠密架构,每个 token 激活全部参数,没有 MoE 的路由开销,官方说法是换取长上下文下的稳定性和可预测的延迟。131K 上下文,支持工具调用与图像输入。全精度要 55GB 以上显存,官方 4-bit 量化版压到 20GB 以内,给 KV cache、图像编码器和投机解码的草稿模型留出余量后仍塞得进 24GB / 32GB 的单卡。Meta 用了 DFlash 投机解码,官方数据是 RTX 5090 上提速 3.1 倍、M5 Max 1.8 倍、M4 Max 1.5 倍。权重在 Hugging Face,Ollama、LM Studio、llama.cpp、MLX、ExecuTorch、vLLM、SGLang 都已支持。训练路径是先从 Muse Spark 1.2 做 logit 蒸馏,再补长上下文与智能体数据,最后混合监督微调、on-policy 蒸馏和强化学习。
从闭源旗舰回摆
Meta 今年 4 月发布首个闭源旗舰 Muse Spark,被普遍读作告别 Llama 时代的开放路线。这次不只放出 Glimmer,扎克伯格还说更强的 Muse Spark 1.2 权重也会开放,并同时发表长文,主张 AI 能力应当分散、而不是集中在少数几家手里。Apache 2.0 是这次真正的关键细节:可商用、可修改、可再分发,没有 Llama 系列附带的那些使用限制。
需要留意的地方
基准数据目前全是厂商自测——Meta 拿 Glimmer 对比 Gemma4-31B 和 Qwen3.6-27B,跑的是 DeepSearch QA、MCP-Atlas、SWE-Bench,第三方复现尚未出现。安全侧有个值得盯的数字:提示注入测试 Siren AgentDojo 上,Glimmer 的攻击成功率 28.4%,介于 Gemma 的 25.6% 与 Qwen 的 40.3% 之间,同时效用分 94.2 是三者最高。The Register 的评价则是,30B 这个量级对「夺回开放权重的领先位置」影响有限。
影响判断
对想把智能体跑在本地的开发者,这次给的组合很实在:许可证够开放、单卡放得下、工具调用和多模态都在,选型时的顾虑主要不在能力而在部署成本。但近三成的提示注入成功率意味着,本地智能体一旦接上文件系统或联网,沙箱和人工审批环节仍然省不掉——能跑起来和能放心跑,是两件事。
via: Meta AI Research 官方发布、NVIDIA 开发者博客的本地部署说明、VentureBeat 报道、The Register 报道;核实于 2026-08-12