两个真正的产品决策
Muse Code 的差异点不在"能写代码",而在两处工程选择。一是子智能体常驻:主智能体协调若干在隔离工作树里并行跑的后台 worker,这些 worker 在整个会话期间保持活跃,而不是每个任务临时拉起一个,省掉了反复重新收集上下文的开销。二是运行时可重放:本地事件日志逐条追加模型调用、工具执行、审批和文件编辑,官方说法是"replay-exact、restart-safe"——进程崩了之后能从中断处精确恢复,这是长耗时迁移和大规模重构真正需要的东西。内置技能有三个:`/plan` 把任务变成需审批的计划,`/grill` 对计划做压力测试,`/goal` 朝既定目标持续推进。
模型和分数
Muse Spark 1.2 是编程方向的检查点,与 Muse Code 协同训练,上下文 100 万 token。Meta 自评的分数是 Terminal-Bench 2.1 拿到 82.9%(覆盖全部 89 个任务,五次尝试的 pass@1),DeepSWE v1.1 拿到 59.3%(91 个仓库、五种语言共 113 个任务),对应上一代 Muse Spark 1.1 的 76.2% 和 53.0%。需要说明的是,这三项评测都是 Meta 自己跑的,官方方法学文档也承认评测设置未必贴合第三方模型的强项;The Register 指出各家分数其实相当密集,Muse Spark 并没有拿到第一。
打法是价格,不是能力
Meta AI 负责人 Alexandr Wang 的表态很直接:这次对标 Anthropic 和 OpenAI 的产品,比的是价格而不是能力。默认按量档每百万输入 token 1.25 美元、输出 4.25 美元;另有一个更便宜的"贡献者"档,条件是开发者同意自己的数据被用于训练。两者都经 Meta Model API 提供,也可通过 OpenRouter 接入。 还有一点值得注意:Muse Spark 是闭源权重的云端模型,和 Llama 时代的开放权重路线不同,扎克伯格只说"之后会有更多消息"。对开发者来说,现在能确定的是多了一个价格更低、上下文更长的终端智能体可选;能否替代已经在用的工具,得看你的代码库规模和这套子智能体机制在真实项目里的表现,而不是这几个基准分数。
via: Meta AI Research 官方博客《Introducing Muse Code and Muse Spark 1.2》、The Register 报道、TechCrunch《Meta launches Muse Code, an AI agent for large code bases》;核实于 2026-08-07