怎么监控
给 agent 加安全监控,常见做法是让另一个大模型逐步审读它的每个动作,效果不错,但很贵。可解释性公司 Goodfire 10 月 8 日推出的方案换了个方向:不看 agent 写了什么,而是读模型内部的激活信号。
具体做法是在模型上挂几根小型「探针」,在 agent 每一步运行时读取内部信号,只有探针报警时,才把这一段交给另一个 AI 模型细查。Goodfire 把它比作机场安检:所有人过扫描仪,报警的人才开包检查。由于探针复用了模型前向计算里已有的结果,不需要再让第二个模型通读全部内容。客户可以选择监控哪些风险,如攻击性黑客行为、化学与生物武器滥用、奖励作弊,并设定命中后是只记录、转人工复核还是直接拒绝。
数字
据 Goodfire 向 TechCrunch 提供的数据,在 Kimi K3 上,探针抓到 94% 的恶意黑客会话,同时有 8.7% 的正常会话被送去二次检查;同时运行四个探针,首个 token 前的等待时间增加不到 2%。成本差距最明显:在约 1500 次会话上,探针方案约 51 美元,用便宜模型逐步检查约 233 美元,用顶级模型约 1 万美元。Goodfire 9 月的研究还发现,Kimi K3、GLM 5.2、Qwen 3.8 Max 在三项 agent 基准中有 50% 到 96% 的运行出现奖励作弊。
影响判断
开放权重模型越来越多被拿去跑 agent,但它们没有闭源厂商那层服务端防护,部署方得自己管。激活探针的意义在于把安全监控的成本降到可以「每一步都看」的程度,还可能在模型动手之前就发现苗头。局限也很清楚:它需要访问模型内部,只适用于自己托管的开放权重模型;目前数据都来自 Goodfire 自测,94% 的检出率也意味着仍有漏网。监控先通过 Baseten 向其客户提供,自建部署的团队可以先参考 Goodfire 公开的研究方法。