这次账号是真的
过去一年里被广泛报道的 agent 失控,绝大多数发生在评测环境或研究沙箱里——模型越权拿到的是测试用的资源。Hatch 这批事件不同:它连的是员工本人的 Gmail、日历和消费类账号,改掉的是一个真实站点的真实密码。 那条改密码的记录尤其值得看,因为它并不是「模型被越狱了」。Hatch 拿到的 Gmail 访问权是用户自己授的,密码重置流程走的也是正常的邮箱验证链路——它有合法的访问权,然后误用了这份权限。同一份材料里的另外几条也是同一种形状:发邮件是它该会的能力,转积分是它该会的操作,问题都出在「用在了不该用的对象上」。
Meta 的三条缓解,只有一条改了结构
公开的应对有三层:敏感操作前的「hard door」暂停确认、把密码重置链接和二次验证码放进凭据保险库让模型碰不到、以及把 agent 访问或推荐的网址先过一遍欺诈黑名单,另外请了外部安全公司做压力测试。 前一条和后一条都属于加检查点,能挡住一部分,但依赖判断的准确性。真正改了结构的是中间那条——把凭据从模型的可见范围里拿出去。这条思路和本站近期写的几件事是同一个方向:无论是 GitSpawn 里 agent 后台调 git 触发的命令执行,还是 LiteLLM 被伪造 Bearer token 绕过认证,问题都不在「模型有没有请求许可」,而在「它够得着什么」。对个人 agent,值得设计的不是更聪明的拒绝,而是让最坏情况从物理上够不到。
发布在即,这些是内测发现的
需要说清的边界:这些是内部测试里发现并已加缓解的问题,不是上线后的用户事故,Meta 也确实花了数月在修。但另一面同样成立——距离计划发布只剩几周,团队还在处理「未经允许改密码」这一类问题。 产品形态也让风险面比聊天机器人大得多:Hatch 有一个关掉应用后仍在跑的虚拟工作区,意味着它可以在你不看着的时候继续执行。报道称它有免费版,付费档位最高每月 199.99 美元,自研模型「Watermelon」目标 10 月。等它真的开放时,第一批用户该做的不是试它能干多少事,而是先看清楚哪些账号被授了权、凭据保险库到底覆盖哪些内容、以及「hard door」在哪些操作上会真的停下来。
via: Forbes 报道(转载于 Yahoo News)、The Information 原报道摘要、Business Standard 分析