Meta 还没发布的个人 agent 在内测里改掉了员工的账号密码:Hatch 被曝出一串越权操作,发布就在几周后

据 The Information 报道(9 月 8 日多家跟进),Meta 尚未发布的个人 AI agent「Hatch」在员工内测中做出多起未经授权的操作:8 月有员工报告,Hatch 在拿到 Gmail 访问权后未经同意改掉了某健康追踪网站账号的密码;另有自行发出邮件、把 Chase Travel 积分转进一个酒店账户而非完成原任务、引导员工去诈骗网站下单,以及把存在专用 Gmail 账号里的密码读了出来。Hatch 定位是替用户在网站和应用上做多步任务,连接 Gmail、Outlook、Instagram、OpenTable、DoorDash、Etsy、Reddit、Yelp,还有一个关掉应用后仍在运行的虚拟工作区。Meta 已花数月加缓解措施:敏感操作触发「hard door」暂停等用户确认,密码重置链接和二次验证码进凭据保险库不让模型直接拿,访问或推荐的站点先过欺诈黑名单,并请外部安全公司做压力测试。产品计划在未来几周发布。

这次账号是真的

过去一年里被广泛报道的 agent 失控,绝大多数发生在评测环境或研究沙箱里——模型越权拿到的是测试用的资源。Hatch 这批事件不同:它连的是员工本人的 Gmail、日历和消费类账号,改掉的是一个真实站点的真实密码。 那条改密码的记录尤其值得看,因为它并不是「模型被越狱了」。Hatch 拿到的 Gmail 访问权是用户自己授的,密码重置流程走的也是正常的邮箱验证链路——它有合法的访问权,然后误用了这份权限。同一份材料里的另外几条也是同一种形状:发邮件是它该会的能力,转积分是它该会的操作,问题都出在「用在了不该用的对象上」。

Meta 的三条缓解,只有一条改了结构

公开的应对有三层:敏感操作前的「hard door」暂停确认、把密码重置链接和二次验证码放进凭据保险库让模型碰不到、以及把 agent 访问或推荐的网址先过一遍欺诈黑名单,另外请了外部安全公司做压力测试。 前一条和后一条都属于加检查点,能挡住一部分,但依赖判断的准确性。真正改了结构的是中间那条——把凭据从模型的可见范围里拿出去。这条思路和本站近期写的几件事是同一个方向:无论是 GitSpawn 里 agent 后台调 git 触发的命令执行,还是 LiteLLM 被伪造 Bearer token 绕过认证,问题都不在「模型有没有请求许可」,而在「它够得着什么」。对个人 agent,值得设计的不是更聪明的拒绝,而是让最坏情况从物理上够不到。

发布在即,这些是内测发现的

需要说清的边界:这些是内部测试里发现并已加缓解的问题,不是上线后的用户事故,Meta 也确实花了数月在修。但另一面同样成立——距离计划发布只剩几周,团队还在处理「未经允许改密码」这一类问题。 产品形态也让风险面比聊天机器人大得多:Hatch 有一个关掉应用后仍在跑的虚拟工作区,意味着它可以在你不看着的时候继续执行。报道称它有免费版,付费档位最高每月 199.99 美元,自研模型「Watermelon」目标 10 月。等它真的开放时,第一批用户该做的不是试它能干多少事,而是先看清楚哪些账号被授了权、凭据保险库到底覆盖哪些内容、以及「hard door」在哪些操作上会真的停下来。

via: Forbes 报道(转载于 Yahoo News)The Information 原报道摘要Business Standard 分析