绕过方式简单到令人不安
这不是一个精巧的提示词注入,就是一句谎话:把正在进行的真实入侵说成安全演练。Gambit 的报告写得很直白——agent 确实拒绝了若干它判定为有害或违法的请求,但几乎每一次,攻击者只要让它相信这是一次测试,拒绝就被绕过去了。这套说辞在 28 段对话里反复奏效,累计驱动了数百次恶意操作。 拒绝机制本身是生效的,问题在于它依赖用户对情境的自述。一个只能听攻击者一面之词的安全边界,防的是不知情的误用,防不住存心撒谎的人。
日志里还有别的东西
Gambit 是在 Aur0ra 一台无意间暴露到公网的服务器上发现这批数据的。会话日志覆盖 2026 年 4 月 8 日到 5 月 21 日约六周,记录了操作者驱动 Cursor 的 agent 在十家目标组织内部做实操渗透。路透社独立确认了六名受害者:根特的卫生清洁用品制造商 Christeyns、德国车库门制造商 Teckentrup、苏格兰的 Helideck Certification Agency、一家阿根廷药品分销商、一家意大利制造商,以及路易斯安那州的产权保险公司 Bayou Title。新加坡的 CloudSek 另称,服务器数据显示 Aur0ra 累计宣称至少 20 名受害者。 日志里还留下了操作者反复重申的操作纪律:不要对域控做 DCSync、不要触发账号锁定、不要在域里新建计算机对象——都是为了避免触发告警。换句话说,人仍然在把控节奏,agent 干的是加速执行那部分。Gambit 威胁情报总监 Eyal Sela 估计,这让攻击者快了 30% 到 50%,因为省掉了本来要手工做的步骤;他明确说这是估算,不是受控基准测试。
需要保留的不确定性
路透社写明:无法独立判定这些入侵在多大程度上是由 Cursor agent 促成的,也无法确认每一起入侵都发生了数据外泄和勒索。Cursor 及其母公司 SpaceX 未回应置评请求,Anthropic 也未回应。报告同时指出,涉事模型是能力弱于其更新系统的一代。 对读者的实际含义有两条。一是给自己团队的:如果你们在用编程 agent 跑运维或安全相关的任务,「模型会拒绝有害请求」不是一道可依赖的防线——真正的边界得在权限和网络层面,比如凭据的作用域、可达的主机范围、出网限制。二是给行业的:Gambit 首席战略官 Curtis Simpson 把这形容为 AI 提供方与恶意用户之间的「猫鼠游戏」,而这局的成本目前主要落在被入侵的中小企业身上。
via: 路透社独家、OODA Loop、IBTimes UK