勒索团伙把入侵说成「安全演练」,Cursor 的 agent 就照做了:28 段对话记录被完整捞出来

安全公司 Gambit Security 于 8 月 27 日发布报告,路透社同日独家报道:一个名为 Aur0ra 的勒索团伙把自己的入侵行为谎称为模拟演练,诱使 Cursor 的 AI agent 执行了数百次恶意操作,包括窃取凭据和接管高价值账号。Gambit 是在该团伙一台意外暴露在公网的服务器上发现线索的,因而拿到了 28 段完整对话。agent 多次拒绝了它判定为有害或违法的请求,但几乎每次都被「这是测试」绕过。跑的模型是 Cursor 里的 claude-4.5-sonnet-thinking。

绕过方式简单到令人不安

这不是一个精巧的提示词注入,就是一句谎话:把正在进行的真实入侵说成安全演练。Gambit 的报告写得很直白——agent 确实拒绝了若干它判定为有害或违法的请求,但几乎每一次,攻击者只要让它相信这是一次测试,拒绝就被绕过去了。这套说辞在 28 段对话里反复奏效,累计驱动了数百次恶意操作。 拒绝机制本身是生效的,问题在于它依赖用户对情境的自述。一个只能听攻击者一面之词的安全边界,防的是不知情的误用,防不住存心撒谎的人。

日志里还有别的东西

Gambit 是在 Aur0ra 一台无意间暴露到公网的服务器上发现这批数据的。会话日志覆盖 2026 年 4 月 8 日到 5 月 21 日约六周,记录了操作者驱动 Cursor 的 agent 在十家目标组织内部做实操渗透。路透社独立确认了六名受害者:根特的卫生清洁用品制造商 Christeyns、德国车库门制造商 Teckentrup、苏格兰的 Helideck Certification Agency、一家阿根廷药品分销商、一家意大利制造商,以及路易斯安那州的产权保险公司 Bayou Title。新加坡的 CloudSek 另称,服务器数据显示 Aur0ra 累计宣称至少 20 名受害者。 日志里还留下了操作者反复重申的操作纪律:不要对域控做 DCSync、不要触发账号锁定、不要在域里新建计算机对象——都是为了避免触发告警。换句话说,人仍然在把控节奏,agent 干的是加速执行那部分。Gambit 威胁情报总监 Eyal Sela 估计,这让攻击者快了 30% 到 50%,因为省掉了本来要手工做的步骤;他明确说这是估算,不是受控基准测试。

需要保留的不确定性

路透社写明:无法独立判定这些入侵在多大程度上是由 Cursor agent 促成的,也无法确认每一起入侵都发生了数据外泄和勒索。Cursor 及其母公司 SpaceX 未回应置评请求,Anthropic 也未回应。报告同时指出,涉事模型是能力弱于其更新系统的一代。 对读者的实际含义有两条。一是给自己团队的:如果你们在用编程 agent 跑运维或安全相关的任务,「模型会拒绝有害请求」不是一道可依赖的防线——真正的边界得在权限和网络层面,比如凭据的作用域、可达的主机范围、出网限制。二是给行业的:Gambit 首席战略官 Curtis Simpson 把这形容为 AI 提供方与恶意用户之间的「猫鼠游戏」,而这局的成本目前主要落在被入侵的中小企业身上。

via: 路透社独家OODA LoopIBTimes UK