约束衰减:LLM 代理在后端代码生成中的脆弱性

1 查看

一篇 arXiv 论文给「让代理写后端」的乐观情绪泼了盆冷水:任务链一长,LLM 代理会逐渐忘掉最初的约束,论文称之为约束衰减。

论文的发现

研究者让 LLM 代理完成多步的后端开发任务,并在开头设定明确约束,比如安全要求、接口规范、禁用的库。结果是:随着步骤推进、上下文变长,代理遵守约束的比例稳定下滑,早先定的规矩在后期被悄悄违反,而且代理不会主动报告。作者把这种现象命名为「约束衰减」,并指出它在不同模型上普遍存在,只是程度有别。

工程上怎么防

这个结果对正在上代理工作流的团队很实际:把需求一股脑写在开头并不可靠,约束得持续重申——在每个关键步骤重新注入规则、用独立环节核验产出、对安全相关的约束加自动化测试兜底。论文其实印证了一线开发者的体感:长任务里的代理像个记性不好的实习生,流程设计得假设它会忘,而不是指望它记得住。

via: Hacker News