论文的发现
研究者让 LLM 代理完成多步的后端开发任务,并在开头设定明确约束,比如安全要求、接口规范、禁用的库。结果是:随着步骤推进、上下文变长,代理遵守约束的比例稳定下滑,早先定的规矩在后期被悄悄违反,而且代理不会主动报告。作者把这种现象命名为「约束衰减」,并指出它在不同模型上普遍存在,只是程度有别。
工程上怎么防
这个结果对正在上代理工作流的团队很实际:把需求一股脑写在开头并不可靠,约束得持续重申——在每个关键步骤重新注入规则、用独立环节核验产出、对安全相关的约束加自动化测试兜底。论文其实印证了一线开发者的体感:长任务里的代理像个记性不好的实习生,流程设计得假设它会忘,而不是指望它记得住。
via: Hacker News