Chain of Thought 是什么?AI 思维链详解

Chain of Thought思维链推理

思维链指让模型在给出答案前,先把中间推理步骤逐步写出来。它最早是一种提示技巧,后来被直接训练进推理模型,成了今天「思考中…」这类交互背后的机制

Chain of Thought 中文一般译成「思维链」,缩写 CoT。它指的是让模型在给出最终答案之前,先把中间推理过程一步步写出来,而不是直接蹦出一个结论。

这个做法 2022 年被论文系统化,当时的发现很直白:在算术、常识和符号推理这类多步任务上,只要让模型「一步一步想」,准确率就能明显提升,而且模型越大,提升越明显。今天你在推理模型里看到的「思考中…」「正在推理」那一段折叠内容,就是思维链的产品化形态。

先用一句话抓住它

思维链就是让模型把草稿纸写出来,而不是只交答案。

想想小学数学考试:老师要求写出解题步骤,不只是因为要给过程分,更因为写步骤本身会逼你把问题拆开,减少一步跳到结论的失误。模型的情况非常类似——它是逐个 Token 生成的,每写一个 Token 都在已经写出的内容上继续推进。让它先写步骤,等于给了它更多计算和纠偏的余地。

它为什么有效

一个直接的解释是:模型在单次前向传播里能做的计算是有限的,而把推理摊到几十上百个 Token 上,相当于把一次性的判断变成了多轮迭代。中间步骤一旦写出来,就进入了上下文,后续生成可以引用它,等于给模型加了一块工作记忆。

问题 直接作答一步给结论 容易在多步任务上出错 思维链拆步骤 → 中间结果 → 汇总 多步任务准确率更高但更慢更贵

原始论文里的做法叫 few-shot CoT:在提示里给几个「问题 + 完整推理过程 + 答案」的示例,模型会照着格式把自己的推理也写出来。后来有人发现,很多时候只要在提示末尾加一句「让我们一步一步思考」就能触发类似效果,这被称为 zero-shot CoT。

从提示技巧到训练目标

真正的变化发生在思维链被写进训练环节之后。推理模型不再依赖你在提示里要求它想,而是通过强化学习被训练成默认先产出一段长推理再作答,并且学会了自我检查、回退、换一条路径重试这些行为。

这条路线把思维链从「提示技巧」变成了推理时计算的一种形式:想得越久、生成的推理 Token 越多,难题上的表现越好。代价也很直接——延迟变长,费用上升,因为那些推理 Token 同样计费。

和相关概念的区别

和提示词工程的关系:思维链是提示词工程里最有效的一类模式,但它只是其中一种。今天在推理模型上,手动写「一步一步思考」的收益已经很小甚至为负——模型内部已经在做了,你再要求一遍反而可能干扰它的格式。

和 Agent 的区别:思维链全程在模型内部完成,产出的是文字;Agent 会把中间步骤变成真实动作,去调用工具、读文件、发请求,再根据真实返回继续推理。思维链是「想」,Agent 是「想完了去做,做完了再想」。

和上下文工程的关系:长推理会占掉大量窗口额度。多轮对话里如果把每一轮的完整思维链都留着,很快就会挤爆窗口,所以实践中通常只保留结论——这属于上下文工程的范畴,具体机制见上下文压缩

容易误解的地方

「写出来的推理就是模型真实的思考过程」——这是最需要警惕的一点。研究表明模型的书面推理和它实际依赖的内部计算并不总是一致:模型可能先有了倾向,再补一段看起来合理的解释;也可能在推理里用了某条线索却不说出来。思维链可读性强,但不能直接当成可信的自我报告,更不能当成审计凭证。

「思维链一定提升效果」——在简单任务上,强行拉长推理会引入无谓的错误,还平白增加成本和延迟。收益主要出现在需要多步骤、有明确中间量的任务上。

「思维链能消除幻觉」——不能。推理过程本身也可能一本正经地编造中间事实,然后基于错误的中间结果推出错误结论,反而显得更有说服力。要压幻觉得靠检索护栏评估

怎么用才划算

用普通对话模型做多步计算、逻辑判断、条件筛选时,明确要求列出步骤通常值得。用推理模型时,反过来——把重点放在把问题和约束说清楚,把推理强度交给模型自己的档位控制。

对成本敏感的场景,可以只在困难样本上开启长推理:先用便宜模型快速作答,判定为高难度或低置信时再升级到推理模型,这也是模型路由的常见策略之一。

资料来源