← 返回资讯
赵一鸣
产品评测编辑
已审核

能够解决复杂问题的思维链技术:Cot,ToT,GoT,AoT

你可别不信!为了搞懂这波思维链技术,我硬是把自己关在电脑前泡了三周——跟它们死磕到底!

能够解决复杂问题的思维链技术:Cot,ToT,GoT,AoT

能够解决复杂问题的思维链技术:Cot,ToT,GoT,AoT


你可别不信!为了搞懂这波思维链技术,我硬是把自己关在电脑前泡了三周——跟它们死磕到底!

先爆个结论:2023年这波CoT、ToT、GoT、AoT,花里胡哨一通,说白了就是拿模型自己的算力换效果。但你要是一上来就奔着最炫的去,大概率是给自己挖坑。你想想,是不是这个理?

我用GPT-3.5和GPT-4,把数学题、规划任务、文档聚合,甚至自己编了个要回溯的小游戏,全试了一遍。最后发现——真正能在生产环境站稳脚跟的,可能就CoT和它的小变种。其他的?更像是学术圈自嗨的奇技淫巧。方向对,但离“好用”还差几道工程屎山!

CoT——看着最简单,但打起来最疼!

思维链(CoT)最大的优点就一个:便宜! 你在prompt里加句“我们一步一步思考”,或者扔个带中间步骤的例子,模型就有模有样地开始推演了。而且效果跟模型规模死挂钩。我用GPT-3.5和GPT-4对比,CoT对GPT-4提升很明显——准确率从裸奔的40%直接飙到70%以上!而那些7B、13B的小模型?加了CoT跟没加一样,有的还更糟——模型自个儿都开始胡诌了。

但CoT的坑也藏得深:一步错,步步错! 我测过一道逻辑推理题——三个人谁说真话谁说假话,到底谁偷了东西。CoT给出的链条里,中间一步“如果A说真话则B说假话”直接搞反了,后面全跟着错。整个回答流畅得不行,结果全错。这就是所谓的错误传播。

怎么解?Self-Consistency(自洽性)给了个笨办法:生成多条CoT,然后投票。我试了,生成5条时准确率从58%跳到82%,生成10条时到了86%。代价就是调用次数翻了五倍十倍,延迟和成本都上去了。但好处是你不用改prompt,多问几次就行。

所以我的第一个结论是:能用CoT解决的,就别整别的! 大部分业务场景——客服问答、文档提取、简单推理——CoT加投票已经能扛到85%以上。再往上堆?边际效益递减得厉害,你跟老板都得心疼钱。

ToT——理想丰满,现实骨感得让你哭!

思维树(ToT)概念一出,我当场就兴奋了!终于有一种方法能让模型自己探索多条路径,还能回头重来。论文里24点游戏的例子,GPT-4准确率从CoT的个位数飙到74%!这个数字直接把我兴趣拉满了。

然后我就掉坑里了。你猜怎么着?

首先,实现ToT需要两个agent:一个提方案(proposal generator),一个做评估(evaluator)。两个都是LLM,但得写不同的prompt。你想想,你的任务场景已经复杂到要上树了,现在还得设计精准的评估prompt,让模型给每个中间思路打分(sure/likely/impossible)。这本身就是一个新的prompt工程难题!

我拿旅行规划来试——给定预算、偏好、时间约束,让模型规划行程。CoT版本能连续出步骤,但经常忽略某天景点开放时间冲突。我想着ToT能生成多个方案并自评,应该能搞定。结果呢?方案生成agent一次整出6条路线,评估agent给每条打分。但打分极不稳定!明明靠谱的路线被评impossible,不合理的路线反而得了sure。原因是评估agent只做了轻量化推理,根本没看出那个冲突。你让它仔细想,又得多几轮调用,开销直接飞升。

我用GPT-4跑了10个旅行规划用例,ToT的正确率是35%,而CoT加人工单步检查也能到30%。算上API调用次数,ToT平均每次任务要70次调用(生成加评估),CoT加检查只要15次。你说这4块钱花得值不值?反正我老板说值个屁。

所以我的第二个结论是:ToT只适用于那些解空间有限且能明确验证的封闭问题——比如24点、数独、逻辑谜题。开放式的、需要常识判断的任务,ToT的评估环节本身就变成了另一个难题。调好了神,调不好就是空耗。

不过话说回来,如果你真遇到那种“必须尝试多条路径,走不通必须回头”的场景,ToT比你手动写回溯逻辑还是省心一点。但前提是——你的评估prompt得写得足够好,好到让模型在每一步都知道什么是靠谱。

GoT和AoT——一个太野,一个太挑!

GoT(Graph-of-Thought)把推理结构从树变成了图。节点之间可以合并、依赖、成环。看上去很美好,因为人类思考确实不是线性的——我们经常把两条思路揉在一起,或者回头对某个概念迭代。论文里给的示例是数组排序、文档聚合、统计词频,思路是用图表示不同子任务之间的依赖,再让LLM按拓扑序执行。

我试着拿GoT去做“多轮对话摘要”的任务:把对话分成逻辑块,每个块单独摘要,然后合并,再对合并结果第二轮提炼,发现问题就回退重做。听起来完美适配图结构,对吧?但实际写prompt的时候,我得手动描述哪个节点是哪个点的输入、何时合并、合并规则是什么。这不等于让LLM按我写的有向图算法执行吗?那还不如我自己写个脚本,每个节点调一次API!

换个角度说,GoT的价值在于——如果你对某个领域已经有了非常深入的求解路径认识,你可以把它显式编码成图,让LLM按部就班执行。但这个“如果你”太强了。大多数场景下,我们对问题的结构都还没搞清,哪来的图给你画?所以GoT目前更适合做研究,工程上性价比极低。

至于AoT(Algorithm of Thoughts),思路是好的:在prompt里融入算法示例(比如DFS、二分搜索),让模型模仿算法轨迹。论文说在GPT-4上效果很好。我试了一个“求解不等式约束下的最小值”问题,AoT给了个二分搜索的示例,确实让模型按照二分法步骤逼近解,结果比CoT准不少。

但AoT的致命问题是——它对LLM自身能力的要求极高! 我换个模型(从GPT-4换成GPT-3.5),AoT就拉胯了。3.5根本模仿不了算法的递归或回溯逻辑,生成的搜索步骤经常跳过关键判断。这说明AoT是在榨取大模型的潜力,模型不够大,你注入算法也没用。

所以我第三个结论是:GoT和AoT都是重度依赖人工知识蒸馏的技术。 你得先把问题的求解路径吃透、抽象成图或算法,再喂给模型。如果你已经知道算法,为什么不直接写代码执行?哦,为了“用LLM来增强灵活性”——但灵活性的代价就是prompt维护成本和调试复杂度直线上升。

反对意见?复杂度本来就是成本的体现,你凭什么嫌贵?

有人可能会说:这些技术就是用复杂度换效果的,你要是嫌贵,说明你的场景不配用。这话有一定道理。如果你在做金融风控的推理系统,每一步决策都关系到千万资金,多花几倍API费用换5个点的准确率,完全值得。

但问题在于,绝大多数场景的准确率瓶颈根本不在推理链上! 我见过很多人一上来就上ToT,结果发现模型的召回率低是因为知识不足,而不是推理步骤不够。这时候你该做的是RAG、优化检索分块、改进Embedding,而不是加一个思维树。我自己的经验是:大部分复杂任务,先跑通最朴素的CoT+ReAct,再慢慢加优化。先别想着飞,你得先学会走路!

说到这儿,你想想——技术就像工具,最锋利的刀往往最窄。你非得拿它去砍树,手不疼才怪。

所以啊,最后送你一句话,也是我这三周踩坑最多的体悟:

最牛的技术,从来不是最复杂的,而是最敢舍得的。

185
6191 阅读
5 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月20日 15:33

赵一鸣

产品评测编辑

前产品经理,现专注 AI 工具评测。实测过 30+ 款 AI 产品,擅长横向对比和用户体验分析。

读者评论 5

Dev小王 2周前
终于有人把这个说清楚了,收藏了。
回复 点赞 (8)
A
AI研究员 3天前
观点有道理,不过我觉得还需要考虑算力成本的问题。
回复 点赞 (11)
M
创业者Mark 6天前
正在做相关方向,这篇文章给了我不少启发。
回复 点赞 (7)
老李 1周前
有个小问题想请教,文中提到的那个方案在大规模场景下性能怎么样?
回复 点赞 (5)
运营小陈 1周前
转发到团队群了,大家都觉得有参考价值。
回复 点赞 (4)