planning像教科书,执行直接跪了
最近好几个朋友都在问我同一个问题:AI agent到底创新在哪儿?
我一般先不讲理论,直接说上个月的翻车现场。
当时接了个agent框架做数据分析,看它planning阶段的输出,那叫一个漂亮——逻辑环环相扣,步骤拆得明明白白,推理过程自洽得像教科书。我心里想,稳了。
然后执行环节直接跪了。
调一个API超时,它停了。不是优雅降级,不是换个策略重试,是直接停了。报错信息模糊得让人想砸键盘。我盯着日志看了整整20分钟,突然意识到一个很根本的问题——模型不会为超时负责,不会为系统失败买单,更不会因为用户体验崩了感到任何压力。
这事儿细想挺可怕的。
人类做复杂决策的时候,思考天然带着时间、成本和后果的约束。你知道拖太久老板会催,知道方案太贵会被毙,知道搞砸了要背锅。模型没有这些。它的思考是真空里的思考,漂亮但无责。
去年跟一个做task bot的老兵喝酒,他聊起他们团队的经历。刚开始对agent兴奋得不行,觉得这玩意儿比传统task bot聪明太多了,简直是降维打击。但真跑进生产环境之后,整个团队开始产生一种强烈的不适感。
他原话是这么说的:"task bot你至少知道它什么时候会出错,agent出错的方式每次都让你意想不到。"
这话绝了。
agent的planning阶段真正让人痛苦的,从来不只是"慢"。而是你在为一种看起来很高级的思考过程,持续支付GPU、延时和系统复杂度的代价。当tool数量开始增加——讲真,模型实际上已经从决策问题退化成了搜索问题。一旦进入搜索空间,turbo系列模型的准确率就会迅速下降。为了兜住结果质量,你不得不切到更大的旗舰模型。而当旗舰模型成为常态选择,agent的thinking就从"智能加成"直接变成了系统瓶颈。
说白了,agent并没有替代原有的task bot思路,而是把原来由人类承担的设计决策,转移成了概率性的模型思考。
学术上这是进步。
工程上这是赤裸裸的风险暴露。
还有个事儿,reflection这个东西。
常常被描述成agent的"自我修正能力",听着特别高级对吧?但在真实系统里,它更像一个不知道什么时候该停下来的内耗机制。我测试过一个场景,让agent写数据分析报告。第一次写得其实已经可以用了——真的可以用了——但它自己觉得不够好,开始reflection。改了一版,又reflection,再改。来来回回搞了四轮,token烧了两倍多,延时堆到用户根本等不了的程度。
最终结果跟第一版比,说实话,区别不大。
你品。
模型并不知道什么叫"已经足够好",也无法判断某个误差在业务上是否可以接受。于是reflection很容易演变成不断自我质疑和自我修正的死循环。它不为成本负责,不为延时负责,不为用户体验负责。这种无责任的思考,暴露了一个很少被直接点破的问题——我们到底在为什么买单?
但如果你问我agent到底有多大创新,我的答案会有点矛盾。
从技术参数的角度看,创新似乎没那么大。大模型还是那些大模型,推理能力还是那些推理能力,工具调用也不是新概念。但从交互范式的角度看——这可能是近二十年来人机交互领域最大的一次范式转移。
过去三十年,人机交互的基本模式是"人找工具"。你想写文档,打开Word。想查数据,打开Excel。软件安静地躺在那里,等你去找它。agent把这套逻辑反转了:工具开始主动找你。
不是你去打开日历软件,是agent发现你明天有个重要会议,主动把背景资料推给你。不是你去打开备忘录,是agent感知到你刚结束一场讨论,主动问"需要我生成会议纪要吗"。这种"工具找人"的范式,改变的不仅是效率,更是注意力分配的方式。用户从"管理工具"中解放出来,把认知资源集中在真正重要的事情上。
更深一层的变化:从"操作"到"委托"。
传统软件是操作型的,你告诉它每一步怎么做。agent是委托型的,你告诉它"我想要什么结果",它自己规划路径、调用工具、处理异常、交付成果。如果让我用一个词概括agent的核心创新,我会选"主动性"。
传统AI是被动响应的:你问,它答。你不问,它不存在。agent的智能体现在"对不对的时机出现"。它感知上下文、判断时机、主动推送、预判需求。这种主动性的技术基础不是更强大的模型——讲真,模型能力就那样——而是事件驱动的架构设计。时间事件、消息事件、文档事件、数据事件,让agent在合适的时机自己跳出来。
挺有意思的。
但回到工程现实,挑战依然巨大。Gartner预测,到2027年,40%的AI agent项目会因ROI不达预期被叫停。长链条任务中,LLM幻觉问题会被逐级放大。46%的企业对数据安全表示担忧。老旧系统缺乏API接口,强行改造的成本往往超出预期。
我自己的经验是,agent项目最容易死在"过度设计"上。团队一上来就想做个全能agent,什么都能干、什么都能自主决策。结果planning链路越做越长,tool越来越多,准确率越来越低,成本越来越高。正确的做法——不对,应该叫现实的做法——是先选"高频、高价值、边界清晰"的场景切入。在支付、删除、发布等关键节点引入人在回路。建立可追溯、可审计的治理体系。
优先建设高质量知识库,这个事儿比很多人想象的重要得多。真的。
agent的创新,我觉得不在于它现在比task bot强多少,而在于它第一次把"思考本身"变成了工程对象。这是真正的范式转移。但范式转移不意味着立刻好用。我们正处在一个开发范式迁移的阵痛期——旧的方法论不适用了,新的方法论还没完全建立起来。
如果你最近做agent项目做得有点难受,其实并不奇怪。
大家都一样。
大概明年这个时候,情况会好一些吧。也可能更糟。
谁知道呢。
读者评论 2