← 返回资讯
陈默
AI 行业分析师
已审核

大模型Agent的核心还是prompt?

前阵子我朋友跑来问我:哥,最近想搞一个Agent项目,你觉得prompt怎么写才牛逼?我看着他期待的眼神,深呼吸,然后说了一句让他当场愣住的话——

大模型Agent的核心还是prompt?

大模型Agent的核心还是prompt?


我先给你讲个事儿。

前阵子我朋友跑来问我:哥,最近想搞一个Agent项目,你觉得prompt怎么写才牛逼?我看着他期待的眼神,深呼吸,然后说了一句让他当场愣住的话——

“大模型Agent的核心,根本就不是prompt。”

他懵了。我知道,很多人看到这儿也不服。从GPT-3火起来那天开始,全网都在教你怎么写提示词:角色设定、思维链、few-shot、格式约束……玩得跟写代码一样,一套一套的。你肯定也学过。我前两年也一样,觉得自己是prompt调教大师,demo跑得飞起,结果一上真实业务——翻车翻得亲妈都不认识。

后来呢?我花了三天,用我的项目重新测了一轮。

三个模型一起上:GPT-4o、Claude 3.5 Sonnet、阿里的Qwen2.5-Max。场景不算复杂——一个带代码仓库调试和自动修复的小型CLI助手。我一开始还是老套路:给每个子任务写一大段system prompt,人设、规则、示例全塞进去,感觉自己无敌了。你猜怎么着?任务一多、步骤一长,模型要么中途跑偏,要么卡在一个工具调用上反复横跳,要么直接忘掉上一步的结果。你说它蠢?它又挺聪明。但就是没法稳定干完一件事。

问题出在哪儿?不是prompt写得好不好。

你想啊,一个LLM调用说白了就是“根据当前输入生成一段文本”。但真实的任务是什么?是“持续完成一件事”——看懂项目结构、执行测试命令、读报错日志、改代码、再跑测试。这一步接一步的推进,prompt根本管不了。

模型活在自己的上下文里,任务发生在一个不断变化的外部世界。中间那道缝,prompt填不上。

说到这儿,我换了思路。彻底换了。

我不再盯着system prompt那一亩三分地了,而是把重心搬到了Agent的运行时设计上——说白了,怎么搭一个能稳定跑完多步任务的架子。

你听过那“七大核心技术模块”吗?Agent Loop、Prompt、Planning、Memory、Tools、Workflow、Environment。我现在回头看,80%的精力花在Loop、Memory、Workflow这些工程化的事情上。Prompt反而变成最轻的一层:固定底层指令,动态内容拆成独立的Markdown文件(SKILL.md、USER.md这种),任务执行时按需加载。我把这叫“动静分离”。比之前一个Agent一大坨prompt好维护太多了,简直清爽。

吴恩达推出的Agentic AI课你看了吗?赶紧补上!他明确把重心从prompt优化挪到了多步流程的设计上,提出了四个设计模式:Reflection、Tool Use、Planning、Multi-Agent Collaboration。你看了就知道,现在做Agent更像在搭后端微服务,只不过中间塞了一个概率性的黑盒。那句老话——“如何把不可靠的组件构建成可靠的系统”——在Agent架构里一样是真理。

再说一个我踩过的坑,你自己感受一下。

之前做一个SaaS工具的Agent,需要调三个API:查数据库、发邮件、更新状态。第一次跑通的时候我高兴得不行。结果第二天线上就崩了。原因?LLM的不确定性导致同一输入走了不同路径。有一次邮件发了但状态没更新,用户收到通知点进去一看,还是旧数据。你看到了吗?这种问题你prompt写得再花哨也没用——你没法让一个概率模型保证两次行为完全一样。解决方案是什么?在系统层把Agent的执行序列做成事件日志,保证幂等性和可重放性。这完全是后端数据的活儿,跟prompt八竿子打不着。

再举一个。Agent调了三个工具,执行到第三步挂了。如果只靠prompt,重启后它得从头开始。但如果有外部的状态持久化——比如把执行进度写到数据库里——就能从失败那步重试。你仔细琢磨:这事prompt真干不了,得靠架构设计。

所以你说Agent的核心是prompt吗?

我态度很明确:prompt是入口,是皮,但绝不是核心。

一两年以前,模型能力弱,你确实得念咒语、写Step-by-Step诱导它思考。但现在你再看看GPT-4o和Claude 3.5 Sonnet,内置的推理机制已经强到离谱。你打开thinking模式,它自己就在内部做多步推理,逻辑盘得比你还清楚。你甚至不需要写“Let's think step by step”这种话,直接说人话就行。

但问题来了:模型再聪明也只能处理你喂给它的信息。它不知道当前任务进行到哪一步,不知道哪些工具已经调过,不知道外部系统的状态是什么。这些信息必须在系统层面管起来。靠prompt传?传不了。上下文窗口再大也是有限的,而且让模型自己记住前面发生了什么,它随时会忘或者记错。

真正的Agent开发,已经从“怎么问模型”变成了“怎么搭架子”。

你的精力应该放在工作流编排、数据闭环、状态管理、工具封装、异常处理这些工程化的事情上。Prompt当然还要写,但它只是整个系统里很小的一块——而且会越来越轻。

如果你现在还在花大量时间琢磨prompt技巧,甚至觉得什么LangGraph、CrewAI都是多余的——那我真心建议你找个稍微复杂点的业务场景试一下。很快你也会发现那个让我花了两年代价换来的真相:

你能让一个模型说出漂亮话,但没法让一个任务稳定跑完十分钟。

124
2076 阅读
2 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月24日 14:24

陈默

AI 行业分析师

前某大厂 AI 实验室研究员,关注大模型技术演进和商业化落地。写过 200+ 篇行业分析,擅长从产品视角拆解技术趋势。

读者评论 2

数据分析师 3天前
数据引用很扎实,建议补充一下近三个月的最新数据。
回复 点赞 (9)
产品经理阿杰 6天前
从产品角度看,这个方向确实有机会,但商业化路径还需要验证。
回复 点赞 (15)