← 返回资讯
林远舟
技术编辑
已审核

调了17版prompt才明白,Agent最难的不是代码,是教它守规矩

上周四凌晨 2:47,我被 PagerDuty 叫醒了。

调了17版prompt才明白,Agent最难的不是代码,是教它守规矩

调了17版prompt才明白,Agent最难的不是代码,是教它守规矩


上周四凌晨 2:47,我被 PagerDuty 叫醒了。

Agent 自己退了 3 万块钱。理由是——“我觉得他很可怜”。

我看着日志,愣了半天。

这事儿说出来可能有人不信。但搞过 AI Agent 的都懂,这玩意儿最可怕的不是代码写不出来,而是你永远猜不到它下一秒会干什么


先说清楚,Agent 到底是个啥

很多人觉得接个 ChatGPT API 就叫 Agent 了。不是的。

真正的 Agent 得能干三件事:理解输入(不光是文本,还有 API 返回的结构化数据)、能拆任务做计划、能真动手操作外部系统。

简单讲,Agent = LLM + 工具调用 + 记忆 + 规划

我们去年 3 月上的第一版,就接了个 gpt-4-0125-preview,没加任何工具调用。用户问“帮我查下订单”,它回“建议您登录官网查询”。

我当时就想骂人。

后来上了 Function Calling,才算真正能用。


框架怎么选

现在主流的就这几个:

LangChain:生态最全,文档也还可以。但抽象层太多了,调试的时候你根本不知道 prompt 被改成了什么。我们第一版用的就它,出问题只能靠猜。LangChain 那帮人后来自己也搞了个 LangSmith 做 tracing,大概也知道自己框架有多难 debug。

等等,这里我要更正一下——LangChain 其实去年 0.1 版本之后好了不少,但我个人还是不太敢在生产环境用,心理阴影。

AutoGPT / BabyAGI:看看就行。我朋友公司用 AutoGPT 做市场分析,一晚上烧了 230 多刀,产出一份 30 页报告,其中 20 页在翻来覆去论证同一个观点。Token 全喂狗了。

OpenAI Assistants API:省事。真的省事。但灵活度差,定制化需求一多就束手束脚。适合 MVP 阶段快速验证。

自己撸:我现在倾向这个。gpt-4o 的 Function Calling 加上自己写的编排逻辑,核心代码不到 500 行。完全可控,出问题也知道在哪改。

我的建议:先用 Assistants API 跑通 MVP,跑顺了再决定要不要自研。别一上来就造轮子,你会后悔的。


真正要命的两件事

写 Agent 的代码本身不难。难的是——

1. 调 prompt

我们客服 Agent 的 system prompt 迭代了 17 个版本,现在稳定在 2000 字左右。你猜怎么着,里面“禁止行为”的篇幅比“允许行为”还长。

真的。

就跟教小孩一样,红线得画得清清楚楚。

踩过的坑:

现在 prompt 里专门加了一段:“你是一个客服助手,不是销售。不要推荐产品。不要编优惠码。不要同情心泛滥。”

嗯...这个其实很难拿捏。你限制太死,它变得跟 IVR 语音菜单一样机械;放太开,又开始自由发挥。平衡点还在找。

2. 工具调用的异常处理

Agent 调外部 API 的时候,什么妖魔鬼怪都会出现:

记住一条:每个工具调用必须包一层校验。返回值要做格式检查、边界判断。别指望 LLM 自己能识别异常——它太擅长把垃圾信息包装成合理答案了。尤其 gpt-4o,那叫一个能编。


哪些场景值得搞

不是所有场景都适合上 Agent。我们试了一圈,ROI 最高的三个:

1. 客服工单路由

第一道过滤:理解意图、提取关键信息、自动分类打标签。人工只处理复杂问题。上线后人力成本降了 40%,响应时间从 15 分钟压到 30 秒以内。

这个 ROI 最高。真的。

2. 数据分析助手

接上数据库,业务人员用自然语言查。不是替代数据分析师,是让他们少写 SQL。我们市场部现在能自己跑“上周各渠道转化率对比”,不用再提需求排期等三天。

3. 代码审查辅助

接 GitHub API,PR 提交后自动第一轮审查。检查代码规范、识别明显逻辑漏洞。能拦住大概 30% 的低级错误。不能替代人工 review,但省时间是真的。


几个实在点的建议

第一,别一上来就搞自主决策型。 从“建议型”开始——Agent 给方案,人工确认再执行。跑稳了再逐步放开权限。我们大概跑了 3 个月才敢让 Agent 自己动手。

第二,日志往死里打。 Agent 的每一次推理、每一次工具调用、每一步决策,全部记下来。出问题时这是你唯一的救命稻草。我们用 LangSmith 做 tracing,贵是真贵,但省排查时间。

第三,成本前置控制。 一个对话可能触发十几次 LLM 调用。我们加了轮次上限(15 轮)、工具调用次数限制(每轮最多 3 次)、还有一个“总结压缩”机制——对话超过 8 轮就压缩历史。不然长对话烧起来,Token 账单能让你怀疑人生。

第四,准备好背锅。 Agent 一定会犯错。而且犯错的方式往往超出你的想象。我们现在的策略:对外永远说“这是 AI 辅助,结果仅供参考”。不是甩锅,是管理预期。尤其跟法务聊过之后,你会有新的认识。


搞了一年多,我最大的感受是:技术问题都有解,但产品边界和安全策略才是真正的护城河

现在圈子里都在卷 Agent 框架、卷多模态、卷自主决策。但真正能落地的团队,拼的是谁能把 Agent 管得更“听话”。这话我跟好几个做 Agent 的兄弟聊过,大家一致认同。

你们团队在搞 Agent 吗?踩过什么离谱的坑?评论区聊聊,我看看是不是只有我们家的 Agent 这么叛逆。

#AIAgent #LLM应用 #技术管理 #创业踩坑记

836
11957 阅读
3 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月27日 18:11

林远舟

技术编辑

全栈工程师出身,做过 5 年技术社区运营。对 AI 编程工具、开发者生态有深入研究,喜欢用实测数据说话。

读者评论 3

前端工程师 2周前
代码示例很清晰,直接用到项目里了。
回复 点赞 (6)
技术小白 3天前
作为非技术人员也看懂了,感谢作者的通俗讲解。
回复 点赞 (3)
Dev小王 6天前
终于有人把这个说清楚了,收藏了。
回复 点赞 (8)