等模型越来越聪明,我们还需要这么努力钻研 prompt
2023年那会儿,我完全是个模板收集狂。
CO-STAR、BROKE、角色链——网上那些花里胡哨的提示词框架,我背得比高考单词还熟。笔记本上用不同颜色的笔,整整齐齐写了七八十页:红的标重点,蓝的写案例,绿笔画流程图。
到处都在喊“年薪三十万的提示工程师”,我信了。甚至幻想过靠这些模板吃一辈子。
结果呢?到了2024年年中,GPT-4随便扔一句话过去,它都能接得挺像样。我熬夜整理的那些格式工整、步骤清晰的模板,突然就变得又笨重又多余,像个穿西装的企鹅。
那一刻我懵了。难道这两年白学了?那些prompt技巧全在瞎忙活?这事儿我咽不下。
所以干了一件狠事
三天时间,同一个任务:帮初创团队写季度产品规划。
我把市面上主流的模型都跑了一遍——GPT-4(0613版)、Claude 3.5 Sonnet(2024年10月版),还有本地跑的Qwen2.5-14B。每组试两种方式:一种是当年“标准教科书”式的模板(带角色、分步骤、给示例),另一种就是甩过去一句话——“帮我写个规划”,然后闭嘴。
结果让我挺意外。
GPT-4和Claude这两台“超级发动机”,粗prompt和精prompt的核心内容差距不大。粗prompt也能干活,但差那么半档:数据引用不具体,节奏感飘忽,结构里缺了优先级排序。而Qwen2.5那个开源小模型,粗prompt简直就是“翻车专业户”——动不动就跑题,用模板才能拉回来。
这告诉了我几件事:
模型越聪明,对prompt精度的依赖确实在下降。“一句话也能干活”正在变成新常态。但“能干活”和“活干得好”之间,有一条清晰的红线。而且不同能力的模型,对prompt的需求完全不同。
可真正让我观念天翻地覆的,不是这些测试,而是之后发生的事。
差点把整个环境搞崩
去年底,我第一次把模型当“agent”用——给它工具,让它自己跑任务,连续执行几个小时。
我写得够细了:“你是一个资深Python工程师,请先分析问题,定位文件,修改代码,最后写测试。”
结果它干了什么?上来就调bash工具,直接rm了一个配置文件。
差一点整个开发环境就崩了。
我冷汗都出来了,坐下来整整复盘了一下午。发现问题不在prompt的措辞,而是模型根本不知道哪些文件安全、哪些命令禁止。它以为“修改代码”就是可以删东西。整个执行过程没有检查点,没有确认机制,完全是个没装刹车的赛车。
那时候用的已经是GPT-4 Turbo,智能度已经很高,但照样闯祸。
所以你看明白了吗?模型再聪明,缺了约束,就是没有缰绳的野马。
真正的高手,早就不玩“模板把戏”了
从那以后,我开始接触一个叫Harness Engineering的东西。
你可能会问,这是什么?其实就是给模型配“马具”。
你不再只是写prompt,还要设计工具列表、权限边界、上下文管理策略、错误恢复逻辑。模型还是那个模型,配上不同的“马具”,表现能差出几倍,这不是夸张。
我拿同一个代码修复任务试过:在LangGraph里定义了一个简单的harness——先配一个代码树扫描工具(只读),再给一个文件阅读工具(锁定可访问目录),最后是修改工具,但修改前必须输出diff,并且请求我人工确认。
这次prompt我只写了两句话:“修复Issue #42中提到的性能问题,遵循现有代码风格。”
一次就过,顺滑得让我不敢相信。
差距不在话少了,而是我把约束嵌进了系统里。
最后一道瓶颈,原来是你自己
上个月读到一个概念叫Loop Engineering,核心思想是说:从Prompt到Context到Harness再到Loop,每一次瓶颈迁移都伴随着模型能力的提升。
现在,最后一道瓶颈已经不是模型了,而是你本人。
你还得坐在键盘前敲回车。系统就在那儿等着,你一离开,它就停了。
后来我在CrewAI里搞了一个小循环:一个Orchestrator agent负责拆任务,调度两个子agent——一个搜资料,一个写草稿——然后自己汇总结论。我只要在系统prompt里定义了大目标和边界:不要联网,所有资料用本地Embedding检索,输出格式必须是Markdown表格。
整个流程跑了将近一个小时,我没管它。
结果送出来一篇竞品分析,质量比我手动写的高太多。
这时候你写的已经不是prompt了,你写的是系统的运行规则。
那prompt技巧,到底还值不值得学?
原本Prompt Engineering里那些最佳实践——角色设定、分步骤推理、少样本示例——它们其实没有消失。你猜它们去哪儿了?被内化到了Agent系统和harness里。 比如Orchestrator的prompt里自动包含了ReAct框架的默认指令;Skills的触发词会被系统自动匹配;Multi-Agent方案里,每个agent的职责已经在工程层面分配好,根本不需要你在用户输入层反复强调。
那这是不是意味着你不需要懂prompt了?
恰恰相反。
如果你只是想跟聊天界面里的模型聊聊天,让输出更好看,确实不用钻研太多。模型自己能理解模糊指令,甚至主动反问。
但如果你想驾驭Agentic AI,想让AI真正为你干活——你就得摸透这些“内化机制”是怎么工作的。
我踩过坑才明白:不懂这些,你绝对会被Agent的表面智能迷惑。有一次我用一个本地Agent应用,它说支持Skills。我安装了一个“写周报”的Skill,结果触发完全靠运气。后来看了文档才发现,Skill的识别依赖prompt里的特定触发词,而在中文环境下,那个触发词特别容易被分词切碎。我在prompt里加了一句“使用‘周报’技能来生成”,问题立刻解决。
工具调用也是同样。Agent选择工具时经常乱来,明明应该用搜索,它偏偏去调数据库。后来我在system prompt里,显式地列出了工具的使用场景和优先级,模型的稳定性立刻提升。
模型的“内化”程度还没到能自己搞定所有调度规则的地步。你需要用prompt给它画地图。
我现在的结论,可能让你有点意外
prompt技巧没有过时。
过时的是“把prompt当成唯一杠杆”的思维。
模型越聪明,你需要介入的层面就越抽象。以前在句子层面修饰,现在要在系统层面设计整个流程。这是一个“让渡控制权”的过程,前提是你得清楚你在让渡什么。
对大多数普通用户,我真不建议去花精力搞什么三万字prompt库。先把最基础的事情做好: 学会把需求说清楚——目标、背景、输出格式、验收标准;学会拆任务,并监控中间结果;学会验证AI输出的质量。这就够了,足够让AI成为顺手的好工具。
但如果你要吃这碗饭—— 做AI产品、做自动化工作流、做Agent应用——那你必须跳到Harness和Loop这一层去理解问题。模型越聪明,harness的设计空间就越大,出车祸的方式也越离奇。这时候纯粹靠“语气温暖、条理清晰”的prompt根本兜不住。
要设计出好的上下文压缩策略,你得理解注意力机制跟梯度下降的类比;要写出不打架的agent prompt,你得理解Multi-Agent调度的死锁和冲突;想写出少跳步的系统指令,还得清楚ReAct循环里思考-行动-观察的周期。
我最近在给团队搭一个代码审查Agent。花了一周调试,最后发现最关键的一行prompt,反而是最朴实的:“每次分析完问题文件后,必须输出文件路径和行号,格式严格一致。” 没有这一行,后面所有下游处理都接不上。
你说,还需要钻研prompt技巧吗?
需要。
但不再是背模板了。 现在是理解原理、理解系统、理解模型为什么吃这一套,而不吃那一套。
当你真正理解,prompt的本质是通过有序的上下文,压缩模型输出的概率分布,你就不再需要任何模板了。你会根据模型能力、任务复杂度、harness设计,现场捏出一个刚好够用的prompt。
至于那些“四代演进”的概念,看看就行,别被绕进去。它们不过是同一个事实的不同投影:模型每一次变强,我们和它交互的抽象层级就抬高一层。
你还觉得写prompt就是在雕花吗?
说明你还在最底层搬砖。我不是贬低你——我是从那里爬上来的,那个地方我也待了很久。
但当你从雕花师傅变成整个花园的设计师,那个新世界的大门才真正为你打开。
读者评论 4