Claude Code在通用Agent上的探索Anthr
通用Agent才是未来!别再给自己找罪受了
你看,这事儿说来挺有意思的。
我上周干了一件“不务正业”的事——把Claude Code直接丢进了一堆财报PDF里。
按理说,我得先去搞个什么“金融专用Agent”,配上一套行业Prompt,再搭个RAG管道,放一堆会计准则进去。想起来脑袋都大。
可那天我实在太懒了。
我就跟它说了句:“你看看这个。”
你猜怎么着?
它真干了!自己调了Python,算了一通现金流,还从财报里的风险提示扒出一堆问题,列了个清单发给我。
我愣在电脑前,脑子里只有一个念头:TMD,以前那15个专用Agent,我白建了。
你是不是也觉得,Agent越专业越好?
说到这儿,我得先跟你掏个底。
你是不是也干过这种事儿——每个领域配一个Agent,金融的、法律的、营销的,一个萝卜一个坑?
我以前也是这么想的,觉得自己聪明透了。用LangChain搭了15个Agent,每一个都配了自己的Prompt、工具集、向量索引。
半年后呢?
我快疯了。
这些Agent的Prompt,重复到亲妈都不认识。
两个不同的Agent,用的API都差不多,可没人敢合并。为什么?怕改了金融的,法律的崩了。
等模型版本一升级,光测试用例就跑了一整夜。
你说这叫什么破事儿?
但Anthropic那个博客,给了我一个大嘴巴子
直到我看了他们那篇讲Skills的文章。
官方话说得挺正经:Skills就是“由指令、脚本和资源组成的有序文件夹,Agent可以动态发现并加载”。
但你把这话翻译成人话是什么?
是Anthropic自己也发现了:所有人都把Claude当通用Agent使,他们索性给大家开了个口子。
你看,2025年底的时候我就发现一个怪现象:好多人拿Claude Code根本不是写代码的。有人做市场调研,有人管项目,还有人写自媒体脚本。
可问题是——Claude Code的内置Prompt你改不了啊!
这就相当于:我给你一辆车,但方向盘是焊死的。
你只能在它给你画好的路上走,却不能告诉它:“嘿,兄弟,咱们今天要去的是我家的后花园。”
Skills要干什么?就是给你一把钥匙。
你创建一个文件夹,把公司的品牌规范、API文档、工作流程往里一丢。启动的时候,它自动识别,需要什么加载什么。
说白了,Anthropic用行动在说:一个通用Agent加上轻量级的知识注入,比一堆专用Agent靠谱一万倍。
等等,这不就是RAG吗?
你是不是想这么问?
我告诉你,第一次听完我也这么想的。
但真正做过Agent生产部署的人,看到这儿一定笑了。
RAG是什么?是你问一句,它去知识库里搜一段,拼拼凑凑给个回答。
可Skills要干的事,比这个阴险得多,也聪明得多。
它的底层机制不是你问它才去找,而是:
1. 启动时自动扫描目录,看有什么货
2. 把 .md、.py、.sh 这些东西的意图都注册到Agent的大脑里
3. 执行过程中遇到相关问题,自己判断要不要加载对应的技能包
我做过测试:一个含3个脚本、2个文档的Skill,加载完启动时间只多了不到2秒。
可后续那个领域的问题呢?准确率直接上一个台阶。
我用的可是真的互联网公司的业务文档测的,不是我编的。
这才是Agent该有的样子——不是服务于某个领域,而是能灵活切换领域。
我为什么说其他团队提不出这个方案?
你想想,现在的AI圈都在干嘛?
画地为牢。
你做一个客服Agent,我做一个金融Agent,他做一个医疗Agent。
每个都像个独立王国,有自己的规章制度、自己的办事流程。
可Anthropic偏不。
他们要做的,是一个通用的智能体,上面挂着不同的“知识包”。
你切到编程模式,它自动加载代码相关的Skills;你切到金融模式,它动态挂上财报分析的技能。
复用的是Agent本身,变化的是领域知识。
这才是“一次构建,到处使用”真正的打开方式。
但话说回来,我得给你泼盆冷水
Skills很牛,但它不是万能药。
它解决的是“Agent懂不懂行”的问题,没解决“Agent靠不靠谱”的问题。
我在生产环境里踩过最大的坑是什么?
不是Agent不懂某个领域,而是它一旦懂了,就开始“自由发挥”。
什么叫“自由发挥”?
就是你给了它一个数据库Schema,它可能在分析数据的时候,顺便自己写了个数据库操作命令。
你没授权它做的事,它自己就干了。
这事儿危险不?
你说危险不?
Anthropic在Claude Code里强制用了沙箱,每个代码执行都跑在独立容器里。可如果你的Skills搭在三方框架上呢?
这得你自己管。
Skill让你更强,也让你更危险。
我最后想说一句
当年iPhone刚出的时候,大家都觉得这玩意儿就是个能打电话的iPod。
直到App Store出现,大家才懵了:原来这才是手机?
Claude Code也一样。
你以为它是一个编程助手,用它写代码、调接口、跑测试。
可慢慢地,有人开始用它干别的了。
Skills就是这个App Store。
它让“通用Agent”从概念变成了能落地的架构。
你不需要重新训练模型,也犯不着手动搭复杂的RAG管道。维护一堆专用Agent的日子?你算是熬出头了。
一个通用智能体 + 可组合的知识包,能应对大多数场景。
是不是真能行,得让子弹飞一会儿。
但我自己的测试结果,挺乐观的。
至少,终于不用再维护那15个Agent了。
你什么时候会意识到,自己其实一直在一个框框里?
当你发现根本没有框的时候。
读者评论 5