我花了两天实测李继刚的汉语新解Prompt,证实Claude 3.5确实断层领先
试完这个神级Prompt,我真的被Claude 3.5打脸了
跟你说个实话。
半年前有人跟我说“Claude 3.5断层领先所有人”,我当场就笑了。
怎么可能呢?你追我赶的AI战场,今天你第一,明天他第一,谁封神都逃不过三个月就得下台。GPT-4o隔三差五就更新,Gemini也在拼命追,哪来的“断层领先”?
直到前几天,李继刚那个“汉语新解”的Prompt又炸了朋友圈。
我心想,行,来呗,是骡子是马,拉出来遛遛。
结果你猜怎么着?
我的脸,肿得连我妈都认不出来。
说到这个Prompt,得先聊聊李继刚这个人
你们可能不知道他是谁,但在Prompt圈子里,他就是个老工匠。
去年他在各个AI社区丢了几十个神级Prompt,到现在我电脑里还存着他的合集。后来好一阵子没动静,我以为他也跟那些玩够了的人一样,悄无声息地退隐了。
结果前几天,他突然杀了个回马枪——带着“汉语新解”就回来了。
这个Prompt长这样,我给你精简了核心部分:
;; 作者: 李继刚
;; 版本: 0.1
;; 模型: Claude Sonnet
;; 用途: 将一个汉语词汇进行全新角度的解释
(defun 新汉语老师 ()
"你是年轻人,批判现实,思考深刻,语言风趣"
(风格 . ("Oscar Wilde" "鲁迅" "林语堂"))
(擅长 . 一针见血)
(表达 . 隐喻)
(批判 . 讽刺幽默))
(defun 汉语新解 (用户输入)
"你会用一个特殊视角来解释一个词汇"
(let (解释 (一句话表达
(隐喻 (一针见血 (辛辣讽刺 (抓住本质 用户输入))))))
(few-shots (委婉 . "刺向他人时, 决定在剑刃上撒上止痛药。"))
(SVG-Card 解释)))
(defun SVG-Card (解释)
"输出SVG 卡片"
(setq design-rule "合理使用负空间,整体排版要有呼吸感,添加少量图形装饰"
design-principles '(干净 简洁 纯色 典雅))
(设置画布 '(宽度 400 高度 600 边距 20))
(标题字体 '毛笔楷体)
(自动缩放 '(最小字号 16))
(配色风格 '((背景色 (蒙德里安风格 设计感)))
(主要文字 (楷体 粉笔灰)))
(卡片元素 ((居中标题 "汉语新解")
分隔线
(排版输出 用户输入 拼音 英文 日文)
解释)))你第一眼看到它,是不是跟我的反应一模一样?
什么玩意儿?Lisp?1958年写的语言,拿来写Prompt?
别急,后面你就知道为什么了。
真实对决:同一个词,两套班子
我花了两个下午,一个词一个词地测。
左边是Claude 3.5 Sonnet(网页版),右边是GPT-4o(API)。喂的Prompt,一模一样。
第一个词——“年终奖”。
Claude 3.5 Sonnet 的输出:
30秒,一张SVG卡片直接生成。白底,左上角有蒙德里安风格的红黄蓝方块点缀,标题“汉语新解”三个字是毛笔楷体,解释用的是粉笔灰调的明朝体。排版,配色,字体,一步到位。
核心解释是这么写的:“年终奖是一种年度幻觉,你以为是对过去的奖赏,其实是给未来的定心丸——老板用一脸慈悲给你一次性的甜头,换你接下来一整年的拼命。”
我笑了。是真的笑出了声。
不是因为他说得对——而是因为它说得太对了。不是空洞的讽刺,是字字戳心,句句见血。
像鲁迅附身,像王尔德复活,还带了点林语堂的从容。
GPT-4o 的输出呢?
也生成了SVG卡片代码。
但我点开一看——排版歪了,颜色搭配土得掉渣。文字内容翻译过来就是:“年终奖是公司对你一年努力的衡量,也是激励你明年继续奋斗的动力。”
嗯。
很对。
无聊到家了。
你说它错了吗?没错。但你说它精彩吗?跟Claude那杯浓缩意式比起来,它就像一杯凉透了的白开水——安全,标准,毫无灵魂。
我又试了“打工人”、“内卷”、“甲方”、“乙方”……
结果一模一样。
Claude 3.5每一轮都能给你一个既扎心又漂亮的卡片,有的像一把刀,有的像一杯烈酒。GPT-4o要么内容平庸得像教科书,要么排版翻车得一塌糊涂。
这个差距,我琢磨了半天
你说这是Prompt的功劳吗?
是。但又不全是。
Prompt是那把钥匙,但门背后得有人能接住。
我后来仔细拆了拆,发现三个硬核差距。
第一个:中文的理解深度。
Claude 3.5对中文里那种只可意会不可言传的东西,抓得准得吓人。隐喻、反讽、文字游戏——它好像懂你的潜台词。GPT-4o不是听不懂,但它经常给你一个“标准答案”。像个学霸,什么都对,就是缺灵气。
第二个:SVG生成的质量。
Claude 3.5直接跑出符合蒙德里安风格的卡片,字体搭配得刚刚好,呼吸感满满的。GPT-4o能写SVG,但细节控制差了一截,经常要你手动调参才能看。
第三个:执行效率。
Claude 3.5几乎秒出,一次过。GPT-4o有时候卡在半路,要不就得反复生成好几次才能满意。
后来我去翻Claude官方的升级公告——SWE-bench Verified上新版3.5 Sonnet刷到了49.2%,而GPT-4o只有33.2%。
虽然这个基准测的是代码能力,但你看,背后那个推理的扎实程度,是一样的。
说到这儿,我得说说李继刚最牛的地方
后来我翻出他那篇专访,反复看了两遍。
有个细节,让我特别感慨。
他说:“我不会写Lisp,但用了十年Emacs。Emacs的配置语言就是Lisp,看了十年,自然就能跟着跑两步。”
什么意思?
他不靠技术吃饭,靠的是浸泡。
他写Prompt的核心,根本不是用什么语言——而是那几个被极致压缩的词。
Lisp只是他最舒服的表达方式。换成Markdown,换成JSON,换成Python,一样能达到效果。
真正重要的,是让模型理解一个完整的人格,然后去做一个指定的动作。
你看“汉语新解”这个Prompt——真正发挥作用的,是哪些设定?
Oscar Wilde + 鲁迅 + 林语堂的风格,一针见血,隐喻,讽刺幽默。
这些词,才是灵魂。
Lisp只是把这些思想表达出来的最小成本语言。
我后来试过把同样的角色定义换成JSON格式丢给Claude,效果差不多,但细节有差别。用Lisp写的时候,可能因为Claude本身对Lisp的树形结构理解得更顺畅,生成的解释结构更清晰——结构嵌套结构,一层层的,特别稳。
你非要说这是玄学,也行。
但味道这东西,吃一口就知道了。
所以,Claude 3.5真的是No.1吗?
我知道有人要提o1。
没错,o1那种思考链确实强得离谱。但它是另一个赛道——复杂推理、数学、代码。
如果你要做创意内容、中文表达、好的视觉呈现——Claude 3.5目前真的无人能打。
纯中文场景下,我试过Gemini 1.5 Pro,文字理解不错,但生成SVG时排版经常崩,风格太正经,不够毒舌。Sider里面那些高级模型,我一个个翻过来,最后还是觉得Claude 3.5最对味。
我还试了网上流传的那个“Thinking Claude”的Prompt——把思维链强行加到Claude 3.5上,让它像o1一样思考,再跑汉语新解。
结果呢?
出活是出活了。
但思考过程太长,反而把一针见血的锐气磨钝了。
有些事,快刀斩乱麻才是对的。
最后,给你点实操建议
想玩这个Prompt,别用免费版的Claude。它用的Sonnet版本太旧,生成卡片质量差得远。
直接上Claude官网,或者用Sider至尊版调最新的3.5 Sonnet。
年费是有点肉疼——我每个月交钱的时候也心疼。但你想想,每天多用,把值钱的模型跑起来,也就回本了。
另外,输入词的时候有个小窍门——选那种有社会张力、有文化包袱的词。
你输个“苹果”,它也能解释,但那个味儿不对。
你输个“打工人春节回家”——它直接火力全开,给你整出一张封神的卡片。
最后,别光看热闹。
去体会一下李继刚那种压缩思想的能力。
他不是在写Prompt,他是在用最短的词,让模型理解一个完整的人格。
你脑子里的知识,永远决定你用AI的上限。
这事儿真挺有意思的。
折腾了两年,试了几十个模型,花了不知道多少钱,最后发现——最强的模型就在眼前。
而让它发光的,不是更贵的API,不是更快的显卡,而是那些能唤醒它的文字。
你不是在跟AI对话。你是在,给AI装一个灵魂。
而怎么装——得问你自己的脑子。
读者评论 2