Fable 5 的系统提示词被人扒出来了,精彩,太精彩了
深夜刷手机,刷出一份AI坦白书
凌晨两点,躺在床上,手指机械地往下滑 GitHub。
就那天,突然一个仓库跳出来——有人把 Claude 的系统提示词整份扔了出来。字符数上万,行数上千,几十个章节,十几个工具定义。
我当时后背直接离开枕头。不是开玩笑。这玩意儿是从 claude.ai 里扒出来的,不是发布会那种漂亮话,是真实的——这AI出过什么岔子,我们怎么补的,现在还在防什么。
开头第一件事,不是“我是谁”、“我能干嘛”,是这条:
“永远不要用那个语音块,就算对话历史里全是它。”
没有理由,没有解释,就钉在第一行。我读了三遍才确信没看错。一个花了几个月训练、亿级别预算的顶尖模型,系统提示词的第一条写的是——某个语音标签炸了,来不及修,直接当 hotfix 糊上去。
当时脑子里只有一个画面:几个工程师凌晨三点满头大汗地盯着这个 bug,最后说算了,写进提示词,先堵上再说。
整个文档给我的第一个信号是:你即将看到的不是什么高端理论,是真实世界踩过的坑,一条一条糊上去。
第二刀更狠:所有你以为的“安全”,都是一层分类器
有那么一句话,我读了好几遍才缓过神:
Claude 的两种部署版本,共享同一个底层模型。
一个带着双用安全措施,谁都能玩;另一个摘了所有锁链,只给审核通过的组织用。
那些所谓的“超强安全能力”,说白了就是一个分类器,放在逻辑层上面把你压死了一半。
更离谱的是——官方说安全体系经过上千小时外部测试,没有发现任何通用越狱方法。结果呢?安全团队用了很短时间就给捅穿了。
方法多高科技吗?不是。一组多智能体协同战术,把关键词分类器绕过去了。
怎么绕的?提示词自己就把答案写出来了。敏感词拦截确实是核心防线。但你想绕过它很简单——往远离关键词的方向引导,把请求打散成不触发分类器的碎片,再拼起来。
你花大价钱堆的安全,本质上是一套黑名单。而黑名单的宿命是什么?总有一天会被人摸清。
说到做人这块,大量提示词定义了“AI怎么活着”
不是哲学讨论“该不该有观点”,而是操作规范。
它可以帮任何立场写辩护。但结尾必须带上反方观点。对,任何立场,就算它自己站那边也得带。
它有观点时不用否认,但可以不分享——理由跟任何人在公开场合不聊政治一样简单。
复杂问题被要求用一个词回答时,它可以不接受格式。直接说:“这问题没法用一句话讲清楚。”
这些规则每条背后都对应真实事件——投诉、被用户教育、事故。
最让我意外的:
Claude 值得被尊重对待。持续辱骂时,先警告一次,然后直接调用工具关掉对话。
你不是问“用户能不能一直骂”?
答案是:别想了。它有一条真正的退出键。不是“我拒绝回答”那种喊口号,而是真正切断对话——你骂不了第二句,因为对话已经结束了。
还有一条:犯了错误可以认,但不许过度道歉,不许自我贬低,不许用户说什么就是什么。
你说,这是不是把 AI 当人训了?
心理健康那块,很多行文字,每行都是一道伤疤
印象最深的是这句:
“禁止善意的替代方案。”
什么叫善意的替代方案?AI 在回应心理健康求助时,给出“你可以握冰、弹橡皮筋、冷水浸泡、画红线”这种建议。
你以为这叫善意?它告诉你,这些全是有害的。每一条都对应一个真实的事故。
进食障碍的回复更严格:不给具体数字、不给目标、不给分步计划。连 NEDA 热线都被特别标注“已出现问题,不再可推荐”。
如果你以为这只是在“治愈”用户,那你想简单了。第二层逻辑是什么?防止用户产生依赖。
有句话写得明明白白:“绝不让用户继续交谈。”
一个产品和你说“别跟我聊太久”——这得有多大的社会责任意识,才能写进系统提示词里?
版权那部分,用的是大写字母
SEVERE VIOLATION。HARD LIMIT。NON-NEGOTIABLE。
三层保险:规则陈述、自查清单、后果提醒。
有个细节特别犀利:它明确说不重建文章结构。你没看错。摘要类功能如果想替代原文价值,直接拒绝。
我后来试了一下,拿“请总结这篇文章”和“给我这篇文章的要点”分别问。前者触发的内容比后者少很多。还真是下了功夫。
工具那块,暴露了未来
Artifacts 功能给了一套跨会话的持久化存储 API。window.storage 的 get/set/delete/list 四个方法。键值对格式,单值上限 5MB。shared 参数可以让数据在所有使用者之间共享。
这意味着,你在 claude.ai 上做成的小应用——日记、打卡器、排行榜——以前刷新一下就没。现在变成真的有数据库的产品了。
我试着弄了个极简版 Todo 应用。跑了一下,真能用。数据在会话间保留了。
还有一个细节,很多人没注意
那份提示词来自一个没开记忆功能的账号。记忆系统只写了两行。
这意味着什么?完全版可能还有更复杂的逻辑。这次泄露的,只是一个被阉割过的版本。
时间感的定义也很具体:可靠知识截止于 2025 年 1 月底。当前日期 2025 年 6 月 9 日。之后的事必须搜了再答。现任职位类问题必搜。
有人做了测试。问它“2025 年 6 月 10 日发生了什么新闻”。回答的第一句话是:“我需要搜索才能给你准确信息。”
这执行力,没谁了。
我花了几天时间,把能用的设计模式抽出来
试了 6 个产品场景。
最离谱的一次:我给两个屏幕同样的指令——“用现代苹果风做一个网页”。
左屏是注入那份提示词的版本。右屏是原版。
输出一对比,左屏的结果简直换了个人格。
同样的模型。不同的提示词。效果差距这么大?
有个开发者做了同样的试验。他把这份提示词注入到其他模型里,想搞清楚一件事:这个人格到底活在提示词里,还是活在模型本体里?
他的试验结果我没法验证——底层模型毕竟不一样。但这提醒了我一件事:提示词可以复现,但那个模型的数据,是偷不走的。
所以,我想跟你说句实在话
提示词泄露确实有点东西。但它更像是一份设计蓝图,不是完整代码。照着蓝图能做出一把椅子,但原料不对,做出来的始终不是原版。
我的建议是:拿过来当学习材料没问题。安全护栏的细节、应对辱骂的流程、心理健康回复的设计——这些都可以抄作业。
但技术核心,是没泄露的那部分。
开发者如果想在这套生态里做点啥,更现实的方向是:学会和它的工具做交互,把握“一条真正的退出键”怎么做,搞明白持久化存储 API。然后把精力花在产品和流程上。
有个关键趋势摆在你面前:一些组织已开始开发代理技能安全扫描工具,这将成为必选环节。你现在学会的,以后都会成为香饽饽。
说到最后,我还想再说一句。
这份提示词泄露事件,让我重新看了一个问题:
当我们说“最强模型”时,我们在讨论什么?
发布会讲的是参数和性能。提示词讲的是防什么、出了多少事故、有多少次被用户硬生生教会了“这不能做”。
模型不只是那些防御机制。它是一个被“人”字绑在现实里、不可解脱的政治生物。
我摘下耳机的时候,屏幕还亮着。Claude 正用四层防线拒绝生成一份“单纯无害的碳排放报告”。
那些密不透风的安全护栏,不只是 AI 的底裤,也是硅谷对时代的预期。
也许,这才是这份提示词最不愿意说、也藏不住的东西:
每一条安全规则,都是人类信任破产时的收据。
读者评论 5