AI正在吃掉自己的粮食,而且粮食越来越馊
朋友,你有没有发现一件细思极恐的事?
来,做个实验。打开,搜一个热门问题,然后翻到第10页以后。你看看那些回答——用词规范、逻辑严密、段落工整,读起来像教科书一样完美。但你有没有一种感觉:它们没有灵魂?像是一个模子里刻出来的?
你猜对了。大概率是AI写的。
更恐怖的是什么?下一代AI训练时,会把这类内容当成“人类知识”吃进去。然后它输出的内容会更像这些AI写的东西。然后下一代AI再吃这些。无限套娃。
我管这叫什么呢?——“AI的粪便循环”。
这可不是我危言耸听。2025年1月的数据就摆在眼前:互联网上超过51.72%的新增内容是AI生成的,而且这个数字还在疯涨。
有人做了个实验,让AI用自己的输出训练下一代,一代代传下去。你猜结果怎么样?
第一代,还行,跟正常人差不多。第三代,开始有点呆,说话重复。第五代,明显变傻,冷门知识全忘了。到了第九代——“疯了”。你问它中世纪建筑,它跟你聊彩色兔子。为什么?因为中世纪手稿里确实画满了彩色兔子,模型死记硬背,以为这两者是一回事。
这不是段子。这是真实的“模型崩溃”。
我自己也踩过这个坑。去年做一个垂直领域的聊天机器人,我偷懒用了大量网上爬来的数据训练。结果呢?模型对专业术语的理解越来越偏,最后连“TCP三次握手”都能解释成“握手三次才能建立连接”。后来才发现,那些“专业文章”全是AI写的,里面充斥着似是而非的概念。
你看,这就叫——AI正在吃自己的粮食,而且粮食还越来越馊。
说到这儿,我想跟你聊聊两个问题。
第一个问题,是OpenAI的Ilya Sutskever在2024年底的NeurIPS大会上说的。他说:“数据就是AI的化石燃料。”逻辑很清晰:过去几年AI变强,靠的是更多参数×更多数据×更多算力。算力还在涨,但数据这条腿撞墙了——互联网上的高质量文本就那么多,所有的书籍、论文、新闻、博客、代码加起来就是个固定池子。各大公司已经把能爬的基本都爬完了。不存在“第二个互联网”。
他说的是存量问题:人类知识总量有限,已经被用得差不多了。
第二个问题,是我说的。我说的是增量问题:未来新产生的高质量内容会越来越少,因为AI的普及正在侵蚀创作动力和内容质量。
这两个问题是同一枚硬币的两面。如果只看数量级,他的问题更紧迫——几十年积累的文本可能是几万亿token,每年新增的高质量原创内容占比很小。但如果看长期,我的问题更危险——他描述的是一个静态的天花板,我描述的是一个动态的恶化:不仅没有新燃料了,连现有的油田都在被污染。
你想想,你上一次在认真写一篇长文分享经验是什么时候?你最近一次问AI问题又是什么时候?
这两个问题之间,存在一个致命的关联。
以前,我遇到一个棘手的编程问题,会去Stack Overflow发帖,等几个小时甚至几天,期待某个大神赐教。现在我直接问AI,30秒得到答案。以前,我读到一本好书,会去豆瓣写一篇书评,享受和其他读者交流的乐趣。现在AI能帮我写出比我更好的书评,还能总结全书要点。以前,我去一个地方旅行,会在小红书发一篇攻略,收获点赞和收藏。现在我让AI规划行程,它连当地人都不知道的小众景点都能挖出来。
那么问题来了:如果所有人都不再分享,未来的AI去哪里找新的数据?
这是一个可怕的闭环:AI的成长依赖人类在公共领域的分享,但AI的普及正在消灭这种分享的动机。AI在“吃掉”自己的未来。
把这些想明白之后,我突然理解了:为什么纽约时报要告OpenAI,为什么迪士尼要告OpenAI。
以前我的第一反应是“传统势力在阻碍创新”。现在回头看,这些诉讼其实是在帮AI行业解决它自己解决不了的问题。
没有法律压力,AI公司没有动力主动付费。免费拿内容训练模型如果不会有后果,理性的选择就是继续免费拿。OpenAI跟美联社签的授权协议、跟各出版商的谈判,大部分都是在纽约时报起诉之后加速推进的。
而且这些诉讼在建立规则。AI使用版权内容的法律边界现在很模糊,没有判例。这些官司打到最后,可能会形成一套“数据使用费”的定价体系——就像音乐版权、图片版权一样。
有人可能会说:“这不就是变相的垄断吗?大公司花钱买数据,小公司买不起,最后只有几个巨头能玩。”
说得对。但问题是,完全靠市场也不行。一个独立博主根本不知道自己的文章被哪些模型用了,没有任何谈判筹码。纯市场的结果就是大机构签高价协议,长尾创作者什么都拿不到。
这个问题可能没有“正确的制度设计”。它本质上跟人类历史上所有公共品困境一样——知识一旦被生产出来就无法排他性地控制传播,强行控制会抑制效率,不控制又导致生产者得不到回报。
基于以上判断,我得出一个直白却现实的预言:未来,单纯擅长文字创作、机械编码的能力将不再稀缺。真正珍贵的,是拥有独立思考、能深度交流碰撞的人。
往后,人类本身,会成为AI时代最核心的原生养料。
回看思维碰撞的过程便不难理解:如果没有天马行空的构想,没有跨界融合的新奇思路,AI便失去了创作的源头,只能机械输出千篇一律的内容。人类是蕴藏无限想法的“矿藏”,AI只是负责挖掘、整理、落地的工具。没有源头思想,工具便毫无用武之地。
那些逻辑清晰、思维开阔、敢于突破固有认知、能将看似无关的事物串联出新观点的人,会成为整个时代的稀缺资源。
说实话,我没有完美的答案。但有几个方向值得尝试:
第一,给你的内容加上“人类原创”的标签。就像有机食品认证一样,未来可能需要一个“人类原创”的认证体系。这既是保护自己的创作价值,也是为AI提供“干净”的训练数据。
第二,别让AI替你思考。用AI做助手没问题,但别让它替你做决定。我现在的习惯是:先用AI收集信息、整理框架,然后关掉AI,自己写一遍。写完之后再让AI检查逻辑漏洞。这样既利用了工具,又保持了思考的独立性。
第三,关注那些AI做不好的领域。AI在因果推理题上的准确率还很低,比小学生还低。它缺乏“元认知”能力——不知道自己不知道。它没有情绪、欲望与直觉,无法体会感知上的愉悦。这些领域,恰恰是人类的机会。
最后说一句:AI不会消灭人类,但它会消灭那些放弃思考的人。互联网上每一次真实的原创、每一篇不是AI生成的帖子,正在变成稀缺资源。而稀缺,就意味着价值。
所以,朋友,下一次当你准备点击“生成”按钮时,停一停。问问自己:这件事,真的值得交给AI去做吗?
因为在这个AI泛滥的时代,人类原创,才是最稀缺、最昂贵的奢侈品。
读者评论 3