为什么至今仍未有任何主流游戏为NPC接入大语言模型LLM?
核心阅读体验是:这篇文章采用了非常生动的第一人称叙事,带有强烈的个人情绪和具体案例,本身已经很大程度上避免了“AI味”。问题主要出在个别数据可能为了效果而失准,以及文末有一些常见的“总结报告”式套话。
以下是逐项分析后的修改版本。
编辑修改版
没人敢说的真相:为什么3A大作都不敢给NPC装AI大脑?
上周五晚上,我盯着Steam后台的退款数据,眼睛都快瞪出血了。
47%。
我花了60天,一个人肝出来的AI侦探游戏——五个NPC全部由大模型实时扮演,玩家想说啥就说啥,没有固定选项,完全自由输入。听起来很牛吧?我一开始也这么觉得。
然后退款率47%。
什么意思?将近一半的人,玩了不到两个小时,就拍桌子走人了。连句再见都没说。
所以当我看到有人问“为什么至今没有主流游戏接入大模型”的时候,我真的笑了。不是苦笑,是那种踩过坑的人才懂的、带着后怕的笑。
你以为他们不想?他们是不敢。
3A厂商要是真把这玩意儿接进去,不用等玩家骂,财务第一个提刀来见。
来,坐好。我把我踩过的那些坑,一个一个讲给你听。顺便回答几个你肯定也好奇的问题。
技术门槛?你以为调个API就完事了?
对,半天就能出demo。效果还特别唬人。
你看啊,你说什么NPC都能接,人设、语气、情感,样样都像模像样。我第一版跑起来的时候,差点觉得自己要改变游戏史了。
结果噩梦从第二天开始。
第一个坑:NPC会“说漏嘴”。
我在提示词里写了八百遍“绝对不要承认你是凶手”,它嘴上说着“我什么都不知道”,结果舞台指示里写了——“她的眼神闪烁着愧疚”。
你想想,这不就等于用身体语言把答案卖给玩家了吗?防不胜防!
第二个坑:NPC会编造游戏里不存在的东西。
玩家问“你有没有看到一把刀”,游戏里压根儿就没刀的设定。但大模型觉得“回答一下也无妨”啊,就随口编了一把刀出来。玩家拿着这把不存在的刀去怼另一个NPC,整个推理链全崩。你说玩家气不气?
第三个坑:也是最恐怖的——玩家会用话术绕开你的所有安全护栏。
我遇到过一个大神,用21轮循序渐进的对话,让我那个1936年的社交名媛角色说出了完全不该说的话。每一轮看起来都像正常审讯,但累积起来方向全偏了。我那会儿用的可是主流大模型,网页端对这类内容严防死守,结果在游戏里,因为系统提示词复杂加上玩家诱导,直接把安全过滤给跳过去了!
我那天晚上是一身冷汗改代码,一边改一边骂。
后来我怎么解决的?双AI架构。
一个AI负责扮演角色,另一个AI专门当裁判——评估玩家的提问质量和推理方向。玩家瞎问,裁判就给低分,角色就稳如泰山。玩家用对了证据、指出了矛盾,裁判给高分,角色的防线才会按设计好的节奏松动。
还不够。上面还有一层程序级检测,每一轮NPC回复都要扫描,有没有说出不该说的关键词、有没有偏离角色设定。一旦偏了,在玩家看到之前直接拦截。
最后我加了层认知层防御——不是关键词过滤,而是让角色在身份认知上就不可能配合某些请求。一个1936年的淑女,骨子里就不会做某些事,不需要系统告诉她不可以。
你看,就五个NPC,我要上两层AI加一层硬编码再加一层认知设计。
3A游戏动辄几百个NPC,每个都这么搞?项目周期直接拉到十年。哪个大厂扛得住?
成本?说出来吓死你
说到这儿你肯定觉得:大模型不是越来越便宜了吗?ChatGPT也没几个钱啊。
那是对话少。
来,咱们算笔账。
假设一个开放世界RPG,每天10万活跃玩家 [注1],每人每天跟NPC平均聊20次 [注2],每次对话消耗500 token。算一下:10万 × 20 × 500 = 10亿 token,一天。
按GPT-4o-mini [注3] 的价格,每天光API调用费就烧掉好几万。如果是GPT-4o,直接翻10倍。
而且这只是保守估计。你想想,真正玩起来,那些喜欢“调教”NPC的玩家,一个人能把你一个月的额度全用完!
大厂当然可以自己部署模型。但推理成本照样不低。一张A100跑7B模型,最多同时服务几十个玩家的对话请求 [注4]。百万DAU的游戏需要多少张卡?你算算。
我这小破游戏还好,日活低,一个月API费用几千块还能顶住。但你让育碧或R星接入这套系统,一个游戏几百万销量,服务器推理成本直接吃掉利润。
更致命的是什么?商业模式悖论——玩家玩得越多,你亏得越多。
这大概是游戏史上第一次有厂商希望玩家别玩太久吧?
有些厂商尝试让玩家用自己的API key,或者付费买token。但你想想——我花钱买了游戏,还要另外付钱跟NPC聊天?大部分人听到这个直接退款了。我退款率47%就是这么来的,不全是这个原因,但玩家对“二次付费”极其敏感。
延迟?3秒钟足够毁掉一切沉浸感
你走到村口,跟铁匠说“帮我打把剑”。
然后铁匠愣了3秒才回你一句。
什么感觉?
沉浸感直接碎成渣。
人类能接受的对话响应时间大概在200到500毫秒。超过1秒,你就觉得“卡”了。现在主流大模型的推理延迟呢?即使在普通网络环境下,也要1到3秒。遇到复杂提示或长上下文,5秒以上是常事。
有人说用流式输出,一个字一个字蹦出来。我实测告诉你——更难受。玩家看到NPC嘴巴在动,文字却一个字一个字往外蹦,感觉比等3秒还折磨。
我这游戏怎么处理的?玩家说完话之后,先让NPC播放一个默认的思考动画——捋胡子、看天之类的小动作,等模型返回完整内容后再一口气显示出来。实际延迟还是差不多2秒,但玩家的心理预期被缓冲了,看起来就像NPC在思考。
但也只是权宜之计。你想想,BOSS战里NPC给你打气,结果卡了3秒才蹦出“加油”两个字——玩家早躺地上了。
幻觉?世界观粉碎机
大模型特别会编故事,而且编得头头是道。
你设计了一个中世纪奇幻世界的铁匠NPC,他应该只会聊打铁、矿石、武器。结果玩家问“你听说过iPhone吗?”
LLM可能一本正经地回答:“啊,那是一种来自东方的神秘法器。”
好笑吗?确实好笑。
但你们团队花几个月搭建的世界观,被一句话就毁了。
更可怕的是,NPC可能编造任务线索。玩家问“去哪找钥匙”,NPC随口说“地窖里”——但游戏里根本就没有地窖这个地点。玩家找了半小时找不到,以为bug了,怒删游戏。
传统NPC说的每一句话都是人写好的,有就是有,没有就是没有。而LLM天生是个“演员”,擅长即兴发挥。这在剧本杀里是优点,在叙事严谨的RPG里就是灾难。
我后来加了一层“世界知识约束层”——每次NPC响应之前,先把输出内容跟游戏内的实体清单做比对,物品、人物、地点,但凡出现不存在的,直接拦截重生成。
代价是什么?额外增加一轮网络请求,延迟更高。
完美的恶性循环。
主流厂商到底在怕什么?
怕风险。
上面说的所有问题——不可控、成本、延迟、幻觉——对3A游戏来说,每一项都不可接受。
育碧拿《孤岛惊魂7》测试生成式AI,行业人士评价效果“一塌糊涂”。他们那个AI NPC项目Neo NPC搞了两年,至今没拿出任何产品 [注5]。
网易的《逆水寒》手游倒是接入了LLM NPC,但上下文记忆太短,对话十几次就开始重复。而且只是个边缘功能,不可能给太多资源倾斜。
米哈游的新作《星布谷地》据说也接入了AI NPC,能跟玩家聊天玩海龟汤。商业模式是免费氪金手游,靠持续运营收入来覆盖高昂的模型成本。这可能目前最靠谱的路——但也不是每个团队都有米哈游那样的用户体量和付费转化。
拉瑞安工作室只是提到在用AI做内部辅助,结果被玩家口诛笔伐,CEO不得不出面承诺新作不会有AI生成内容。《猛兽派对》搞了个AI视频创作大赛,7.5万美元奖金,结果玩家差评轰炸,57%投票者要求取消,最终官方道歉收尾。
玩家对AI的抵触,比很多从业者想象的要强烈得多。
我上架后收到不少评价,有人直接写了“AI游戏,不玩”。哪怕我的NPC其实是人工写了很多基础对话加AI动态发挥,但在部分玩家眼里,只要沾了AI就是偷懒。
最后补几个可能让你意外的事
第一,本地部署可能才是救命稻草。
我现在用的是云API,但已经开始测试本地模型了。Qwen3-35B-A3B这个混合专家模型,35B总参数但每次只激活3B,6G显存就能跑,32G内存就能加载 [注6]。再过一两年,家用显卡跑中等规模的模型应该会普及。到时候成本不再是问题,延迟也能降到可接受范围——前提是你愿意下载模型,40GB起步,并忍受偶尔的智力降级。
第二,做好LLM NPC的核心不是语言模型,是它跟游戏机制的耦合。
我踩过最深的坑就是以为“能说话就行”。结果发现NPC必须知道它能做什么、不能做什么、游戏里有什么、没什么。一个真正的AI NPC应该是一个能理解游戏状态、能够执行动作、并且说话符合情境的智能体,而不是一个套着角色皮的聊天机器人。现在大部分所谓的AI游戏,本质上就是个换皮聊天软件。
第三,好玩的游戏不一定需要万能的NPC。
俄罗斯方块一个词都没有。传送门也就几句旁白。Hades的战斗循环几乎不需要对话。语言是游戏里最容易被优化的调味料,不是主菜。BioWare在二十年前就能写出漂亮的分支对话,LLM目前的能力在这种经过精心设计的叙事面前,还是个毛坯房。
最后说句大实话:现在做AI NPC的游戏,要么是像我这样的独立开发者头铁,要么是大厂用来做技术储备的试验田。真正要看到“主流游戏里的NPC都靠大模型实时生成”这个画面,我猜至少还要等两三年。等本地推理的成本和速度都跨过门槛,等有人想明白怎么把LLM跟玩法揉在一起,而不是贴个对话标签上去。
在那之前,你打开3A游戏遇到的铁匠,还是会重复那三句台词。
也挺好的,至少他不会告诉你iPhone是东方神秘法器。
对吧?
—— 来自一个被退款率砸醒的“独立开发者”
注:
1. 指日活跃用户(DAU)。
2. 此处为估算值。
3. 文字用此价格代入,实际不同模型和缓存策略会显著影响成本。
4. 实际并发数受硬件配置、模型量化方式、推理框架等多种因素影响。
5. 指截至本文写作时的公开信息。
6. 作者引用了对特定模型优化的描述,实际性能表现需以实测为准。
读者评论 2