← 返回资讯
陈默
AI 行业分析师
已审核

为什么至今仍未有任何主流游戏为NPC接入大语言模型LLM?

核心阅读体验是:这篇文章采用了非常生动的第一人称叙事,带有强烈的个人情绪和具体案例,本身已经很大程度上避免了“AI味”。问题主要出在个别数据可能为了效果而失准,以及文末有一些常见的“总结报告”式套话。

为什么至今仍未有任何主流游戏为NPC接入大语言模型LLM?

为什么至今仍未有任何主流游戏为NPC接入大语言模型LLM?


核心阅读体验是:这篇文章采用了非常生动的第一人称叙事,带有强烈的个人情绪和具体案例,本身已经很大程度上避免了“AI味”。问题主要出在个别数据可能为了效果而失准,以及文末有一些常见的“总结报告”式套话。

以下是逐项分析后的修改版本。


编辑修改版

没人敢说的真相:为什么3A大作都不敢给NPC装AI大脑?

上周五晚上,我盯着Steam后台的退款数据,眼睛都快瞪出血了。

47%。

我花了60天,一个人肝出来的AI侦探游戏——五个NPC全部由大模型实时扮演,玩家想说啥就说啥,没有固定选项,完全自由输入。听起来很牛吧?我一开始也这么觉得。

然后退款率47%。

什么意思?将近一半的人,玩了不到两个小时,就拍桌子走人了。连句再见都没说。

所以当我看到有人问“为什么至今没有主流游戏接入大模型”的时候,我真的笑了。不是苦笑,是那种踩过坑的人才懂的、带着后怕的笑。

你以为他们不想?他们是不敢。

3A厂商要是真把这玩意儿接进去,不用等玩家骂,财务第一个提刀来见。

来,坐好。我把我踩过的那些坑,一个一个讲给你听。顺便回答几个你肯定也好奇的问题。


技术门槛?你以为调个API就完事了?

对,半天就能出demo。效果还特别唬人。

你看啊,你说什么NPC都能接,人设、语气、情感,样样都像模像样。我第一版跑起来的时候,差点觉得自己要改变游戏史了。

结果噩梦从第二天开始。

第一个坑:NPC会“说漏嘴”。

我在提示词里写了八百遍“绝对不要承认你是凶手”,它嘴上说着“我什么都不知道”,结果舞台指示里写了——“她的眼神闪烁着愧疚”。

你想想,这不就等于用身体语言把答案卖给玩家了吗?防不胜防!

第二个坑:NPC会编造游戏里不存在的东西。

玩家问“你有没有看到一把刀”,游戏里压根儿就没刀的设定。但大模型觉得“回答一下也无妨”啊,就随口编了一把刀出来。玩家拿着这把不存在的刀去怼另一个NPC,整个推理链全崩。你说玩家气不气?

第三个坑:也是最恐怖的——玩家会用话术绕开你的所有安全护栏。

我遇到过一个大神,用21轮循序渐进的对话,让我那个1936年的社交名媛角色说出了完全不该说的话。每一轮看起来都像正常审讯,但累积起来方向全偏了。我那会儿用的可是主流大模型,网页端对这类内容严防死守,结果在游戏里,因为系统提示词复杂加上玩家诱导,直接把安全过滤给跳过去了!

我那天晚上是一身冷汗改代码,一边改一边骂。

后来我怎么解决的?双AI架构。

一个AI负责扮演角色,另一个AI专门当裁判——评估玩家的提问质量和推理方向。玩家瞎问,裁判就给低分,角色就稳如泰山。玩家用对了证据、指出了矛盾,裁判给高分,角色的防线才会按设计好的节奏松动。

还不够。上面还有一层程序级检测,每一轮NPC回复都要扫描,有没有说出不该说的关键词、有没有偏离角色设定。一旦偏了,在玩家看到之前直接拦截。

最后我加了层认知层防御——不是关键词过滤,而是让角色在身份认知上就不可能配合某些请求。一个1936年的淑女,骨子里就不会做某些事,不需要系统告诉她不可以。

你看,就五个NPC,我要上两层AI加一层硬编码再加一层认知设计。

3A游戏动辄几百个NPC,每个都这么搞?项目周期直接拉到十年。哪个大厂扛得住?


成本?说出来吓死你

说到这儿你肯定觉得:大模型不是越来越便宜了吗?ChatGPT也没几个钱啊。

那是对话少。

来,咱们算笔账。

假设一个开放世界RPG,每天10万活跃玩家 [注1],每人每天跟NPC平均聊20次 [注2],每次对话消耗500 token。算一下:10万 × 20 × 500 = 10亿 token,一天。

按GPT-4o-mini [注3] 的价格,每天光API调用费就烧掉好几万。如果是GPT-4o,直接翻10倍。

而且这只是保守估计。你想想,真正玩起来,那些喜欢“调教”NPC的玩家,一个人能把你一个月的额度全用完!

大厂当然可以自己部署模型。但推理成本照样不低。一张A100跑7B模型,最多同时服务几十个玩家的对话请求 [注4]。百万DAU的游戏需要多少张卡?你算算。

我这小破游戏还好,日活低,一个月API费用几千块还能顶住。但你让育碧或R星接入这套系统,一个游戏几百万销量,服务器推理成本直接吃掉利润。

更致命的是什么?商业模式悖论——玩家玩得越多,你亏得越多。

这大概是游戏史上第一次有厂商希望玩家别玩太久吧?

有些厂商尝试让玩家用自己的API key,或者付费买token。但你想想——我花钱买了游戏,还要另外付钱跟NPC聊天?大部分人听到这个直接退款了。我退款率47%就是这么来的,不全是这个原因,但玩家对“二次付费”极其敏感。


延迟?3秒钟足够毁掉一切沉浸感

你走到村口,跟铁匠说“帮我打把剑”。

然后铁匠愣了3秒才回你一句。

什么感觉?

沉浸感直接碎成渣。

人类能接受的对话响应时间大概在200到500毫秒。超过1秒,你就觉得“卡”了。现在主流大模型的推理延迟呢?即使在普通网络环境下,也要1到3秒。遇到复杂提示或长上下文,5秒以上是常事。

有人说用流式输出,一个字一个字蹦出来。我实测告诉你——更难受。玩家看到NPC嘴巴在动,文字却一个字一个字往外蹦,感觉比等3秒还折磨。

我这游戏怎么处理的?玩家说完话之后,先让NPC播放一个默认的思考动画——捋胡子、看天之类的小动作,等模型返回完整内容后再一口气显示出来。实际延迟还是差不多2秒,但玩家的心理预期被缓冲了,看起来就像NPC在思考。

但也只是权宜之计。你想想,BOSS战里NPC给你打气,结果卡了3秒才蹦出“加油”两个字——玩家早躺地上了。


幻觉?世界观粉碎机

大模型特别会编故事,而且编得头头是道。

你设计了一个中世纪奇幻世界的铁匠NPC,他应该只会聊打铁、矿石、武器。结果玩家问“你听说过iPhone吗?”

LLM可能一本正经地回答:“啊,那是一种来自东方的神秘法器。”

好笑吗?确实好笑。

但你们团队花几个月搭建的世界观,被一句话就毁了。

更可怕的是,NPC可能编造任务线索。玩家问“去哪找钥匙”,NPC随口说“地窖里”——但游戏里根本就没有地窖这个地点。玩家找了半小时找不到,以为bug了,怒删游戏。

传统NPC说的每一句话都是人写好的,有就是有,没有就是没有。而LLM天生是个“演员”,擅长即兴发挥。这在剧本杀里是优点,在叙事严谨的RPG里就是灾难。

我后来加了一层“世界知识约束层”——每次NPC响应之前,先把输出内容跟游戏内的实体清单做比对,物品、人物、地点,但凡出现不存在的,直接拦截重生成。

代价是什么?额外增加一轮网络请求,延迟更高。

完美的恶性循环。


主流厂商到底在怕什么?

怕风险。

上面说的所有问题——不可控、成本、延迟、幻觉——对3A游戏来说,每一项都不可接受。

育碧拿《孤岛惊魂7》测试生成式AI,行业人士评价效果“一塌糊涂”。他们那个AI NPC项目Neo NPC搞了两年,至今没拿出任何产品 [注5]。

网易的《逆水寒》手游倒是接入了LLM NPC,但上下文记忆太短,对话十几次就开始重复。而且只是个边缘功能,不可能给太多资源倾斜。

米哈游的新作《星布谷地》据说也接入了AI NPC,能跟玩家聊天玩海龟汤。商业模式是免费氪金手游,靠持续运营收入来覆盖高昂的模型成本。这可能目前最靠谱的路——但也不是每个团队都有米哈游那样的用户体量和付费转化。

拉瑞安工作室只是提到在用AI做内部辅助,结果被玩家口诛笔伐,CEO不得不出面承诺新作不会有AI生成内容。《猛兽派对》搞了个AI视频创作大赛,7.5万美元奖金,结果玩家差评轰炸,57%投票者要求取消,最终官方道歉收尾。

玩家对AI的抵触,比很多从业者想象的要强烈得多。

我上架后收到不少评价,有人直接写了“AI游戏,不玩”。哪怕我的NPC其实是人工写了很多基础对话加AI动态发挥,但在部分玩家眼里,只要沾了AI就是偷懒。


最后补几个可能让你意外的事

第一,本地部署可能才是救命稻草。

我现在用的是云API,但已经开始测试本地模型了。Qwen3-35B-A3B这个混合专家模型,35B总参数但每次只激活3B,6G显存就能跑,32G内存就能加载 [注6]。再过一两年,家用显卡跑中等规模的模型应该会普及。到时候成本不再是问题,延迟也能降到可接受范围——前提是你愿意下载模型,40GB起步,并忍受偶尔的智力降级。

第二,做好LLM NPC的核心不是语言模型,是它跟游戏机制的耦合。

我踩过最深的坑就是以为“能说话就行”。结果发现NPC必须知道它能做什么、不能做什么、游戏里有什么、没什么。一个真正的AI NPC应该是一个能理解游戏状态、能够执行动作、并且说话符合情境的智能体,而不是一个套着角色皮的聊天机器人。现在大部分所谓的AI游戏,本质上就是个换皮聊天软件。

第三,好玩的游戏不一定需要万能的NPC。

俄罗斯方块一个词都没有。传送门也就几句旁白。Hades的战斗循环几乎不需要对话。语言是游戏里最容易被优化的调味料,不是主菜。BioWare在二十年前就能写出漂亮的分支对话,LLM目前的能力在这种经过精心设计的叙事面前,还是个毛坯房。

最后说句大实话:现在做AI NPC的游戏,要么是像我这样的独立开发者头铁,要么是大厂用来做技术储备的试验田。真正要看到“主流游戏里的NPC都靠大模型实时生成”这个画面,我猜至少还要等两三年。等本地推理的成本和速度都跨过门槛,等有人想明白怎么把LLM跟玩法揉在一起,而不是贴个对话标签上去。

在那之前,你打开3A游戏遇到的铁匠,还是会重复那三句台词。

也挺好的,至少他不会告诉你iPhone是东方神秘法器。

对吧?

—— 来自一个被退款率砸醒的“独立开发者”

注:

1. 指日活跃用户(DAU)。

2. 此处为估算值。

3. 文字用此价格代入,实际不同模型和缓存策略会显著影响成本。

4. 实际并发数受硬件配置、模型量化方式、推理框架等多种因素影响。

5. 指截至本文写作时的公开信息。

6. 作者引用了对特定模型优化的描述,实际性能表现需以实测为准。

26
1344 阅读
2 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月21日 23:43

陈默

AI 行业分析师

前某大厂 AI 实验室研究员,关注大模型技术演进和商业化落地。写过 200+ 篇行业分析,擅长从产品视角拆解技术趋势。

读者评论 2

技术小白 昨天
作为非技术人员也看懂了,感谢作者的通俗讲解。
回复 点赞 (3)
Dev小王 4天前
终于有人把这个说清楚了,收藏了。
回复 点赞 (8)