← 返回资讯
赵一鸣
产品评测编辑
已审核

生成式推荐是不是一个伪范式?

上周三晚上十一点,我差点把咖啡泼在键盘上!团队跟我扯一个线上实验的结果——我们在一路召回上换了生成式方案,AUC涨了0.1%,你猜怎么着?线上收入反而掉了0.3%!运营同学跑来问我:“这玩意儿到底行不行?”

生成式推荐是不是一个伪范式?

生成式推荐是不是一个伪范式?


生成式推荐:我踩过的坑和看到的真相

先说个真事儿,你坐稳了。

上周三晚上十一点,我差点把咖啡泼在键盘上!团队跟我扯一个线上实验的结果——我们在一路召回上换了生成式方案,AUC涨了0.1%,你猜怎么着?线上收入反而掉了0.3%!运营同学跑来问我:“这玩意儿到底行不行?”

我说,你这个问题啊,我十年前就被人问过。

那时候我刚入行,在搞双塔召回。老板盯着实验数据,脸拉得老长:“你这深度学习搞了半天,还不如我们16年的FM加稀疏化LR!”我当时憋了一肚子火,但数据摆在那儿,确实没人家好——又笨重,又危险,动不动就炸。

现在呢?双塔成了行业基线,新来的应届生都觉得这东西天经地义,就像呼吸一样自然。历史就是个轮回,你想想,当年质疑深度学习的那帮人,不是被说服了,是慢慢退出行业了。就像物理学上那个老梗——反对相对论的老登们不是被说服了,而是他们后来死了。

话糙理不糙,但就是这么回事儿。


一、生成式推荐到底是不是伪范式?

我直接说结论,你听好了:不是伪范式,但也不是万能药。

你看现在各家都在搞什么,数据一个比一个漂亮——

百度今年发了GRAB,CTR涨了3.49%,收入涨了3.05%。小红书搞了LASER,ADVV涨2.36%,收入涨2.08%。LinkedIn的Feed-SR,12亿会员在线,互动提升了3.52%。

数字都挺漂亮,对吧?但你仔细看,没有一家敢说自己全面替换了传统架构。快手搞OneRec算是激进的,也只在部分场景上线。抖音搞Mixtoken,保留了判别式目标,只是加了生成式loss。说白了,大家都在试探,没人敢梭哈。

为啥?我给你讲个亲身经历。

我测试过HSTU的复现。按照Meta的论文,把特征全塞进去,你猜结果怎样?效果还不如我们线上跑了三年的老模型!后来发现,人家的side info融合方式跟我们不一样,特征工程积累的东西全得推倒重来。你想想,一个团队花三年攒下来的特征工程经验,说扔就扔?老板不骂娘才怪!

更坑的是,有些论文根本复现不出来。我们试字节的HLLM,按照原文揣摩着搞,效果远低于双塔。后来怀疑是文本样本构造的问题,但东南亚小语种的数据,试错成本太高了,搞了两个月没结果,老板直接叫停。那一刻,我真想把论文打印出来烧了。


二、技术落地的坑,比想象的多

说到这儿,我告诉你一个秘密。

我面试了快两百人,问Transformer和GPU相关的问题。校招大概一半能答个大概,真正懂的不超过30%。社招更惨,能说清楚的不超过30%,让我觉得这人真懂的不到10%。

这说明什么?行业的认知积累还远远不够。

就像当年深度学习刚火的时候,能写TensorFlow的人凤毛麟角。后来这批人成了行业主力,技术才慢慢变成基线。翁家翌说过一句话我特别认同:“每家LLM的Infra都有不同程度的bug,谁修的bug越多、修得越快,谁的模型就训得越好。”

推荐系统也一样。关于生成式推荐的认知够了,Infra里的bug修得差不多了,它自然就变成强基线了。但现在,认知不到位,Infra也不到位。

我见过最离谱的事,你听了别笑——某大厂的推荐系统MFU不到1%。你没看错,不到1%!算力全浪费在碎片化的级联架构上了。召回、粗排、精排、重排,每层一个模型,每个模型都吃不饱,但加起来占的资源不少。

这就是传统架构的硬伤。但你要改?涉及到线上推理系统、线下训练系统、数据系统,一大串中间件全得动。工业界的技术决策都是不见兔子不撒鹰的,没有实打实的商业价值,谁也不敢动。


三、生成式推荐的优势到底在哪?

说实话,现阶段生成式推荐在效果上并没有碾压传统架构。

传统架构依托超大规模的特征工程和各种奇妙的链路组合,也能实现类似的效果。你加一路生成式召回,可能涨0.5%,但人家加一路特征交叉,也能涨0.3%。差距没那么大。

那生成式的优势在哪儿?你猜对了——计算效率。

端到端的生成式架构,能把MFU从1%拉到10%甚至更高。这意味着同样的算力,能处理更多的请求,或者同样的请求,能跑更复杂的模型。在互联网公司,算力就是钱。

另外,生成式范式天然支持scaling law。传统架构的模型参数做大了,效果就饱和了。但生成式模型,你给它更多数据、更大参数,效果还能涨。这事儿Meta在HSTU论文里验证过,数据摆在那儿,你不服不行。

当然,也有局限。推荐系统的交互模式决定了,你不能像ChatGPT那样让用户等半天。毫秒级的响应时间,模型参数的天花板很快会被在线推理耗时的硬门槛锁死。模型参数扩大十倍,只带来千分位的AUC提升,这个ROI老板是不会批的。你想想,花一千万买0.1%的AUC?老板不抽你才怪。


四、我的判断

说到这儿,我给你交个底。

生成式推荐不是伪范式,但也不会一蹴而就。它大概率会走LLM的老路:先验证数据配方和scaling law,再验证训练方法和策略,最后验证推理能力。现在行业基本还在第一阶段,少数公司走到了第二阶段。

我个人的建议是,别盲目跟风。 先搞清楚自己的baseline优化到什么程度了,用户习惯、场景特性、数据规模各不一样,别人的经验很难直接迁移。我们试了那么多方案,最后发现最有效的反而是把上下文工程做好,再加一路生成式召回。

说白了,生成式推荐是个好东西,但得慢慢来。就像当年深度学习一样,它不是一天就变成基线的,是随着行业认知的积累和Infra的完善,慢慢成为主流的。

那些说生成式推荐是噱头的人,要么是没踩过坑,要么是踩了坑没爬起来。而那些说生成式推荐马上就能替代一切的人,大概率没做过线上系统。

事儿得一点一点干,坑得一个一个填。该来的,总会来。

但记住——别等风来了才造帆,也别以为风来了就能飞。

434
14479 阅读
5 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月22日 18:15

赵一鸣

产品评测编辑

前产品经理,现专注 AI 工具评测。实测过 30+ 款 AI 产品,擅长横向对比和用户体验分析。

读者评论 5

运营小陈 6天前
转发到团队群了,大家都觉得有参考价值。
回复 点赞 (4)
数据分析师 1周前
数据引用很扎实,建议补充一下近三个月的最新数据。
回复 点赞 (9)
产品经理阿杰 1周前
从产品角度看,这个方向确实有机会,但商业化路径还需要验证。
回复 点赞 (15)
张工 昨天
写得很实在,特别是实测对比那部分,跟我自己的使用感受一致。
回复 点赞 (12)
前端工程师 4天前
代码示例很清晰,直接用到项目里了。
回复 点赞 (6)