← 返回资讯
赵一鸣
产品评测编辑
已审核

复旦大学邱锡鹏教授团队:Transformer最新综述

去年有个读者给我发私信,说自己面大模型岗位,被问到“Transformer有哪些改进方向”那一刻,脑子直接卡壳。憋了半天,只挤出来一个Reformer。面完出来一搜——好家伙!邱锡鹏老师团队2021年就发过一篇Transformer综述,光分类就分了三个维度,覆盖上百种模型,写得明明白白。这位兄弟当场破防。

复旦大学邱锡鹏教授团队:Transformer最新综述

复旦大学邱锡鹏教授团队:Transformer最新综述


你知道吗?Transformer改进方向,光分类就能分三个维度

先跟你说个事儿。

去年有个读者给我发私信,说自己面大模型岗位,被问到“Transformer有哪些改进方向”那一刻,脑子直接卡壳。憋了半天,只挤出来一个Reformer。面完出来一搜——好家伙!邱锡鹏老师团队2021年就发过一篇Transformer综述,光分类就分了三个维度,覆盖上百种模型,写得明明白白。这位兄弟当场破防。

我看着这条消息,笑了。不是因为嘲笑他,而是我太懂了。

这篇综述首发那天我就下载了。打开,看了十分钟——啪!关上了。说实话,2021年那会儿Transformer变体还没现在这么爆炸,但那篇论文背后已经整理了不下200篇文献。你想一口气啃完?得啃出工伤来。

后来呢?我断断续续读了半年,三遍下去才算真正用上了。今天不聊高大上的理论,就跟你聊聊这篇综述怎么读、值不值得读,还有我踩过的那些坑。


2017-2021:Transformer的“百家争鸣”,那叫一个热闹

先回顾一下背景,你看,2017年《Attention Is All You Need》一出来,所有人就像打了鸡血一样往里塞东西。有人改注意力结构,有人折腾位置编码,有人把层归一化翻出花来。到了2020年,光改进方向的论文就突破200篇!而且每篇都有一个花里胡哨的名字——Performer、Reformer、Linformer、Longformer、BigBird……我的天,这些X-former简直像从字母表里往外蹦。

学界的核心诉求其实很单纯,就三个:

1. 长序列跑不动——self-attention复杂度O(n²),遇上长文本直接当场跪下。怎么办?上稀疏注意力、线性注意力这些花活儿。

2. 小数据泛化差——Transformer太能吃数据了,小样本上想见效,必须加正则化或者搞预训练。

3. 领域适配难——翻译上效果不错,可扔到CV、音频甚至科学计算里,得动手改到亲妈都不认识。

但问题来了——这么多改进方向,互相交叉、互相缠绕,光追踪论文就够你喝一壶的。我当时在做BERT蒸馏实验,想找找有没有类似的注意力压缩方案,翻了两天论文愣是没找到系统性对比。你想想,那种感觉,就像在黑屋子里瞎摸,还摸不到开关。

这时候,邱锡鹏团队的这篇综述,算是给这个领域画了一张完整的地图


这篇综述到底讲了啥?三个角度,清清楚楚

第一,架构层面的修改。 注意力机制、位置编码、FFN、层归一化——每个模块都能独立拆改。综述把这些变体按“改了什么模块”归类,就像搭乐高一样告诉你:A家换了位置编码,B家把FFN拆成块,C家直接用哈希算注意力。一目了然!

第二,预训练层面的改进。 从BERT到GPT,再到各种花式预训练目标,综述梳理了Mask Language Model、Auto-regressive、Seq2Seq三种范式的演进。我读完之后最大的收获是什么?原来早期预训练策略跟模型架构是脱钩的!同一套Transformer骨架,挂不同的预训练目标,出来的模型性格完全不同——就像同一个人换上不同的衣服,气质天差地别。

第三,应用层面的适配。 NLP是老家,但CV、语音、多模态、甚至蛋白质序列都在搞Transformer化。综述把每个领域的典型适配方法点了一遍:比如Vision Transformer怎么处理图像patch,Swin怎么用分层注意力省资源。这些都是实打实的干货。

我读第一遍的时候,就按这个分类框架做了一个思维导图。后来再查论文,先把论文往这个分类里一丢,就能快速定位到类似的工作。效率至少提了一倍!你说值不值?


我的踩坑记录:千万别从第一章硬啃!

结论先给你:别从第一章硬啃。

为什么?我第一遍就是这么读的。按摘要、介绍、背景、分类法,顺序往下读——不到五页,差点睡着。论文里堆满数学符号,激活函数对比散得到处都是,引用密度高到每句话后面都挂着[1][2][3]。读完之后你发现脑子一片空白,跟没读一样。

第二遍我换了策略:先跳到最后看未来方向,再回到注意力改进的章节精读。一下就通了!

具体怎么读?我跟你分享三个方法:

第一,遇到一个变体(比如Sparse Transformer),立马去搜代码或者找别人的复现笔记。 上“迷途小书僮”那套系列文章就是按这篇综述的结构写的,每个章节掰开揉碎讲,配合着看,能省不少力。别自己硬扛。

第二,注意力复杂度改进那块,我直接拿iPad画对比图。 哪种方法用在什么场景?O(n)还是O(n log n)?需要额外训练还是即插即用?画完脑子就清晰了。文字记不住的,图能一笔画明白。

第三,位置编码部分,我翻到后面,直接跳过绝对位置编码的公式(这部分邱老师那本《神经网络与深度学习》讲得更清楚),只看相对位置编码和旋转位置编码的对比。 不浪费时间去啃你已经懂的地方。

第三遍,我是带着问题读的。

当时我在搞一个长文档分类项目,序列长度能到8192。原版Transformer直接炸显存,根本跑不了。我在综述里定位到“分而治之方法”那一节,看到了Transformer-XL和Compressive Transformer的思路——用循环机制分段处理长序列。我顺着引用找了原论文,花两天时间实现了实验,成功把处理长度从512推到了4096。

你发现没有?这篇综述对我真正有用的地方就在这里:它不只是一个总结,更是一个索引。你把问题带进去,能快速找到历史上有哪些人试过类似的方案,他们为什么没成功,瓶颈在哪。这才叫真正用起来了。


到今天(2026年),Transformer还够用吗?

最近很多人问:Mamba、RWKV、线性复杂度模型都出来了,Transformer是不是要退场了?

我的看法很直接:还早呢!

你想啊,这篇综述里提到的很多改进方向,后来被证明比预期的更值钱。比如Flash Attention(虽然综述发布时还没出现)让注意力计算速度翻了好几倍,直接让O(n²)在工程上变得不那么疼。再比如LayerNorm的RMS替代方案、GLU激活函数——这些细致入微的微调,让Transformer的潜力被挖了一层又一层。

你看OpenAI、Google、Meta这波大模型,核心骨架仍然是Transformer,只是修修补补。你改得再花,Attention这个钉子户还在里面稳坐江山。

当然,新架构确实在特定场景有优势——比如Mamba在超长序列上比Transformer更省资源。但我认为未来的趋势是混合:把注意力机制和状态空间模型结合起来。这篇综述在“未来方向”里其实就提到了类似的思路,当时没引起重视,现在回头看——啧啧,算是一种预言。

所以你说Transformer要退场?我觉得还早。它只是进化了。


给读者的建议:你要不要读,怎么读

如果你只是个C端用户、API侠,那读不读这篇综述无所谓,调接口不耽误事。你只要会用就行,不需要知道发动机怎么造的。

但如果你想搞懂了再去用——比如微调模型、做推理优化、或者判断一个新发的X-former到底有没有价值——那这篇综述绕不过去。花一周时间,把它当地图翻一遍,比你瞎看200篇论文的摘要高效得多。

说个实操技巧:这篇综述有个配套的GitHub仓库,整理了论文表格和部分代码实现。我一般先看概览表格,挑出自己关心的分类,再去读对应章节。直接从PDF开始啃容易迷路——别问我怎么知道的。

最后多嘴一句:邱锡鹏老师那本《神经网络与深度学习》,写Transformer的那一章可以和这篇综述配合看。一个讲基础,一个讲变体,两个放一起,够你搭出一整套认知框架了。

反正,我书架上那本已经翻烂了。


你看,真正的问题从来不是“Transformer够不够好”,而是你手上有没有它的地图,和打开地图的勇气。 🚀

920
13147 阅读
5 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月23日 05:58

赵一鸣

产品评测编辑

前产品经理,现专注 AI 工具评测。实测过 30+ 款 AI 产品,擅长横向对比和用户体验分析。

读者评论 5

前端工程师 1周前
代码示例很清晰,直接用到项目里了。
回复 点赞 (6)
技术小白 1周前
作为非技术人员也看懂了,感谢作者的通俗讲解。
回复 点赞 (3)
Dev小王 2周前
终于有人把这个说清楚了,收藏了。
回复 点赞 (8)
A
AI研究员 3天前
观点有道理,不过我觉得还需要考虑算力成本的问题。
回复 点赞 (11)
M
创业者Mark 6天前
正在做相关方向,这篇文章给了我不少启发。
回复 点赞 (7)