← 返回资讯
赵一鸣
产品评测编辑
已审核

大模型超详细解读 (目录)

还记得2019年那个夏天吗?我坐在出租屋的破椅子上,对着GPT那篇论文啃了一整天,然后兴奋地在敲下第一篇解读。你猜怎么着?我原以为这只是个一时兴起的笔记——结果三年过去了,这个系列我还在写,还在更新,而且越写越停不下来!

大模型超详细解读 (目录)

大模型超详细解读 (目录)


还记得2019年那个夏天吗?我坐在出租屋的破椅子上,对着GPT那篇论文啃了一整天,然后兴奋地在敲下第一篇解读。你猜怎么着?我原以为这只是个一时兴起的笔记——结果三年过去了,这个系列我还在写,还在更新,而且越写越停不下来!

今天这篇,没有高大上的理论。就想跟你好好聊聊,我做这个「大模型超详细解读(目录)」系列踩过的那些坑,还有实操后的一些真话。


第一关:一开始,我根本没想到要做目录

你肯定以为,写系列文章要先规划好目录对吧?大错特错!

当年写第一篇GPT解读(2019年),我压根没想过搞什么系列。结果读者追着问:下一期呢?怎么没下文了?我才开始着急。于是老老实实开始搭目录。

我的原则说出来你可能不信:不按时间线,按重要性和联系

把GPT、GPT-2、GPT-3串在一起——参数量从1.17亿一路飙到1750亿,训练数据从5GB膨胀到45TB。我拉了个表格,往那儿一摆,对比一目了然。然后LLaMa、OPT这些开源复刻版自然排在后边。Mamba系列是新冒出来的方向,2024年才火,单独开一条线。MoE系列呢,是碰上了华为诺亚方舟实验室那篇知识蒸馏的paper,顺手加了进去。

实操小秘密:我在Notion里建了一张大表,每篇论文一张卡片:标题、发表时间、代码链接、关键结论、自己打星。写作时就按这个表排序,保证不打架。

但坑也踩得不少。一开始我贪多,把Diffusion和Vision Transformer全塞进同一个目录——你猜结果怎么着?读者翻到一半就骂娘!后来学乖了:每个模型家族开一个系列,内部用小节分开。目录得像书架一样分层,找东西才快。


第二关:写一篇解读到底要多久?说出来别怕

平均一篇15到20小时。不是整天坐着写那种,是下班后熬夜加班挤出来的碎片时间。你以为把论文翻译一遍就完了?太天真了!

我给你拆开看:

以写LLaMA那篇为例。Meta吹说13B就能吊打GPT-3的175B。我当时就不信!二话不说,拿他们给的数据在huggingface transformers 4.28.0上跑了一遍zero-shot评测。结果呢?某些基准确实接近,但没paper吹得那么神。我没在文章里直接写“骗人”,而是把真实分数差摆了出来,还加了一句猜测:可能是训练数据更干净、更新。后来评论区炸了,好多人赞同,也有人私信来讨论。

重点:别光复述论文,一定要有自己的实验或观察。哪怕只是跑个demo,也算。否则你写的东西跟机器翻译有什么区别?


第三关:那些你想都想不到的坑

公式和排版

的LaTeX渲染,尤其是多行公式、矩阵,能把人气死。你明明写对了,一发布就乱码。我一开始不知道,被投诉了好几次。后来发现一个土办法:全部用代码块包裹LaTeX,或者直接截图。可截图不好更新啊!于是我在文章开头加了一句:“本文永久链接,公式问题请直接看PDF。”——你别说,这招真管用。

目录更新不及时

每隔两个月我集中更新一次目录。有时候新论文上线了,拖了两周没加进去,后台就有人骂:“说好的持续更新呢?”确实是我的问题。后来我设了每月第一个周日的闹钟强制更新。现在目录里每个section后面都有最后的更新日期。

转载和授权

我的系列授权给了极市平台,所以他们转载必须经过我同意。写系列也要注意版权,尤其是引用别人的图和公式,最好改画成自己的风格。在Mamba那篇文章里,我自己画了状态空间模型的流程图——虽然丑,但不会被投诉,心里踏实。


第四关:怎么判断一篇论文值不值得写进目录?

现在arxiv上每天几十篇大模型相关,全写不现实。我给自己定了三条线:

1. 影响力:这个方法有没有被后续大量工作引用?比如GPT系列、Mamba。看Google Scholar大概能知道。

2. 开源程度:如果代码和数据集全闭源,我写起来费劲,读者复现也难——除非paper本身有开创性。LLaMa最初只开源了权重,我也写了,因为效果摆在那。

3. 学习性价比:这篇论文的idea是否独立?还是只改了个激活函数、换了个数据集?后者我一般不单独成篇,顶多在展望里提一句。

举个例子,MambaOut那篇(Mamba系列Section 1)问了个好问题:“视觉任务真的需要Mamba吗?”这是讨论性文章,结论不一定对,但它逼着你去思考token mixing的本质。这种文章我写起来带劲,读者也爱看吵起来的评论区。说实话,这种比单纯刷榜的paper有价值多了。


第五关:读者才是最好的串讲人

评论区经常有人问“怎么没写DPO?”“MoE那部分的参数怎么理解?”有些问题直接点出了我的遗漏。

比如GPT-2那篇,我一开始漏了“零样本多任务学习”的分段解释。有个读者在楼下贴了一个实验对比图,我一看——自己确实漏了一块,马上补了一整段进去。这种被读者推动着进步的感觉,太爽了!

个人小技巧:每次更新文章后,我在目录页面开头写一行update log,比如“2024.5.12 更新Mamba寄存器文章”。读者一眼就知道新东西在哪。这个简单的习惯帮我攒了不少信任。


说到这儿,你可能会问:这么累,图什么?

说真的,写这个系列最累的不是读论文,是长期坚持。尤其是半夜改公式、排版被平台吞掉、被同行指出错误——那种挫败感我经历过太多次。但看到后台有人说“因为你这篇我懂了MHA和MQA的区别”,还是会觉得:值了!

如果你想搞类似的系列,我的建议是:

最后,这个目录我至今还在维护。今天翻出来看,从GPT写到Mamba,从5GB数据聊到45TB,挺多感慨。大模型这个圈跑得太快,写解读本质上是在帮未来的自己存档。

你一定要记住:你写的每一篇解读,不只是给别人看的,更是给将来的自己留的一份礼物。

368
12283 阅读
5 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月23日 11:10

赵一鸣

产品评测编辑

前产品经理,现专注 AI 工具评测。实测过 30+ 款 AI 产品,擅长横向对比和用户体验分析。

读者评论 5

产品经理阿杰 1周前
从产品角度看,这个方向确实有机会,但商业化路径还需要验证。
回复 点赞 (15)
张工 1周前
写得很实在,特别是实测对比那部分,跟我自己的使用感受一致。
回复 点赞 (12)
前端工程师 2天前
代码示例很清晰,直接用到项目里了。
回复 点赞 (6)
技术小白 5天前
作为非技术人员也看懂了,感谢作者的通俗讲解。
回复 点赞 (3)
Dev小王 1周前
终于有人把这个说清楚了,收藏了。
回复 点赞 (8)