大模型超详细解读 (目录)
还记得2019年那个夏天吗?我坐在出租屋的破椅子上,对着GPT那篇论文啃了一整天,然后兴奋地在敲下第一篇解读。你猜怎么着?我原以为这只是个一时兴起的笔记——结果三年过去了,这个系列我还在写,还在更新,而且越写越停不下来!
今天这篇,没有高大上的理论。就想跟你好好聊聊,我做这个「大模型超详细解读(目录)」系列踩过的那些坑,还有实操后的一些真话。
第一关:一开始,我根本没想到要做目录
你肯定以为,写系列文章要先规划好目录对吧?大错特错!
当年写第一篇GPT解读(2019年),我压根没想过搞什么系列。结果读者追着问:下一期呢?怎么没下文了?我才开始着急。于是老老实实开始搭目录。
我的原则说出来你可能不信:不按时间线,按重要性和联系。
把GPT、GPT-2、GPT-3串在一起——参数量从1.17亿一路飙到1750亿,训练数据从5GB膨胀到45TB。我拉了个表格,往那儿一摆,对比一目了然。然后LLaMa、OPT这些开源复刻版自然排在后边。Mamba系列是新冒出来的方向,2024年才火,单独开一条线。MoE系列呢,是碰上了华为诺亚方舟实验室那篇知识蒸馏的paper,顺手加了进去。
实操小秘密:我在Notion里建了一张大表,每篇论文一张卡片:标题、发表时间、代码链接、关键结论、自己打星。写作时就按这个表排序,保证不打架。
但坑也踩得不少。一开始我贪多,把Diffusion和Vision Transformer全塞进同一个目录——你猜结果怎么着?读者翻到一半就骂娘!后来学乖了:每个模型家族开一个系列,内部用小节分开。目录得像书架一样分层,找东西才快。
第二关:写一篇解读到底要多久?说出来别怕
平均一篇15到20小时。不是整天坐着写那种,是下班后熬夜加班挤出来的碎片时间。你以为把论文翻译一遍就完了?太天真了!
我给你拆开看:
- 粗读论文 + 画思维导图:2小时
- 复现关键实验(如果代码干净):3~5小时
- 整理公式和架构图:3小时
- 写成文章,加背景和吐槽:5小时
- 校对 + 排版 + 跑的公式渲染:2小时
以写LLaMA那篇为例。Meta吹说13B就能吊打GPT-3的175B。我当时就不信!二话不说,拿他们给的数据在huggingface transformers 4.28.0上跑了一遍zero-shot评测。结果呢?某些基准确实接近,但没paper吹得那么神。我没在文章里直接写“骗人”,而是把真实分数差摆了出来,还加了一句猜测:可能是训练数据更干净、更新。后来评论区炸了,好多人赞同,也有人私信来讨论。
重点:别光复述论文,一定要有自己的实验或观察。哪怕只是跑个demo,也算。否则你写的东西跟机器翻译有什么区别?
第三关:那些你想都想不到的坑
公式和排版
的LaTeX渲染,尤其是多行公式、矩阵,能把人气死。你明明写对了,一发布就乱码。我一开始不知道,被投诉了好几次。后来发现一个土办法:全部用代码块包裹LaTeX,或者直接截图。可截图不好更新啊!于是我在文章开头加了一句:“本文永久链接,公式问题请直接看PDF。”——你别说,这招真管用。
目录更新不及时
每隔两个月我集中更新一次目录。有时候新论文上线了,拖了两周没加进去,后台就有人骂:“说好的持续更新呢?”确实是我的问题。后来我设了每月第一个周日的闹钟强制更新。现在目录里每个section后面都有最后的更新日期。
转载和授权
我的系列授权给了极市平台,所以他们转载必须经过我同意。写系列也要注意版权,尤其是引用别人的图和公式,最好改画成自己的风格。在Mamba那篇文章里,我自己画了状态空间模型的流程图——虽然丑,但不会被投诉,心里踏实。
第四关:怎么判断一篇论文值不值得写进目录?
现在arxiv上每天几十篇大模型相关,全写不现实。我给自己定了三条线:
1. 影响力:这个方法有没有被后续大量工作引用?比如GPT系列、Mamba。看Google Scholar大概能知道。
2. 开源程度:如果代码和数据集全闭源,我写起来费劲,读者复现也难——除非paper本身有开创性。LLaMa最初只开源了权重,我也写了,因为效果摆在那。
3. 学习性价比:这篇论文的idea是否独立?还是只改了个激活函数、换了个数据集?后者我一般不单独成篇,顶多在展望里提一句。
举个例子,MambaOut那篇(Mamba系列Section 1)问了个好问题:“视觉任务真的需要Mamba吗?”这是讨论性文章,结论不一定对,但它逼着你去思考token mixing的本质。这种文章我写起来带劲,读者也爱看吵起来的评论区。说实话,这种比单纯刷榜的paper有价值多了。
第五关:读者才是最好的串讲人
评论区经常有人问“怎么没写DPO?”“MoE那部分的参数怎么理解?”有些问题直接点出了我的遗漏。
比如GPT-2那篇,我一开始漏了“零样本多任务学习”的分段解释。有个读者在楼下贴了一个实验对比图,我一看——自己确实漏了一块,马上补了一整段进去。这种被读者推动着进步的感觉,太爽了!
个人小技巧:每次更新文章后,我在目录页面开头写一行update log,比如“2024.5.12 更新Mamba寄存器文章”。读者一眼就知道新东西在哪。这个简单的习惯帮我攒了不少信任。
说到这儿,你可能会问:这么累,图什么?
说真的,写这个系列最累的不是读论文,是长期坚持。尤其是半夜改公式、排版被平台吞掉、被同行指出错误——那种挫败感我经历过太多次。但看到后台有人说“因为你这篇我懂了MHA和MQA的区别”,还是会觉得:值了!
如果你想搞类似的系列,我的建议是:
- 别求全,挑20%重要的写深写透就行。
- 目录索引必须做,既方便读者,也是你自己知识骨架的迭代。
- 写每个系列之前,花点时间定好范围和边界,别像我一开始那样什么都往里塞。
- 工具方面,我目前用VSCode + Markdown,公式用MathJax,图用draw.io或excalidraw——简陋但顺手。
最后,这个目录我至今还在维护。今天翻出来看,从GPT写到Mamba,从5GB数据聊到45TB,挺多感慨。大模型这个圈跑得太快,写解读本质上是在帮未来的自己存档。
你一定要记住:你写的每一篇解读,不只是给别人看的,更是给将来的自己留的一份礼物。
读者评论 5