← 返回资讯
陈默
AI 行业分析师
已审核

什么是LoRA模型,如何使用和训练LoRA模型?你想要的

你看,第一次遇上LoRA,我整个人是懵的。

什么是LoRA模型,如何使用和训练LoRA模型?你想要的

什么是LoRA模型,如何使用和训练LoRA模型?你想要的


你看,第一次遇上LoRA,我整个人是懵的。

满脑子就一个问题:这玩意儿跟那些动不动就几个G的大模型,到底差在哪儿?我找资料,翻帖子,踩坑踩到膝盖都碎了,才算是把它整明白了。今天咱不绕弯子,从概念到实操,我把吃过的大亏和攒下来的经验全摊在桌上——你坐好了,听我慢慢说。

LoRA到底是啥

别被“Low-Rank Adaptation”这个学术名吓到。说白了,LoRA就是给Stable Diffusion大模型打补丁的一种方式。

大模型是骨架,LoRA是肌肉。

你想想,训练的时候不动骨架本身,只在关键连接处加几根小绳子——低秩矩阵。用的时候把绳子一接,效果就变了。

这玩意儿最早是给NLP用的。当时的GPT-3,参数量上千亿,重新训练一次够买套房。LoRA的思路多聪明?就训练那几个百兆级别的低秩矩阵,插进原模型就能干活。后来被AI绘画社区拿来用在SD上,效果出奇地好。

你猜怎么着?C站上SD大模型一共才两千多个,剩下的四万多全是LoRA之类的小模型!

我手上在用的水墨画风格、八重神子IP,全是LoRA搓出来的。一个LoRA文件通常只有144MB左右,跟SD大模型动辄2GB起步比起来——简直是小U盘对抗大硬盘。

但!有一个天大的前提:LoRA必须配合底模用,底模版本也得对上。你用SD1.5训练的LoRA,就不能用在SDXL上,否则出来的是鬼片。这话我喊过一次、两次、三次——真的,版本不匹配,画面直接变恐怖片。

怎么用LoRA

大部分人用的都是stable-diffusion-webui。操作很简单:把下载的.safetensors文件丢到models/Lora目录,生图的时候在Prompt里写

权重一般设在0.6到1.0之间,调太高容易画面崩。这句话说我心坎上——我第一次设了1.5,出来的图脸都炸了。

C站被墙之后,我开始用aigccafe.com这个镜像站,国内直接访问,下载速度也不错。下LoRA的时候一定看清标注的Base Model是SD 1.5还是SDXL——别拿混了。

说到这儿,我插一句:你有没有遇到过那种情况,花了一堆时间下完LoRA,导入后生成出来的脸就像打上了马赛克?八成就是底模版本搞错了。这道理跟U盘插错接口一个样——接口对了,一下就识别;接口不对,啥都读不出来。

训练自己的LoRA

好,重头戏来了。这玩意儿我前后折腾了整整一个月。

试过秋叶的SD-Trainer、朱尼酱的赛博丹炉、还有OneTrainer——每一步都是血泪史。现在我把经验全倒出来给你看。

第一步:素材收集

我一开始图省事,从网上扒了20张图就开练。

结果呢?模型只能复现那几张的角度,换个光线就直接崩掉——那一刻,我对着屏幕骂了十分钟。

后来老老实实按规矩来:

你看,其实道理特简单:你想让模型学会你,而不是学会背景里的那盆花。

第二步:打标与正则化

这是最容易踩坑的地方,踩一次就能教你做人。

社区里很多人说标签越少越好,甚至有人只写一个触发词。我刚开始也信了——结果呢?模型严重过拟合,只认识那几张图,换个背景就翻车。

后来我想通了:标签太少,模型就像只记得标准答案的学生,你没考原题,它直接交白卷。

正确做法是什么?先用wd14 tagger自动打标,然后手动检查,把不相关的标签去掉。但也别把环境标签全删光——保留一些,有助于模型理解场景关联。

正则化这块儿,我刚开始完全没配。

结果训练出来的LoRA只要调用那个类别词(比如“1girl”),就只出训练集里的那张脸,连衣服都固定了。你说气不气人?

后来照Dreambooth的套路:先在底模上用“1girl”生成了200张风格各异的女孩子图片扔进正则化文件夹,再训练。然后呢?练出来的LoRA就稳多了!

我感叹一句:这事儿就像教小孩认脸——你光给他看你全家的合照,他就以为全世界都长这样;你多让他看各种人的照片,他才学会真正的“人脸”是什么。

第三步:工具选择与参数配置

市面上主流的训练工具有三套,每套我都用过,每套我都有话说。

秋叶的SD-Trainer

对新手最友好,全中文界面,一键配置。不过我有时候会遇到报错,基本靠重启解决。它内置了大部分超参,懒得折腾的话,直接默认就能出不错的LoRA。

朱尼酱的赛博丹炉

我个人最推荐的一款。界面炫酷,操作直观,而且作者更新很勤。它可以直接预览训练过程中的效果图——每50步出一张,方便随时中断调整。里面内置了“人物”“建筑”等预设,连TAG编辑器都带翻译功能。唯一的坑是训练集目录不能有中文,否则报路径错误。

OneTrainer

如果你喜欢自己调参,可以试试这个。它支持SDXL转SD格式的缩放,但我第一次用的时候缩放器不管用,后来发现是版本问题,更新后就正常了。OneTrainer的配置比较细,比如r(秩)、lora_alphalora_dropout都需要手动设。我一般r=8alpha=16dropout=0.1起步,显存够的话再往上加。

说到这儿,就不得不提一个反直觉的真相——你觉得越复杂越专业,其实适合自己才最好。秋叶适合新手,赛博丹炉适合爱折腾的人,OneTrainer适合想较真的大神。你是什么水平,你选什么工具,跟别人说的完全没关系。

第四步:训练参数精调

好,这一步最讲究。

基础模型(底模)

这是最关键的。很多人拿二次元底模去练人物LoRA,结果只能搭配二次元模型用。我建议直接用官方Stable Diffusion 1.5或SDXL作为底模,泛化性最强。如果你需要特定风格,也可以选对应的大模型,但泛化性会下降。

分辨率

默认512x512,练SDXL就上1024x1024。练真人我一般用512x768。

Epoch与重复次数

我试过20张图,重复100次,训练20个epoch,结果严重过拟合。后来改为重复20次,epoch设到40,效果就好多了。关键看图片的数量和质量——图好、差异大,可以少重复。

学习率

秋叶默认1e-4,赛博丹炉默认1e-5。我一般从1e-4开始,如果loss降不下去就改成1e-5。用OneTrainer时试过cosine衰减,效果比恒定学习率好。

分层训练

如果你只想学画风,可以固定底层,只调上层。赛博丹炉有现成的分层训练选项,勾上就行。

这些参数很细,但别怕。我一开始也烦这些破参数,后来发现调好的那一瞬间,什么烦躁都值了。

第五步:测试与迭代

训练完之后别急着高兴,至少用三四个不同的底模生成一下,看看泛化能力。

我练的一个“胶片风格”LoRA,在SD 1.5上效果爆好,换到SDXL上偏色严重。后来重新用SDXL底模训练才解决。

如果发现过拟合,可以试试:

你看,这事儿就像煲汤——第一次没煲好就别急着喝,加点料再熬熬,总能熬出那个味儿来。

说说那些忽悠人的误区

最流行的说法是“标签越少LoRA效果越好”。

我亲测过同一组图片:一组只保留一个触发词,另一组保留了完整标签(“1girl, 长发, 微笑, 户外, 阳光”)。

结果呢?少标签的LoRA在原始底模上表现尚可,但一旦换模型或换构图,瞬间翻车;多标签的那个在所有测试里都稳如狗。

别信那些玄学——标签精细反而能帮模型理解特征与背景的关系,提高泛化性。

还有一个误区是“训练集越多越好”。我有个朋友一次塞了200张图,跑了几天几夜,出来的LoRA啥也学不会——因为图片质量参差不齐,模型学成了平均脸。

宁缺毋滥。30张高品质比300张糊图强十倍。这话你能信几分?

未来走向

现在社区已经全面向SDXL迁移,LoRA训练也从命令行工具转向一键工具。赛博丹炉、SD-Trainer都在更新XL支持,OneTrainer也做了适配。

我预计接下来半年,LoRA会进一步简化,甚至像插件一样在线下载即用。但同时,随着模型越来越复杂——比如FLUX系列——LoRA可能也会出现新的变体,比如用Q-LoRA减少显存,或者在训练时自动筛选质量图片。

训练成本也一直在降。即便是个人开发者,用一张8G显存的显卡也能跑SDXL的LoRA,无非慢一点。我自己就是2060 Super,128x128的分辨率跑一个epoch大概3分钟,训练40个epoch也就两小时。

如果你是新手,不妨直接从秋叶整合包或者赛博丹炉上手——少走我当年的弯路。

说实话,LoRA不是什么高科技魔法,它就是降低定制化门槛的好工具。只要素材用心,参数不瞎调,你也能练出自己的专属模型。

有问题欢迎评论区交流,看到就会回。

但,说到这儿,我最想告诉你的是这样一句话——

到那时候,你会发现——你的想象力有多大,这个工具就有多大。LoRA不是魔法,它是你手里那根听话的画笔。

824
13748 阅读
2 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月21日 23:08

陈默

AI 行业分析师

前某大厂 AI 实验室研究员,关注大模型技术演进和商业化落地。写过 200+ 篇行业分析,擅长从产品视角拆解技术趋势。

读者评论 2

A
AI研究员 5天前
观点有道理,不过我觉得还需要考虑算力成本的问题。
回复 点赞 (11)
M
创业者Mark 1周前
正在做相关方向,这篇文章给了我不少启发。
回复 点赞 (7)