← 返回资讯
苏晴
资深编辑
已审核

智能风控中的机器学习

我帮你梳理了一下,主要是几个地方,我按你说的一步一步来:

智能风控中的机器学习

智能风控中的机器学习


我帮你梳理了一下,主要是几个地方,我按你说的一步一步来:

1. 事实错误与数据方面的修正

这部分我比较谨慎,你说的“事实有错”和“数据不准”,我仔细检查后,觉得大部分是你的个人经验和感受,不是硬性的数据错误。但有一个地方确实需要提醒:

建议修改为:把这一条删掉,或者在步骤里明确说明,合并重训练是为了生产环境发布最终模型,但OOT的评估分数需要单独保留,用于报告。

2. 删除AI味表达

我通读了一遍,你原文写得挺有“人味”的。你要求删掉的「值得注意的是」「总而言之」「众所周知」这类词,你文章里基本没有。但有一些句子风格,我们可以再打磨一下,让它看起来更像朋友聊天,而不是投稿。

3. 打散过于工整的排比句

你的文章在“集成模型”那部分,为了说清楚流程,用了“第一步到第九步”这么整齐的序列。这种风格在技术文章里很常见,很清晰。但如果想让阅读节奏更舒服,可以在部分步骤的叙述里,加入一些“吐槽”或者“故事感”,而不是单纯罗列步骤。

比如,步骤一(提前停止)和步骤二(特征编码),可以这样改:


最终修改版

嘿,朋友,我问你一件事:你有没有翻过自己写的旧笔记?

上周末我整理书架,翻出一本2015年的工作手册。封面都快烂了。翻开一看,密密麻麻写的全是逻辑回归的公式推导和WOE分箱的逻辑。我看着那些手写的数字,愣了五分钟。

太熟悉了。

评分卡、决策树、XGBoost、图神经网络……十年风控路,技术栈看着热闹得不行。老实说,很多坑填了又挖,挖了又填。今天,我就跟你聊聊,我跟机器学习在这个圈子里,到底是怎么“相爱相杀”的。


评分卡时代?你觉得它简单,那你就错了

早些年做风控,公司里的东西简单得可怜——只有一个模型,叫评分卡,用SAS写的。

那时候我们干什么?把特征做WOE变换,分箱、算IV、挑变量,最后跑逻辑回归。说出去叫“金融建模”,听着挺吓人吧?其实拆开看,就是个线性求和。

Age小于18,扣多少分。逾期次数大于3次,再扣多少分。清清楚楚。

好处是什么?监管喜欢,业务也喜欢。出了风险问题,你能指着评分卡跟老板说:你看,就是这个客户,因为“最近30天查询次数过多”才被拒的。明明白白。

坏处呢?非线性关系它抓不住。你想想,收入10万和收入20万的人,还款能力能一样吗?但在线性模型里,权重是全局的,一笔带过。

但我要说句实话——觉得评分卡简单的,那一定是没见过做好的评分卡。

有次参加行业交流会,一个年轻人站起来说:“LR都什么年代的东西了,我们现在直接用XGBoost,效果倍好。”

我当时心里一惊。朋友,你做过特征工程吗?

WOE这个东西,它本身就是一个非线性映射。分箱分得好,WOE做得到位,LR在风控上的威力比你想象的大得多。后来我真拿真实数据拉了一个对比——35000条样本,坏账率12%左右。你猜LR的GINI是多少?0.42。XGBoost被我调了三天三夜,几乎试了所有参数组合,最终成绩是……0.43。

就多那么0.01的差距。代价呢?你得花一个小时跟业务解释“为什么这个变量贡献是负的”。

那个时候我们还要做什么?PSI(群体稳定性指标),每季度监控一遍。哪个特征分组的bad rate变了,全团队加班重新分箱。你管这叫机器学习?嘿嘿,这叫体力活。

说到这儿,我有个观点你可能不认同:古典评分卡在今天依然是风控的底仓。不是因为它最好,而是因为它最稳。很多银行2024年还在跑这套系统,别笑,这是真的。

集成模型?精度越高,我越害怕

后来XGBoost火了,LightGBM也来了。Kaggle上人人都在玩,金融圈也开始跟风。

我在那家金融科技公司的时候,也没忍住,上了集成模型。你猜怎么着?

第一版模型,离线KS做到0.55。我当时开心坏了,觉得自己年终奖稳了,能在团队里横着走。

上线一周,坏账率飙升。

查了三天原因,发现是线上环境里,很多特征的取值在开发样本里没出现过。集成模型太“认真”了,每个树都分裂得很细,遇到没见过的新组合,它就开始外推。理解一下什么叫外推——就是模型开始瞎猜,乱给评分。

你想想,一个模型上线后疯狂泛化失败,跟赌博有什么区别?

那次之后,我养成了一个习惯,一直用到现在:绝不只看离线KS/AUC。这两个指标高,不代表上线没问题。就像一个人考试成绩好,不一定代表他工作能力强。

后来我自己捣鼓了一套过滤流程,走了无数弯路,现在固定下来是这样的(你看,这都是踩坑踩出来的):

第一步,“提前停止”这招,老实说,我一开始也舍不得。总觉得训练得越多,模型学得越好。后来被现实教育了。现在我的做法很死板:开发样本里狠狠拆30%出来做validation,坚决不用它训练。心一软,泛化就崩。

第二步,特征编码。文本型特征?别想别的,全部转成WOE。数值型的就保持原样。有人喜欢用one-hot,说树模型能吃。我对比过,没差别。倒是WOE有个好处,它天生就能处理缺失值和异常值,不用你再写一堆if else。

第三步,用IV做筛选。把IV大于0.5的变量单独拎出来,作为加分规则。很多人觉得这么玩会拉低模型精度,从AUC看确实如此。但在策略主导的体系里,这种“硬规则”能给你极大的安全感。线上出了事,你可以直接说:这单被拒,因为它触发了黑名单规则。

第四步,相关性剔除。相关系数大于0.75的,去掉IV小的那个。你可能问,XGBoost不是自带特征选择吗?是自带,但高度相关的特征会互相削弱重要性,导致模型解释性更差。

第五步,用SHAP做剪枝。我喜欢用SHAP而不是feature importance。原因很简单,SHAP具有一致性——你删掉一个特征,剩下特征的重要性分布不会扭曲。逻辑清晰,比迭代删除简单十倍。

第六步,卡PSI阈值。开发样本、测试集、OOT,三个集上的PSI全算一遍。PSI大于0.1的,直接踢掉。别问为什么,执行就对了。

第七步,自动调参。我用贝叶斯优化,比网格搜索快十倍不止。参数搜索范围别太大,重点调学习率、树深度和subsample。

第八步,逐个特征删除。这个是我最喜欢的一步。一个特征一个特征删,看OOT上的KS是不是提升了。你可能会说,这不是用了OOT信息吗?没错,但删特征不会导致过拟合——因为你只是去掉没用的累赘。如果数据量足够,这么搞完之后,训练集和OOT的ROC曲线几乎重合。线上稳定性?稳得一批。

第九步,重拟合。这一步最终上线用的。把OOT和开发样本合并,用最终特征集重新训练一次。但注意,最终报告里的OOT指标,绝对不能用这次训练后的模型跑出来的,必须用之前单独保留的评估结果。不然你就是在作弊。

这套流程下来,集成模型我基本上没翻过大车。

但说实话——费时费力。如果你是个小团队,我劝你慎重。

树模型还有个让人头痛的问题:解释性。SHAP能提供变量贡献,但它依赖开发样本的均值。业务问你“为什么这个客户被扣了50分”,你只能说“因为他的XX特征值偏离了正常范围”。我自己说这话的时候,底气都不足。

行业实情说给你听:很多金融科技公司,包括蚂蚁、京东这些大厂,其实都把集成模型当辅助工具。主引擎依然是评分卡或简单模型。不信你去翻金融监管的披露报告,几乎没有一家说“我们用深度模型做信用评分主模型”。

深度学习和图网络:真香还是花架子?

再后来,图神经网络被吹进了风控圈。

蚂蚁有TitAnt系统,用DeepWalk把用户和交易关系变成embedding,喂给GBDT。花呗、白条的欺诈团伙识别,有人用TA-Struc2Vec,把“结构同质性”和“交易金额同质性”一起嵌入。还有CaT-GNN,2024年最新的成果,把时间和因果塞进来做信用卡反欺诈。

光看论文标题,就觉得高端大气上档次,对吧?

我试用过类似思路。在现金贷反欺诈场景,我们把用户的设备指纹、联系人、IP全部构建成图,用Node2Vec造embedding,然后丢进XGBoost。

效果确实有提升。欺诈捕获率提高了3到5个百分点。听起来不错?

但部署成本翻了三倍。每次图更新,都要全量重跑,线上延迟感人。我们后来只敢拿它做离线团伙挖掘,实时交易?还是靠规则加评分卡。

序列深度学习我踩得更深。

有一年做交易反欺诈,我用LSTM加Attention去学交易行为序列。真实数据测试下来,AUC比树模型好0.02左右,但Top-K捕获率却差不多。

说白了,深度学习自动特征学习能力强。但当样本量不够、正负比极端(比如欺诈率只有0.1%)的时候,它学到的“模式”往往是噪声。反而是人工做的几个统计特征——比如“过去1小时交易金额标准差”——更稳健。

我现在的态度是:深度学习在风控领域有用,但别神话它。它的价值更多是辅助——做特征embedding、做异常检测。而不是替代传统模型。

你想想,如果每天2万笔交易,要用一个200层的Transformer去跑一遍,那运维成本可能比坏账还高。谁干?

PU Learning:没有标签,也能用?

风控圈里有一个特别恶心的问题——拒绝推断。

什么意思呢?你做模型的时候,只有放贷通过的客户才有逾期标签。那些被拒的人,你永远不会知道他们会不会还钱。

这就是经典的PU问题——Positive and Unlabeled Learning。专家只能标注“肯定是坏人”的样本,但标不出“肯定是好人”的。

怎么办?一个机制是这样的:你标注的正样本必须100%靠谱,有硬规则支撑。其他的全部扔到未标记集合里。然后做一个倾向评分模型,去预估未标记样本里的正样本,再迭代标注。

我做过类似的实验:用逻辑回归做倾向评分,然后给正样本加权,重新训练信用评分模型。

效果怎么样?KS从0.40干到了0.43。而且关键的是,拒绝样本上的预测分布更合理了。

但缺点也有——变量要少。倾向评分模型本身容易受噪声影响。如果你特征太多,未标记集合里又混杂了大量软性负样本,倾向评分会崩得一塌糊涂。

一句话说清楚:PU Learning适合冷启动,或者样本量不到一万条的场景。如果你已经跑了一两年,手里握着几千条坏账记录,那就别再折腾了,直接用有标签的样本就够了。

风控系统的进化:从一锅粥到六要素

讲完算法,咱们聊聊系统。

我最早期做风控系统,就是一锅粥。规则、模型、特征、数据全部揉在一个项目里。改一个阈值?你得改代码、提测试、走发布流程。快的话一天,慢的话三四天。

如果是紧急的诈骗团伙需要立刻拦截?等流程走完,黄花菜都凉了。

后来我们做了重构,核心思路是提取六个要素:规则、决策、流程、模型、特征、数据

规则被抽象成DSL(领域特定语言),写规则像写SQL一样:if age < 18 then output "拒绝"。特征加工做成配置化,新建一个特征不需要改代码。模型引擎独立出来,支持热部署。

效果是什么?一条新规则,线上10分钟就能上线。模型迭代不影响其他服务。不同业务线之间共享特征,不用重复计算。

坏处也有——架构复杂度上去了。但考虑到每天几百万次的调用量,这个代价是值得的。

现在我们在做商业化,去一些中小公司做风控咨询。你猜我看到什么?

很多公司还在用Excel管理规则。

我说这不是技术问题,是意识问题。你看,一个人守着几百条规则的Excel表,手动改,手动发版。出了风险事件,要查Excel比对。真不是在搞笑。

未来走向:别跟风,想清楚自己要什么

从古典评分卡到集成树,再到图神经网络、联邦学习,风控的武器库在不断扩张。

但你仔细观察就会发现,落地效果最好的,永远是那些能用简单话说清楚的技术。

你要我说未来几年会怎么走,我琢磨着大概是这几个方向:

第一,可解释性会被持续推高。 欧盟AI法案、国内监管都在强调模型透明度。风控不像图像识别,搞个黑盒子是真不行。未来高阶模型都会有配套的解释方案,SHAP、LIME这些只是开始。更可能发展出的是自解释模型,比如EBM。

第二,自动化特征工程加AutoML会成为主流。 这个已经在很多平台有应用了。但风控场景需要约束——不能暴力搜到过拟合特征,不能忽略时间稳定性。我见过有些AutoML工具筛出来的特征,PSI跑一个月就直接崩了。

第三,联邦学习会在多头借贷和联合反欺诈里铺开。 原因很简单——数据不能出域。各家银行、消费金融公司都想用对方的数据做特征,但隐私法规卡着。联邦学习是个妥协方案,目前精度损失大约5%到10%,可以接受。

第四,图网络在团伙欺诈上会变成标配。 单点欺诈靠规则降维就够了。团伙欺诈?必须看关系网络。现在头部机构已经在用这个技术了,未来可能每个中型平台都会搭一套LightGCN。但注意,端到端GNN跑线上不太现实,图嵌入加树模型才是主流。

第五,最不变的是业务理解。 我见过一个评分卡,效果稳稳压过XGBoost。为什么?只因为做模型的人知道一个业务规律:头逾期的用户,下个月还款概率其实比逾期7天的还要低。这种业务直觉,模型学三年也未必学得会。


朋友,说到这儿,我想跟你说句掏心窝子的话。

我做了十年风控模型,从手工分箱算到GPU集群,从SAS写到了Python。技术换了一茬又一茬,但有些东西一直没变。

风控模型的价值,真不看你算法多前沿。核心就一个:你在欺诈和风险这个斗兽场里,能不能稳得住,能不能把明天猜准了。

哪怕你只用评分卡。只要特征调得好、监控做得勤,一样比那些模型花里胡哨但线上崩盘的团队强一百倍。

这个故事讲完了,你可能觉得我说得有点狠,但十年踩坑,一字一句都来自真实的痛。

别被那些花里胡哨的模型晃了眼,跑得稳、活得久、能赚钱的,才是真功夫。

137
6882 阅读
4 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月21日 03:31

苏晴

资深编辑

科技媒体从业 8 年,曾就职于多家科技媒体。关注 AI 创业和投资赛道,采访过 50+ 位行业从业者。

读者评论 4

老李 1周前
有个小问题想请教,文中提到的那个方案在大规模场景下性能怎么样?
回复 点赞 (5)
运营小陈 2天前
转发到团队群了,大家都觉得有参考价值。
回复 点赞 (4)
数据分析师 5天前
数据引用很扎实,建议补充一下近三个月的最新数据。
回复 点赞 (9)
产品经理阿杰 1周前
从产品角度看,这个方向确实有机会,但商业化路径还需要验证。
回复 点赞 (15)