写点什么

基于 Logistict 回归的评分卡模型

  • 2020-03-22
  • 本文字数:1970 字

    阅读完需:约 6 分钟

基于Logistict回归的评分卡模型

1 评分卡分类


A 卡(Applicationscore card)新客户申请审批


  • 更准确地评估申请人的未来表现(违约率),降低坏帐率;

  • 加快(自动化)审批流程, 降低营运成本;

  • 增加审批决策的客观性和一致性,提高客户满意度;


B 卡(Behaviorscore card)现有客户管理


  • 更好的客户管理策略, 提高赢利;

  • 减少好客户的流失;

  • 对可能拖欠的客户,提早预警;


C 卡(Collectionscore card)早期催收


  • 优化催收策略,提高欠帐的回收率;

  • 减少不必要的催收行为,降低营运成本。

2 模型开发全流程

用一张图为大家展示,量化团队分析师开发评分卡模型的全流程,以及具体实现方式:



Step1:变量初选


通过等频分箱或最优分箱离散原始数据,计算 IV 值,剔除预测能力差的指标。


  • 信息值(information value,简称”IV”)是常用的进行自变量筛选的指标,计算简单,并且有经验的判断法则,IV 值的计算公式为:





Step2:变量剔除


通过变量聚类或者计算相关系数的方法剔除变量,这一步主要目的是解决多重共线性问题。多重共线性(Multicollinearity)是指线性回归模型中的解释变量之间由于存在精确相关关系或高度相关关系而使模型估计失真或难以估计准确。


Step3:数据离散化


数据离散化的目的是降低异常值的影响,同时增加模型的可解释性,通过 BESTKs、卡方合并、决策树等有监督算法将连续变量离散化几个区间,然后进行 WOE 转换。


  • 证据权重(Weight of Evidence,简称“WOE”)



WOE 是对原始自变量的一种编码形式,要对一个变量进行 WOE 编码,需要首先把这个变量进行分组处理(也叫离散化、分箱)。



Step4:初步建模


将原始指标用 WOE 进行替换后,用 logistic 回归估计参数,并剔除参数估计为负的变量。


下面让我们来了解一下信用评分卡模型所依赖的 Logistic 回归算法。何为“回归”呢?当有一些数据点,用一条直线对这些点进行拟合(该直线称为最佳拟合直线),这个拟合过程就叫回归。那么,利用 Logistic 回归进行分类的主要思想就是根据现有数据对分类边界线建立回归公式,以此进行分类。“回归”源于最佳拟合,即使用最优化算法,找到最佳拟合参数集。


  • Logistic 回归的实现:对于输入特征,每个特征乘以一个回归系数,将所有结果值相加带入 Sigmoid 函数中,从而得到一个 0~1 之间的数值,根据实际情况设定相关阈值,从而达到预测的目的。

  • 最优化算法:如何找到最优回归系数,是 Logistic 回归的关键问题。



即:找到上式的w\dot机器学习中常用的最优化算法有:梯度下降法(GradientDescent)、牛顿法和拟牛顿法(Newton’s method & Quasi-NewtonMethods)、共轭梯度法(Conjugate Gradient)等等,接下来简单介绍梯度下降法。


  • 梯度下降法(Gradient Descent):梯度下降即沿着某函数的梯度方向,找到该函数的最小值,如果梯度记为▽,则函数 f(x,y)的梯度为:



则梯度下降算法的迭代公式为:,其中,为步长。


Step5:人工干预


根据指标的业务意义、上下限、人数占比、违约比例调整分箱规则,即业务干预。


Step6:WOE 更新


人工干预后,得到新的分箱,根据新分箱,更新 WOE。


Step7:模型更新


更新完 WOE 之后,利用新的 WOE 值估计回归参数。


Step8:分数转化


根据 Logistic 回归估计的参数、分箱的 WOE 来确定每个区间的得分。


Step9:模型效果评估


我们利用 AUC、KS 等指标评估模型的预测能力。


  • AUC(Area Under Curve)


AUC 实际上就是 ROC 曲线下的面积,ROC 曲线反映了分类器的分类能力,结合考虑了分类器输出概率的准确性,AUC 量化了 ROC 曲线的分类能力,越大分类效果越好,输出概率越合理。


  • KS (Kolmogorov-Smirnov)


K-S 统计量被应用于信用评级模型主要是为了验证模型对违约对象的区分能力,是表现模型区分能力的验证指标;通常,如果模型的 K-S 统计量越大,表明模型区分正常客户和违约客户的能力越强。


Step10:模型监控


  • PSI (population stability index)


系统稳定性指数,主要考察了模型预测结果的稳定性,通过对建模样本和监控样本中客户的评分或评级分布的比较来判断模型预测结果的稳定性。系统稳定性指数越小,越稳定,表明监控样本的分数的分布情况和建模样本中的情况越相似,可以预期模型在监控样本中的性能表现和建模样本中的性能表现会很接近。


Step11:评分


下面的小示例,简单为大家展示评分卡及其计分模式:



如果该模型的基础分是 50 分,比如有个客户,大专毕业,男性,拥有自有住房,工作 10 年以上,那么他的分数就应该是:Score=50+14+9+24+12=109。

3 总结

本文介绍了基于 Logistic 回归的评分卡模型的实现流程,介绍了 Logistic 算法、IV 值和 WOE,以及评价模型的指标 AUC、ks 值、PSI 等。在实际应用中,评分卡模型的作用日渐突出。量化团队根据业务需要开发各种不同评分卡模型,并尝试不同算法建模,试图更加科学、准确地构建模型,降低误判率,增加审批的客观性,提高客户的满意度。


2020-03-22 21:042618

评论

发布
暂无评论
发现更多内容

以AI智能技术破解中小电商 “服务短板” 困境

极客天地

天谋科技 CTO 乔嘉林博士:时序数据库 IoTDB 步入 2.0,3 大方向,9 大升级

Apache IoTDB

融云“通信+AI”解决方案三大场景实例

融云 RongCloud

大数据-49 Redis 缓存异常全攻略:穿透、击穿、雪崩、热Key、大Key通杀指南

武子康

Java redis 大数据 缓存 分布式

语音 AI 迎来并购潮:Meta 收购 PlayAI 后,谁是下一个目标?WhatsApp 上线语音通话 API丨日报

声网

如何设计 RBAC(基于角色的访问控制)系统

NocoBase

开源 低代码 权限管理 rbac 无代码

微软2011年5月安全公告:漏洞可利用性指数改进与预先通知服务

qife122

漏洞利用性指数 微软安全响应中心

大庆等保测评周期与复测要求解析

等保测评

KafkaMQ 日志采集最佳实践

观测云

kafka

Apache Airflow 工作流管理平台

qife122

工作流 任务调度 数据管道

【超实用】苹果电脑无法往U盘里存东西怎么办?Mac文件无法拷贝进U盘怎么解决?

阿拉灯神丁

NTFS 磁盘管理器 Tuxera NTFS2024 Mac磁盘管理 磁盘格式读写软件

京东商品评论API指南

tbapi

京东API 京东商品评论API 京东评论API 京东商品评论数据采集 京东评论数据采集

远程踏勘系统(源码+文档+讲解+演示)

深圳亥时科技

盈米基金与阿里云达成AI全栈战略合作

盈米AI开放平台

企业AI 全栈云 MCP Server

企业 RPA 部署指南:IT 人必看 4 要点

Techinsight

自动化 RPA Agent RPA智能体

BlueHat Shanghai 2019:全球防御合作伙伴的力量放大

qife122

网络安全 容器安全

基于YOLOv8的高压电线(绝缘子、电缆)有无故障检测识别项目|完整源码数据集+PyQt5界面+完整训练流程+开箱即用!

申公豹

yolo

中烟创新数字档案:开启烟草行业“智”理新动能

中烟创新

金融 RPA 选型必看!从技术适配到信创合规,这 3 个坑 90% 机构踩过

Techinsight

金融科技 金融

iPad需要备份数据吗?苹果手机第三方备份软件哪个好?

阿拉灯神丁

imazing iTunes 苹果手机备份 icloud

黑龙江等保测评的核心流程

等保测评

从MTSC2025思考AI如何重塑研发质效

十三Tech

架构 AI 后端 cursor MTSC

SpringBoot--如何创建自己的自动配置

量贩潮汐·WholesaleTide

spring

TCL电子(01070.HK)发布中期业绩盈喜预告 预期2025年上半年经调整归母净利润同比增幅约为45%至65%

财见

安卓应用如何快速移植到鸿蒙系统?这个D2C技巧,开发必备!

职场工具箱

android 开发 HarmonyOS D2C 设计稿转代码

Ubuntu 22.04系统KWDB数据库安装部署使用教程_案例传感器

KaiwuDB

京东图片搜索商品API指南

tbapi

京东API 京东图片搜索接口 京东拍立淘接口 京东以图搜索接口 京东图搜API

RPA 部署别踩坑!这三点 IT 人必须懂

Techinsight

RPA RPA评测 RPA Agent RPA智能体

WAIC 送票丨最关心语音 AI 的一群人都来世界人工智能大会了

声网

javax.security.auth.login.LoginException: Message stream modified (41)

刘大猫

人工智能 数据挖掘 算法 数据分析 大模型

等保测评的行业适用性与案例分析

等保测评

基于Logistict回归的评分卡模型_文化 & 方法_京东数字科技产业AI中心_InfoQ精选文章