模型稳定度指标PSI与IV
由于模型是以特定时期的样本所开发的,此模型是否适用于开发样本之外的族群,必须经过稳定性测试才能得知。稳定度指标(population stability index ,PSI)可衡量测试样本及模型开发样本评分的的分布差异,为最常见的模型稳定度评估指针。其实PSI表示的就是按分数分档后,针对不同样本,或者不同时间的样本,population分布是否有变化,就是看各个分数区间内人数占总人数的占比是否有显著变化。公式如下:
这里的AC与EX为不同时间段的模型输出分数,如果PSI过大,说明模型输出的分数分布变化很大了,需要更新模型。
PSI实际应用范例:
1)样本外测试
针对不同的样本测试一下模型稳定度,比如训练集与测试集,也能看出模型的训练情况,我理解是看出模型的方差情况。
2)时间外测试
测试基准日与建模基准日相隔越远,测试样本的风险特征和建模样本的差异可能就越大,因此PSI值通常较高。至此也可以看出模型建的时间太长了,是不是需要重新用新样本建模了。
变量的PSI计算:
PSI:检验变量的稳定性,当一个变量的psi值大于0.0001时,变量不稳定。一个变量,将它的取值按照分位数来分组一下,每一组中测试模型的客户数占比减去训练模型中的客户数占比再乘以这两者相除的对数,就是这一组的稳定性系数psi,然后变量的psi系数就是把这个变量的所有组的psi相加总起来。
https://blog.csdn.net/sinat_26917383/article/details/51721107
IV与WOE:
IV表示一个变量的预测能力:
<=0.02,没有预测能力,不可用
0.02~0.1 弱预测性
0.1~0.2 有一定预测能力
0.2+高预测性
IV还可以用来挑选变量,IV就越大,它就越应该进入到入模变量列表中。
WOE计算公式:
要对一个变量进行WOE编码,需要首先把这个变量进行分组处理(也叫离散化、分箱等等,说的都是一个意思)。分组后,对于第i组,WOE的计算公式如下:
IV计算公式:
IV和woe参考:https://blog.csdn.net/kevin7658/article/details/50780391
最新文章
- Redis 队列操作
- PHP常用函数大全。
- Yahoo! s4和Twitter storm的粗略比较
- gVIM 简洁配置 in Windows
- Java中万恶的注解
- 如何诊断oracle数据库运行缓慢或hang住的问题
- 【ArcGIS Server 开发系列】Flyingis六大系列讲座精品PDF奉献
- HDU 畅通工程系列
- InnoDB的配置
- ReactJS入门二
- 201621123068 Week03-面向对象入门
- react学习目录
- SQLSERVER 聚集一个表的字段2008及以后,要求支持XML
- Redis的快照持久化-RDB与AOF
- PostgreSQL work_mem理解
- 关于z-index的那些事儿
- Python3学习之路~6.1 编程范式:面向过程 VS 面向对象
- Python 词频统计
- PKU 3687 Labeling Balls(拓扑排序)
- Android 解决setRequestedOrientation之后手机屏幕的旋转不触发onConfigurationChanged方法
热门文章
- 虚拟机中安装 centOS,本地安装 SSH 连接 - 01
- Dbgrid控件多重选择的怪问题。BookMarkList,BookMark,使用书签,用的ADOQuery控件。100分送上,急阿!!!请高手帮忙!
- struct和class的联系与区别
- adb使用过程常见的几种错误总结
- 51nod 1677 treecnt(思维)
- python传参
- 51nod 1277字符串中的最大值(拓展kmp)
- BZOJ3262:陌上花开 &; 洛谷3810:三维偏序——题解
- 洛谷 P3102 [USACO14FEB]秘密代码Secret Code 【区间dp】
- Spark集群基础概念 与 spark架构原理