
这次我们聊聊“违规识别”模型,在有的行里也被称为“三反”模型。这类模型的一个共同特点是获得明确标签(Y)的成本很高、主要特征提取自交易(有动帐)和行为(无动帐)数据的RFM模型及其衍生变量,和通过这些交易和行为数据构建时、空、网的关联关系而获取的衍生特征。这里需要强调一下,申请反欺诈和交易反欺诈在以上三方面存在明显差别。虽然申请反欺诈也会用到复杂网络,但是仅使用联系人、设备等信息构建的复杂网络,而不是依据交易流水做的复杂网络。
很多人在分析“三反”问题是都遇到难以清晰分类的问题。这是很正常的现象,因为这三者往往是伴生的。如果一定要分清楚的,不妨可以这样来区分:洗钱的交易发起者是用户本身,交易欺诈的发起者非用户的其他人,舞弊的交易发起者是内部员工。
笔者曾经在和客户沟通时,甲方反应反舞弊和反欺诈的差别很大。诚然,在业务理解上确实差别很大。但是在模型抽象的角度,这三个主题建模时,其标签的数据特征、取数窗口的设置、特征的提取方式是沿用的一套框架。因此可以统一来讨论其建模问题。
我们再强调一下建模的三个原则,即以成本-收益分析为单一分析框架、区分分析主体和客体两个视角、全模型生命周期工作模板。
我们这里以舞弊为例,讨论一下从事舞弊活动的人的成本-收益。舞弊的成本较明确,那就是事情败露后面临的处分、开除、经济处罚或刑事处罚。收益也很明确,那就是从事舞弊行为获得的收入。也就是说在舞弊行为分析中,成本-收益可以看似固定的。那为什么一个人有时候刚正不阿,而有时候禁不住诱惑呢?主要的问题是其内心发生了变换。如下所示的“舞弊三角”理论中,压力和动机是最关键的,这往往是外部事件,推动者行为人心中的砝码发生偏移,从而酿成悲剧。
建立违规识别模型的一个最重要的问题是对这个业务问题认识不足。很难有业务专家可以清晰的知道所有违规类型,每一次做这类项目,总是本着抓大放小的原则,针对最关心的一些“洗钱”、“交易欺诈”或“舞弊”的类型进行识别。同时样本的标签也是相互混淆的,因为犯罪份子可不会每次只按照洗钱“教科书”中的一种违规行为做事,比如地下钱庄和其他洗钱类型往往是伴生的。第二个难点是PU问题,即违规份子的行为没有被全部识别出来,也没有明确的类罪相对应。
由于违规识别模型有以上问题,因此需要两到三步才能处理好以上问题。比如针对第一类问题,需要使用到无监督的异常学习算法将与正常交易有明显差异的交易提取出来供下一步分析。针对第二个问题,目前主要是依赖业务人员手工审核。清洗干净的数据才会用于建模。
“三反”模型统一使用“黑名单”、“规则引擎”、“机器学习”、“ 复杂网络特征构建和无监督”。看过“越狱”的读者可能有印象,那里在分析犯罪时就会使用复杂网络作为分析工具。之所以现在这类技术被广泛使用,主要得益于开源大数据分析平台极大的降低了建设成本,使得可以基于全量的交易数据构建复杂网络和异常识别模型。因为这两类模型是不应该对数据抽样的。
之前很多人认为构建风控模型一定要可解释,因此一定要使用逻辑回归,甚至还要求必须制作评分卡之类的产出物。这种要求在“三反”模型中是不适宜的。因为违规交易的子类型太多了。虽然每一种违规行为和正常交易的客户有可能是线性可分的。但是如下图“问题4”所示,具有违规标示的样本是按群聚集的,而不同类的群是分散的。因此使用一个逻辑回归构建起的线性模型的精确度是很低的。需要使用组合算法构建非线性模型。
以上提到,违规识别模型需要从大量交易流水中提取交易特征和复杂网路特征。而且此类模型建模是不建议采用抽样的方式。因此使用分布式计算平台对数据进行加工是不可避免的。以下列出了主要模块,即数据源采集、图数据库、特征工程平台、机器学习平台。
下面这是一家金融机构的经历。由于传统的“三反模型”的规则很少是数据驱动的,而且及时是数据驱动的,规则的准确性也是很低的。通过构建无监督学习模型,使用异常识别算法,在降低了原模型15%召回率的情况下,预测精度提升了60倍。在使用有监督机器学习模型,并充分提取交易网络信息后,召回率无降低的请款下,模型精度提高了80倍。模型上线后,可以极大的减少“三反”调查人员的工作量。不过需要强调一点,本例中使用的样本是业务人员手工梳理的,模型效果容易做到指标上好看。
数据资管出品
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
K-S 曲线、回归与分类:数据分析中的重要工具 在数据分析与机器学习领域,K-S 曲线、回归和分类是三个核心概念与工具,它们各 ...
2025-07-31大数据时代对定性分析的影响 在大数据时代,海量、多样、高速且低价值密度的数据充斥着我们的生活与工作。而定性分析作为一 ...
2025-07-31CDA含金量分析 在数字经济与人工智能深度融合的时代,数据驱动决策已成为企业核心竞争力的关键要素。CDA(Certified Data Analys ...
2025-07-31SASEM 决策树:理论与实践应用 在复杂的决策场景中,如何从海量数据中提取有效信息并制定科学决策,是各界关注的焦点。SASEM 决 ...
2025-07-30SPSS 语法使用详解 在当今数据驱动的时代,SPSS( Statistical Package for the Social Sciences)作为一款功能强大的统计分析软 ...
2025-07-30人工智能对CDA数据分析领域的影响 人工智能对 CDA(Certified Data Analyst,注册数据分析师)数据分析领域的影响是全方位、多层 ...
2025-07-30MySQL执行计划中rows的计算逻辑:从原理到实践 MySQL 执行计划中 rows 的计算逻辑:从原理到实践 在 MySQL 数据库的查询优化中 ...
2025-07-29左偏态分布转正态分布:方法、原理与实践 左偏态分布转正态分布:方法、原理与实践 在统计分析、数据建模和科学研究中,正态分 ...
2025-07-29CDA 数据分析师的职业生涯规划:从入门到卓越的成长之路 在数字经济蓬勃发展的当下,数据已成为企业核心竞争力的重要来源,而 CD ...
2025-07-29CDA数据分析师证书考取全攻略 一、了解 CDA 数据分析师认证 CDA 数据分析师认证是一套科学化、专业化、国际化的人才考核标准, ...
2025-07-29解析神经网络中 Softmax 函数的核心作用 在神经网络的发展历程中,激活函数扮演着至关重要的角色,它们为网络赋予了非线性能力, ...
2025-07-29解析 response.text 与 response.content 的核心区别 在网络数据请求与处理的场景中,开发者经常需要从服务器返回的响应中提取数 ...
2025-07-29鸢尾花判别分析:机器学习中的经典实践案例 在机器学习的世界里,有一个经典的数据集如同引路明灯,为无数初学者打开了模式识别 ...
2025-07-29用 Python 开启数据分析之旅:从基础到实践的完整指南 在数据驱动决策的时代,数据分析已成为各行业不可或缺的核心能力。而 Pyt ...
2025-07-29从 CDA LEVEL II 考试题型看 Python 数据分析要点 在数据科学领域蓬勃发展的当下,CDA(Certified Data Analyst)认证成为众多从 ...
2025-07-29CDA 数据分析师的工作范围解析 在数字化时代的浪潮下,数据已成为企业发展的核心资产之一。CDA(Certified Data Analyst)数据分 ...
2025-07-29解析 insert into select 是否会锁表:原理、场景与应对策略 在数据库操作中,insert into select 是一种常用的批量数据插入语句 ...
2025-07-29用 Power BI 制作地图热力图:基于经纬度数据的实践指南 在数据可视化领域,地图热力图凭借直观呈现地理数据分布密度的优势,成 ...
2025-07-29从数据到决策:CDA 数据分析师如何重塑职场竞争力与行业价值 在数字经济席卷全球的今天,数据已从 “辅助工具” 升级为 “核心资 ...
2025-07-292025 年 CDA 数据分析师考纲焕新,引领行业人才新标准 在数字化浪潮奔涌向前的当下,数据已成为驱动各行业发展的核心要素。作为 ...
2025-07-29