这次我们聊聊“违规识别”模型,在有的行里也被称为“三反”模型。这类模型的一个共同特点是获得明确标签(Y)的成本很高、主要特征提取自交易(有动帐)和行为(无动帐)数据的RFM模型及其衍生变量,和通过这些交易和行为数据构建时、空、网的关联关系而获取的衍生特征。这里需要强调一下,申请反欺诈和交易反欺诈在以上三方面存在明显差别。虽然申请反欺诈也会用到复杂网络,但是仅使用联系人、设备等信息构建的复杂网络,而不是依据交易流水做的复杂网络。
很多人在分析“三反”问题是都遇到难以清晰分类的问题。这是很正常的现象,因为这三者往往是伴生的。如果一定要分清楚的,不妨可以这样来区分:洗钱的交易发起者是用户本身,交易欺诈的发起者非用户的其他人,舞弊的交易发起者是内部员工。
笔者曾经在和客户沟通时,甲方反应反舞弊和反欺诈的差别很大。诚然,在业务理解上确实差别很大。但是在模型抽象的角度,这三个主题建模时,其标签的数据特征、取数窗口的设置、特征的提取方式是沿用的一套框架。因此可以统一来讨论其建模问题。
我们再强调一下建模的三个原则,即以成本-收益分析为单一分析框架、区分分析主体和客体两个视角、全模型生命周期工作模板。
我们这里以舞弊为例,讨论一下从事舞弊活动的人的成本-收益。舞弊的成本较明确,那就是事情败露后面临的处分、开除、经济处罚或刑事处罚。收益也很明确,那就是从事舞弊行为获得的收入。也就是说在舞弊行为分析中,成本-收益可以看似固定的。那为什么一个人有时候刚正不阿,而有时候禁不住诱惑呢?主要的问题是其内心发生了变换。如下所示的“舞弊三角”理论中,压力和动机是最关键的,这往往是外部事件,推动者行为人心中的砝码发生偏移,从而酿成悲剧。
建立违规识别模型的一个最重要的问题是对这个业务问题认识不足。很难有业务专家可以清晰的知道所有违规类型,每一次做这类项目,总是本着抓大放小的原则,针对最关心的一些“洗钱”、“交易欺诈”或“舞弊”的类型进行识别。同时样本的标签也是相互混淆的,因为犯罪份子可不会每次只按照洗钱“教科书”中的一种违规行为做事,比如地下钱庄和其他洗钱类型往往是伴生的。第二个难点是PU问题,即违规份子的行为没有被全部识别出来,也没有明确的类罪相对应。
由于违规识别模型有以上问题,因此需要两到三步才能处理好以上问题。比如针对第一类问题,需要使用到无监督的异常学习算法将与正常交易有明显差异的交易提取出来供下一步分析。针对第二个问题,目前主要是依赖业务人员手工审核。清洗干净的数据才会用于建模。
“三反”模型统一使用“黑名单”、“规则引擎”、“机器学习”、“ 复杂网络特征构建和无监督”。看过“越狱”的读者可能有印象,那里在分析犯罪时就会使用复杂网络作为分析工具。之所以现在这类技术被广泛使用,主要得益于开源大数据分析平台极大的降低了建设成本,使得可以基于全量的交易数据构建复杂网络和异常识别模型。因为这两类模型是不应该对数据抽样的。
之前很多人认为构建风控模型一定要可解释,因此一定要使用逻辑回归,甚至还要求必须制作评分卡之类的产出物。这种要求在“三反”模型中是不适宜的。因为违规交易的子类型太多了。虽然每一种违规行为和正常交易的客户有可能是线性可分的。但是如下图“问题4”所示,具有违规标示的样本是按群聚集的,而不同类的群是分散的。因此使用一个逻辑回归构建起的线性模型的精确度是很低的。需要使用组合算法构建非线性模型。
以上提到,违规识别模型需要从大量交易流水中提取交易特征和复杂网路特征。而且此类模型建模是不建议采用抽样的方式。因此使用分布式计算平台对数据进行加工是不可避免的。以下列出了主要模块,即数据源采集、图数据库、特征工程平台、机器学习平台。
下面这是一家金融机构的经历。由于传统的“三反模型”的规则很少是数据驱动的,而且及时是数据驱动的,规则的准确性也是很低的。通过构建无监督学习模型,使用异常识别算法,在降低了原模型15%召回率的情况下,预测精度提升了60倍。在使用有监督机器学习模型,并充分提取交易网络信息后,召回率无降低的请款下,模型精度提高了80倍。模型上线后,可以极大的减少“三反”调查人员的工作量。不过需要强调一点,本例中使用的样本是业务人员手工梳理的,模型效果容易做到指标上好看。
数据资管出品
数据分析咨询请扫描二维码
数据分析师的工作内容涉及多个方面,主要包括数据的收集、整理、分析和可视化,以支持商业决策和问题解决。以下是数据分析师的一 ...
2024-11-21数据分析师必须掌握的技能可以从多个方面进行归纳和总结。以下是数据分析师需要具备的主要技能: 统计学基础:数据分析师需要 ...
2024-11-21数据分析入门的难易程度因人而异,总体来看,入门并不算特别困难,但需要一定的学习和实践积累。 入门难度:数据分析入门相对 ...
2024-11-21数据分析是一项通过收集、整理和解释数据来发现有用信息的过程,它在现代社会中具有广泛的应用和重要性。数据分析能够帮助人们更 ...
2024-11-21数据分析行业正在迅速发展,随着技术的不断进步和数据量的爆炸式增长,企业对数据分析人才的需求也与日俱增。本文将探讨数据分析 ...
2024-11-21数据分析的常用方法包括多种技术,每种方法都有其特定的应用场景和优势。以下是几种常见的数据分析方法: 对比分析法:通过比 ...
2024-11-21企业数字化转型是指企业利用数字技术对其业务进行改造和升级,以实现提高效率、降低成本、创新业务模式等目标的过程。这一过程不 ...
2024-11-21数据分析作为一个备受追捧的职业领域,吸引着越来越多的女性加入其中。对于女生而言,在选择成为一名数据分析师时,行业选择至关 ...
2024-11-21大数据技术专业主要学习计算机科学、数学、统计学和信息技术等领域的基础理论和技能,旨在培养具备大数据处理、分析和应用能力的 ...
2024-11-21《Python数据分析极简入门》 第2节 3 Pandas数据查看 这里我们创建一个DataFrame命名为df: importnumpyasnpi ...
2024-11-21越老越吃香的行业主要集中在需要长时间经验积累和专业知识的领域。这些行业通常知识更新换代较慢,因此随着年龄的增长,从业者能 ...
2024-11-20数据导入 使用pandas库的read_csv()函数读取CSV文件或使用read_excel()函数读取Excel文件。 支持处理不同格式数据,可指定分隔 ...
2024-11-20大数据与会计专业是一门结合了大数据分析技术和会计财务理论知识的新型复合型学科,旨在培养能够适应现代会计业务新特征的高层次 ...
2024-11-20要成为一名数据分析师,需要掌握一系列硬技能和软技能。以下是成为数据分析师所需的关键技能: 统计学基础 理解基本的统计概念 ...
2024-11-20是的,Python可以用于数据分析。Python在数据分析领域非常流行,因为它拥有丰富的库和工具,能够高效地处理从数据清洗到可视化的 ...
2024-11-20在这个数据驱动的时代,数据分析师的角色变得愈发不可或缺。他们承担着帮助企业从数据中提取有价值信息的责任,而这些信息可以大 ...
2024-11-20数据分析作为现代信息时代的支柱之一,已经成为各行业不可或缺的工具。无论是在商业、科研还是日常决策中,数据分析都扮演着至关 ...
2024-11-20数字化转型已成为当今商业世界的热点话题。它不仅代表着技术的提升,还涉及企业业务流程、组织结构和文化的深层次变革。理解数字 ...
2024-11-20在现代社会的快速变迁中,选择一个具有长期增长潜力的行业显得至关重要。了解未来发展前景好的行业不仅能帮助我们进行职业选择, ...
2024-11-20统计学专业的就业方向和前景非常广泛且充满机遇。随着大数据、人工智能等技术的快速发展,统计学的重要性进一步凸显,相关人才的 ...
2024-11-20