大数据征信究竟是个什么鬼?能有多神奇?商业化前景存疑
在征信行业的发展过程中,评估模型的依据通常是基于个人的信用历史和还款表现。这类数据背后的逻辑是以个人过往信用的质量来推断他未来的信用表现。在新的大数据征信系统中,信用评估的来源更加广泛,社交网络与电子商务行为中产生的海量数据,都能给用户行为提供侧面支持。
大数据征信可以通过我们在互联网上留下的这些“足迹”清晰地描绘出一个人,但如何把控数据源的“量”与“度”,各家机构还在不断尝试。更重要的是,最终绘制出的人物“肖像”与个人信用究竟有多大的关联度,至今仍存有争议。
此前亦有接近监管部门人士对《第一财经日报》记者表示,个人征信牌照迟迟未能落地,其原因之一也在于监管部门对于大数据征信的商业化应用存有疑虑。尤其,以人脸识别为代表的关键技术的可靠性还有待进一步检验。
此外,“另一个更重要的症结在于行政化监管与商业化发展之间的矛盾。”该人士表示,现在个人征信市场的参与者越来越多,远不止申请牌照的八家机构,如果该市场要商业化发展,那么监管方式就要改进。
大数据征信究竟是个什么鬼?
在FICO中国区总裁陈建看来,征信的本质就是采集和记录信用信息并在整理加工后提供给决策者,而如今,得益于大数据、云计算、人脸识别、深度算法等技术的进步,征信有了更广泛的意义和用途。
“只要对消费者的特征描绘和风险判断有显著作用的就可以叫征信。”陈建认为, 现在一切信息皆可以成为信用数据,经过分析后用于证明一个人或企业的信用状况。因为数据覆盖广、维度多,因此形成了广义的征信,也就是大数据征信。
陈建表示,有价值的大数据具备几个因素:第一要覆盖面广,用户足够多,例如银联、电信的数据;第二维度要有效,能够有效转为结构化的数据,例如电商的数据;第三信息要稳定。
不过,对于这种日益崛起的征信新业态,今年7月在上海外滩举办的“2015上海新金融年会”上,央行征信中心副主任王晓蕾直截了当地提出了疑问,“我不知道你们说的‘征信’是什么”?
央行的征信系统是一个“放贷人之间的信息共享数据库”,主要采集的数据为身份信息、信贷信息、非金融负债信息三类,以及部分公共信息。因此,王晓蕾对于征信的基本定义为,“从放贷人那里采集借款人信息”。
而另一个“纠结”的概念在于,王晓蕾认为,放贷机构之“征信”是放贷机构基于内部信息的风险管理过程,而征信行业之“征信”是为放贷机构的风险管理提供外部信息支持的活动,征信机构应该是一个纯粹的独立第三方。
如果按照这个界定,我们现在所谈到的大数据征信跳脱了传统“征信”范畴内。不再局限于金融属性的信息,并且也打破了“采集者与信息产生没有任何关系”的独立第三方原则。
例如芝麻信用、前海征信、腾讯征信,一方面它们的数据来源目前还主要来自母公司阿里、平安、腾讯,而另一方面,它们的兄弟公司又涉足放贷业务,例如阿里小贷。
尽管有关大数据征信的定义和效用仍争议不断,但对于既无法接入央行征信系统又面临快速发展的互联网金融行业而言,利用大数据来帮助判定风险、开拓业务已是必然的选择。
从应用范围来看,目前大数据征信已从金融业务向生活服务蔓延。其中,最核心的两个价值就是:防范欺诈风险和信用风险。简单来说就是:既要证明“你是你”,还要描述出“你是什么样的人”。
利用数据证明“你就是你”
无论是在传统金融领域,还是互联网金融领域,给客户做信用评估的前提是必须知道这个人就是他自己。所以,如何利用证明“你是你”是大数据征信首先要解决的问题。
尤其,随着越来越多的金融业务互联网化,“反欺诈”面临的挑战也日益增大。“身份认证”的重要性在各项监管文件中反复被强调,而各家机构也在不断探索如何利用新的技术在网上实现身份的核实。
其中,在指纹、虹膜、人脸识别等一系列生物识别技术中,人脸识别因技术的成熟度和准确率较高,以及其使用的便捷性而被进一步普及。包括腾讯征信、芝麻征信在内的多家个人征信机构都有组建自己的人脸识别技术团队。
此前,在腾讯征信的北京媒体沟通会上,为腾讯财付通、微众银行、腾讯征信等提供图像和模式识别技术支持的优图团队也向大家展示了“人脸识别”在“反欺诈”方面的应用,即如何证明“你是你”。
根据现场的演示,在上传身份证照片、自拍照片并与公安部的信息进行比对之后,“人脸识别”的另一关键步骤是活体检测,通过读取随机的数字串,分析声音和唇语等信息来防范有人用视频、照片等方式仿冒用户。
据了解,在今年国际权威的人脸识别数据库LFW上,腾讯优图团队在人脸验证测试中达到了 99.65%的准确率。目前,微信的“人脸识别”技术已经在腾讯征信、微众银行、微证券开户等场景中开始试用。
尽管人脸识别的准确率已经达到较高水平,但该项技术的商业化应用才刚刚起步,它的有效性和安全性仍备受质疑。
优图团队研发总监黄飞跃也表示,该技术现在还不能说100%地成熟,而是适用于某些特定的应用环境中。其中,金融领域的身份核实条件较好,由于用户往往是为了通过验证所以比较配合。
芝麻信用首席科学家俞吴杰表示,整个的反欺诈产品从身份认证到信息验证再到网络关联,每一步的技术含量非常高。以身份认证为例,现在已有很多的途径,比如信息交叉比对、人脸识别技术、KBA问答认证等。
他以网络关联技术为例说明:它能把所有出现过违约行为的身份、手机、设备等关键点都在风险库里面分门别类地保留下来,我们可以通过一层或者多层关联找出所有的风险点供合作伙伴参考,这对技术和硬件要求都非常高。
数据与信用的相关性到底有多大?
解决了“身份认证”的问题,接下来就要评估你的信用,即描述出“你是什么样的人”。
在关于大数据征信的文章中,我们经常可以看到一些案例,如经常半夜上网的用户可能被认为没有稳定的工作而降低信用评分,买双开门冰箱的用户可能因为有家庭而信用评分较高,微博更新频繁的用户可能因为社交活跃而信用评分较高等。
“这些考量因素被过度放大了,也许这只是用户个人习惯而已。但每一个因素与个人信用的相关性有多大?我们还无法完全解释,尤其当数据源不足够丰富时,这些评判便存在欠缺。”芝麻信用的技术专家景艺亮表示。
冰鉴科技CEO顾凌云在回国前曾领导并开发了Zest Finance前四代风控模型,在他看来,大数据征信的核心并不是对某个变量极其依赖,而是把很多个都只有微小影响的变量通过非线性的算法整合在一起,从而使模型的整体表现更好。
“大数据其实并不一定就是数据量本身大,我们讲求的是变量涵盖的信息维度要多和均衡,然后才是能够通过浅度学习和深度学习等多种复杂的算法把这些变量更有效地糅合在一起。”他表示。
王晓蕾认为,互联网记录了借款人以前不可记录的行为,获得了以前无法获取或获取成本很高的数据,为放贷人了解借款人是谁、有没有还款能力和还款意愿提供了新的渠道和方法。但是,相关的信息究竟如何使用有待进一步研究验证。
王晓蕾引用2014年美国政策与经济研究委员会(PERC)的一项研究结果称,非金融信息在信贷决策中的作用有限。例如,社交信息对于判断借款人的还款意愿和能力暂无预测力。
“诸如水、电、煤、有线电视、手机等非金融信息纳入征信系统,显著地提高了薄信用档案人群的信贷获得能力,但对于厚信用档案人群而言,边际作用不大。”她表示。
“只有好样本,没有坏样本是无法建立有效的信用评估机制的。” 宜信至诚征信的董事总经理赵卉表示,电商、支付、社交等数据只能作为信贷审核的参考值,而贷后数据才是强参数。
对于这种论断,互联网公司们或是不赞同的。
腾讯征信总经理吴丹告诉记者,从这段时间内测的结果来看,在模型中加入社交数据以后,对它的风控能力有20%~25%的提升,尤其在小额贷款领域。因为,通常一笔几百块的借款,违约发生的原因不在于借款人的还款能力而是意愿。
俞吴杰表示,通过大量的研究证明,人的行为数据和他的信用有直接关联,因为行为很难撒谎。从这段时间公测的结果来看,用户的芝麻分越高,其贷款的违约率越低,二者呈单调、线性的关系,这也证明了芝麻分在信用评估上的有效性。
不过,仅仅依靠互联网上的数据并不足以建立一个强大的信用评估体系。显然,所有大数据征信的市场参与者都深知这一点。“在未来,把传统数据和创新数据结合到一起,一定是我们要到达的终点。”芝麻信用的总经理胡滔如此总结到。
顾凌云告诉记者,风控模型本质上还是对一个人金融还贷能力的预测和评估,所以,尽管Zest Finance大量采用非传统的信用数据,但在大部分的风险评估模型中,传统的信用数据(银行信贷数据)依然占有一定的比重,平均也在40%左右。
大数据征信并非独立存在,也不是另起炉灶。预判一个人的行为,从任何角度来看,都是非常困难的一件事情。数据对于风险控制的帮助,更多的是集中在量化概率与可能性的判断之上。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
“最近复购率一直在下降,我们的营销力度不小啊,为什么用户还是走了?” “是不是广告投放的用户质量不高?还是我们的产品问题 ...
2025-02-21以下文章来源于数有道 ,作者数据星爷 SQL查询是数据分析工作的基础,也是CDA数据分析师一级的核心考点,人工智能时代,AI能为 ...
2025-02-19在当今这个数据驱动的时代,几乎每一个业务决策都离不开对数据的深入分析。而其中,指标波动归因分析更是至关重要的一环。无论是 ...
2025-02-18当数据开始说谎:那些年我们交过的学费 你有没有经历过这样的场景?熬了三个通宵做的数据分析报告,在会议上被老板一句"这数据靠 ...
2025-02-17数据分析作为一门跨学科领域,融合了统计学、编程、业务理解和可视化技术。无论是初学者还是有一定经验的从业者,系统化的学习路 ...
2025-02-17挖掘用户价值本质是让企业从‘赚今天的钱’升级为‘赚未来的钱’,同时让用户从‘被推销’变为‘被满足’。询问deepseek关于挖 ...
2025-02-17近来deepseek爆火,看看deepseek能否帮我们快速实现数据看板实时更新。 可以看出这对不知道怎么动手的小白来说是相当友好的, ...
2025-02-14一秒精通 Deepseek,不用找教程,不用买资料,更不用报一堆垃圾课程,所有这么去做的,都是舍近求远,因为你忽略了 deepseek 的 ...
2025-02-12自学 Python 的关键在于高效规划 + 实践驱动。以下是一份适合零基础快速入门的自学路径,结合资源推荐和实用技巧: 一、快速入 ...
2025-02-12“我们的利润率上升了,但销售额却没变,这是为什么?” “某个业务的市场份额在下滑,到底是什么原因?” “公司整体业绩 ...
2025-02-08活动介绍 为了助力大家在数据分析领域不断精进技能,我们特别举办本期打卡活动。在这里,你可以充分利用碎片化时间在线学习,让 ...
2025-02-071、闺女,醒醒,媒人把相亲的带来了。 我。。。。。。。 2、前年春节相亲相了40个, 去年春节相亲50个, 祖宗,今年你想相多少个 ...
2025-02-06在数据科学的广阔领域中,统计分析与数据挖掘占据了重要位置。尽管它们常常被视为有关联的领域,但两者在理论基础、目标、方法及 ...
2025-02-05在数据分析的世界里,“对比”是一种简单且有效的方法。这就像两个女孩子穿同一款式的衣服,效果不一样。 很多人都听过“货比三 ...
2025-02-05当我们只有非常少量的已标记数据,同时有大量未标记数据点时,可以使用半监督学习算法来处理。在sklearn中,基于图算法的半监督 ...
2025-02-05考虑一种棘手的情况:训练数据中大部分样本没有标签。此时,我们可以考虑使用半监督学习方法来处理。半监督学习能够利用这些额 ...
2025-02-04一、数学函数 1、取整 =INT(数字) 2、求余数 =MOD(除数,被除数) 3、四舍五入 =ROUND(数字,保留小数位数) 4、取绝对值 =AB ...
2025-02-03作者:CDA持证人 余治国 一般各平台出薪资报告,都会哀嚎遍野。举个例子,去年某招聘平台发布《中国女性职场现状调查报告》, ...
2025-02-02真正的数据分析大神是什么样的呢?有人认为他们能轻松驾驭各种分析工具,能够从海量数据中找到潜在关联,或者一眼识别报告中的数 ...
2025-02-01现今社会,“转行”似乎成无数职场人无法回避的话题。但行业就像座围城:外行人看光鲜,内行人看心酸。数据分析这个行业,近几年 ...
2025-01-31