京公网安备 11010802034615号
经营许可证编号:京B2-20210330
大数据征信的“是与非”
传统信用评估模型是根据一个人的借贷历史和还款表现,通过逻辑回归的方式来判断这个人的信用情况。而大数据征信的数据源则十分广泛,包括电子商务、社交网络和搜索行为等都产生了大量的数据。
大数据征信可以通过我们在互联网上留下的这些“足迹”清晰地描绘出一个人,但如何把控数据源的“量”与“度”,各家机构还在不断尝试。更重要的是,最终绘制出的人物“肖像”与个人信用究竟有多大的关联度,至今仍存有争议。
此前亦有接近监管部门人士对《第一财经日报》记者表示,个人征信牌照迟迟未能落地,其原因之一也在于监管部门对于大数据征信的商业化应用存有疑虑。尤其,以人脸识别为代表的关键技术的可靠性还有待进一步检验。
此外,“另一个更重要的症结在于行政化监管与商业化发展之间的矛盾。”该人士表示,现在个人征信市场的参与者越来越多,远不止申请牌照的八家机构,如果该市场要商业化发展,那么监管方式就要改进。
何为大数据征信
在FICO中国区总裁陈建看来,征信的本质就是采集和记录信用信息并在整理加工后提供给决策者,而如今,得益于大数据、云计算、人脸识别、深度算法等技术的进步,征信有了更广泛的意义和用途。
“只要对消费者的特征描绘和风险判断有显著作用的就可以叫征信。”陈建认为,现在一切信息皆可以成为信用数据,经过分析后用于证明一个人或企业的信用状况。因为数据覆盖广、维度多,因此形成了广义的征信,也就是大数据征信。
陈建表示,有价值的大数据具备几个因素:第一要覆盖面广,用户足够多,例如银联、电信的数据;第二维度要有效,能够有效转为结构化的数据,例如电商的数据;第三信息要稳定。
不过,对于这种日益崛起的征信新业态,今年7月在上海外滩举办的“2015上海新金融年会”上,央行[微博]征信中心副主任王晓蕾直截了当地提出了疑问,“我不知道你们说的‘征信’是什么”?
央行的征信系统是一个“放贷人之间的信息共享数据库”,主要采集的数据为身份信息、信贷信息、非金融负债信息三类,以及部分公共信息。因此,王晓蕾对于征信的基本定义为,“从放贷人那里采集借款人信息”。
而另一个“纠结”的概念在于,王晓蕾认为,放贷机构之“征信”是放贷机构基于内部信息的风险管理过程,而征信行业之“征信”是为放贷机构的风险管理提供外部信息支持的活动,征信机构应该是一个纯粹的独立第三方。
如果按照这个界定,我们现在所谈到的大数据征信跳脱了传统“征信”范畴内。不再局限于金融属性的信息,并且也打破了“采集者与信息产生没有任何关系”的独立第三方原则。
例如芝麻信用、前海征信、腾讯征信,一方面它们的数据来源目前还主要来自母公司阿里、平安、腾讯,而另一方面,它们的兄弟公司又涉足放贷业务,例如阿里小贷。
尽管有关大数据征信的定义和效用仍争议不断,但对于既无法接入央行征信系统又面临快速发展的互联网金融行业而言,利用大数据来帮助判定风险、开拓业务已是必然的选择。
从应用范围来看,目前大数据征信已从金融业务向生活服务蔓延。其中,最核心的两个价值就是:防范欺诈风险和信用风险。简单来说就是:既要证明“你是你”,还要描述出“你是什么样的人”。
如何证明“你是你”
无论是在传统金融领域,还是互联网金融领域,给客户做信用评估的前提是必须知道这个人就是他自己。所以,如何利用证明“你是你”是大数据征信首先要解决的问题。
尤其,随着越来越多的金融业务互联网化,“反欺诈”面临的挑战也日益增大。“身份认证”的重要性在各项监管文件中反复被强调,而各家机构也在不断探索如何利用新的技术在网上实现身份的核实。
其中,在指纹、虹膜、人脸识别等一系列生物识别技术中,人脸识别因技术的成熟度和准确率较高,以及其使用的便捷性而被进一步普及。包括腾讯征信、芝麻征信在内的多家个人征信机构都有组建自己的人脸识别技术团队。
此前,在腾讯征信的北京媒体沟通会上,为腾讯财付通、微众银行、腾讯征信等提供图像和模式识别技术支持的优图团队也向大家展示了“人脸识别”在“反欺诈”方面的应用,即如何证明“你是你”。
根据现场的演示,在上传身份证照片、自拍照片并与公安部的信息进行比对之后,“人脸识别”的另一关键步骤是活体检测,通过读取随机的数字串,分析声音和唇语等信息来防范有人用视频、照片等方式仿冒用户。
据了解,在今年国际权威的人脸识别数据库LFW上,腾讯优图团队在人脸验证测试中达到了99.65%的准确率。目前,微信的“人脸识别”技术已经在腾讯征信、微众银行、微证券开户等场景中开始试用。
尽管人脸识别的准确率已经达到较高水平,但该项技术的商业化应用才刚刚起步,它的有效性和安全性仍备受质疑。
优图团队研发总监黄飞跃也表示,该技术现在还不能说100%地成熟,而是适用于某些特定的应用环境中。其中,金融领域的身份核实条件较好,由于用户往往是为了通过验证所以比较配合。
芝麻信用首席科学家俞吴杰表示,整个的反欺诈产品从身份认证到信息验证再到网络关联,每一步的技术含量非常高。以身份认证为例,现在已有很多的途径,比如信息交叉比对、人脸识别技术、KBA问答认证等。
他以网络关联技术为例说明:它能把所有出现过违约行为的身份、手机、设备等关键点都在风险库里面分门别类地保留下来,我们可以通过一层或者多层关联找出所有的风险点供合作伙伴参考,这对技术和硬件要求都非常高。
争议大数据征信
解决了“身份认证”的问题,接下来就要评估你的信用,即描述出“你是什么样的人”。
在关于大数据征信的文章中,我们经常可以看到一些案例,如经常半夜上网的用户可能被认为没有稳定的工作而降低信用评分,买双开门冰箱的用户可能因为有家庭而信用评分较高,微博更新频繁的用户可能因为社交活跃而信用评分较高等。
“这些考量因素被过度放大了,也许这只是用户个人习惯而已。但每一个因素与个人信用的相关性有多大?我们还无法完全解释,尤其当数据源不足够丰富时,这些评判便存在欠缺。”芝麻信用的技术专家景艺亮表示。
冰鉴科技CEO顾凌云在回国前曾领导并开发了ZestFinance前四代风控模型,在他看来,大数据征信的核心并不是对某个变量极其依赖,而是把很多个都只有微小影响的变量通过非线性的算法整合在一起,从而使模型的整体表现更好。
“大数据其实并不一定就是数据量本身大,我们讲求的是变量涵盖的信息维度要多和均衡,然后才是能够通过浅度学习和深度学习等多种复杂的算法把这些变量更有效地糅合在一起。”他表示。
王晓蕾认为,互联网记录了借款人以前不可记录的行为,获得了以前无法获取或获取成本很高的数据,为放贷人了解借款人是谁、有没有还款能力和还款意愿提供了新的渠道和方法。但是,相关的信息究竟如何使用有待进一步研究验证。
王晓蕾引用2014年美国政策与经济研究委员会(PERC)的一项研究结果称,非金融信息在信贷决策中的作用有限。例如,社交信息对于判断借款人的还款意愿和能力暂无预测力。
“诸如水、电、煤、有线电视、手机等非金融信息纳入征信系统,显著地提高了薄信用档案人群的信贷获得能力,但对于厚信用档案人群而言,边际作用不大。”她表示。
“只有好样本,没有坏样本是无法建立有效的信用评估机制的。”宜信至诚征信的董事总经理赵卉表示,电商、支付、社交等数据只能作为信贷审核的参考值,而贷后数据才是强参数。
对于这种论断,互联网公司们或是不赞同的。
腾讯征信总经理吴丹告诉记者,从这段时间内测的结果来看,在模型中加入社交数据以后,对它的风控能力有20%~25%的提升,尤其在小额贷款领域。因为,通常一笔几百块的借款,违约发生的原因不在于借款人的还款能力而是意愿。
俞吴杰表示,通过大量的研究证明,人的行为数据和他的信用有直接关联,因为行为很难撒谎。从这段时间公测的结果来看,用户的芝麻分越高,其贷款的违约率越低,二者呈单调、线性的关系,这也证明了芝麻分在信用评估上的有效性。
不过,仅仅依靠互联网上的数据并不足以建立一个强大的信用评估体系。显然,所有大数据征信的市场参与者都深知这一点。“在未来,把传统数据和创新数据结合到一起,一定是我们要到达的终点。”芝麻信用的总经理胡滔如此总结到。
顾凌云告诉记者,风控模型本质上还是对一个人金融还贷能力的预测和评估,所以,尽管ZestFinance大量采用非传统的信用数据,但在大部分的风险评估模型中,传统的信用数据(银行信贷数据)依然占有一定的比重,平均也在40%左右。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在神经网络模型搭建中,“最后一层是否添加激活函数”是新手常困惑的关键问题——有人照搬中间层的ReLU激活,导致回归任务输出异 ...
2025-12-05在机器学习落地过程中,“模型准确率高但不可解释”“面对数据噪声就失效”是两大核心痛点——金融风控模型若无法解释决策依据, ...
2025-12-05在CDA(Certified Data Analyst)数据分析师的能力模型中,“指标计算”是基础技能,而“指标体系搭建”则是区分新手与资深分析 ...
2025-12-05在回归分析的结果解读中,R方(决定系数)是衡量模型拟合效果的核心指标——它代表因变量的变异中能被自变量解释的比例,取值通 ...
2025-12-04在城市规划、物流配送、文旅分析等场景中,经纬度热力图是解读空间数据的核心工具——它能将零散的GPS坐标(如外卖订单地址、景 ...
2025-12-04在CDA(Certified Data Analyst)数据分析师的指标体系中,“通用指标”与“场景指标”并非相互割裂的两个部分,而是支撑业务分 ...
2025-12-04每到“双十一”,电商平台的销售额会迎来爆发式增长;每逢冬季,北方的天然气消耗量会显著上升;每月的10号左右,工资发放会带动 ...
2025-12-03随着数字化转型的深入,企业面临的数据量呈指数级增长——电商的用户行为日志、物联网的传感器数据、社交平台的图文视频等,这些 ...
2025-12-03在CDA(Certified Data Analyst)数据分析师的工作体系中,“指标”是贯穿始终的核心载体——从“销售额环比增长15%”的业务结论 ...
2025-12-03在神经网络训练中,损失函数的数值变化常被视为模型训练效果的“核心仪表盘”——初学者盯着屏幕上不断下降的损失值满心欢喜,却 ...
2025-12-02在CDA(Certified Data Analyst)数据分析师的日常工作中,“用部分数据推断整体情况”是高频需求——从10万条订单样本中判断全 ...
2025-12-02在数据预处理的纲量统一环节,标准化是消除量纲影响的核心手段——它将不同量级的特征(如“用户年龄”“消费金额”)转化为同一 ...
2025-12-02在数据驱动决策成为企业核心竞争力的今天,A/B测试已从“可选优化工具”升级为“必选验证体系”。它通过控制变量法构建“平行实 ...
2025-12-01在时间序列预测任务中,LSTM(长短期记忆网络)凭借对时序依赖关系的捕捉能力成为主流模型。但很多开发者在实操中会遇到困惑:用 ...
2025-12-01引言:数据时代的“透视镜”与“掘金者” 在数字经济浪潮下,数据已成为企业决策的核心资产,而CDA数据分析师正是挖掘数据价值的 ...
2025-12-01数据分析师的日常,常始于一堆“毫无章法”的数据点:电商后台导出的零散订单记录、APP埋点收集的无序用户行为日志、传感器实时 ...
2025-11-28在MySQL数据库运维中,“query end”是查询执行生命周期的收尾阶段,理论上耗时极短——主要完成结果集封装、资源释放、事务状态 ...
2025-11-28在CDA(Certified Data Analyst)数据分析师的工具包中,透视分析方法是处理表结构数据的“瑞士军刀”——无需复杂代码,仅通过 ...
2025-11-28在统计分析中,数据的分布形态是决定“用什么方法分析、信什么结果”的底层逻辑——它如同数据的“性格”,直接影响着描述统计的 ...
2025-11-27在电商订单查询、用户信息导出等业务场景中,技术人员常面临一个选择:是一次性查询500条数据,还是分5次每次查询100条?这个问 ...
2025-11-27