京公网安备 11010802034615号
经营许可证编号:京B2-20210330
互联网金融正面临的挑战:大数据
一、大数据信息有效性不足
虽然信息时代使得人们面对的信息规模扩大和沟通效率提高, 但是这并不意味着有价值的数据信息获取就变得更加迅捷和容易。
首先,有价值的数据信息获取面临挑战。网络信息资源在扩大人们信息来源渠道和提高信息获取效率的同时,也不可避免的会促使人们遭受大量虚假、无用数据信息的困扰。信息大爆炸造成的信息环境污染和“噪音信息”的蔓延增加了人们识别、判定和利用有效信息的困难。
其次,有价值的数据信息整合面临挑战。使用大数据面临的一大挑战就是如何将社会经济各个主体之间的数据信息能够方便和有效地整合在一起。要想让大数据更有效地服务于人类社会,就必须将存在于社会各个主体中多种格式的海量数据通过统一的数据格式构建融合人、机、物三元世界的统一信息系统。最后,有价值的数据信息生成存在算法演化问题。在现实中,大数据往往是根据各个社会经济主体行为被动产生的,但是数据生成者的商业模式等行为会影响大数据的生成机制,导致其提供的信息不具有时间前后的可比性。以谷歌公司为例,其商业模式的主要目标是更快速地为使用者提供准确的信息。为此,谷歌不断改进搜索算法,使用者可以通过后续谷歌推荐的相关词快捷地获得有用信息。这一模式改变了数据生成机制,容易出现数据使用者搜索的关键词并非其本意的现象。
二、大数据样本选择困难
人们希望通过海量数据信息的收集减少信息不对称,但是这些庞大的数据可能对我们解决问题并不会起到正面的作用。当前,大数据使企业或者机构获取每一个客户的信息、构建客户群的总体数据成为可能。但是,这种大数据并不一定就是我们所要研究对象的全部数据总体。如果我们误将掌握的海量数据当作所要研究对象的数据总体,那么基于大数据分析得出的结论就很有可能是错误的。因此,在分析和研究某个问题时,我们不能迷信大数据的作用。
以“谷歌流感趋势”(GFT) 项目为例,2008 年11 月谷歌公司启动该项目,目标是预测美国疾控中心(CDC) 报告的流感发病率。2009 年,GFT 团队在《自然》杂志发表文章报告,只需分析数十亿搜索中45 个与流感相关的关键词,GFT 就能比CDC 提前两周预报2007-2008 季流感的发病率。但是,2014 年美国《科学》杂志报道,2009 年GFT 没有能预测到非季节性流感A-H1N1;从2011 年8 月到2013 年8 月的108 周里,GFT 有100 周高估了CDC 报告的流感发病率。其中,2011-2012 季期间,GFT 预测的发病率是CDC 报告值的1.5 倍多;2012-2013 季期间,GFT 流感发病率是CDC 报告值的2 倍多。另外,2007 年美国爆发的次贷危机也是一个例证。自20 世纪90 年代起, 美国无论是抵押贷款和信用卡的申请还是资产证券化产品的定价和评级,都是建立在较为成熟的大数据基础上的。但是,金融机构仍然做出了系统性错误的金融决策,成为金融危机爆发的导火索。
三、大数据数据处理技术更新缓慢
大数据虽然可以通过扩大数据样本规模和提升数据处理能力来管理日常经营性的风险,但是代表金融创新风险等未来事件是无法用历史数据进行预测和分析的。
首先,大数据处理技术面临数据生成者学习行为的挑战。大数据处理技术和评估标准影响数据生成者行为,同样数据生成者行为也会影响大数据处理技术和评估标准。以我国大数据重要来源之一的社交媒体为例,这种大数据来源的有效性是有前提条件的,即人们在社交媒体分享的信息都是真实的、自发的、不受大数据处理技术和各种评估标准的影响。但是,人们在互联网时代运用网络学习的能力是不断提高的。如果人们通过学习大数据处理技术和各种评估标准而相应改变社交媒体的信息,就会导致大数据生成机制发生质变。因此,在对大数据进行技术处理时,简单地认为数据生成者都是无意识地生产大数据,忽略了数据生产者行为背后趋利避害的动机,可能就会得出错误的判断和结论。
其次,大数据处理技术面临去冗降噪挑战。在现实中,大数据一般来自于不同的社会主体,以动态数据流的形式产生,人们在方便获取数据的同时,也会使得虚假数据、无效数据等噪声数据的生产成本降低。面对大数据中包含众多不同形态的噪声数据,如何通过数据处理技术的革新来挖掘有价值的信息是我们自始至终都要面临的一项技术挑战。这如同人类社会医学技术创新与病毒变异之间的“竞赛”一样是长期存在的。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据仓库与数据分析体系中,维度表与事实表是构建结构化数据模型的核心组件,二者如同“骨架”与“血肉”,协同支撑起各类业务 ...
2026-01-16在游戏行业“存量竞争”的当下,玩家留存率直接决定游戏的生命周期与商业价值。一款游戏即便拥有出色的画面与玩法,若无法精准识 ...
2026-01-16为配合CDA考试中心的 2025 版 CDA Level III 认证新大纲落地,CDA 网校正式推出新大纲更新后的第一套官方模拟题。该模拟题严格遵 ...
2026-01-16在数据驱动决策的时代,数据分析已成为企业运营、产品优化、业务增长的核心工具。但实际工作中,很多数据分析项目看似流程完整, ...
2026-01-15在CDA(Certified Data Analyst)数据分析师的日常工作中,“高维数据处理”是高频痛点——比如用户画像包含“浏览次数、停留时 ...
2026-01-15在教育测量与评价领域,百分制考试成绩的分布规律是评估教学效果、优化命题设计的核心依据,而正态分布则是其中最具代表性的分布 ...
2026-01-15在用户从“接触产品”到“完成核心目标”的全链路中,流失是必然存在的——电商用户可能“浏览商品却未下单”,APP新用户可能“ ...
2026-01-14在产品增长的核心指标体系中,次日留存率是当之无愧的“入门级关键指标”——它直接反映用户对产品的首次体验反馈,是判断产品是 ...
2026-01-14在CDA(Certified Data Analyst)数据分析师的业务实操中,“分类预测”是高频核心需求——比如“预测用户是否会购买商品”“判 ...
2026-01-14在数字化时代,用户的每一次操作——无论是电商平台的“浏览-加购-下单”、APP的“登录-点击-留存”,还是金融产品的“注册-实名 ...
2026-01-13在数据驱动决策的时代,“数据质量决定分析价值”已成为行业共识。数据库、日志系统、第三方平台等渠道采集的原始数据,往往存在 ...
2026-01-13在CDA(Certified Data Analyst)数据分析师的核心能力体系中,“通过数据建立模型、实现预测与归因”是进阶关键——比如“预测 ...
2026-01-13在企业数字化转型过程中,业务模型与数据模型是两大核心支撑体系:业务模型承载“业务应该如何运转”的逻辑,数据模型解决“数据 ...
2026-01-12当前手游市场进入存量竞争时代,“拉新难、留存更难”成为行业普遍痛点。对于手游产品而言,用户留存率不仅直接决定产品的生命周 ...
2026-01-12在CDA(Certified Data Analyst)数据分析师的日常工作中,“挖掘变量间的关联关系”是高频核心需求——比如判断“用户停留时长 ...
2026-01-12在存量竞争时代,用户流失率直接影响企业的营收与市场竞争力。无论是电商、互联网服务还是金融行业,提前精准预测潜在流失用户, ...
2026-01-09在量化投资领域,多因子选股是主流的选股策略之一——其核心逻辑是通过挖掘影响股票未来收益的各类因子(如估值、成长、盈利、流 ...
2026-01-09在CDA(Certified Data Analyst)数据分析师的工作场景中,分类型变量的关联分析是高频需求——例如“用户性别与商品偏好是否相 ...
2026-01-09数据库中的历史数据,是企业运营过程中沉淀的核心资产——包含用户行为轨迹、业务交易记录、产品迭代日志、市场活动效果等多维度 ...
2026-01-08在电商行业竞争日趋激烈的当下,数据已成为驱动业务增长的核心引擎。电商公司的数据分析师,不仅是数据的“解读官”,更是业务的 ...
2026-01-08