京公网安备 11010802034615号
经营许可证编号:京B2-20210330
应用大数据开展分析预测真的重要吗?
最近一段时间,笔者陆续看到一些非议大数据的文章,指出大数据的问题和局限性。但我看到的几乎所有文章,提出的问题都是针对应用大数据进行分析预测而言。其实,早在两年前,我就看到过一则所谓大数据的寓言。话说有一只小猪出生在猪圈里,从它出生起,每天就看到一些两条腿的动物在周围走来走去,给它送一些吃的喝的。小猪高兴的时候,就在泥里打滚;忧伤的时候,就趴在猪圈里看夕阳西下。经过对几百天的“大数据分析”,它得出结论“未来的日子也一定是这样的”。终于,一场血腥的杀戮终结了它的大数据分析。临死的时候,它恍然悟到“(此处省略两个字),大数据都是骗人的”。
其实,寓言都是人编写创作的,为的是说明作者的某种态度和观点。而这则寓言的作者显然回避了一些最为基本且重要的“剧情”,就是小猪的身边还有没有它的同类。如果有,那么小猪不可能不看到其他同类的下场;如果它忽视了,那只能说它的分析出了问题,忽视了几百天的时间内其它同类的命运。如果这只小猪真的是一只遗腹子、独生子女,前无古人后无来者,独自在猪圈里住了几百天,那么,还有什么其他方法能让它对自己的命运作出更加准确的预测吗?
当年,谷歌曾经准确地对禽流感疫情作出预测判断。但作为一个成功的案例却好景不长,此后,谷歌的预测不准了。于是,预测不准又成了“反面教材”。在今年第二期《统计研究》杂志上,秦磊和谢邦昌先生从数据源和统计分析方法的角度,对这个经典案例进行了剖析。而同样的道理是,即使谷歌后来的分析有各种问题,但不依据大数据做出的、比谷歌的预测更加精准的禽流感预测案例,有吗?
2014年9月,国家统计局举办全国统计系统建模大赛。统计科研所的参赛队伍利用百度关键词搜索,对北京的房价走势进行了预测。有媒体担心,统计部门如果做预测,就难免会将自己的实际数字往预测数据上靠,就难免带来数据的失真。其实,利用搜索大数据分析房价,一是为了在传统数据尚未出炉之前,对形势发展早一些做出预判;二是为了使评估传统数据质量时多了一个参照系。分析房价如此,分析预测其他方面的数据及趋势,意义同样如是。对于其他研究人员、专家学者、主管部门而言,应用大数据的意义或许主要就是分析和预测,至少目前是这样;但对政府统计部门和统计工作而言,应用大数据的意义绝非仅限于此,更为重要的,还是将大数据作为统计的重要数据源。
有些质疑的文章说,重视大数据的人,连什么是大数据也未必整得明白。其实,从麦肯锡报告到维基百科,从涂子沛先生的《大数据》到工信部的白皮书,对大数据的的定义都大同小异,概括起来就是三点:体量大,电子化产生,数据与技术的集成。在大数据改变着我们的生活、我们生活的改变又时时催生出新的大数据的今天,越来越多的大数据成为与我们核心指标的基础性数据。不将其恰如其分地纳入统计范围,我们的核心指标就面临失真的风险。
前不久,有媒体报道,阿里集团的年销售额已达3万亿元。这是什么概念呢?2015年全年,中国的社会消费品零售总额为30万亿元,国内生产总值是67.7万亿元。尽管不同指标间或有口径、范围的差异,但作为一家电商企业,阿里的市场份额和扩张速度还是可以由此窥豹一斑的。而除了龙头老大阿里之外,还有京东商城、1号店等诸多电商平台,规模和速度也不可小觑。网上零售的大数据将直接关系社会商品零售总额、行业增加值、居民消费价格指数、居民消费支出等诸多重要统计数据的准确程度。同样,当很多人团购成为习惯、当外卖攻陷校园、当没有一个人去影院买票却可以满场的时候,我们已经到了绝不能再固守原有统计渠道及方法的时候。面对大数据带来的改变,从法律法规到制度方法、到技术手段等诸多方面,变革真的迫在眉睫,真的刻不容缓。而这些,也真的比应用大数据开展分析预测更加重要和急迫。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
CDA持证人已遍布在世界范围各行各业,包括世界500强企业、顶尖科技独角兽、大型金融机构、国企事业单位、国家行政机关等等,“CDA数据分析师”人才队伍遵守着CDA职业道德准则,发挥着专业技能,已成为支撑科技发展的核心力量。 ...
2026-01-22在数字化时代,企业积累的海量数据如同散落的珍珠,而数据模型就是串联这些珍珠的线——它并非简单的数据集合,而是对现实业务场 ...
2026-01-22在数字化运营场景中,用户每一次点击、浏览、交互都构成了行为轨迹,这些轨迹交织成海量的用户行为路径。但并非所有路径都具备业 ...
2026-01-22在数字化时代,企业数据资产的价值持续攀升,数据安全已从“合规底线”升级为“生存红线”。企业数据安全管理方法论以“战略引领 ...
2026-01-22在SQL数据分析与业务查询中,日期数据是高频处理对象——订单创建时间、用户注册日期、数据统计周期等场景,都需对日期进行格式 ...
2026-01-21在实际业务数据分析中,单一数据表往往无法满足需求——用户信息存储在用户表、消费记录在订单表、商品详情在商品表,想要挖掘“ ...
2026-01-21在数字化转型浪潮中,企业数据已从“辅助资源”升级为“核心资产”,而高效的数据管理则是释放数据价值的前提。企业数据管理方法 ...
2026-01-21在数字化商业环境中,数据已成为企业优化运营、抢占市场、规避风险的核心资产。但商业数据分析绝非“堆砌数据、生成报表”的简单 ...
2026-01-20定量报告的核心价值是传递数据洞察,但密密麻麻的表格、复杂的计算公式、晦涩的数值罗列,往往让读者望而却步,导致核心信息被淹 ...
2026-01-20在CDA(Certified Data Analyst)数据分析师的工作场景中,“精准分类与回归预测”是高频核心需求——比如预测用户是否流失、判 ...
2026-01-20在建筑工程造价工作中,清单汇总分类是核心环节之一,尤其是针对楼梯、楼梯间这类包含多个分项工程(如混凝土浇筑、钢筋制作、扶 ...
2026-01-19数据清洗是数据分析的“前置必修课”,其核心目标是剔除无效信息、修正错误数据,让原始数据具备准确性、一致性与可用性。在实际 ...
2026-01-19在CDA(Certified Data Analyst)数据分析师的日常工作中,常面临“无标签高维数据难以归类、群体规律模糊”的痛点——比如海量 ...
2026-01-19在数据仓库与数据分析体系中,维度表与事实表是构建结构化数据模型的核心组件,二者如同“骨架”与“血肉”,协同支撑起各类业务 ...
2026-01-16在游戏行业“存量竞争”的当下,玩家留存率直接决定游戏的生命周期与商业价值。一款游戏即便拥有出色的画面与玩法,若无法精准识 ...
2026-01-16为配合CDA考试中心的 2025 版 CDA Level III 认证新大纲落地,CDA 网校正式推出新大纲更新后的第一套官方模拟题。该模拟题严格遵 ...
2026-01-16在数据驱动决策的时代,数据分析已成为企业运营、产品优化、业务增长的核心工具。但实际工作中,很多数据分析项目看似流程完整, ...
2026-01-15在CDA(Certified Data Analyst)数据分析师的日常工作中,“高维数据处理”是高频痛点——比如用户画像包含“浏览次数、停留时 ...
2026-01-15在教育测量与评价领域,百分制考试成绩的分布规律是评估教学效果、优化命题设计的核心依据,而正态分布则是其中最具代表性的分布 ...
2026-01-15在用户从“接触产品”到“完成核心目标”的全链路中,流失是必然存在的——电商用户可能“浏览商品却未下单”,APP新用户可能“ ...
2026-01-14