
应用大数据开展分析预测真的重要吗?
最近一段时间,笔者陆续看到一些非议大数据的文章,指出大数据的问题和局限性。但我看到的几乎所有文章,提出的问题都是针对应用大数据进行分析预测而言。其实,早在两年前,我就看到过一则所谓大数据的寓言。话说有一只小猪出生在猪圈里,从它出生起,每天就看到一些两条腿的动物在周围走来走去,给它送一些吃的喝的。小猪高兴的时候,就在泥里打滚;忧伤的时候,就趴在猪圈里看夕阳西下。经过对几百天的“大数据分析”,它得出结论“未来的日子也一定是这样的”。终于,一场血腥的杀戮终结了它的大数据分析。临死的时候,它恍然悟到“(此处省略两个字),大数据都是骗人的”。
其实,寓言都是人编写创作的,为的是说明作者的某种态度和观点。而这则寓言的作者显然回避了一些最为基本且重要的“剧情”,就是小猪的身边还有没有它的同类。如果有,那么小猪不可能不看到其他同类的下场;如果它忽视了,那只能说它的分析出了问题,忽视了几百天的时间内其它同类的命运。如果这只小猪真的是一只遗腹子、独生子女,前无古人后无来者,独自在猪圈里住了几百天,那么,还有什么其他方法能让它对自己的命运作出更加准确的预测吗?
当年,谷歌曾经准确地对禽流感疫情作出预测判断。但作为一个成功的案例却好景不长,此后,谷歌的预测不准了。于是,预测不准又成了“反面教材”。在今年第二期《统计研究》杂志上,秦磊和谢邦昌先生从数据源和统计分析方法的角度,对这个经典案例进行了剖析。而同样的道理是,即使谷歌后来的分析有各种问题,但不依据大数据做出的、比谷歌的预测更加精准的禽流感预测案例,有吗?
2014年9月,国家统计局举办全国统计系统建模大赛。统计科研所的参赛队伍利用百度关键词搜索,对北京的房价走势进行了预测。有媒体担心,统计部门如果做预测,就难免会将自己的实际数字往预测数据上靠,就难免带来数据的失真。其实,利用搜索大数据分析房价,一是为了在传统数据尚未出炉之前,对形势发展早一些做出预判;二是为了使评估传统数据质量时多了一个参照系。分析房价如此,分析预测其他方面的数据及趋势,意义同样如是。对于其他研究人员、专家学者、主管部门而言,应用大数据的意义或许主要就是分析和预测,至少目前是这样;但对政府统计部门和统计工作而言,应用大数据的意义绝非仅限于此,更为重要的,还是将大数据作为统计的重要数据源。
有些质疑的文章说,重视大数据的人,连什么是大数据也未必整得明白。其实,从麦肯锡报告到维基百科,从涂子沛先生的《大数据》到工信部的白皮书,对大数据的的定义都大同小异,概括起来就是三点:体量大,电子化产生,数据与技术的集成。在大数据改变着我们的生活、我们生活的改变又时时催生出新的大数据的今天,越来越多的大数据成为与我们核心指标的基础性数据。不将其恰如其分地纳入统计范围,我们的核心指标就面临失真的风险。
前不久,有媒体报道,阿里集团的年销售额已达3万亿元。这是什么概念呢?2015年全年,中国的社会消费品零售总额为30万亿元,国内生产总值是67.7万亿元。尽管不同指标间或有口径、范围的差异,但作为一家电商企业,阿里的市场份额和扩张速度还是可以由此窥豹一斑的。而除了龙头老大阿里之外,还有京东商城、1号店等诸多电商平台,规模和速度也不可小觑。网上零售的大数据将直接关系社会商品零售总额、行业增加值、居民消费价格指数、居民消费支出等诸多重要统计数据的准确程度。同样,当很多人团购成为习惯、当外卖攻陷校园、当没有一个人去影院买票却可以满场的时候,我们已经到了绝不能再固守原有统计渠道及方法的时候。面对大数据带来的改变,从法律法规到制度方法、到技术手段等诸多方面,变革真的迫在眉睫,真的刻不容缓。而这些,也真的比应用大数据开展分析预测更加重要和急迫。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
用 Power BI 制作地图热力图:基于经纬度数据的实践指南 在数据可视化领域,地图热力图凭借直观呈现地理数据分布密度的优势,成 ...
2025-07-24解析 insert into select 是否会锁表:原理、场景与应对策略 在数据库操作中,insert into select 是一种常用的批量数据插入语句 ...
2025-07-24CDA 数据分析师的工作范围解析 在数字化时代的浪潮下,数据已成为企业发展的核心资产之一。CDA(Certified Data Analyst)数据分 ...
2025-07-24从 CDA LEVEL II 考试题型看 Python 数据分析要点 在数据科学领域蓬勃发展的当下,CDA(Certified Data Analyst)认证成为众多从 ...
2025-07-23用 Python 开启数据分析之旅:从基础到实践的完整指南 在数据驱动决策的时代,数据分析已成为各行业不可或缺的核心能力。而 Pyt ...
2025-07-23鸢尾花判别分析:机器学习中的经典实践案例 在机器学习的世界里,有一个经典的数据集如同引路明灯,为无数初学者打开了模式识别 ...
2025-07-23解析 response.text 与 response.content 的核心区别 在网络数据请求与处理的场景中,开发者经常需要从服务器返回的响应中提取数 ...
2025-07-22解析神经网络中 Softmax 函数的核心作用 在神经网络的发展历程中,激活函数扮演着至关重要的角色,它们为网络赋予了非线性能力, ...
2025-07-22CDA数据分析师证书考取全攻略 一、了解 CDA 数据分析师认证 CDA 数据分析师认证是一套科学化、专业化、国际化的人才考核标准, ...
2025-07-22左偏态分布转正态分布:方法、原理与实践 左偏态分布转正态分布:方法、原理与实践 在统计分析、数据建模和科学研究中,正态分 ...
2025-07-22你是不是也经常刷到别人涨粉百万、带货千万,心里痒痒的,想着“我也试试”,结果三个月过去,粉丝不到1000,播放量惨不忍睹? ...
2025-07-21我是陈辉,一个创业十多年的企业主,前半段人生和“文字”紧紧绑在一起。从广告公司文案到品牌策划,再到自己开策划机构,我靠 ...
2025-07-21CDA 数据分析师的职业生涯规划:从入门到卓越的成长之路 在数字经济蓬勃发展的当下,数据已成为企业核心竞争力的重要来源,而 CD ...
2025-07-21MySQL执行计划中rows的计算逻辑:从原理到实践 MySQL 执行计划中 rows 的计算逻辑:从原理到实践 在 MySQL 数据库的查询优化中 ...
2025-07-21在AI渗透率超85%的2025年,企业生存之战就是数据之战,CDA认证已成为决定企业存续的生死线!据麦肯锡全球研究院数据显示,AI驱 ...
2025-07-2035岁焦虑像一把高悬的利刃,裁员潮、晋升无望、技能过时……当职场中年危机与数字化浪潮正面交锋,你是否发现: 简历投了10 ...
2025-07-20CDA 数据分析师报考条件详解与准备指南 在数据驱动决策的时代浪潮下,CDA 数据分析师认证愈发受到瞩目,成为众多有志投身数 ...
2025-07-18刚入职场或是在职场正面临岗位替代、技能更新、人机协作等焦虑的打工人,想要找到一条破解职场焦虑和升职瓶颈的系统化学习提升 ...
2025-07-182025被称为“AI元年”,而AI,与数据密不可分。网易公司创始人丁磊在《AI思维:从数据中创造价值的炼金术 ...
2025-07-18CDA 数据分析师:数据时代的价值挖掘者 在大数据席卷全球的今天,数据已成为企业核心竞争力的重要组成部分。从海量数据中提取有 ...
2025-07-18