
大数据≠科学实验_唯数据论者当冷静_数据分析师
双十一的购物狂潮已过,但有关双十一的话题依旧层出不穷。从“大数据成就双十一”到“哪个星座是购物狂人”,上至专业数据分析人员,下至业余星座研究爱好者,都从中找到了乐趣。这两天有关“购买大号内衣的女性往往更败家”的话题又登上了热榜。
大数据分析师在对阿里巴巴内衣销售数据进行分析后发现,购买大号内衣的女性往往更“败家”。其根据是,65%B罩杯的女性属于低消费顾客,而C罩杯及以上的顾客大多属于中等消费或高消费买家。这一结论是否成立姑且不论,但首先传递了一个信息,今天人们已经进入数据为王的时代,其中大数据似乎又是王中之王。
大数据时代无论是商业网站还是搜索网站,人们的所搜所看所买都成为大数据的组成部分,无论之于商业,还是之于公共卫生,抑或国家安全,它们都是有用的信息。有心人已经意识到,因为拥有大量未经充分研究的中产阶层,中国成为世界上最重要的数据市场之一。研究这些数据,对社会各方面都是多赢。当然,保护人们个人隐私的代价需要考虑。
2008年谷歌推出“谷歌流感趋势”(GFT)数据分析工具,谷歌的工程师根据这个工具的数据分析,预测了2009年H1N1流感将要暴发,甚至具体到特定的地区和州。这一结论在流感暴发前发表在英国的《自然》杂志上。后来,情况果真如此,这与美国疾病控制和预防中心(CDC)的预测完全一致,但时间上比CDC早了近两周。从2010年起,阿里巴巴利用其数据建立的信用记录,向小微企业提供融资,也取得了不错的效果。
这些结果表明,数据为王时代早就到来。其实,这并不奇怪。人类文明的三大支柱是材料(物质)、能量和信息,数据又是信息中的核心部分。古希腊的毕达哥拉斯早就说过,“一切皆数”,尽管其所说的“数”与今天的数据有所不同,但在某些方面是相似的。
不过,数据为王并不意味着大数据为王,或数据越多越好,还要看如何分析和利用数据,进而得出最契合实际的结论,并且有效利用这一结论。因此,如果要承认阿里巴巴基于内衣销售的数据分析得出的女性胸越大越“败家”的结论,就需要有符合客观实际的解释,不幸的是,这一结论还处于见仁见智的阶段。网友的各种分析就提供了佐证:一是“大胸都被有钱人娶了,所以才有能力败”;二是“说明青春期的营养状况确实会影响胸的大小”,“胸大的确实普遍嫁得好”;三是“胸大并不败家,集中在网上打折的时候买东西,只会旺家。”
这笔混乱账目前肯定掰扯不清,但已有事实证明,数据越大并不意味着越好。就算是谷歌,一旦他们的大数据处理和分析不当,也会得出错误的结论。2013年1月,美国又发生流感,但GFT的预测比实际数据高两倍。这并非偶然出现错误,而是在过去一再发生。2011年8月~2013年9月,GFT高估流感流行长达108周。
谷歌的大数据为何预测不准呢?发表在2014年3月14日《科学》杂志上的一篇文章指出了两个主要原因。一是大数据浮夸,二是算法变化。大数据浮夸指的是,以为大数据可以完全取代传统的数据收集方法,而非作为后者的补充。大数据浮夸的最大问题在于,绝大多数大数据与经过严谨科学试验得到的数据之间存在很大的差异。
另外,谷歌对算法会进行不断的调整和改进,搜索引擎算法的改变和用户的搜索行为会影响到预测结果,比如媒体对于流感流行的报道会增加与流感相关的词语的搜索次数,进而影响GFT的预测;相关搜索算法也会对GFT造成影响。例如,搜索“发烧”,相关搜索中会给出关键词“流感”,而搜索“咳嗽”则会给出“普通感冒”。
大数据在某种程度上确实能透析出一些问题,但它并不是万能的,在大数据应用方面保持冷静,才能让大数据真正实现其价值。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
PowerBI 累计曲线制作指南:从 DAX 度量到可视化落地 在业务数据分析中,“累计趋势” 是衡量业务进展的核心视角 —— 无论是 “ ...
2025-08-15Python 函数 return 多个数据:用法、实例与实战技巧 在 Python 编程中,函数是代码复用与逻辑封装的核心载体。多数场景下,我们 ...
2025-08-15CDA 数据分析师:引领商业数据分析体系构建,筑牢企业数据驱动根基 在数字化转型深化的今天,企业对数据的依赖已从 “零散分析” ...
2025-08-15随机森林中特征重要性(Feature Importance)排名解析 在机器学习领域,随机森林因其出色的预测性能和对高维数据的适应性,被广 ...
2025-08-14t 统计量为负数时的分布计算方法与解析 在统计学假设检验中,t 统计量是常用的重要指标,其分布特征直接影响着检验结果的判断。 ...
2025-08-14CDA 数据分析师与业务数据分析步骤 在当今数据驱动的商业世界中,数据分析已成为企业决策和发展的核心驱动力。CDA 数据分析师作 ...
2025-08-14前台流量与后台流量:数据链路中的双重镜像 在商业数据分析体系中,流量数据是洞察用户行为与系统效能的核心依据。前台流量与 ...
2025-08-13商业数据分析体系构建与 CDA 数据分析师的协同赋能 在企业数字化转型的浪潮中,商业数据分析已从 “可选工具” 升级为 “核 ...
2025-08-13解析 CDA 数据分析师:数据时代的价值挖掘者 在数字经济高速发展的今天,数据已成为企业核心资产,而将数据转化为商业价值的 ...
2025-08-13解析 response.text 与 response.content 的核心区别 在网络数据请求与处理的场景中,开发者经常需要从服务器返回的响应中提取数 ...
2025-08-12MySQL 统计连续每天数据:从业务需求到技术实现 在数据分析场景中,连续日期的数据统计是衡量业务连续性的重要手段 —— 无论是 ...
2025-08-12PyTorch 中 Shuffle 机制:数据打乱的艺术与实践 在深度学习模型训练过程中,数据的呈现顺序往往对模型性能有着微妙却关键的影响 ...
2025-08-12Pandas 多列条件筛选:从基础语法到实战应用 在数据分析工作中,基于多列条件筛选数据是高频需求。无论是提取满足特定业务规则的 ...
2025-08-12人工智能重塑 CDA 数据分析领域:从工具革新到能力重构 在数字经济浪潮与人工智能技术共振的 2025 年,数据分析行业正经历着前所 ...
2025-08-12游戏流水衰退率:计算方法与实践意义 在游戏行业中,流水(即游戏收入)是衡量一款游戏商业表现的核心指标之一。而游戏流水衰退 ...
2025-08-12CDA 一级:数据分析入门的基石 在当今数据驱动的时代,数据分析能力已成为职场中的一项重要技能。CDA(Certified Data Anal ...
2025-08-12破解游戏用户流失困局:从数据洞察到留存策略 在游戏行业竞争白热化的当下,用户流失率已成为衡量产品健康度的核心指标。一款游 ...
2025-08-11数据时代的黄金入场券:CDA 认证解锁职业新蓝海 一、万亿级市场需求下的数据分析人才缺口 在数字化转型浪潮中,数据已成为企业核 ...
2025-08-11DBeaver 实战:实现两个库表结构同步的高效路径 在数据库管理与开发工作中,保持不同环境(如开发库与生产库、主库与从库)的表 ...
2025-08-08t 检验与卡方检验:数据分析中的两大统计利器 在数据分析领域,统计检验是验证假设、挖掘数据规律的重要手段。其中,t 检验和卡 ...
2025-08-08