京公网安备 11010802034615号
经营许可证编号:京B2-20210330
采集和分析大数据时所面临的问题
你或许很熟悉这样一个统计结论:世界90%的数据是过去几年里产生的。事实上,过去三十年中,全世界的数据量大约每两年增加10倍——远远超过了计算机领域的摩尔定律。
这样的信息增长速率会带来一些问题,其中之一便是现时的数据量总是远远超过即使最近的过去。想象你正在通过一本相片簿回顾人生的头18年,假设在两岁时你有两张照片,如果信息增长速率与世界数据量相同,那么在你6到8岁时,你会有惊人的2000张照片;10到12岁时有20万张照片;而在16到18岁时,照片数量会达到2亿张,相当于在最后两年中,每秒有3张以上的照片。
当然,这并非是全球数据增长情况的完美类比。首先,世界大部分数据的增长源于有更多的人创造出了更多的信息来源,同时伴随更大、更精细的格式。不过,有关比例的观点还是成立的。如果你像前述的例子那样回顾以往的记录,或者试图进行分析,那距离越久远的过去就会变得越无关紧要。
这就是目前采集和分析大数据时所面临的问题。当你开始以更长远的视角往前回溯时,会发现近期的事情太多,而以前的事情太少。短视是结构性的,对短期趋势的过度估计是压倒性的,同时却忽略了历史的经验教训。
为了理解这个问题的重要性,需要考虑社会科学中有关“近期偏差”(recency bias,又称近因效应)的研究发现。近期偏差是指在判断趋势时,认为未来事件与近期体验更加类似。这可以说是某种“可利用性法则”(availability heuristic) ——不恰当地以最容易被知觉到的信息来作为思考的基础。这还是一种普遍的心理学特征。举例来说,如果在你居住的地方,过去几年中夏季都异乎寻常地寒冷,你 可能会认为夏天正在变得更冷——或者说你当地的气候正在变冷。事实上,你不应当把任何东西都塞到数据里分析。你需要有一个长远的视角,才能认识真正有意义的气候趋势。在短时期内,你最好不进行任何猜测。不过,我们之中又有谁能真正做到这点呢?
现实生活中大部分复杂的趋势正是如此:股票市场、经济发展、企业的成功或失败、战争或和平、国家关系、帝国的崛起和衰落等等。短期分析不仅不够扎实,而且毫无益处甚至会带来误导。看看2009年金融危机即将到来的时候,还有那么多经济学家信誓旦旦地宣称这一事件不会发生。认为从那种时间尺度的数据就能做出扎实的预测,本身就有很大的问题。
我们还应当记住,在决定哪些数据是保存还是删除的时候,新颖性往往会成为主要的考虑因素。旧的淘汰,新的进来,在这个搜索算法本质上偏向于新鲜事物的数字世界中,这是明显的趋势。从高等法院的裁决,到所有的社交媒体服务平台上,我们到处都可以看到已经失效的网址。对当前的偏好已经渗透到我们身边几乎所有的技 术中,大多数人已经习惯用个四五年就把原本光鲜亮丽的机器抛弃。
怎么办?这不仅是一个如何更好保存旧数据的问题——尽管这并不是个坏主意,想想我们现在还有什么东西能保留10年的。更重要的是,这个问题关系到确定哪些东西值得优先保存,如何在知识的名义下,确定哪些信息最有意义。
或许我们需要的是“智能遗忘”:让我们的工具变得更会放弃最近的过去,从而在整体视角上保持更大的连续性。这有点像是重新组织一本相片簿,尽管加上了更多的 数学方法。什么时候两百万张照片的价值比两千张照片更低?什么时候较大的样品覆盖的范围反而较小?什么时候细节水平能提供有用的质疑证据,而不是虚假的自信?
许多数据集是无法缩减的,而且在完整的情况下才最宝贵,比如,基因序列、人口统计学数据、地理和物理学的原始观测数据等。科学性越弱,数据规模与数据的质量更可能呈现负相关,此时时间本身就成为更加重要的过滤工具。我们如果不仔细选择过去保存下来的有价值、有意义的东西,那它们就会悄无声息地淹没在如今日益增长的噪音之中。
今天的企业、个人和政府机构都能够获得比以往(甚至就在几年前)大许多数量级的数据,但这些数据并没有获得更多的处理时间。利用越来越高效的工具,董事会成员、首席执行官、政府官员等决策者可以就已有的信息提出更有意义的问题。单纯的堆积不是问题的答案。在一个数据量越来越大的时代,如何选择不知道哪些事情,与选择做什么事情一样重要。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在Python Pandas数据分析中,DataFrame是承载结构化数据的核心载体,数据清洗、数据修正、条件赋值、字段更新等实操场景,都离不 ...
2026-09-09 很多数据分析师掌握了Excel函数、会写SQL查询,但当被问到“数据从哪里来”“数据加工有哪些步骤”“如何使用分析工具连接数 ...
2026-09-09卡方检验(Chi-Square Test)是统计学中针对分类数据的经典显著性检验方法,核心用于判断两个离散分类变量是否相互独立、数据实 ...
2026-09-09CDA数据分析师 出品 作者:李诗怡 1. 销售漏斗阶段判断 题目:销售漏斗模型中,通过广告、社交媒体等方式触达品牌信息(如浏览品 ...
2026-09-07在Python数据分析中,Pandas库的DataFrame是最核心、最常用的结构化数据表对象,类似于Excel的二维表格,具备规整的行列结构、字 ...
2026-09-07在数据分析、经营复盘、业绩预测与经济统计工作中,平均增速(平均增长率)是衡量数据长期变化趋势、业务发展快慢的核心指标。不 ...
2026-09-07 很多数据分析师精通Excel单元格操作,但当被问到“表结构数据的基本处理单位是什么”“字段和记录的本质区别”“为什么表结 ...
2026-09-07随着大数据技术的快速发展,商业竞争逐步从传统的经验式经营转变为数据驱动的精细化运营。海量的用户行为数据、交易数据、运营数 ...
2026-09-04CDA数据分析师 出品 作者:李诗怡 1. 波士顿矩阵(BCG Matrix) 定义: BCG于1970年提出的业务组合分析工具,以"市场增长率"(纵 ...
2026-09-04 数据分析师八成以上的时间在和数据表格打交道,但许多人拿到Excel后习惯性地先算、先分析,结果回头发现漏了一列关键数据, ...
2026-09-04数据透视表是Excel与Power BI中最核心的数据分析工具,具备快速汇总、维度拆分、动态筛选的能力,可高效完成数据归类与统计展示 ...
2026-09-03在Power BI数据分析可视化场景中,堆积柱状图+折线图是最常用的复合图表组合。堆积柱状图适合展示各细分维度当期数值、结构占比 ...
2026-09-03 很多数据分析师每天与Excel打交道,但当被问到“表格结构数据的基本处理单位是什么”“数据类型误判会引发哪些分析错误”“ ...
2026-09-03CDA数据分析师 出品 作者:李诗怡 一、8个核心数据清洗函数 1. TRIM:一键清除多余空格(最常用) 作用:仅保留文本中"单词/字 ...
2026-09-02数据分析的核心并非单纯操作工具、整理报表或绘制图表,而是依靠科学的思维逻辑挖掘数据价值、解释业务现象、指导经营决策。在完 ...
2026-09-02在社会经济、产业研究、区域治理与大数据实证分析中,面板数据是最具研究价值的数据类型。面板数据同时包含截面维度与时间维度信 ...
2026-09-02 很多数据分析师能熟练计算均值、标准差,但当被问到“如何用一张图让业务方3秒内看懂核心结论”“面对不同数据类型该怎么选 ...
2026-09-02在数据驱动决策的体系中,数据分析按照分析目的可分为描述性分析、诊断性分析、预测性分析与指导性分析四大类型。其中,诊断性分 ...
2026-09-01网络请求是Python爬虫开发、接口测试、数据拉取的核心基础功能,Python生态中主要依靠 urllib 和 requests 两大库实现HTTP请求操 ...
2026-09-01 很多数据分析师面对业务问题时,常常感到“知道要分析,却不知道用什么方法”。其实,数据分析并非无章可循——从三大基础范 ...
2026-09-01