京公网安备 11010802034615号
经营许可证编号:京B2-20210330
认清大数据四大误区:大数据终将消除经济自由是最大谬误
在互联网时代,大数据已充斥了我们生活和工作的方方面面。有了大数据,人们对于经济社会的认识与把握进入到一个全新的时代,即进入到一个较信息经济更高位阶的新阶段,也就是“数字经济”。数字经济时代,似乎“谁”“掌握”了大数据,就能够对经济活动乃至经济社会做到“全知”,进而能够“预知”经济社会的未来,甚或能够“全能性”地主宰经济社会,但其实这些都是关于“大数据”的认识误区。
误区一:大数据终将主宰经济社会,消除个体差异,成就一元化的经济体系。
网络经济时代,人们在经济社会中的诸种活动通过网络账户体系来实现,这些活动也就是所谓的网络账户活动,其基本内容更多地体现为账户间的关系。这些账户活动及其账户关系是由数字网络程序所设定的、驱动的,且被实时地记录下来。这就形成了所谓的“大数据”。因此,大数据来源于大量的网络账户的活动及其有效的记录,简言之,大数据是网络账户数据。
有人认为,大数据意味着“全知”,进而“全知”意味着“全能”,发展开去,大数据终将主宰经济社会,消除个体差异,成就一元化的经济体系。这是关乎大数据最大的谬误。
“大数据”是“经济自由”所投射下的数字影像,它无法反噬掉“经济自由”,成为经济社会的主宰。经济社会中的大数据,是经济活动的网络化、账户化、数字化的产物,是经济人自由意志的集合映射。换言之,没有高度的经济自由,没有充分而多样化的经济选择,就无所谓“大数据”。
大数据就是社会经济活动的一层“数据化的外衣”而已,不管它多么服帖、合体或随心,活动着的是里面的“身体”,且这个“身体活动”是自由意志所决定的。如果认为掌握了大数据就能影响乃至决定人们的经济决策,将自身的意志贯彻到别人的头上去,这就是本末倒置了。
误区二:大数据是全量数据,能够预知未来。
“大数据”并不能“全能性”地预设未来,但是能否“先知”般地预知未来?同样,做不到。因为,大数据在时间上是有约束条件的。依凭历史数据,能够预知未来吗?
大数据是全量数据,源于事实,也是事实,它并非既有经济理论变量性的函数分析,并不能在时间轴上理所应当地延展开去。在时间轴上,大数据终归是局部的,远非全量,它是实然的,是已发生的,即其性质上仍然是历史数据而已。
大数据本身不是先知,也没有谁能通过大数据成为先知。基于大数据并不能建构所谓的“历史规律”,更谈不上把同大数据有所谓“关系”的某人或某类人嵌入到这一所谓的历史规律中去,进而使其发挥主观能动性,担纲某种角色。历史数据对于未来有一定的作用,但是根本上讲,历史数据并不能决定未来。没人能够凭依大数据而可预知未来,成为先知。
误区三:大数据包揽一切信息。
数据的标准化与格式化,决定了大数据不是“全息”的。
全知是指在一定标准或口径下的全量数据,但并不意味着包揽所有信息。信息的完整性是一个抽象而复杂的问题。数据信息往往是静态的,是在一定时间点下的结论,其被有效地获取甚或表达出来,就意味着一部分信息是确定的、静态的,而另一部分则是不确定、动态的。这就好像猫的眼睛一样,当你用相机去拍摄它时,它便发生变化,也就是必然丢失掉或隐去一部分信息。所以,全知是就对象自身而言的,并非是与对象有关的全部信息而言的。
现实中,人们对于大数据的感受确是非常丰满有力、醒目而刺激的,这种情况一时间使人们感性上误以为这就是全息的。事实上,这种情形以往也反复出现过,有如第一次听到电话听筒里传来另一端亲友的话语,便以为那是真声音。
误区四:把“大数据”当作“小数据”用,分析采用部分局部数据。
经济社会中,如果取得的数据样本有限,就需要确立有效的分析框架,建立模型,确立函数关系,做回归分析。然而,如果样本不仅是充分的,而且是完整的,是全量的,那么数据分析就要摆脱既有的旧模式了。从全样本的大数据中,收窄样本数量,只选取部分样本用来分析,是一种缩量的方法,缩量样本分析后的结论又要适用于总量,这就是对大数据的“小用”。
举例来说,如果能够获得一个城镇全部机动车以及全部外埠入城车辆的运行状况,我们就可依所设议题来直接抓取数据,获得结论。抽样建模分析及其回归分析,就不仅累赘,而且极有可能铸成大错。简单来说,大数据,就是扳手指头数不过来的状况,交给机器与程序去“扳”,不仅数得过来,而且数出来了。大数据往往更多地可以直接抓取并使用,而非在数理化、模型化、函数化等“加工”后再使用。
大数据具有完整性和全局性的特质,如果采用部分局部数据,然后试图得出超出部分局部数据范围的结论,这种既有的思维惯性,并不适用于大数据的逻辑和现实。大数据不能当作小数据用,小数据终归拼不出完整的大数据。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
你有没有想过,手机里点外卖、刷社交软件、转一笔账,背后到底是谁在替你"记着账"? 答案其实很简单:数据库,以及跟它对话的那 ...
2026-10-07CDA数据分析师 出品 作者:李诗怡 一、数据分析四大思维 1. 对比思维:没有对比就没有分析 核心观点:单独一个数字没有意义,有 ...
2026-10-05Kimball 是方法,星型模型是它产出的形状。 很多人把"Kimball vs 星型模型"当成一道选择题——这本身就是个误会:Kimball 是动词 ...
2026-10-05写在开头 老板在微信上甩来一句: "帮我看下为什么销量跌了。" ” 你回工位,打开 SQL,开始写。查订单表、拉近三个月、按 ...
2026-10-03CDA数据分析师 出品 作者:李诗怡 1. 事实表 vs 维度表 对比维度 事实表 维度表 核心问题 记录“业务发生了什么事” 描述 ...
2026-10-02做数据聚合时,PySpark的groupBy()确实能完成统计,这也是它的本职工作。但它有一个根本性局限:每一组数据,最终只能返回一行 ...
2026-10-01热力地图是数据可视化中极具辨识度与实用性的空间分析图表,结合地理空间维度与数据密度特征,通过颜色深浅、色阶渐变直观展示数 ...
2026-09-30 很多数据分析师做过按月份的销售额趋势图,画过按天的流量折线图,但当被问到“时间序列和普通数据有什么本质区别”“季节性 ...
2026-09-30同样是“银行数据岗”,在国有大行总行数据中心、在一家城商行的零售部、在银行系金融科技子公司、在保险公司,工作内容、成长节 ...
2026-09-29在数据分析与统计学研究中,数据往往不是独立存在的,不同变量之间普遍存在相互关联、相互影响的关系。相关性统计分析是挖掘变量 ...
2026-09-29 导读:大多数人只把 dataclasses 当成偷懒工具,用来少写 __init__、__repr__ 这类魔法方法。但它的能力远不止于此。本文带 ...
2026-09-29 很多数据分析师能熟练地计算指标、搭建标签体系,但当被问到“画像到底在解决什么问题”“画像和标签是什么关系”“画像如何 ...
2026-09-29在MySQL数据库运维与业务开发中,行业普遍存在“数据达到千万级就必须分表”的说法。但在实际生产环境中,千万条数据并不是强制 ...
2026-09-28CDA数据分析师 出品 作者:李诗怡 1. 5W1H 分析法 定义:经典系统性思维框架,通过六个核心维度对问题进行全方位拆解与剖析,确 ...
2026-09-28 很多分析师在设计标签时思路清晰,但真到落地环节却面临“数据在手,不知如何转化为可用标签”的困境:或因加工方式选择不当 ...
2026-09-28CDA数据分析师 出品 作者:李诗怡 1. 用户标签体系 定义: 通过一系列高度精炼的特征标识,对用户属性、行为与偏好进行量化刻画 ...
2026-09-24Pandas是Python生态中用于表格数据处理的核心库,广泛应用于数据清洗、统计运算、报表输出、数据分析建模等场景。在处理极大数值 ...
2026-09-24随着数字经济快速发展,数据已成为核心生产要素,各行各业的业务沉淀、用户行为、设备运行、市场交易均产生海量数据。数据处理作 ...
2026-09-24 很多分析师每天和数据打交道,但当被问到“标签是什么”“标签和指标有什么区别”“标签体系如何设计”时,却常常答不上来。 ...
2026-09-24在时序数据分析中,大部分业务数据并非持续平稳变化,而是会在某些时间节点出现突然抬升、断崖下跌、趋势反转、波动异变等现象, ...
2026-09-23