京公网安备 11010802034615号
经营许可证编号:京B2-20210330
大数据何以成为“主义”
数据者,有广义与狭义之分。狭义的数据,就是数字或数值,如1、2、3、4、5⋯⋯;广义的数据,则可概括为人类观察、实验、计算等的记录。
作为这些记录的符号,或数字,或文字,或图像,或音视频,从上古时代的结绳记事、楔形文字、甲骨文,到古代乃至现代以竹简、布帛、羊皮、纸张等为载体的图文,直至现在以比特为单位的电子信息,可谓无所不包。
也许,正是由于互联网技术工程师们习惯于把以电子信息方式存在的内容统称为“数据”,于是,“数据”一词便由狭义的“数字”或“数值”演变为主要指向通用的广义“数据”。
随着计算机、互联网、现代通信以及相关软硬件技术的飞速发展,大数据和云计算,如同一枚硬币不可分离的两面,成为我们这个时代的高频词。
大数据之大,不仅大在巨量或海量——由人们熟知的千字节(KB)、兆(MB)、千兆(GB)和太字节(TB),跃升为专业人士才了解的拍字节 (PB)、艾字节(EB)、泽字节(ZB),乃至尧字节(YB)。 (1KB=1024B,1MB=1024KB,1GB=1024MB,1TB=1024GB,1PB=1024TB,1EB=1024PB,1ZB=1024EB,1YB=1024ZB)。
其中,不变的是基本单位B,即比特或字节,而从K到Y,则是成千倍的递增,以致有人据此宣称,目前的数据计算已经进入“PB时代”。
大数据之大,还大在数据结构的有容乃大——它不再需要传统的数据库表格来整齐排列,几乎可以无所不包地记录、存储和计算各种规则的结构化数据和不规则的非结构化数据,于是,便有了逐步演变为一个数字化世界的可能。
如此庞大和复杂的数据,远远超出传统计算机的处理能力,于是,建立在互联网基础上的云计算技术应运而生,承担起存储、传输、计算和应用大数据的重任。而正是大数据与云计算的有效互动,打开了世界观、方法论乃至价值观的新视野。
在本书中,作者引用专业研究机构的统计,揭示了大数据的规模与速度:一方面,到2014年,全世界电子化数据已增至4.4ZB,即4.4亿万亿 字节,如果将如此之巨的信息量存入只有7.5毫米厚的苹果平板电脑,后者叠加起来的厚度可达地球与月球间距离的2/3;另一方面,有史以来90%的数据 量,都是在过去两年的时间里产生的。
由此不难预期,一个电子化的、独立于物质世界的“数字世界”,正在大数据和云计算的互动中迅速构建,它虽然不可能穷尽物质世界全部存在,越来越逼近物质世界本体却是不争的事实。
尤为值得注意的是,许许多多以往被闲置的数据,由于一些精明商家的开发和利用,开始“变废为宝”。一个耳熟能详的案例,就是那个“尿片+啤酒” 的商业发现与行动。世界最大零售商沃尔玛通过大数据统计和分析发现,男性顾客在购买婴儿尿片时,常常会顺便买上几瓶啤酒,于是推出将啤酒和尿片捆绑销售的 促销方式,从而有效地提高了啤酒销量。
凡此种种表明,如同宇宙大爆炸般飞速扩张的“数字世界”,不仅日益成为外在的客观物质世界的“镜像”,而且正在越来越多地包含对人类自身行为的追踪和记录,成为人类观察和认识自我的“镜子”。
二者的叠加,形成一个有趣的悖论:由大数据构筑而成的数字世界,在日趋脱离客观物质世界的同时,又越来越接近世界的本原。因此,人们在解码这样一个虚拟世界的同时,也在一定程度上改变着对世界的看法。
然而,就在哲学家们对数字世界的属性还没有来得及给出明确界定之际,为利益所驱动的商家们却迫不及待地启动了对这一新矿藏的发掘。
它们是如此急切:还没来得及弄清两个相关现象之间的互动机理或因果关系,便急匆匆地将其中的商机转化为提升经济效益的手段;云计算技术刚刚出现,便迅速地将统计分析对象由随机采样拓展为可获取的全部数据;为寻求“大数据的高效率”,不惜置“小数据的精确度”于不顾⋯⋯
回过头来看,正是这近乎“饥不择食”的匆忙,竟在无意中成就了认识数字世界的锁钥:不再执着于因果关联,不再满足于抽样分析,不再一味地追求精 确度的提高,转而直面模糊与混杂,关注看似不相关的相关现象。这一系列有别于以往的方法,为人类认识世界、解决问题提供了传统工具箱中没有的新工具。
诚如史蒂夫.洛尔在本书中的比喻,这些大数据时代的新工具,犹如“望远镜”和“显微镜”。“望远镜”让人们看得更远,发现新的星系;“显微镜”则将比细胞更加微小的世界展示在人们面前,人们据此看到并计量之前一无所知的事物。
抛开学术和技术层面的研讨,大数据及其应用几乎与生俱来就伴随了喋喋不休的争论。
其中有两个关键词,一是“开放”,一是“保护”。如果说开放就是要打破垄断分割,推动信息与数据互联互通;变革体制机制,实现数据资源共有共 享;鼓励技术创新,促进大数据资源开发利用⋯⋯最大限度地拓展数字世界“公共空间”,让大数据和云计算普惠大众,造福人类;那么保护则意味着要在数字世界 为个人留下一方“私密领地”,或者为公权力画上一道不能逾越的“红线”——“风可进,雨可进,国王不能进”。
开放与保护,“公共空间”与“私密领地”,在这里构成既对立又统一的关系。对立在开放与保护“井水不犯河水”,统一在“公共空间”与“私密领地”共存于同一个数字世界,且双方都以对方的存在为自身存在的证据,正所谓没有“公”即没有“私”,没有“私”亦没有“公”。
一言以蔽之,数字世界与现实世界理应奉行同样的价值理念:该开放的一定要最大限度开放,该保护的必须严格加以保护。
本书向读者展示了这样一幅图景:不管你自觉还是不自觉,乐意还是不乐意,大数据正以空前的速度和规模渗透到人类社会生活的方方面面,它在一定程 度上已经和正在改变人们观察、认识、思考乃至生存与发展的方式。特别是这后一方面的变化,或许就是“大数据”之所以成为“主义”的原因。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在实验检测、质量控制、科研验证等场景中,“方法验证”是确保检测/分析结果可靠、可复用的核心环节——无论是新开发的检测方法 ...
2026-03-04在数据分析、科研实验、办公统计等场景中,我们常常需要对比两组数据的整体差异——比如两种营销策略的销售额差异、两种实验方案 ...
2026-03-04在数字化转型进入深水区的今天,企业对数据的依赖程度日益加深,而数据治理体系则是企业实现数据规范化、高质量化、价值化的核心 ...
2026-03-04在深度学习,尤其是卷积神经网络(CNN)的实操中,转置卷积(Transposed Convolution)是一个高频应用的操作——它核心用于实现 ...
2026-03-03在日常办公、数据分析、金融理财、科研统计等场景中,我们经常需要计算“平均值”来概括一组数据的整体水平——比如计算月度平均 ...
2026-03-03在数字化转型的浪潮中,数据已成为企业最核心的战略资产,而数据治理则是激活这份资产价值的前提——没有规范、高质量的数据治理 ...
2026-03-03在Excel办公中,数据透视表是汇总、分析繁杂数据的核心工具,我们常常通过它快速得到销售额汇总、人员统计、业绩分析等关键结果 ...
2026-03-02在日常办公和数据分析中,我们常常需要探究两个或多个数据之间的关联关系——比如销售额与广告投入是否正相关、员工出勤率与绩效 ...
2026-03-02在数字化运营中,时间序列数据是CDA(Certified Data Analyst)数据分析师最常接触的数据类型之一——每日的营收、每小时的用户 ...
2026-03-02在日常办公中,数据透视表是Excel、WPS等表格工具中最常用的数据分析利器——它能快速汇总繁杂数据、挖掘数据关联、生成直观报表 ...
2026-02-28有限元法(Finite Element Method, FEM)作为工程数值模拟的核心工具,已广泛应用于机械制造、航空航天、土木工程、生物医学等多 ...
2026-02-28在数字化时代,“以用户为中心”已成为企业运营的核心逻辑,而用户画像则是企业读懂用户、精准服务用户的关键载体。CDA(Certifi ...
2026-02-28在Python面向对象编程(OOP)中,类方法是构建模块化、可复用代码的核心载体,也是实现封装、继承、多态特性的关键工具。无论是 ...
2026-02-27在MySQL数据库优化中,索引是提升查询效率的核心手段—— 面对千万级、亿级数据量,合理创建索引能将查询时间从秒级压缩到毫秒级 ...
2026-02-27在数字化时代,企业积累的海量数据如同散落的珍珠,若缺乏有效的梳理与分类,终将难以发挥实际价值。CDA(Certified Data Analys ...
2026-02-27在问卷调研中,我们常遇到这样的场景:针对同一批调查对象,在不同时间点(如干预前、干预后、随访期)发放相同或相似的问卷,收 ...
2026-02-26在销售管理的实操场景中,“销售机会”是核心抓手—— 从潜在客户接触到最终成交,每一个环节都藏着业绩增长的关键,也暗藏着客 ...
2026-02-26在CDA数据分析师的日常工作中,数据提取、整理、加工是所有分析工作的起点,而“创建表”与“创建视图”,则是数据库操作中最基 ...
2026-02-26在机器学习分析、数据决策的全流程中,“数据质量决定分析价值”早已成为行业共识—— 正如我们此前在运用机器学习进行分析时强 ...
2026-02-25在数字化时代,数据已成为企业决策、行业升级的核心资产,但海量杂乱的原始数据本身不具备价值—— 只有通过科学的分析方法,挖 ...
2026-02-25