
大数据真是“大”吗? 并不见得
数据并不只是因为成为了“大数据”才有了价值,“小数据”就没有价值吗?而是只要是数据都是有价值的。
大数据(bigdata),或称巨量资料,指的是所涉及的资料量规模巨大到无法通过目前主流软件工具,在合理时间内达到撷取、管理、处理、并整理成为帮助企业经营决策更积极目的的资讯(见百度百科)。业界将其归纳为4“V”—Volume(大量)、Velocity(高速)、Variety(多样)、Veracity(真实性)。大数据的“大”,目前应该是指与计算机为代表的信息设备诞生以来这70年所产生的信息数据相比是“大”了,即与历史产生的信息数据相比是“巨量”了。但若我们将其放在纵、横两个维度上去比,大数据还“大”吗?
从数据产生的过程看。目前的大数据(从TB级别,跃升到了PB级别)与以往的MB、GB级别相比确实大了,但与未来的EB、ZB级别相比还只能称之为“小数据”。从数据以外方面看。首先与同为IT概念的IP地址的IPv6相比,即使目前定义数据量最大计量单位DB,与其相比还差近2个级别。再与信息(在此信息即为数据,下同)共同构成世界的物质、能量三要素的其他二要素物质、能量相比,地球的质量约为5.98×1027克,世界探明煤炭资源可采储量约为9.84×1017克,10TB大约等于一个人脑的存储量,全球70亿人的脑存储量约为6.52×270Byte,相对应来看目前所说的大数据也并不“大”。但我们也还没有称IPv6为“大IP地址”,没有称物质、能量为“大物质”、“大能量”等等。
在物质世界有“大”就有“小”,如物质就计量单位从小到大有克、十克、百克、千克……,从大到小有克、分克、厘克、毫克……。而数据,目前计量单位只能从小到大有bit、Byte、KB、MB……,但却不能从大到小。而我们知道数据计量单位每缩小一个级别,则数据量就可增加1024即210倍。
物质有限可分还是无限可分虽然还将争论下去,但就当今理论和实践的发展看物质是可分的,就物质的计量单位而言是具有双向性的(能大能小)。而数据似乎是不可分的,就数据的计量单位而言似乎是单向性的(只能大)。
若将物质资源的计量单位定为“克”,则煤炭储量的数值可与数据资源数值的EB对应;而若将物质资源的计量单位定为“毫克”,则煤炭储量的数值就可与数据资源数值的ZB对应。就当今理论和实践的发展看物质是可分的,则物质资源的数值相较数据资源就计量单位而言似乎是无限大的,数据资源的“大”就更待商榷了。
人类利用物质和能量资源的过程是:自然产生物质和能量资源(软件),人类发明工具开发物质和能量资源(硬件),人类改进工艺利用物质和能量资源。即先有物质和能量资源,再有开发物质和能量资源的硬、软件工具。
而人类利用数据资源的过程是:人类发明了计算机等信息设备来承载数据资源(硬件),人类设计了软件来处理数据资源(软件),数据才向人类展现出其资源的特性(资源)。即先有了开发数据资源的硬、软件工具,再有数据资源。
物质和能量资源的产生经过了亿万年自然的进化,其产生与人类没有关系,即不已人类的意志而转移。而数据资源的产生只有短短的几十年时间(该数据资源是指计算机诞生以后产生的信息数据资源),其产生与人类有直接关系,即其会随着人类的意志而转移。这种根本性的不同,对人类意味着什么?目前我们不得而知。物质不灭定律(又称“质量守恒定律”)告诉我们“物质虽然能够变化,但不能消灭或凭空产生”。数据是否也是不灭的,数据又将如何变化呢?这些,我们都是无法回答的。
目前,“大数据”的核心只是改变了人类以前的理解,即承载数据的硬件有价值,处理数据的软件有价值,而数据本身却不具有价值。由此,呈现了数据本身也是具有价值这一理念。
“大数据”一词,目前还只是IT界自说自话的技术术语,并没有体现出其价值所在,百姓并不明白它有什么用处。其实还不如称“大数据”为“数据资源”或“资源数据”。以突出“资源”一词所蕴含的价值,以体现数据的资源特性。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在神经网络模型设计中,“隐藏层层数” 是决定模型能力与效率的核心参数之一 —— 层数过少,模型可能 “欠拟合”(无法捕捉数据 ...
2025-10-14在数字化浪潮中,数据分析师已成为企业 “从数据中挖掘价值” 的核心角色 —— 他们既要能从海量数据中提取有效信息,又要能将分 ...
2025-10-14在企业数据驱动的实践中,“指标混乱” 是最常见的痛点:运营部门说 “复购率 15%”,产品部门说 “复购率 8%”,实则是两者对 ...
2025-10-14在手游行业,“次日留存率” 是衡量一款游戏生死的 “第一道关卡”—— 它不仅反映了玩家对游戏的初始接受度,更直接决定了后续 ...
2025-10-13分库分表,为何而生? 在信息技术发展的早期阶段,数据量相对较小,业务逻辑也较为简单,单库单表的数据库架构就能够满足大多数 ...
2025-10-13在企业数字化转型过程中,“数据孤岛” 是普遍面临的痛点:用户数据散落在 APP 日志、注册系统、客服记录中,订单数据分散在交易 ...
2025-10-13在数字化时代,用户的每一次行为 —— 从电商平台的 “浏览→加购→购买”,到视频 APP 的 “打开→搜索→观看→收藏”,再到银 ...
2025-10-11在机器学习建模流程中,“特征重要性分析” 是连接 “数据” 与 “业务” 的关键桥梁 —— 它不仅能帮我们筛选冗余特征、提升模 ...
2025-10-11在企业的数据体系中,未经分类的数据如同 “杂乱无章的仓库”—— 用户行为日志、订单记录、商品信息混杂存储,CDA(Certified D ...
2025-10-11在 SQL Server 数据库操作中,“数据类型转换” 是高频需求 —— 无论是将字符串格式的日期转为datetime用于筛选,还是将数值转 ...
2025-10-10在科研攻关、工业优化、产品开发中,正交试验(Orthogonal Experiment)因 “用少量试验覆盖多因素多水平组合” 的高效性,成为 ...
2025-10-10在企业数据量从 “GB 级” 迈向 “PB 级” 的过程中,“数据混乱” 的痛点逐渐从 “隐性问题” 变为 “显性瓶颈”:各部门数据口 ...
2025-10-10在深度学习中,“模型如何从错误中学习” 是最关键的问题 —— 而损失函数与反向传播正是回答这一问题的核心技术:损失函数负责 ...
2025-10-09本文将从 “检验本质” 切入,拆解两种方法的核心适用条件、场景边界与实战选择逻辑,结合医学、工业、教育领域的案例,让你明确 ...
2025-10-09在 CDA 数据分析师的日常工作中,常会遇到这样的困惑:某电商平台 11 月 GMV 同比增长 20%,但究竟是 “长期趋势自然增长”,还 ...
2025-10-09Pandas 选取特定值所在行:6 类核心方法与实战指南 在使用 pandas 处理结构化数据时,“选取特定值所在的行” 是最高频的操作之 ...
2025-09-30球面卷积神经网络(SCNN) 为解决这一痛点,球面卷积神经网络(Spherical Convolutional Neural Network, SCNN) 应运而生。它通 ...
2025-09-30在企业日常运营中,“未来会怎样” 是决策者最关心的问题 —— 电商平台想知道 “下月销量能否达标”,金融机构想预判 “下周股 ...
2025-09-30Excel 能做聚类分析吗?基础方法、进阶技巧与场景边界 在数据分析领域,聚类分析是 “无监督学习” 的核心技术 —— 无需预设分 ...
2025-09-29XGBoost 决策树:原理、优化与工业级实战指南 在机器学习领域,决策树因 “可解释性强、处理非线性关系能力突出” 成为基础模型 ...
2025-09-29