
一、大数据的基本特征
21世纪是数据信息大发展的时代,移动互联、社交网络、电子商务等极大地拓展了互联网的边界和应用范围,各种数据正在迅速膨胀并变大。互联网(社交、搜索、电商)、移动互联网(微博、微信)、物联网、车联网、GPS、医学影像、安全监控、金融(银行、股市、保险)、电信(通话、短信)等行业都在疯狂产生着数据。
数据的单位从小到大依次为Byte、KB、MB、GB、TB、PB、EB、ZB、YB、DB、NB,相邻单位之间相差进率为1024。我们日常生活中接触较多的是前5个,但大数据的单位却几乎是从TB才开始的。在2006年,个人用户刚刚迈进TB时代,全球一共新产生了约180EB的数据,在2011年,这个数字达到了1.8ZB。根据著名市场研究机构IDC的预测,到2020年,整个世界的数据总量将会增长44倍,达到35.2ZB。想驾驭这些庞大的数据,我们必须了解大数据的基本特征。
一是体量大(Volume)。据统计,互联网一天产生的全部内容可以制作1.68亿张DVD,一天发出2940亿封邮件以及200万个帖子。这些数据都表明,互联网时代,社交网络、电子商务与移动通信把人类带入了一个以“PB”为单位的新时代,PB化已经成为比较常态的情况。大数据中的“大”除了大量的意思外,还有全局的概念,所有的数据都聚集在这里。
二是多样化(Variety)。从形式上看,如今的数据类型早已不是单一的文本形式,海量数据有不同的格式,订单、日志、音频对人们的处理能力提出了更高的要求。从结构上看,数据分为结构化、半结构化、非结构化数据,其中非结构化数据正以很高的速率增长,占总数据量的80%~90%,比结构化数据增长快 10到50倍,是传统数据仓库的10到50倍。
三是价值高(Value)。网络每天都会产生大量的不相关信息,这些未经过处理的原始材料属于价值密度低的数据,需要人们沙里淘金。以视频为例,一部1小时的视频,在连续不间断监控过程中,可能有用的数据仅仅只有一两秒。如何通过强大的机器算法更迅速地完成数据的价值“提纯”,是目前大数据汹涌背景下亟待解决的难题。
四是速度快(Velocity)。大数据的产生速度相当快,包括股票、资讯等各方面的信息随时都在传输。由于数据化存在时效性,需要快速处理并得到结果,实时获取需要的信息。比如说一些电商数据,今天的信息不经处理就不能产生有效的结果,这将会影响到今天捕获很多商业决策,因此在海量的数据面前,处理数据的效率就是企业的生命。[1]
二、大数据与传统数据的价值差异
大数据包括交易数据和交互数据集在内的所有数据集,具体由海量交易数据、海量交互数据和海量处理数据三种主要技术汇聚组成。
海量交易数据指企业内部的经营交易信息数据,主要包括联机交易数据和联机分析数据,是结构化的、通过关系数据库进行管理和访问的静态、历史数据。通过这些数据,我们能了解过去发生了什么。
海量交互数据来自Facebook、Twitter、LinkedIn及其他来源的社交媒体数据。它包括呼叫详细记录CDR、设备和传感器信息、GPS和地理定位映射数据、通过管理文件传输Manage File Transfer协议传送的海量图像文件、Web文本和点击流数据、科学信息、电子邮件等。这些数据可以告诉我们未来会发生什么。
海量数据处理是一种应对复杂、海量数据的能力,大数据的涌现已经催生出了设计用于数据密集型处理的架构。例如具有开放源码、在商品硬件群中运行的Apache Hadoop,难题在于以具备成本效益的方式快速可靠地从Hadoop中存取数据。
有人说,大数据是对传统数据的终结和替代。这种观点并不被学者们普遍接受。但大数据的价值和处理方式的确与传统数据有很大程度的不同。
在宗旨上,传统数据处理遵循的是固化业务优于高效,高效优于发现业务。整体上讲这是一种求稳策略。而大数据处理却将传统方法的顺序整体颠倒过来,首先是发现业务,其次是高效,最后是固化业务。
在数据特点上,传统数据面对的一般是企业内部数据,数据量一般不会超过10亿量级。大数据处理的却是多样化的数据,从数据来源上有内部和外部,数据结构上有结构化和非结构化,数据量可处理xPB级。
在技术手段上,传统数据处理方法使用商务智能的开源RDBMS,昂贵的分析挖掘工具,甚至是商用集群。大数据处理方法则更多的是使用开源技术,更注重数据本身,使用多种技术解决业务问题。
在场景上,传统数据主要处理实时、事务性、在线业务,而大数据则会处理大量的批量数据和少量的在线实时型数据。总而言之,传统数据是以业务为中心,大数据则是以数据为中心,数据为业务服务。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
数据清洗工具全景指南:从入门到进阶的实操路径 在数据驱动决策的链条中,“数据清洗” 是决定后续分析与建模有效性的 “第一道 ...
2025-08-29机器学习中的参数优化:以预测结果为核心的闭环调优路径 在机器学习模型落地中,“参数” 是连接 “数据” 与 “预测结果” 的关 ...
2025-08-29CDA 数据分析与量化策略分析流程:协同落地数据驱动价值 在数据驱动决策的实践中,“流程” 是确保价值落地的核心骨架 ——CDA ...
2025-08-29CDA含金量分析 在数字经济与人工智能深度融合的时代,数据驱动决策已成为企业核心竞争力的关键要素。CDA(Certified Data Analys ...
2025-08-28CDA认证:数据时代的职业通行证 当海通证券的交易大厅里闪烁的屏幕实时跳动着市场数据,当苏州银行的数字金融部连夜部署新的风控 ...
2025-08-28PCU:游戏运营的 “实时晴雨表”—— 从数据监控到运营决策的落地指南 在游戏行业,DAU(日活跃用户)、MAU(月活跃用户)是衡量 ...
2025-08-28Excel 聚类分析:零代码实现数据分群,赋能中小团队业务决策 在数字化转型中,“数据分群” 是企业理解用户、优化运营的核心手段 ...
2025-08-28CDA 数据分析师:数字化时代数据思维的践行者与价值推动者 当数字经济成为全球经济增长的核心引擎,数据已从 “辅助性信息” 跃 ...
2025-08-28ALTER TABLE ADD 多个 INDEX:数据库批量索引优化的高效实践 在数据库运维与性能优化中,索引是提升查询效率的核心手段。当业务 ...
2025-08-27Power BI 去重函数:数据清洗与精准分析的核心工具 在企业数据分析流程中,数据质量直接决定分析结果的可靠性。Power BI 作为主 ...
2025-08-27CDA 数据分析师:数据探索与统计分析的实践与价值 在数字化浪潮席卷各行业的当下,数据已成为企业核心资产,而 CDA(Certif ...
2025-08-27t 检验与 Wilcoxon 检验:数据差异比较的两大统计利器 在数据分析中,“比较差异” 是核心需求之一 —— 如新药疗效是否优于旧药 ...
2025-08-26季节性分解外推法:解锁时间序列预测的规律密码 在商业决策、资源调度、政策制定等领域,准确的预测是规避风险、提升效率的关键 ...
2025-08-26CDA 数据分析师:数据治理驱动下的企业数据价值守护者 在数字经济时代,数据已成为企业核心战略资产,其价值的释放离不开高 ...
2025-08-26基于 SPSS 的 ROC 曲线平滑调整方法与实践指南 摘要 受试者工作特征曲线(ROC 曲线)是评估诊断模型或预测指标效能的核心工具, ...
2025-08-25神经网络隐藏层神经元个数的确定方法与实践 摘要 在神经网络模型设计中,隐藏层神经元个数的确定是影响模型性能、训练效率与泛 ...
2025-08-25CDA 数据分析师与数据思维:驱动企业管理升级的核心力量 在数字化浪潮席卷全球的当下,数据已成为企业继人力、物力、财力之后的 ...
2025-08-25CDA数据分析师与数据指标:基础概念与协同逻辑 一、CDA 数据分析师:数据驱动时代的核心角色 1.1 定义与行业价值 CDA(Certified ...
2025-08-22Power Query 移动加权平均计算 Power Query 移动加权平均设置全解析:从原理到实战 一、移动加权平均法的核心逻辑 移动加权平均 ...
2025-08-22描述性统计:CDA数据分析师的基础核心与实践应用 一、描述性统计的定位:CDA 认证的 “入门基石” 在 CDA(Certified Data Analy ...
2025-08-22