
大数据管理问题亟待解决
如果在百度谷歌去搜索"大数据",你会发现,大数据包括三个V,第一个V数据量足够大;第二个V是指数据的种类非常多、结构复杂;第三个V则是对于数据的实时性要求非常高。所以,拥有大量的数据,能够快速将这些数据进行抽取,挖掘,分析,并且可供拥有者实时访问,调用,能够满足其实际需求,这就是大数据。
大数据的出现与互联网的发展息息相关,从搜索引擎、社交网站到移动终端,互联网上的信息总量正以每年50%的增速不断膨胀,其中90%的信息来自近三年,包括每个月Facebook上分享的30亿条内容,每天12TB的Twitter信息,每天淘宝上超过30亿条店铺、商品浏览记录以及上千万的成交、收藏记录等等。据IDC统计,2011年全球所产生的数据总量是1.8ZB(10的21次方),如果把这些数据刻录到CD此片中门起摞起来的高度等于地球到月球的距离!
大数据没有限定的数量,比如多少TB,或者EB的数据。若是中小企业用户,可能企业内部只有十几、二十几个人,那么十个TB对这个企业来说就是大数据了,所以大数据的概念因人而异。工信部十二五的物联网规划引人注意,其中包括海量级的数据存储,数据挖掘,图象视频的智能分析,以及信息感知和信息传输,这些规划提供了一个警示信号,即大数据是未来的发展方向,所以在此后的一段时间内,热门话题会是大数据、云存储、以及对象存储。这些都是在存储或者计算领域热门的话题。
"大数据"是大势所趋。纵观整个数据市场,甚至存储市场,用户的数据量正呈现出爆炸式的增长态势。大概四、五年前,一个邮件系统用终端存储就可以满足一个中等规模企业的需要,数据量大概在30-50T.随着企业员工数量逐年增长,邮件系统的空间也呈爆炸式增长,由于人员沟通之间邮件更容易成为沟通的桥梁,邮件的附件越来越大,邮件系统的数据量亦随之水涨船高。现在该企业的数据量恐怕已增长到2.5PB甚至更多,需要添置一台存储设备或是几台储备设备做邮件系统,可见存储需求量增长之快。
尽管大数据的产生多半是因为企业发展及数据产生的种类多元化这个"大环境"所致,但是面对这些快速增长的大数据所暴露出的问题还是让企业管理者们不安。到底该如何管理这些大数据?如何进行安全有效的保护?出现问题时怎样进行恢复?这些都是企业待解的难题。
第一、在大数据愈演愈烈之时,对于企业来说,如何经济、高效访问数据值得探讨。并非购买了最高端的存储,更昂贵的备份存储就可以高枕无忧,如何经济、高效的访问数据才是企业目前需要研究的课题之一。通常情况下,按照数据被访问频率的高低,可以将这些大数据分为热数据和冷数据,热点数据放在昂贵的介质上没有任何异议,但是冷数据放在昂贵的介质上面则会导致IT建设成本上升,是一种浪费。所以如何将冷、热数据进行分层存储,既能优化存储系统的性能,又可以有效地降低存储系统的整体拥有成本,实现一举两得是企业的突破方向。
第二,如何组织、检索、存储、处理分析这些大数据。最近开展的题为"大数据:商业领袖们的经验"的全球调查发现,稿营收企业的成功与明确的数据战略之间有着极强的关联性。大数据的时代迎面袭来,企业重视大数据的潜在价值只是一个良好的开始,如何应对海量数据在管理方面的挑战才是企业至关重要的策略之一。
第三,数据备份。数据备份可谓"老生常谈",大家一直在谈数据需要备份,备份是企业最后的保障、最后的一个利器,可以保护企业的系统依然有数据可用。10年前的"9.11"事件,早给过我们惨痛的教训:世贸中心中大约2/3企业因为未做数据备份而导致彻底倒闭。
无独有偶,就在前不久前,雅虎日本服务器系统发生故障,导致近5700家企业数据丢失,除了小林制药这样日常进行数据备份的用户可以在几天之内恢复数据外,其他用户的数据绝无回复的可能,其损失可谓"惨重".一个企业的数据信息决定着企业的生死存亡。但是今天,数据量的持续增长增加了备份和恢复的时间,是企业面临着严重的合规和宕机风险,数据备份却越来越困难。用户数据量越来越大,备份时间窗口又那么小,设备又是有限的,怎样快速把大数据中的核心数据抽取出来,保障企业数据信息能够适时进行恢复,成为企业CIO们共同考量的当务之急。
第四、重复数据删除。由于存储经理们继续降低备份数据量,重复数据删除技术从而一度成为热门的技术,但尽管这个话题已经"风靡"了多年,近三、五年的时间大家都在讲重复数据的删除。基本上主流的厂商和用户能够接受的还是把带库删除。如周一到周五的数据一样,就把重复的数据删掉,以后每天把增量的数据保存。但是有一些厂家也提倡在线存储删除,这也可行。只是现在某些技术尚不完全成熟,所以现在的重复数据删除重点还是在备份领域涉猎较多。
第五,如何节省电力、节约空间、节约成本等。面临数据爆炸式增长带来的问题,我们将怎么样节省电力、空间、成本呢?近几年企业在采购存储时,会发现存储硬件的成本在逐年走低。回顾过去,硬盘价格都是高高在上的,而现在不管是传统的机械硬盘还是SSD(固态硬盘)都开始变得越发"亲民",而价格更低的同时容量却更高了。但是,对于很多企业来说,整体的存储成本却不降反升,原因就是存储的管理成本在逐年走高。因为大数据的接茬大涨需要大量的人力管理和维护,所以如何节约IT资源,减少IT人员的压力等也是现在企业需要考虑的因素。
在大数据时代,尽管这些快速增长的海量数据所引发的一系列蹩脚问题,足以让CIO们感到炙手可热,但是管理这些数据所带来的几多挑战并不能令人窒息。完整的数据保护解决方案或许能够成为"成人之美"的一剂良药。毕竟,实践是检验真理的唯一标准,这的确是不易之论……
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在 “神经网络与卡尔曼滤波融合” 的理论基础上,Python 凭借其丰富的科学计算库(NumPy、FilterPy)、深度学习框架(PyTorch、T ...
2025-10-23在工业控制、自动驾驶、机器人导航、气象预测等领域,“状态估计” 是核心任务 —— 即从含噪声的观测数据中,精准推断系统的真 ...
2025-10-23在数据分析全流程中,“数据清洗” 恰似烹饪前的食材处理:若食材(数据)腐烂变质、混杂异物(脏数据),即便拥有精湛的烹饪技 ...
2025-10-23在人工智能领域,“大模型” 已成为近年来的热点标签:从参数超 1750 亿的 GPT-3,到万亿级参数的 PaLM,再到多模态大模型 GPT-4 ...
2025-10-22在 MySQL 数据库的日常运维与开发中,“更新数据是否会影响读数据” 是一个高频疑问。这个问题的答案并非简单的 “是” 或 “否 ...
2025-10-22在企业数据分析中,“数据孤岛” 是制约分析深度的核心瓶颈 —— 用户数据散落在注册系统、APP 日志、客服记录中,订单数据分散 ...
2025-10-22在神经网络设计中,“隐藏层个数” 是决定模型能力的关键参数 —— 太少会导致 “欠拟合”(模型无法捕捉复杂数据规律,如用单隐 ...
2025-10-21在特征工程流程中,“单变量筛选” 是承上启下的关键步骤 —— 它通过分析单个特征与目标变量的关联强度,剔除无意义、冗余的特 ...
2025-10-21在数据分析全流程中,“数据读取” 常被误解为 “简单的文件打开”—— 双击 Excel、执行基础 SQL 查询即可完成。但对 CDA(Cert ...
2025-10-21在实际业务数据分析中,我们遇到的大多数数据并非理想的正态分布 —— 电商平台的用户消费金额(少数用户单次消费上万元,多数集 ...
2025-10-20在数字化交互中,用户的每一次操作 —— 从电商平台的 “浏览商品→加入购物车→查看评价→放弃下单”,到内容 APP 的 “点击短 ...
2025-10-20在数据分析的全流程中,“数据采集” 是最基础也最关键的环节 —— 如同烹饪前需备好新鲜食材,若采集的数据不完整、不准确或不 ...
2025-10-20在数据成为新时代“石油”的今天,几乎每个职场人都在焦虑: “为什么别人能用数据驱动决策、升职加薪,而我面对Excel表格却无从 ...
2025-10-18数据清洗是 “数据价值挖掘的前置关卡”—— 其核心目标是 “去除噪声、修正错误、规范格式”,但前提是不破坏数据的真实业务含 ...
2025-10-17在数据汇总分析中,透视表凭借灵活的字段重组能力成为核心工具,但原始透视表仅能呈现数值结果,缺乏对数据背景、异常原因或业务 ...
2025-10-17在企业管理中,“凭经验定策略” 的传统模式正逐渐失效 —— 金融机构靠 “研究员主观判断” 选股可能错失收益,电商靠 “运营拍 ...
2025-10-17在数据库日常操作中,INSERT INTO SELECT是实现 “批量数据迁移” 的核心 SQL 语句 —— 它能直接将一个表(或查询结果集)的数 ...
2025-10-16在机器学习建模中,“参数” 是决定模型效果的关键变量 —— 无论是线性回归的系数、随机森林的树深度,还是神经网络的权重,这 ...
2025-10-16在数字化浪潮中,“数据” 已从 “辅助决策的工具” 升级为 “驱动业务的核心资产”—— 电商平台靠用户行为数据优化推荐算法, ...
2025-10-16在大模型从实验室走向生产环境的过程中,“稳定性” 是决定其能否实用的关键 —— 一个在单轮测试中表现优异的模型,若在高并发 ...
2025-10-15