京公网安备 11010802034615号
经营许可证编号:京B2-20210330
大数据存储能否顺应时代的发展要求_数据分析师
大数据存储,可以认为是存储厂商基于现有大数据应用的特点进行优化的解决方案。
不久前去香港出差,刚下飞机就收到招商银行发来的一条短信,内容是告之香港有哪些商场在举办促销活动。不知道这是巧合,还是招商银行利用大数据的新成果,但是可以肯定,利用大数据分析可以为客户提供定制化的服务,实现精准营销。大数据正在改变企业业务模式,也让人们的生活变得更加便利和丰富多彩。
存储必须整合
大数据存储是一类单独的产品吗?赛迪顾问高级分析师陈靓并不这么认为:“把大数据软件与存储进行整合,就称为大数据存储,未免有些牵强。如果非要说出大数据存储的特征,那么我认为它至少应该能让大数据的‘4V’发挥出应有的效果,满足大数据对性能和扩展性的要求。”
“与其说大数据存储是一类产品,不如说它是下一代的存储架构。这种架构可以将传统的DAS、SAN和NAS有效地整合起来,以满足上层计算平台的要求。”Forrester Research首席咨询分析师戴昆表示,“大数据存储本身的性能与传统企业级存储并没有显着差异,它主要依赖于上层计算平台的分布式并行处理能力,但其扩展性一定要强。”
“在中国市场上,大数据应用还没有真正落地,许多用户谈的还是BI(商业智能)。而从国外的实践看,BI只是大数据的一部分,属于大数据的起步阶段,真正的大数据应用是近实时或实时的数据分析。”中桥调研咨询首席分析师王丛告诉记者,“计算、存储、网络等都与大数据的价值有关。大数据存储并不是一类单独的产品,它也可以通过类似公有云或私有云的方式提供给用户。应用和数据量的增加,对数据的存取提出了更高要求。因此,并行存储能力的增强对大数据存储来说非常重要。”
EMC Isilon存储事业部总经理杨兰江表示,大数据存储有很多实现方式,不过它应具备以下特性:海量数据存储能力、全局命名空间、支持标准接口、读写性能优异、易于管理维护、基于开放架构、多级数据冗余、多级存储备份等。
“存储产品并不像网络产品那样有严格的界线,因此很难将大数据存储单独划分出来。其实,大数据存储并不是只有分布式存储这一种方式,传统的存储也可以成为大数据存储解决方案的一部分。”华为存储产品线市场总监经宁解释说,“华为将大数据存储当成相对独立的一类产品,主要是从产品的主定位角度考虑的。华为有针对企业级应用的高端存储,也有针对中小型用户的通用存储,当然还有专门为大数据优化的分布式、可横向扩展的大数据存储。”
目前,业内并没有关于大数据存储产品的通用定义,但是综合考虑厂商的产品以及用户的需求,可以简单概括出大数据存储的特征:首先,大数据存储必须能够支持全类型数据,包括结构化、半结构化和非结构化数据,实现统一数据支持;其次,在保证可靠性的基础之上,大数据存储必须具备线性扩展能力,同时还要具有很强的批处理和实时处理能力;最后,在系统达到一定规模后,大数据存储平台的易用性和可管理性也是不可或缺的。
在大数据处理过程中,用户发现性能的瓶颈并不在计算层面,而在于海量数据的上传和下载。因此,极高的数据加载速率是大数据存储必须具备的特性。大数据解决方案通常包含数据存储、计算及分析,存储是大数据基础架构中的一部分。
凸显高性能、可扩展
对中国用户来说,大数据应用落地的关键是如何更好地让企业的IT决策者和架构师理解业务需求,建立适合企业业务特点的数据应用场景和数据管理架构,更好地利用企业现有的数据资产,而非盲目地进行所谓的大数据投资。“用户首先要考虑的是什么样的大数据应用才能为企业带来合理产出,其次再考虑大数据平台和存储,切勿本末倒置。”戴昆表示。
赛迪顾问的研究发现,中国使用大数据存储比较多的行业是电信、互联网、金融等,其他行业大多还在观望及测试中。中国用户对于大数据存储的需求首先是可靠和稳定,金融行业的用户非常重视这一点;互联网用户则要求大数据存储具有很高的I/O吞吐能力;电信行业的客户更青睐高性价比的大数据存储设备。
中国惠普有限公司企业集团存储产品部存储架构师张楠表示,很多中国用户会追求大容量和高性能,忽略了大数据存储本身应该具有的其他属性,这让用户在实际应用中很容易遇到一些障碍,比如无法将存储与大数据平台进行对接,无法在业务中充分发挥大数据存储的价值等。究其原因,主要障碍在于有些大数据存储产品没有开放的接口协议, 没有针对用户的大数据应用场景进行特别优化, 没有提供用户容易接受的易用管理方式等。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在 MySQL 实际应用中,“频繁写入同一表” 是常见场景 —— 如实时日志存储(用户操作日志、系统运行日志)、高频交易记录(支付 ...
2025-10-30为帮助教育工作者、研究者科学分析 “班级规模” 与 “平均成绩” 的关联关系,我将从相关系数的核心定义与类型切入,详解 “数 ...
2025-10-30对 CDA(Certified Data Analyst)数据分析师而言,“相关系数” 不是简单的数字计算,而是 “从业务问题出发,量化变量间关联强 ...
2025-10-30在构建前向神经网络(Feedforward Neural Network,简称 FNN)时,“隐藏层数目设多少?每个隐藏层该放多少个神经元?” 是每个 ...
2025-10-29这个问题切中了 Excel 用户的常见困惑 —— 将 “数据可视化工具” 与 “数据挖掘算法” 的功能边界混淆。核心结论是:Excel 透 ...
2025-10-29在 CDA(Certified Data Analyst)数据分析师的工作中,“多组数据差异验证” 是高频需求 —— 例如 “3 家门店的销售额是否有显 ...
2025-10-29在数据分析中,“正态分布” 是许多统计方法(如 t 检验、方差分析、线性回归)的核心假设 —— 数据符合正态分布时,统计检验的 ...
2025-10-28箱线图(Box Plot)作为展示数据分布的核心统计图表,能直观呈现数据的中位数、四分位数、离散程度与异常值,是质量控制、实验分 ...
2025-10-28在 CDA(Certified Data Analyst)数据分析师的工作中,“分类变量关联分析” 是高频需求 —— 例如 “用户性别是否影响支付方式 ...
2025-10-28在数据可视化领域,单一图表往往难以承载多维度信息 —— 力导向图擅长展现节点间的关联结构与空间分布,却无法直观呈现 “流量 ...
2025-10-27这个问题问到了 Tableau 中两个核心行级函数的经典组合,理解它能帮你快速实现 “相对位置占比” 的分析需求。“index ()/size ( ...
2025-10-27对 CDA(Certified Data Analyst)数据分析师而言,“假设检验” 绝非 “套用统计公式的机械操作”,而是 “将模糊的业务猜想转 ...
2025-10-27在数字化运营中,“凭感觉做决策” 早已成为过去式 —— 运营指标作为业务增长的 “晴雨表” 与 “导航仪”,直接决定了运营动作 ...
2025-10-24在卷积神经网络(CNN)的训练中,“卷积层(Conv)后是否添加归一化(如 BN、LN)和激活函数(如 ReLU、GELU)” 是每个开发者都 ...
2025-10-24在数据决策链条中,“统计分析” 是挖掘数据规律的核心,“可视化” 是呈现规律的桥梁 ——CDA(Certified Data Analyst)数据分 ...
2025-10-24在 “神经网络与卡尔曼滤波融合” 的理论基础上,Python 凭借其丰富的科学计算库(NumPy、FilterPy)、深度学习框架(PyTorch、T ...
2025-10-23在工业控制、自动驾驶、机器人导航、气象预测等领域,“状态估计” 是核心任务 —— 即从含噪声的观测数据中,精准推断系统的真 ...
2025-10-23在数据分析全流程中,“数据清洗” 恰似烹饪前的食材处理:若食材(数据)腐烂变质、混杂异物(脏数据),即便拥有精湛的烹饪技 ...
2025-10-23在人工智能领域,“大模型” 已成为近年来的热点标签:从参数超 1750 亿的 GPT-3,到万亿级参数的 PaLM,再到多模态大模型 GPT-4 ...
2025-10-22在 MySQL 数据库的日常运维与开发中,“更新数据是否会影响读数据” 是一个高频疑问。这个问题的答案并非简单的 “是” 或 “否 ...
2025-10-22