京公网安备 11010802034615号
经营许可证编号:京B2-20210330
Spark会成为大数据分析的新里程碑_数据分析师
在年初于纽约举行的Spark Summit East大会上,Databrick成为了焦点所在,通过新发布的数据处理云服务,该公司力图将Spark与MapReduce及Hadoop系统划清界限。
经过本次大会,Spark在业界的逐渐普及已是不争的事实。Apache Spark是一个开源的大数据处理引擎,能够被用于解决各界面临的高难度问题:如何快速识别针对比特币网络的拒绝服务攻击?如何将车辆与物联网或互联网相连接?如何识别出那些极为隐秘的洗钱行为?
对于Spark的兴趣不仅仅局限于具有纯天然数字化基因的企业,或者提供Spark相关技术的厂商。诺华制药(Novartis)、有线电视网Comcast和高盛等公司也在会上为Spark唱起了赞歌。但是,本次Spark Summit与其说是一次会议,不如说是一次Databrick的专场演出。Databrick发布了商业版的Spark系统,并且撇清与Hadoop生态的任何关系 -- 既非敌人也不是朋友。Databrick这次发布的是基于云的Spark服务。
顺势而生
Databrick由加州伯克利大学AMP实验室团队所创建,即Apache Spark的开发者。自从诞生伊始,Spark就被拿来与MapReduce进行比较,MapReduce是Hadoop最初的数据处理引擎。MapReduce因其对大数据集的分布式处理能力而广受关注,但是也一直在效率方面饱受责难。MapReduce以批处理方式进行计算,无法很好地应对流处理模式(比如物联网项目)。而且,MapReduce没有内存计算的选项,每次计算后都要将结果写入外部存储,这使得迭代式的任务相当耗时。
MapReduce的种种缺陷,使得诸如Spark之类的新一代处理引擎应运而生。“MapReduce的设计始于15年以前,”Databrick的联合创始人Patrick Wendell表示:“而Spark则是基于当代最新的硬件,完全重新设计而成的。”
同时,Databrick实现了Spark与Hadoop环境的兼容,并坚信Spark将在大数据生态中扮演更重要的角色。“我认为Spark将凌驾于Hadoop之上,在更多的场景中发挥作用。目前,在很大程度上这一点已经成为现实。”Wendell说。
去年春季,Databrick与DataStax建立了合作伙伴关系,后者专注于提供NoSQL数据库Cassandra的商业版。去年秋天,Databrick发布了Databrick云,基于Amazon S3存储提供Spark环境,实现所谓的大数据即服务。由于在可用性方面受限,有传闻Databrick云最终将驻留在Google Compute Engine和微软Azure云上。与MapReduce不同,Databrick尽量让使用Spark的技术门槛降低,能够面向更为广泛的受众。比如,Databrick为用户提供了各种高级和低级的API接口 – 所谓高级接口,主要针对那些对数据科学或分布式系统不熟悉的用户,使之同样能从复杂的机器学习算法中受益。
应者云集
如果说本次Spark Summit East大会带来的影响,应该就是CIO们,或者更确切地说是那些一直追踪大数据技术发展的数据分析师们会认为Spark将是继Hadoop之后的新里程碑。Databrick宣称Spark大数据处理引擎将改变企业分析的形态(过去的情况是,诸如Cloudera一类的Hadoop提供商一直扮演着支撑的角色)。Databrick同样让与会者相信,即使那些“普通”(normal,先前举行的Hadoop World大会上,Cloudera使用了这个词)的公司,也能够从Spark中受益,比如诺华制药和Comcast,以及不那么有名的Automatic和Shopify公司。
对于Spark的赞美同样来自于其他与会者。Tresata的创始人和首席执行官Abhishek Mehta表示:“我认为Spark应对了当前大数据研究中的所有热点问题。”高盛的Matt Glickman表示,Spark代表了未来发展的方向,将成为大数据分析的通用工具。Alteryx(致力于为普通用户提供分析语言R和大数据分析能力)的首席运营官George Mattew则描述了在集成R和MapReduce时的遭遇。
“有人说,旧约中并没有对地狱的具体描述。”Mathew回忆到:“但是,当我们试图将R和MapReduce集成时,却有了切身体会。在引入其他通用的计算能力时,MapReduce的步伐是如此艰难。”
这听起来非常刺耳,曾经的大数据明星,如今被Spark的光芒所掩盖 – 至少在某些大数据信徒看来,事实就是如此。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
【核心关键词】软件、洞察力、大数据、产品、经验、硬件、流量、创新、决策、数据安全、网络安全、数据分析、决策制定、数据挖 ...
2026-06-18在方案选型、效果复盘、产品评估、供应商筛选等各类业务决策场景中,仅凭单一指标下结论往往会陷入 “以偏概全” 的误区。多维度 ...
2026-06-18 很多数据分析师精通Excel单元格操作,但当被问到“表结构数据的基本处理单位是什么”“字段和记录的本质区别”“为什么表结 ...
2026-06-18在数据分析、用户运营与业务增长的工作体系中,漏斗拆解是最基础也最高频的问题定位方法。很多业务场景下,我们只能看到最终的转 ...
2026-06-17在数据库开发、数据清洗与报表统计场景中,数值类型转换为日期是高频刚需操作。业务系统常以 Unix 时间戳、整型日期(如20240617 ...
2026-06-17 数据分析师八成以上的时间在和数据表格打交道,但许多人拿到Excel后习惯性地先算、先分析,结果回头发现漏了一列关键数据, ...
2026-06-17【核心关键词】数据库、电商、知识、产品、数据产品、监管业务、产品经理、业务系统、用户行为分析、用户分析、数据分析、电商 ...
2026-06-16在 Python 动态类型与面向对象的编程体系中,变量定义与类实例化是构建代码逻辑的两大核心基石。变量是数据存储、传递与运算的基 ...
2026-06-16 很多数据分析师每天与Excel打交道,但当被问到“表格结构数据和表结构数据有什么区别”“数据类型误判会引发哪些分析错误” ...
2026-06-16在 MySQL 查询性能优化体系中,索引是降低查询耗时、提升数据库吞吐的核心手段。其中联合索引与覆盖索引是实际开发中最高频的两 ...
2026-06-15在数据仓库建设与商业智能分析体系中,维度建模是应用最广泛的建模方法论,而事实表与维度表是维度建模的两大核心构件,共同构成 ...
2026-06-15 很多数据分析师能熟练计算指标,但当被问到“这家企业的核心业务目标是什么”“如何把模糊的战略目标拆解为可量化的指标”“ ...
2026-06-15在数据分析、业务监控、运营复盘等场景中,列值趋势计算是核心需求之一。无论是分析销售额的月度增长、用户活跃的变化趋势、库存 ...
2026-06-12在数字经济深度渗透的当下,消费者的购买行为已从过去的 “被动接受” 转变为 “主动决策”。流量红利消退、获客成本攀升、用户 ...
2026-06-12CDA三级认证是三个级别中的塔尖,全面考察数据战略、团队领导和复杂项目的综合能力。它所对应的《敏捷数据挖掘》教材,不再局限 ...
2026-06-12在游戏产业的商业逻辑中,付费玩家是支撑游戏生存与发展的核心支柱。行业普遍遵循 “二八定律”:20% 的付费玩家贡献了游戏 80% ...
2026-06-11【核心关键词】企业、定位、传统、产品、互联网、可视化、业务侧、数字化、结构化、数据分析、传统制造业、市场状态、发展空间 ...
2026-06-11 解读《CDA二级教材:量化策略分析(2025)》的全景结构与学习逻辑 ” CDA二级认证是企业招聘数据分析师时最常提及的证书门槛 ...
2026-06-11【核心关键词】药企、可视化、营销、分类、数据分析师、销售数据、业务人员、指导方向、分析报告、营销数据、营销医生 【专访摘 ...
2026-06-10在统计学分析、问卷调研、实验验证、业务复盘等场景中,卡方检验与 T 检验是应用最广泛的两类基础假设检验方法。前者专门处理分 ...
2026-06-10