京公网安备 11010802034615号
经营许可证编号:京B2-20210330
大数据服务上云的思考_数据分析师考试
最近看到亚马逊第一次单独公布AWS财报,一年营收57亿美元,市场份额占比第一。混合云市场,2014年,IBM以综合的IT能力,收入70亿夺魁。云计算喊了这么多年,不知不觉已经变成了几十亿美元的大生意。云计算时代真的来了!
今天不是来说AWS的,说说大数据怎么上云的一些思考:
1、首先说说,大数据和云的关系,云是一种网络形态的概念,是继1980年代大型计算机到客户端-服务器的大转变之后的又一种巨变。云计算(Cloud Computing)是分布式计算(Distributed Computing)、并行计算(Parallel Computing)、效用计算(Utility Computing)、网络存储(Network Storage Technologies)、虚拟化(Virtualization)、负载均衡(Load Balance)、热备份冗余(High Available)等传统计算机和网络技术发展融合的产物。除了技术上的融合形态,更重要的体现了一种服务模式的一种融合和改变,对于云来说,大数据只是上面的一种服务,和其他的web服务,数据库服务没有区别。
2、I层(云的基础设施)现在业界最火的方案是OpenStack,OpenStack是一个由NASA(美国国家航空航天局)和Rackspace合作研发并发起的,以Apache许可证授权的自由软件和开放源代码项目。
OpenStack是一个开源的云计算管理平台项目,由几个主要的组件组合起来完成具体工作。OpenStack支持几乎所有类型的云环境,项目目标是提供实施简单、可大规模扩展、丰富、标准统一的云计算管理平台。OpenStack通过各种互补的服务提供了基础设施即服务(IaaS)的解决方案,每个服务提供API以进行集成。
OpenStack云计算平台,帮助服务商和企业内部实现类似于 Amazon EC2 和 S3 的云基础架构服务(Infrastructure as a Service, IaaS)。OpenStack 包含两个主要模块:Nova 和 Swift,前者是 NASA 开发的虚拟服务器部署和业务计算模块;后者是 Rackspace开发的分布式云存储模块,两者可以一起用,也可以分开单独用。OpenStack除了有 Rackspace 和 NASA 的大力支持外,还有包括 Dell、Citrix、 Cisco、 Canonical等重量级公司的贡献和支持,发展速度非常快。
在云环境中,Openstack解决了I层的问题,所有物理资源的管理和分配由I层来负责。
3、正是因为I层将资源和存储进行了虚拟化然后对上提供,大数据上云最大的两个问题是资源管理和数据存储。同时大数据又是重载的业务,对资源的需求非常高,因此需要大数据和openstack充分配合,大数据上云才能运行的好。
4、传统数据中心,大数据集群的资源管理和分配目前主要的方案是mesos/YARN.
从上图大家可以看出,Mesos/YARN来对物理资源直接进行管理,然后分配给上层的组件使用。 资源隔离方面,docker方案发展很快,所以又有YARN和kubernets结合的方案。PaaS作为一个服务直接架在YARN上。在没有直接I层能力的情况下,应该是非常合适的一种的过渡方案,但是如果YARN管理的不是直接的物理资源,而是I层虚拟出来的VM/docker之类,mesos/YARN和I层的能力就出现了一定的重合和冲突,这个时候mesos/YARN应该把VM/Docker级资源管理和分配的能力释放给I层,聚焦于job级资源的分配和调度。此时PaaS在架构在YARN/MESOS上就非常多余。
5、对于存储存在同样的问题,HDFS是对物理硬盘的直接抽象成对象存储,并提供3份冗余来保障数据的可靠性。云上的I层对存储通常也会抽象,并且进行一定的冗余,来动态分配给上层应用。HDFS直接架在I层上,就存在反复冗余的问题。同时大数据的核心是对数据的处理,数据存储的位置对性能起到非常关键的作用,多层反复虚拟化之后,数据分析软件存储的不确定性,性能损耗非常大。因此I层最好将物理硬盘直接提供出来给大数据服务可见,让用数据的人直接管理数据效率最高。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据仓库与数据分析体系中,维度表与事实表是构建结构化数据模型的核心组件,二者如同“骨架”与“血肉”,协同支撑起各类业务 ...
2026-01-16在游戏行业“存量竞争”的当下,玩家留存率直接决定游戏的生命周期与商业价值。一款游戏即便拥有出色的画面与玩法,若无法精准识 ...
2026-01-16为配合CDA考试中心的 2025 版 CDA Level III 认证新大纲落地,CDA 网校正式推出新大纲更新后的第一套官方模拟题。该模拟题严格遵 ...
2026-01-16在数据驱动决策的时代,数据分析已成为企业运营、产品优化、业务增长的核心工具。但实际工作中,很多数据分析项目看似流程完整, ...
2026-01-15在CDA(Certified Data Analyst)数据分析师的日常工作中,“高维数据处理”是高频痛点——比如用户画像包含“浏览次数、停留时 ...
2026-01-15在教育测量与评价领域,百分制考试成绩的分布规律是评估教学效果、优化命题设计的核心依据,而正态分布则是其中最具代表性的分布 ...
2026-01-15在用户从“接触产品”到“完成核心目标”的全链路中,流失是必然存在的——电商用户可能“浏览商品却未下单”,APP新用户可能“ ...
2026-01-14在产品增长的核心指标体系中,次日留存率是当之无愧的“入门级关键指标”——它直接反映用户对产品的首次体验反馈,是判断产品是 ...
2026-01-14在CDA(Certified Data Analyst)数据分析师的业务实操中,“分类预测”是高频核心需求——比如“预测用户是否会购买商品”“判 ...
2026-01-14在数字化时代,用户的每一次操作——无论是电商平台的“浏览-加购-下单”、APP的“登录-点击-留存”,还是金融产品的“注册-实名 ...
2026-01-13在数据驱动决策的时代,“数据质量决定分析价值”已成为行业共识。数据库、日志系统、第三方平台等渠道采集的原始数据,往往存在 ...
2026-01-13在CDA(Certified Data Analyst)数据分析师的核心能力体系中,“通过数据建立模型、实现预测与归因”是进阶关键——比如“预测 ...
2026-01-13在企业数字化转型过程中,业务模型与数据模型是两大核心支撑体系:业务模型承载“业务应该如何运转”的逻辑,数据模型解决“数据 ...
2026-01-12当前手游市场进入存量竞争时代,“拉新难、留存更难”成为行业普遍痛点。对于手游产品而言,用户留存率不仅直接决定产品的生命周 ...
2026-01-12在CDA(Certified Data Analyst)数据分析师的日常工作中,“挖掘变量间的关联关系”是高频核心需求——比如判断“用户停留时长 ...
2026-01-12在存量竞争时代,用户流失率直接影响企业的营收与市场竞争力。无论是电商、互联网服务还是金融行业,提前精准预测潜在流失用户, ...
2026-01-09在量化投资领域,多因子选股是主流的选股策略之一——其核心逻辑是通过挖掘影响股票未来收益的各类因子(如估值、成长、盈利、流 ...
2026-01-09在CDA(Certified Data Analyst)数据分析师的工作场景中,分类型变量的关联分析是高频需求——例如“用户性别与商品偏好是否相 ...
2026-01-09数据库中的历史数据,是企业运营过程中沉淀的核心资产——包含用户行为轨迹、业务交易记录、产品迭代日志、市场活动效果等多维度 ...
2026-01-08在电商行业竞争日趋激烈的当下,数据已成为驱动业务增长的核心引擎。电商公司的数据分析师,不仅是数据的“解读官”,更是业务的 ...
2026-01-08