
无论是“小数据”时代还是现在的“大数据”时代,对数据的挖掘、存储、分析和使用从来就不是一件简单的事儿,而且这件事的难度还会随着数据量的增长而变得越来越大。同时,单个企业若是仅仅想要进行数据的存放和处理,去配备一整套Hadoop集群也并不经济。于是,阿里云准备将这件事做成一门生意,帮助企业对他们手中的数据进行存储和分析。
不久前,阿里云正式对外公布了一个叫做ODPS的商用服务。ODPS的全称是Open Data Processing Service,也就是开放数据处理服务。企业可以将来自前端的大量数据集中导入到阿里云中存储,这一点类似于亚马逊此前推出的Redshift数据仓库。
不仅如此。官方还表示,在这个基础上,阿里云将会开放更多的数据分析服务。目前,ODPS开放了SQL功能,以用于数据仓库和日志分析。这就像是Google此前推出的BigQuery——它可以让开发者可以使用Google的架构来运行SQL语句对超级大的数据库进行操作。同样地,现在企业也可以使用ODPS来对数据进行处理了。
在价格和性能方面,ODPS是按照使用量付费的:存储1GB的数据,每个月收取大概0.5元钱左右;阿里云还官方公布了一个数据处理能力供参考:6个小时ODPS可以处理100PB的数据。至于至关重要的商用后的SLA(服务等级协议),ODPS产品经理汤子楠披露了一部分:在技术层面,阿里云承诺放在ODPS中的数据不会泄漏,阿里巴巴和阿里云也不会查看;在服务层面,鉴于不能承诺所有提交的数据处理作业都能计算成功,如果是阿里云方面的原因导致作业失败,那么阿里云则不会收费,而且对于离线作业来说,只对作业成功的那次进行收费。
在此前,ODPS一直被应用于阿里内部的业务系统中,一个典型的应用就是阿里小贷公司的审核和放款流程。阿里巴巴的官方数据称,有超过36万人从阿里小贷借款,最小贷款额为1元,并且能够实现3分钟申请、1秒放款、0人工干预。在这些背后,阿里小贷每天需要处理30PB数据,包括店铺等级、收藏、评价等800亿个信息项,运算100多个数据模型……这些都是放在ODPS上存储和分析的。阿里云还表示,淘宝和支付宝等阿里巴巴的部分核心数据业务,也都运行在ODPS平台之上。而在ODPS的产品页面则拿出了阿里巴巴的关联公司天弘基金和众安保险作为案例来进行宣传。
从目前来看,ODPS开放的还只是针对大量数据的数据仓库功能,以及部分数据分析服务。但阿里云显然并不想止步于此。
你可以把阿里云此前一个叫做“御膳房”的服务看作ODPS未来发展方向的缩影。简单来说,“御膳房”实际上是对淘宝和天猫电商数据的挖掘、存储、分析和服务输出的整套服务。在“御膳房”中,淘宝和天猫平台上的大量电商数据被放到ODPS上进行存储,阿里巴巴还引入了第三方ISV(独立软件开发商)来针对这些数据开发分析工具和模型进行分析,最后他们将分析结果拿到服务市场上去销售给卖家——所谓针对淘宝天猫用户进行的精准广告营销,就是通过这种方法得来的。
在ODPS被开放出来之前,“御膳房”完全是阿里巴巴内部的电商平台上生长出来的产物,从数据来源,到数据取向,都是服务于淘宝和天猫平台。而在开放以后,就会有更多类型的企业和数据(包括一些阿里巴巴内部不太擅长处理的非结构化数据)被放在ODPS上,而使用范围也将不仅仅局限于阿里巴巴平台了。
用更加直白的语言来解释就是,ODPS此次作为PaaS被开放了出来进行商用,接下来,企业自身、或者借用ISV开发的工具再在ODPS之上进行数据分析,然后使用这些分析结果。
不过,ODPS现阶段仍有不少问题。汤子楠坦言,对非结构数据的支持将会是ODPS面临的一大挑战。因为ODPS最早是基于阿里巴巴内部的业务成长起来的,而阿里巴巴分析的数据主要是交易数据和用户行为数据——这些数据大多都是结构化和半结构化的。这决定了,ODPS最初开放的服务面向的也都是结构化数据,比如无人分析、数据仓库、BI(商业智能)分析。而随着更多的企业使用ODPS,一定会有大量非结构化的数据放到这个平台上来,这将会是ODPS接下来要探索的很重要的一个方面。
另外则是数据的传输问题。阿里云官方的建议是直接使用ODPS的数据仓库,这样就可以直接调用ODPS之上的分析工具;但如果客户的数据并不存储在阿里云上,也想使用ODPS对数据进行分析,则只能通过API使用https协议传输——这意味着网络传输不得不受到网速的限制。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
用 Power BI 制作地图热力图:基于经纬度数据的实践指南 在数据可视化领域,地图热力图凭借直观呈现地理数据分布密度的优势,成 ...
2025-07-24解析 insert into select 是否会锁表:原理、场景与应对策略 在数据库操作中,insert into select 是一种常用的批量数据插入语句 ...
2025-07-24CDA 数据分析师的工作范围解析 在数字化时代的浪潮下,数据已成为企业发展的核心资产之一。CDA(Certified Data Analyst)数据分 ...
2025-07-24从 CDA LEVEL II 考试题型看 Python 数据分析要点 在数据科学领域蓬勃发展的当下,CDA(Certified Data Analyst)认证成为众多从 ...
2025-07-23用 Python 开启数据分析之旅:从基础到实践的完整指南 在数据驱动决策的时代,数据分析已成为各行业不可或缺的核心能力。而 Pyt ...
2025-07-23鸢尾花判别分析:机器学习中的经典实践案例 在机器学习的世界里,有一个经典的数据集如同引路明灯,为无数初学者打开了模式识别 ...
2025-07-23解析 response.text 与 response.content 的核心区别 在网络数据请求与处理的场景中,开发者经常需要从服务器返回的响应中提取数 ...
2025-07-22解析神经网络中 Softmax 函数的核心作用 在神经网络的发展历程中,激活函数扮演着至关重要的角色,它们为网络赋予了非线性能力, ...
2025-07-22CDA数据分析师证书考取全攻略 一、了解 CDA 数据分析师认证 CDA 数据分析师认证是一套科学化、专业化、国际化的人才考核标准, ...
2025-07-22左偏态分布转正态分布:方法、原理与实践 左偏态分布转正态分布:方法、原理与实践 在统计分析、数据建模和科学研究中,正态分 ...
2025-07-22你是不是也经常刷到别人涨粉百万、带货千万,心里痒痒的,想着“我也试试”,结果三个月过去,粉丝不到1000,播放量惨不忍睹? ...
2025-07-21我是陈辉,一个创业十多年的企业主,前半段人生和“文字”紧紧绑在一起。从广告公司文案到品牌策划,再到自己开策划机构,我靠 ...
2025-07-21CDA 数据分析师的职业生涯规划:从入门到卓越的成长之路 在数字经济蓬勃发展的当下,数据已成为企业核心竞争力的重要来源,而 CD ...
2025-07-21MySQL执行计划中rows的计算逻辑:从原理到实践 MySQL 执行计划中 rows 的计算逻辑:从原理到实践 在 MySQL 数据库的查询优化中 ...
2025-07-21在AI渗透率超85%的2025年,企业生存之战就是数据之战,CDA认证已成为决定企业存续的生死线!据麦肯锡全球研究院数据显示,AI驱 ...
2025-07-2035岁焦虑像一把高悬的利刃,裁员潮、晋升无望、技能过时……当职场中年危机与数字化浪潮正面交锋,你是否发现: 简历投了10 ...
2025-07-20CDA 数据分析师报考条件详解与准备指南 在数据驱动决策的时代浪潮下,CDA 数据分析师认证愈发受到瞩目,成为众多有志投身数 ...
2025-07-18刚入职场或是在职场正面临岗位替代、技能更新、人机协作等焦虑的打工人,想要找到一条破解职场焦虑和升职瓶颈的系统化学习提升 ...
2025-07-182025被称为“AI元年”,而AI,与数据密不可分。网易公司创始人丁磊在《AI思维:从数据中创造价值的炼金术 ...
2025-07-18CDA 数据分析师:数据时代的价值挖掘者 在大数据席卷全球的今天,数据已成为企业核心竞争力的重要组成部分。从海量数据中提取有 ...
2025-07-18