京公网安备 11010802034615号
经营许可证编号:京B2-20210330
八大趋势看透大数据分析的未来_数据分析师考试
Intuit公司负责数据工程的副总裁Bill Loconzolo已两脚踏入了数据湖。而Smarter Remarketer的首席数据科学家Dean Abbott也径直走进了云中。当我们说到大数据[注]和分析的前沿时,它既包括数据湖(以原生格式存储海量数据),当然也包括云计算[注]。尽管这些技术选项距离成熟还很远,但我们肯定不能选择一味的等待和观望。 现实情况虽然是,各种大数据工具在不断涌现,但Hadoop平台的前途尚未达到让企业能够依赖的程度,Loconzolo说。然而大数据和分析技术演变得如此之快,企业必须做出抉择,要么涉足其中,要么就得冒落后的风险。
在过去,新兴技术可能需要几年时间才能成熟。而现在,解决方案的迭代和升级只需要几个月,甚至几周时间,那么,在你的观察名单或者实验室里,最重要的新兴技术和趋势是什么呢?当我们用这样的问题去问很多IT高管、咨询师和行业分析师时,得到了如下的答案。 1、云中的大数据分析 Hadoop框架和一组工具可用于处理非常大的数据集,它最初是为了物理机集群而设计的。
但现在情况有了变化。Forrest分析师Brian Hopkins说:“如今已有很多技术可用于处理云中的数据。”实例包括亚马逊Redshift所托管的BI数据仓库、谷歌BigQuery数据分析服务、IBM Bluemix云平台,以及亚马逊Kinesis数据处理服务等。大数据的未来状态将是企业端和云端的某种混合态。 从事零售业分析与营销服务的SaaS[注]厂商Smarter Remarketer最近已从其内部的Hadoop和MongoDB数据库基础架构转移到了亚马逊Redshift云数据仓库上。
该公司主要收集线上和线下的零售销售数据、消费者统计数据及实时行为数据,然后对其作分析,帮助零售商创建有针对性的消息发送,以便吸引顾客的响应(某些情况下可能是实时的响应)。 Abbortt称,Redshift对于Smarter Remarketer的数据需求来说,更具成本效益,特别是其针对结构化数据的范围广泛的报表功能。作为一种托管服务,Redshift既可扩展,使用起来也相对简单。
它在虚拟机上的扩展成本要比购买由我们自己管理的物理机便宜不少。 Intuit也开始谨慎地在向云分析转移,因为它需要一个安全、稳定和可审计的环境。这家财务软件公司一方面计划在自己私有的Intuit分析云中保留一切资源,另一方面,又在与亚马逊和Cloudera合作,计划构建一个公私混合的、高度可用而且安全的分析云,Loconzolo说。对于像Intuit这样销售在云中运行的产品厂商来说,向云的迁移是不可避免的。一旦在企业端分析数据的成本高到无法承受时,就只能把所有的数据迁到云中去。
2、Hadoop:新的企业数据操作系统 Hopkins认为,各种分布式分析框架,如MapReduce,正在演变为分布式资源管理器,它们会逐渐地将Hadoop转变为一种通用的数据操作系统。有了Hadoop这样的分布式文件存储系统,你就能执行很多不同的数据操控和分析任务。
这种变化对企业来说意义何在呢?和SQL一样,MapReduce、内存计算、流处理、图形分析和其他类型的工作负载都能够以适当的性能在Hadoop上运行,越来越多的企业会把Hadoop当作企业数据集中库来使用。这样的能力,即针对Hadoop上的数据执行多种不同类型查询和操控的能力,将使其成为一种低成本的通用平台,企业想要分析的任何数据都可以放在其上进行分析。Hopkins说。 Intuit已经开始在构建自己的Hadoop基础。“我们的战略是利用MapReduce和Hadoop,构造Hadoop分布式文件系统,长期目标是让人和产品之间所有类型的互动得以产生,”Loconzolo说。
3、大数据湖 传统的数据库理论会告诉你,在进入任何数据之前,首先得设计好数据集。而数据湖,也称企业数据湖或企业数据集中库,可能会彻底改变传统模式,普华永道美国咨询业务负责人兼首席技术专家Chris Curran说。也就是说,我们会将各种数据资源倾倒进一个大的Hadoop仓库中去,而不会事先设计什幺数据模型。
相反地,我们会提供各种工具,再配上对数据湖中现存数据的顶层定义,供人们去分析数据。这样,人们就可随着对数据湖的逐步深入而构建起自己的数据视图。这正是构建一个大规模数据库的增量化的、有机的模型。
不过,这种方法也存在不足,那就是对数据分析人员的技术要求较高。 Loconzolo说,作为Intuit分析云的一个组成部分,Intuit也有一个数据湖,包括用户的点击流数据、企业数据和第三方数据,但重点是围绕数据湖对工具进行所谓的“民主化”,让商业人士都能有效地使用它。Loconzolo说,在Hadoop里构建一个数据湖,他的一个担心是Hadoop平台并未真正实现企业就绪。我们希望它具备数十年来传统企业数据库所具备的所有功能――监控访问控制、数据加密、保护数据,并可跟踪数据从源到目标的传递路径。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据分析与建模中,“显性特征”(如用户年龄、订单金额、商品类别)是直接可获取的基础数据,但真正驱动业务突破的往往是 “ ...
2025-11-07在大模型(LLM)商业化落地过程中,“结果稳定性” 是比 “单次输出质量” 更关键的指标 —— 对客服对话而言,相同问题需给出一 ...
2025-11-07在数据驱动与合规监管双重压力下,企业数据安全已从 “技术防护” 升级为 “战略刚需”—— 既要应对《个人信息保护法》《数据安 ...
2025-11-07在机器学习领域,“分类模型” 是解决 “类别预测” 问题的核心工具 —— 从 “垃圾邮件识别(是 / 否)” 到 “疾病诊断(良性 ...
2025-11-06在数据分析中,面对 “性别与购物偏好”“年龄段与消费频次”“职业与 APP 使用习惯” 这类成对的分类变量,我们常常需要回答: ...
2025-11-06在 CDA(Certified Data Analyst)数据分析师的工作中,“可解释性建模” 与 “业务规则提取” 是核心需求 —— 例如 “预测用户 ...
2025-11-06在分类变量关联分析中(如 “吸烟与肺癌的关系”“性别与疾病发病率的关联”),卡方检验 P 值与 OR 值(比值比,Odds Ratio)是 ...
2025-11-05CDA 数据分析师的核心价值,不在于复杂的模型公式,而在于将数据转化为可落地的商业行动。脱离业务场景的分析只是 “纸上谈兵” ...
2025-11-05教材入口:https://edu.cda.cn/goods/show/3151 “纲举目张,执本末从。” 若想在数据分析领域有所收获,一套合适的学习教材至 ...
2025-11-05教材入口:https://edu.cda.cn/goods/show/3151 “纲举目张,执本末从。” 若想在数据分析领域有所收获,一套合适的学习教材至 ...
2025-11-04【2025最新版】CDA考试教材:CDA教材一级:商业数据分析(2025)__商业数据分析_cda教材_考试教材 (cdaglobal.com) ...
2025-11-04在数字化时代,数据挖掘不再是实验室里的技术探索,而是驱动商业决策的核心能力 —— 它能从海量数据中挖掘出 “降低成本、提升 ...
2025-11-04在 DDPM(Denoising Diffusion Probabilistic Models)训练过程中,开发者最常困惑的问题莫过于:“我的模型 loss 降到多少才算 ...
2025-11-04在 CDA(Certified Data Analyst)数据分析师的工作中,“无监督样本分组” 是高频需求 —— 例如 “将用户按行为特征分为高价值 ...
2025-11-04当沃尔玛数据分析师首次发现 “啤酒与尿布” 的高频共现规律时,他们揭开了数据挖掘最迷人的面纱 —— 那些隐藏在消费行为背后 ...
2025-11-03这个问题精准切中了配对样本统计检验的核心差异点,理解二者区别是避免统计方法误用的关键。核心结论是:stats.ttest_rel(配对 ...
2025-11-03在 CDA(Certified Data Analyst)数据分析师的工作中,“高维数据的潜在规律挖掘” 是进阶需求 —— 例如用户行为包含 “浏览次 ...
2025-11-03在 MySQL 数据查询中,“按顺序计数” 是高频需求 —— 例如 “统计近 7 天每日订单量”“按用户 ID 顺序展示消费记录”“按产品 ...
2025-10-31在数据分析中,“累计百分比” 是衡量 “部分与整体关系” 的核心指标 —— 它通过 “逐步累加的占比”,直观呈现数据的分布特征 ...
2025-10-31在 CDA(Certified Data Analyst)数据分析师的工作中,“二分类预测” 是高频需求 —— 例如 “预测用户是否会流失”“判断客户 ...
2025-10-31