京公网安备 11010802034615号
经营许可证编号:京B2-20210330
CDA数据分析师俱乐部从2013年3月开始成功举办了很多次线下聚会讨论,积累了丰富的经验,基于大数据狂潮和数据分析业务的发展,现在我们改变聚会的形式和时间,将以CDA数据分析师驿站的形式,在每周六(18:30-20:30无特殊情况时间不变)邀您与大家围在一起,喝喝咖啡,谈谈合作,听听大数据牛人的真知灼见 。会员也可以发言和主题分享,只需要提前告知申请,并准备简单的ppt!
10月17日,CDA俱乐部线下活动回顾
主题:Hadoop从部署到应用
俱乐部特邀嘉宾:曹正凤老师
一、先用几分钟聊了下大数据现状。
二、转为Hadoop的安装与部署
1.配置单机分布,
2.进而布置成伪分布
3.最后搭建集群分布的流程和编程(一连串代码就不写了。。)
三、最后讲到大数据的实际应用,主要有以下几点:
1.大数据提升预测准确性,
2.精准营销,整合营销,联合营销。 并以 谷歌、耐克等企业为例。
俱乐部特邀嘉宾:孙增辉老师。
从企业需求、技术实现等角度,讲解MapReduce、spark、storm三种分布式的优缺点。区别与联系。在运行海量数据时,公司主要有两种解决方式,一个是用大型计算机(两千万左右),二是采用分布式(价格便宜),所以在大部分企业中都是用分布式运行处理海量数据。Hadoop和spark的衔接,storm的性能优势及成本劣势。最后详细的讲解了三种软件在企业中应用的流程。
针对两位嘉宾的发言,其他会员进行了半个小时的提问,针对会员的各种问题,两位老师都一一解答。主要有一下几点:
1.现在企业中用的是 商业Hadoop还是免费版本的, 因为免费版本的要自己写程序,而上夜班的只要点点按钮就可以了,这对要不要学习Hadoop,很迷茫。
因为商业的Hadoop的费用是很贵的,并且和企业的具体需求匹配度等问题,现在大部分企业都是使用免费版本的,例如 阿里 百度, 他们都是自定义开发Hadoop的。
2.我现在搭建过单机分布,想在想要研究Hadoop的维护方向,老师有何建议?
如果你只是搭建过单机,对Hadoop的整体运行流程和应用都不了解,那还是从基本学起。现在维护方面有需求,但是没有形成规模,并且Hadoop更新太快了, 做维护研究,会贬值的,就是你学会了2.版本的维护,Hadoop的3.版本就上线了,那你就要从新学起
3.就想您说的Hadoop更新太快,那我们现在学习这些有用吗?会不会刚学习完,就更新了,还要重新学起?
Hadoop更新是很快,但主要从内存等方面更新, 代码原理是不会改变的, 所以把代码学会,就不怕Hadoop更新的快与慢了,但对Hadoop更新的特点要了解清楚
当投入到一件事情后,时间就会过得很快。不知不觉两个半小时已经过去,会员们还在积极讨论,但时间已经很晚了,不得不结束本次活动。相信会员们都收获了一定的知识或者想法,但还没有尽兴,我们创建了微信群,以便后期交流。后续俱乐部互动会持续展开。希望大家多多参与交流
期待下一期活动:《数据分析案例集》新书试读会:http://bbs.pinggu.org/thread-3932529-1-1.html
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
【核心关键词】贷款、报表、课程、专业、建模、缺失值、营销、互联网、银行、办公自动化、数据分析、数据预处理、特征工程、贷 ...
2026-06-05在数据库数据查询、业务报表统计、多表关联分析中,LEFT JOIN左连接是使用率最高的SQL关联查询语句。其核心特性是保留左表全部数 ...
2026-06-05 很多数据分析师能熟练地写SQL、做透视表、算描述性统计,但当被问到“如何预测用户流失概率”“如何归因销量下滑的关键因素 ...
2026-06-05任何一款产品从诞生、普及到最终退出市场,都会遵循一套固定的发展规律,这就是产品生命周期理论。在市场竞争日益激烈、产品迭代 ...
2026-06-04在Excel数据分析、办公统计、业务报表制作场景中,数据透视表是数据汇总、分类统计、快速复盘的核心工具,能够高效完成海量原始 ...
2026-06-04 很多数据分析师拿到数据就开始清洗、建模,但当被问到“这批数据属于什么类型——结构化还是非结构化?分类变量还是数值变量 ...
2026-06-04在问卷调查与社会科学数据分析中,卡方检验是最常用、最基础的非参数检验方法,广泛应用于市场调研、用户分析、行为统计、满意度 ...
2026-06-03【核心关键词】贷款、报表、课程、专业、建模、缺失值、营销、互联网、银行、办公自动化、数据分析、数据预处理、特征工程、贷 ...
2026-06-03 很多数据分析师画过趋势图、做过业绩预测,但当被问到“这个月销售额增长20%,到底是长期趋势自然增长,还是促销活动的短期 ...
2026-06-03逻辑回归是数据分析、机器学习、统计建模中应用最广泛的二分类预测模型,常用于风险判断、行为预测、归因分析等场景。在SPSS、Py ...
2026-06-02数字经济时代,市场竞争日趋同质化,用户消费需求愈发个性化、多元化,传统依托经验、粗放式、广撒网的营销模式弊端日益凸显。长 ...
2026-06-02 很多数据分析师做过按月份的销售额趋势图,画过按天的流量折线图,但当被问到“时间序列和普通数据有什么本质区别”“季节性 ...
2026-06-02在市场竞争日趋饱和、用户需求不断细分的当下,企业创业创新、产品迭代与市场拓展不再依赖经验决策,而是需要系统化、工具化的商 ...
2026-06-01【核心关键词】调度、岗位、数据库、企业、报表、培训、程序、数据分析、数据加工、业务部门、企业数据、调度工具、业务指标、 ...
2026-06-01 很多数据分析师能熟练地计算指标、搭建标签体系,但当被问到“画像到底在解决什么问题”“画像和标签是什么关系”“画像如何 ...
2026-06-01在数据统计分析、数据清洗、异常值识别与数据分布研究中,箱型图是最直观、高效、专业的可视化分析工具。相较于柱状图、折线图仅 ...
2026-05-29Tkinter是Python内置的标准GUI图形界面库,具备无需额外安装、调用简单、兼容性强、轻量化高效等优势,是Python快速开发桌面小程 ...
2026-05-29 很多分析师在设计标签时思路清晰,但真到落地环节却面临“数据在手,不知如何转化为可用标签”的困境:或因加工方式选择不当 ...
2026-05-29【核心关键词】大数据、经理、专业、金融、客户、传统、建模、数据产品、互联网金融、产品经理、数据分析、金融行业、数据模型 ...
2026-05-28 很多分析师每天和数据打交道,但当被问到“标签是什么”“标签和指标有什么区别”“标签体系如何设计”时,却常常答不上来。 ...
2026-05-28