数据分析的基本流程和方法
在大数据时代,数据分析的重要性显得更加突出,但是数据分析是一个相对比较专业的领域。数据分析的目的性很强,数据收集、数据处理和数据建模都要围绕数据分析的目的展开;同时数据分析有对专业知识和技巧要求比较高,如概率统计、数学建模的等。本文将介绍数据分析的基本流程和方法,并以一个数据分析的具体实例来来揭开数据分析的神秘面纱。
某大型牙膏制造企业为了更好地拓展产品市场,有效地管理库存,公司董事会要求销售部门根据市场调查,找出公司生产的牙膏销售量与销售价格、广告投入等之间的关系,从而预测出在不同价格和广告费用下的销售量。
定义问题
明确数据分析目标是数据分析的出发点。明确数据分析目标就是要明确本次数据分析要研究的主要问题和预期的分析目标等,简单的说就是定义问题。
针对这个具体问题,最根本的目标是预测不同价格和广告费用下的销售量,而且也决定了途径,找出牙膏销售量与销售价格和广告投入之间的关系。所以预期的分析目标确定了,就是预测不同价格和广告费用下的销售量,主要问题如何找到牙膏销售量与销售价格和广告投入之间的关系。
当对研究对象的内在特性和各因素间的关系有比较充分的认识时,一般用机理分析方法进行数据分析,但是如果由于客观事物内部规律的复杂性及人们认识程度的限制,无法分析实际对象内在的因果关系,建立合乎机理规律的数学模型,那么通常的办法是搜集大量的数据,基于对数据的统计分析找到相关因素的关系。
预测牙膏销量的问题,是一个“灰箱”问题,无法准确地在已掌握市场运行规律的基础上去推理分析药膏销量与价格和广告投入之间的关系,再者,要考虑到市场中不只是只有一家牙膏公司。显然,整个问题是无法通过简单推理分析来确定销量与价格和广告投入之间的关系的。
收集数据
正确收集数据是指从分析目标出发,排除干扰因素,正确收集服务于既定分析目标的数据。正确的数据对于实现数据分析目的将起到关键性的作用。如何正确的收集数据呢?简单的说就是用恰当的数据收集方法收集正确的的数据。
总体上讲有三类原始数据收集的方法原始数据包括实验方法、调查方法、观察方法等,
实验研究是一种受控的观测方法,通过一个或多个自变量的变化来评估它对一个或多个因变量产生的效应。统计调查研究(survey research)已经广泛应用于各个领域,包括政治学、社会学、经济学、教育学和管理学科。它是以研究样本的数据为基础辨析总体状况的研究方法。实地研究(fieldresearch)是对自然状态下的研究对象进行直接观察,收集一段时期内若干变量的数据。实地研究(fieldresearch)是对自然状态下的研究对象进行直接观察,收集一段时期内若干变量的数据。每种数据收集的方法都有自己的优缺点和适用范围,这里不详谈。
针对这个问题将采用样本统计调查(sample survey)的方法,但是该收集那些数据呢?研究的主要问题就是发现本公司牙膏销量与牙膏价格和广告投入的关系。正确的数据肯定包含该公司各个销售周期的销售量、销售价格和广告投入。但是从上面的分析中可以看到,本公司的牙膏销量绝对和其他公司的牙膏价格有关系,因此把其他牙膏公司的销售价格也作为数据收集对象。
数据处理
在明确数据分析目标基础上收集到的数据,往往还需要进行必要的加工整理后才能真正用于分析建模。数据的加工整理通常包括数据缺失值处理、数据的分组、基本描述统计量的计算、基本统计图形的绘制、数据取值的转换、数据的正态化处理等,它能够帮助人们掌握数据的分布特征,是进一步深入分析和建模的基础。
回到具体问题,收集到的数据有该公司的每个销售周期的牙膏销售量、价格、广告投入、和其他牙膏公司的价格。其他牙膏公司的价格和各公司的牙膏销售量有关系,但是其他公司的药膏价格却是有很多统计变量组成的,但是这些变量的影响作用是具有同样的规律,可以把这些变量看做一个整体,于是可以对这些统计变量做个取均值的处理,这是对数据处理的第一步。
由于牙膏是生活必需品,对大多数顾客来说,在购买同类产品的牙膏时更多地会在意不同品牌之间的价格差异,而不是它们的价格本身因此,在研究各个因素对销售量的影响时,用价格差代替公司销售价格和其它厂家平均价格更为合适。这是对数据处理的第二步。
记牙膏销售量为y,其它厂家平均价格与公司销售价格之差(价格差)为x1公司投入的广告费用为x2,其它厂家平均价格和公司销售价格分别为x3和x4, x1=x3-x4.
为了大致分析请y与x1和x2的关系,我们可以分别简单的绘制y对x1和x2的散点图。
图 1 y对x1的散点图
从图1可以发现,随着x1的增加,y的值有比较明显的线性增长趋势,图中的直线是用线性模型。
图 2 y对x2的散点图
当x2增大时,y有向上弯曲增加的趋势,图中的曲线使用二次函数拟合的,可以看到二者具有非线性关系。
数据加工整理完成后一般就可以进行进一步的数据分析了。分析时应切忌滥用和误用统计分析方法。滥用和误用统计分析方法主要是由于对方法能解决哪类问题、方法适用的前提、方法对数据的要求不清等原因造成的。另外,统计软件的不断普及和应用中的不求甚解也会加重这种现象。因此,在数据分析中应避免盲目的"拿来主义",否则,得到的分析结论可能会偏差较大甚至发生错误。
另外,选择几种统计分析方法对数据进行探索性的反复分析也是极为重要的。每一种统计分析方法都有自己的特点和局限,因此,一般需要选择几种方法反复印证分析,仅依据一种分析方法的结果就断然下结论是不科学的。
很对本问题,经过数据的简单处理和分析,已经可以看到销售量总体上和价格差成线性关系,销售量和广告投入上成非线性关系,因此可以建立一个回归模型,根据统计信息来求解模型,获得变量的系数,完成对模型的求解。
从图1可以发现,随着x1的增加,y的值有比较明显的线性增长趋势,可以得到公式1,
(1)
从图2中可以你发现,当x2增大时,y有向上弯曲增加的趋势,可以得到公式2,
(2)
根据以上分析可以建立如下回归模型(3)
(3)
其中和成为回归变量,,,,就是回归系数,影响的其它因素包含在随机误差中。
直接利用MATLAB中统计工具箱中的命令regress求解,使用格式为
[b,bint,r,rint,stats] = regress(y,x,alpha).其中,y为表中30个周期的销售量,长度为30的一向量,x为回归系数的数据矩阵[1,,,],是一个30*4的向量,b为回归系数向量的估计值,bint为其置信区间,r为残差向量,rint为残差向量的置信区间,stats为回归模型的检验统计量,包括三个变量,回归方程的决定系数,F统计变量值,与F统计变量值对应的概率p。
分析与结论
数据分析的直接结果是统计量和统计参数。正确理解它们的统计含义是一切分析结论的基础,它不仅能帮助人们有效避免毫无根据地随意引用统计数字的错误,同时也是证实分析结论正确性和可信性的依据,而这一切都取决于人们能否正确地把握统计分析方法的核心思想。
另外,将统计量和统计参数与实际问题相结合也是非常重要的。客观地说,统计方法仅仅是一种有用的数据分析工具,它绝不是万能的。统计方法是否能够正确地解决各学科的具体问题不仅取决于应用统计方法或工具的人能否正确地选择统计方法,还取决于他们是否具有深厚的应用背景。只有将各学科的专业知识与统计量和统计参数相结合,才能得出令人满意的分析结论。
本问题的计算结果如下:
且=0.9054, F = 82.9409, p= 0
=0.9054表示销售量的90.54%可由上述模型确定,F值远超过F检验的临界值,p远小于0.05,因而从总体上看模型是可用的。
回归模型的一个重要应用是,对于给定的回归变量的取值,可以以一定的置信度预测因变量的取值范围,即预测区间。比如当x1=0.2,x2=6.5 时可以算出牙膏销售量的置信度为95的预测区间[7.8230,8.7636],它表明在将来的某个销售周期中,如公司维持产品的价格差为0.2元,并投入650万元的广告费用,那么可以有95%的把握保证牙膏的销售量在7.8230,8.7636百万支之间,实际操作时,预测上限可以用来作为库存管理的目标值,即公司可以生产(或库存)8.763百万支牙膏来满足该销售周期顾客的需求;预测下限则可以用
来较好地把握(或控制)公司的现金流,理由是公司对该周期销售7.8230 百万支
牙膏十分自信.这在实际中将具有非常大的作用。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
数据分析在当今信息时代发挥着重要作用。单因素方差分析(One-Way ANOVA)是一种关键的统计方法,用于比较三个或更多独立样本组 ...
2025-04-25CDA持证人简介: 居瑜 ,CDA一级持证人国企财务经理,13年财务管理运营经验,在数据分析就业和实践经验方面有着丰富的积累和经 ...
2025-04-25在当今数字化时代,数据分析师的重要性与日俱增。但许多人在踏上这条职业道路时,往往充满疑惑: 如何成为一名数据分析师?成为 ...
2025-04-24以下的文章内容来源于刘静老师的专栏,如果您想阅读专栏《刘静:10大业务分析模型突破业务瓶颈》,点击下方链接 https://edu.cda ...
2025-04-23大咖简介: 刘凯,CDA大咖汇特邀讲师,DAMA中国分会理事,香港金管局特聘数据管理专家,拥有丰富的行业经验。本文将从数据要素 ...
2025-04-22CDA持证人简介 刘伟,美国 NAU 大学计算机信息技术硕士, CDA数据分析师三级持证人,现任职于江苏宝应农商银行数据治理岗。 学 ...
2025-04-21持证人简介:贺渲雯 ,CDA 数据分析师一级持证人,互联网行业数据分析师 今天我将为大家带来一个关于用户私域用户质量数据分析 ...
2025-04-18一、CDA持证人介绍 在数字化浪潮席卷商业领域的当下,数据分析已成为企业发展的关键驱动力。为助力大家深入了解数据分析在电商行 ...
2025-04-17CDA持证人简介:居瑜 ,CDA一级持证人,国企财务经理,13年财务管理运营经验,在数据分析实践方面积累了丰富的行业经验。 一、 ...
2025-04-16持证人简介: CDA持证人刘凌峰,CDA L1持证人,微软认证讲师(MCT)金山办公最有价值专家(KVP),工信部高级项目管理师,拥有 ...
2025-04-15持证人简介:CDA持证人黄葛英,ICF国际教练联盟认证教练,前字节跳动销售主管,拥有丰富的行业经验。在实际生活中,我们可能会 ...
2025-04-14在 Python 编程学习与实践中,Anaconda 是一款极为重要的工具。它作为一个开源的 Python 发行版本,集成了众多常用的科学计算库 ...
2025-04-14随着大数据时代的深入发展,数据运营成为企业不可或缺的岗位之一。这个职位的核心是通过收集、整理和分析数据,帮助企业做出科 ...
2025-04-11持证人简介:CDA持证人黄葛英,ICF国际教练联盟认证教练,前字节跳动销售主管,拥有丰富的行业经验。 本次分享我将以教培行业为 ...
2025-04-11近日《2025中国城市长租市场发展蓝皮书》(下称《蓝皮书》)正式发布。《蓝皮书》指出,当前我国城市住房正经历从“增量扩张”向 ...
2025-04-10在数字化时代的浪潮中,数据已经成为企业决策和运营的核心。每一位客户,每一次交易,都承载着丰富的信息和价值。 如何在海量客 ...
2025-04-09数据是数字化的基础。随着工业4.0的推进,企业生产运作过程中的在线数据变得更加丰富;而互联网、新零售等C端应用的丰富多彩,产 ...
2025-04-094月7日,美国关税政策对全球金融市场的冲击仍在肆虐,周一亚市早盘,美股股指、原油期货、加密货币、贵金属等资产齐齐重挫,市场 ...
2025-04-08背景 3月26日,科技圈迎来一则重磅消息,苹果公司宣布向浙江大学捐赠 3000 万元人民币,用于支持编程教育。 这一举措并非偶然, ...
2025-04-07在当今数据驱动的时代,数据分析能力备受青睐,数据分析能力频繁出现在岗位需求的描述中,不分岗位的任职要求中,会特意标出“熟 ...
2025-04-03