京公网安备 11010802034615号
经营许可证编号:京B2-20210330
大数据小白的一些浅见
近期关注大数据比较多,也接触了一些大数据领域的专业人士,收获颇丰。听了诸多专家的观点,对南大通用杜国旺总和华云数据集团的首席技术官郑军博士观点深有感触。在此,基于二位的观点,谈谈我对大数据发展的一些看法。
要谈论大数据,如果学究一点,首先要弄清楚的一个问题就是什么是大数据,怎样来解构大数据这个概念。对于此,杜总的分析还是比较清楚的。
在杜总看来,大数据分为三个层面:
第一, 画像数据,包含人物静态画像、事件动态画像和群类画像。人物静态画像是以人或物为基本线索进行数据关联(如:万科),事件动态画像是以事件主题为线索的数据关联(如:雷阳事件),Hadoop技术为实现以上两个需求提供了良好的技术支撑。群类画像是基于二级标引的多维属性画像,数据源以前两类为基础,将典型特征属性进行标引,然后以某个特征属性为线索进行关联,图数据库为该需求提供较好的技术支撑(如地质测绘、套牌车发现)。在我看来,杜总实际指的是数据的三种类型,这三类数据具有某种层度的递进关系,后一类比前一类更抽象更有价值,尤其是群类画像数据。实际上,我们所指的大数据更多的是指群类画像数据,是对很多个体某一特征的抽象概括数据,这样的数据才更有价值。
第二, 数据的统计分析,基于人物或事件的典型特征统计分析或动态查询,主要是基于统计概念的(如金融精准营销),数据源一般为典型的结构化数据,分析方法也较为成熟,mpp数据库为该需求提供快捷方便的技术支撑。
第三, 数据挖掘,这是目前大数据应用最难的,也是最有价值的,就是分析数据关联关系,主要是基于逻辑概念的,如(气象预报、风险预警、趋势分析、 机器人、watson等等),大部分人认为业务建模是一个非常复杂的事情,需要丰富的行业经验。这也正是大数据的应有之意。要从大量数据中挖掘有价值得信息,这与传统的数据统计分析有很大的不同,是深入数据的价值实体的,从海量数据中发现规律。
华云数据集团的郑军博士认为机器学习对于大数据的发展具有特殊的意义,我深表赞同。按照杜总对大数据的解构分析,数据挖掘才是大数据的本质,而要进行数据挖掘,机器学习方面技术的发展就必不可少了。毕竟要进行海量数据的复杂计算,靠人工来进行传统的统计分析是不现实的。
对于此,我有一个公式:云计算+大数据+机器学习=智能互联网。
其实云计算、大数据、机器学习这三个概念并不是孤立的,而是相辅相成,缺一不可的。要进行大量数据的处理,并且要将这种数据处理能力像水电一样作为基础设施提供给社会,那就必然要向全社会输出计算能力。目前来看,云计算技术承担了为社会提供计算能力的任务。另外,要将打通各个信息孤岛,共享局部甚至是全社会的数据,必然需要一个基于云架构的信息系统,云计算也承担了打通社会数据的使命。
在拥有强大的计算能力之后,只有通过对海量数据的处理,通过数据挖掘发现其中的价值,才算是发挥了云计算的功用。所以云计算和大数据是一枚硬币的两面,相辅相成。云计算和大数据的紧密关系,已经在业界得到普遍认知,但是要将这项事业推向深入,机器学习技术的发展就必不可少。因为人脑虽然具有很强的创造力,但是对大量信息的存储和处理能力却很缺乏,面对大量结构化和非结构化的数据,单靠人工来进行统计分析,是没效率甚至是不可能的。为计算系统赋予一定的智能,发挥其强大的存储和计算能力,是大数据发展的必然之路。
上面从概念上谈了大数据的理论,但如果要将大数据技术进行实际应用,应该怎么做,又会遇到什么困难呢?对于这个问题,华云数据集团的郑军博士给予了我一些启发。郑博士认为,我们的信息化进程可分为三个阶段:IT化阶段、数字化阶段、数据化阶段。目前阻碍我国大数据产业发展的一个重要障碍就是信息化进程的落后。用郑博士的话说,要进行大数据应用,首先必须得有大量数据,而目前我国的很多企业尤其是小型企业,还处在IT化阶段,几乎没有数据积累。如果“小数据”都没有,谈何大数据。阻碍大数据产业发展的另一障碍就是信息孤岛的大量存在,要想大数据获得发展,首先必须进行全社会数据的打通。
那么,我国的大数据应用情况到底怎么样了,是处于什么阶段呢?带着这样的问题,中国软件网进行了市场调研,并对调研结果进行分析,得出了一些有意思的结论,在此也跟大家分享一下:
1. 大数据主要是从公司的日常运营中产生,其次是从外部引入。

2.产生和存储的大数据类型主要有交易数据、生产数据,其次为移动数据、机器和传感器数据,可以看到企业产生和存储的主要数据都与其业务相关。产生的数据略多于存储的数据,说明还有部分产生的数据没能获得存储。
3. 从数据处理的全生命周期来看,目前采用的大数据技术方案主要集中于数据采集、分布式存储、分布式计算等靠前的环节。值得注意的是,在大数据分析处理环节,较多的企业也采用了相应的技术方案。
4.目前已经有和需求较多的大数据应用主要集中新业务拓展、提升客户体验、优化客户市场细分、精细化管理、市场和用户行为预测等几个方面。大数据应用的需求普遍高于已经有的大数据应用,说明市场需求还没有得到满足。但在精细化生产方面,已经有的大数据应用已经超过需求。

5.在大数据应用过程中的难点方面,主要集中在数据安全、数据存储压力、数据类型多样化、数据资源不丰富等几个方面。
6. 在大数据应用部署方面,已经在使用、计划1年内部署、计划2年内部署的企业相当,各占30%左右。
7. 企业在大数据应用方面,最希望获得技术支持、其次是数据业务发展规划支持,以及业务需求管理、产品/服务开发方面的支持。
以上是通过走访行业专家和我们自己的一些研究,对大数据产业发展的一些发现和看法。一方面为我国大数据领域的快速发展而兴奋,另一方面也深感挑战的艰巨。前路漫漫,我国大数据的发展还得靠大家的共同努力。但我始终坚信,道路是曲折的,前途是异常光明的。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数字化时代,企业的每一次业务优化、每一项技术迭代,都需要回答一个核心问题:这个动作到底能带来多少价值?是提升了用户转化 ...
2026-05-15在数据仓库建设中,事实表与维度表是两大核心组件,二者相互关联、缺一不可,共同构成数据仓库的基础架构。事实表聚焦“发生了什 ...
2026-05-15 很多数据分析师沉迷于复杂的机器学习算法,却忽略了数据分析最基础也最核心的能力——描述性统计。事实上,80%的商业分析问 ...
2026-05-15【核心关键词】互联网、机会、运营、关键词、账户、数字化、后台、客户、成本、网络、数据分析、底层逻辑、市场推广、数据反馈、 ...
2026-05-14在Python数据分析中,Pandas作为核心工具库,凭借简洁高效的数据处理能力,成为数据分析从业者的必备技能。其中,基于两列(或多 ...
2026-05-14 很多人把统计学理解为“一堆公式和计算”,却忽略了它的本质——一门让数据“开口说话”的科学。真正的数据分析高手,不是会 ...
2026-05-14在零售行业存量竞争日趋激烈的当下,客户流失已成为侵蚀企业利润的“隐形杀手”——据行业数据显示,零售企业平均客户流失率高达 ...
2026-05-13当流量红利消退、用户需求日趋多元,“凭经验决策、广撒网投放”的传统营销模式早已难以为继。大数据的崛起,为企业营销提供了全 ...
2026-05-13 许多数据分析师精通Excel函数和SQL查询,但当面对一张上万行的销售明细表,要快速回答“哪个地区销量最高”“哪款产品增长最 ...
2026-05-13【专访摘要】本次CDA持证专访邀请到拥有丰富物流供应链数据分析经验的赖尧,他结合自身在京东、华莱士、兰格赛等企业的从业经历 ...
2026-05-12在手游行业存量竞争日趋激烈、流量成本持续高企的当下,“拉新”早已不是行业核心痛点,“留存”尤其是“付费留存”,成为决定手 ...
2026-05-12 很多数据分析师掌握了Excel函数、会写SQL查询,但当被问到“数据从哪里来”“数据加工有哪些步骤”“如何使用分析工具连接数 ...
2026-05-12用户调研是企业洞察客户需求、优化产品服务、制定运营策略的核心前提,而调研数据的可靠性,直接决定了决策的科学性与有效性。在 ...
2026-05-11在市场竞争日趋激烈、流量成本持续攀升的今天,企业的核心竞争力已从“获取流量”转向“挖掘客户价值”。客户作为企业最宝贵的资 ...
2026-05-11 很多数据分析师精通Excel单元格操作,熟练应用多种公式,但当被问到“表结构数据的基本处理单位是什么”“字段和记录的本质 ...
2026-05-11在互联网运营、产品优化、用户增长等领域,次日留存率是衡量产品价值、用户粘性与运营效果的核心指标,更是判断新用户是否认可产 ...
2026-05-09相关性分析是数据分析领域中用于探究两个或多个变量之间关联强度与方向的核心方法,广泛应用于科研探索、商业决策、医疗研究、社 ...
2026-05-09 数据分析师八成以上的时间在和数据表格打交道,但许多人拿到Excel后习惯性地先算、先分析,结果回头发现漏了一列关键数据, ...
2026-05-09在数据驱动运营的时代,指标是连接业务目标与实际行动的核心桥梁,是企业解读业务现状、发现问题、预判趋势的“量化标尺”。一套 ...
2026-05-08在存量竞争日趋激烈的商业时代,“以客户为中心”早已从口号落地为企业运营的核心逻辑。而客户画像作为打通“了解客户”与“服务 ...
2026-05-08