京公网安备 11010802034615号
经营许可证编号:京B2-20210330
大数据的挑战问题和发展趋势_数据分析师
Hadoop大会是2008年的时候几十个人在金融所的楼里面讨论的Hadoop IN China,从去年开始上千人到今年有更多的人参加本身就反映了一种趋势。也就是说为什么今年把名字改成了Hadoop与大数据技术大会,实际上大数据不是今年就一定有。大数据的时代已经到来了,五年前我们组织Hadoop IN CHINA这个会已经和今天的大数据的主题比较切合,今年大数据的概念比较大,所以我们把题目改成了Hadoop与大数据技术大会大会。
当然,大数据不仅仅与Hadoop相关,传统的关系数据库和结构化存储相关的技术,在大数据时代的时候是不是有什么新的问题,有什么新的挑战,业界、学术界以及政府部门对相关的大数据是怎么看的。我估计今年至少从10月份以来,国内关于大数据的会议已经开了7、8次了,往后还会陆陆续续要开。这种情况下,中国计算机学会组织大数据专家委员会,不是为了赶热闹,而是组织专家委员会以及把Hadoop归到大数据专家委员会来统一组织实际上是有它内在的理由和原因的。
为什么第一个报告我来讲,去年的Hadoop大会叫数据掘宝,主题已经是跟大数据相关了。今年的主题叫大数据开源与技术共享,这实际上是大数据今年发展面临的关键的问题。今天我是代表中国计算机学会专家委员会来发布大数据的热点及未来的发展趋势做一些调研跟大家分享。
这个工作的过程简单地介绍一下,大数据执行委从今年10月在中国计算机大会上成立以来有70名委员,其中学术界有46位,产业界14位,还有海外学术界委员10位。我们在大连开会的时候探讨过,既然大数据这么热,而且在CNCC大会上有1600、1700人差不多每个人都说自己是做的大数据,无论是做物联网的还是做高清计算的,所有人都说我做的是大数据。当时我们在想,既然整个计算机界人做的都是大数据,那什么是大数据。
我们是不是在赶时髦用同样的一个词装各自所说的酒,也是基于这样的考虑,大数据专家为第一次开会的时候希望能不能邀请业界的人士共同探讨大数据的科学问题是什么、边界是什么,以及为什么大数据成为热点的词以及大大数据技术上的挑战到底是什么。当时的会议上我们提出了这样的议案,最后在很短的时间内从调研分析以及具体的提案到侯选问题的征集到最后专家的投票、委员的投票会聚了现在的结果,这个过程持续了一个多月。
这只是初步的结果。
针对大数据问题我们搜集了14个选项,包括科学问题相关的数据的科学问题、大数据的基本内涵、计算模式,跟技术相关的是大数据的多样性和数据态、大数据的空间维问题、时间维问题,如何将大数据变小及数据的价值提炼。数字都是70位委员的投票数。也包括了大数据的关键应用领域,以及大数据对IT技术和架构提出的安全与占、数据的安全和隐私。最后一个是大数据的生态问题。侯选项相互之间是有一定的重叠,而且颗粒度也不完全一致,完全是由专家自己提出来的,我们给他做了会聚,没有做一些很精细的加工。但基本上大家的投票结果来看,投票率还是非常高的,比如说数据的计算模式问题关注度非常高。投票的初始结果我们给出了大数据热点问题的八个方面。第一个方面是数据科学与大数据的学科边界问题,涉及到侯选项的两项,讲到了数据界、物理界与人的关联是什么,数据是不是客观存在的空间和现象。还有数据有没有独立的问题。大数据的基本学科边界有一个内涵和外延的限定,以及区别于其他数据的关键特征。最近有一本出版的数讲的是大数据不见得规模大,而是比较全。当然这是一种新的说法的。也就是说大数据的基本问题和边界是什么。这是我们关心的第一个大的方面。
第二个方面是数据计算的基本模式和范式问题,包括了数据密集型计算的基本范式是什么,以及数据计算的基本评估和数据计算的复杂性,以数据为中心去中心化的自主计算模式是不是数据计算的主要的模式。第三个热点问题是大数据的特性和数据态的问题。从数据的复杂性来讲,数据的关联模式、关系为复杂,数据的空间为复杂,包括数据在人机物三个空间里以及柔性密度的所产生的空间维度的复杂性,以及跟时间相关的特性。我们把它总结为大数据的基本特性和数据态的问题。
第四个热点问题是大数据的作用力与变化反应。包括了两个方面,第一个方面是如何将大数据变小,在尽量不损失价值的情况下减少数据的规模,像数据的清洗、去除等等,也是如何有效地处理大数据类似物理的作用把大数据的规模变小但不损失价值。第二个是化学作用,从一个平面的大数据提炼出高附加值的概念、知识和智慧。大数据的探索和可视性在这里面可以得到很大的发挥。计算方面我们通过群体指挥以及认知等方面发挥和提炼。
第五个问题是大数据的安全和隐私问题。投票是59票。
第六个问题是大数据对IT技术的挑战,包括存储、传出和分布式计算相关的整体架构的变化。今天的Hadoop实际上是应对大数据及大数据处理的相关的架构,虽然它目前的影响力很大了,但离成熟还有很远的距离,也就是说大数据的发展和爆发对IT架构提出了大的挑战。
第七个问题是大数据的应用和产业链的问题,。大数据有大价值,但在产业上如何形成有效增益的环境,以及大数据到底在什么样的应用领域里能够发挥绝对的价值,比如说跟社会科学、跟金融相关的,后面还会有一些分析,这个投票方面有大数据的应用和产业链。
第八个问题是大数据的生态环境问题,如果大数据时代真正地来临,从数据变成资产、数据的加工和制造,甚至在前期讨论有数据的制药,有新的数据工业和数据衍生品,这种数据市场和数据衍生品带来的市场的繁荣,另一方面是政策、环境包括投资环境和管理政策方面以及科研、研究所、学生的培养和国家政策的扶持方面形成的生态环境是大数据的第八个关键热点问题。由于大数据广泛的使用也会带来政治伦理政治方面的问题,我们统称为大数据的生态问题。
这是我们提炼出14个侯选项广泛地参与意见和投票之后提炼出的大数据时代的核心问题,这是目前的认识,也许未来这个问题包括在座的每一位同仁们可能有自己的想法,我们只是抛砖引玉,对大数据的核心问题提炼出八点。
第二方面的议题是发展趋势。任何的预测都是有问题的,我们发布的时候其实心里面是没有底气的,题目是在2013年在最近的距离内可预测的大数据的发展趋势是哪些方面,搜集了一些相关的内容,包括了70多位专家以及跟数学领域的专家合作,大家提炼出的发展趋势有37项,包括大数据的整体态势和发展趋势,大数据与学术、大数据与人类的活动,大数据的安全隐私、关键应用、系统处理和整个产业的影响。这方面总共有37项。大数据的整体态势上,数据的规模更大,数据资源化、数据的价值凸显、数据私有化出现和联盟共享。大数据有没有形成新的学科,当然仁者见仁智者见智,有很多人提出很多的想法。跟学术相关的包括数据科学的兴起,数学学科发生了很多的变革,由于数据学科的产生反过来影响为物理学和数学提出的新的要求,需求促使了技术学科的发展和变革。颗粒度不太一样,还有一些自主计算,基于海量知识的智能的革命性
的方法。有更奇妙的人机互联。大数据的隐私安全及跟国家安全相关的问题,我们也希望提出一个问号,总令人瞩目的大数据的应用到底是什么。还有基于大数据的决策支持、大数据的预测和清洗,大数据跟大企业的信息的推荐。大数据的系统处理上处理能力难以满足需要,处理模式多样化以及带来的网络带宽的压力。如果大数据来了以后把数据的价值充分发挥出来,网络的传输、网络的管理会带来一些非常突出的压力。资本会不会高度关注
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据可视化实践中,数据系列与数据标签的混淆是导致图表失效的高频问题——将数据标签的样式调整等同于数据系列的维度优化,或 ...
2025-11-21在数据可视化领域,“静态报表无法展现数据的时间变化与维度关联”是长期痛点——当业务人员需要分析“不同年份的区域销售趋势” ...
2025-11-21在企业战略决策的场景中,“PESTEL分析”“波特五力模型”等经典方法常被提及,但很多时候却陷入“定性描述多、数据支撑少”的困 ...
2025-11-21在企业数字化转型过程中,“业务模型”与“数据模型”常被同时提及,却也频繁被混淆——业务团队口中的“用户增长模型”聚焦“如 ...
2025-11-20在游戏行业“高获客成本、低留存率”的痛点下,“提前预测用户流失并精准召回”成为运营核心命题。而用户流失并非突发行为——从 ...
2025-11-20在商业数据分析领域,“懂理论、会工具”只是入门门槛,真正的核心竞争力在于“实践落地能力”——很多分析师能写出规范的SQL、 ...
2025-11-20在数据可视化领域,树状图(Tree Diagram)是呈现层级结构数据的核心工具——无论是电商商品分类、企业组织架构,还是数据挖掘中 ...
2025-11-17核心结论:“分析前一天浏览与第二天下单的概率提升”属于数据挖掘中的关联规则挖掘(含序列模式挖掘) 技术——它聚焦“时间序 ...
2025-11-17在数据驱动成为企业核心竞争力的今天,很多企业陷入“数据多但用不好”的困境:营销部门要做用户转化分析却拿不到精准数据,运营 ...
2025-11-17在使用Excel透视表进行数据汇总分析时,我们常遇到“需通过两个字段相乘得到关键指标”的场景——比如“单价×数量=金额”“销量 ...
2025-11-14在测试环境搭建、数据验证等场景中,经常需要将UAT(用户验收测试)环境的表数据同步到SIT(系统集成测试)环境,且两者表结构完 ...
2025-11-14在数据驱动的企业中,常有这样的困境:分析师提交的“万字数据报告”被束之高阁,而一张简洁的“复购率趋势图+核心策略标注”却 ...
2025-11-14在实证研究中,层次回归分析是探究“不同变量组对因变量的增量解释力”的核心方法——通过分步骤引入自变量(如先引入人口统计学 ...
2025-11-13在实时数据分析、实时业务监控等场景中,“数据新鲜度”直接决定业务价值——当电商平台需要实时统计秒杀订单量、金融系统需要实 ...
2025-11-13在数据量爆炸式增长的今天,企业对数据分析的需求已从“有没有”升级为“好不好”——不少团队陷入“数据堆砌却无洞察”“分析结 ...
2025-11-13在主成分分析(PCA)、因子分析等降维方法中,“成分得分系数矩阵” 与 “载荷矩阵” 是两个高频出现但极易混淆的核心矩阵 —— ...
2025-11-12大数据早已不是单纯的技术概念,而是渗透各行业的核心生产力。但同样是拥抱大数据,零售企业的推荐系统、制造企业的设备维护、金 ...
2025-11-12在数据驱动的时代,“数据分析” 已成为企业决策的核心支撑,但很多人对其认知仍停留在 “用 Excel 做报表”“写 SQL 查数据” ...
2025-11-12金融统计不是单纯的 “数据计算”,而是贯穿金融业务全流程的 “风险量化工具”—— 从信贷审批中的客户风险评估,到投资组合的 ...
2025-11-11这个问题很有实战价值,mtcars 数据集是多元线性回归的经典案例,通过它能清晰展现 “多变量影响分析” 的核心逻辑。核心结论是 ...
2025-11-11