
2014年12月12-14日,由中国计算机学会(CCF)主办,CCF大数据专家委员会承办,中科院计算所与CSDN共同协办,以推进大数据科研、应用与产业发展为主旨的2014中国大数据技术大会(Big Data Technology Conference 2014,BDTC 2014)暨第二届CCF大数据学术会议在北京新云南皇冠假日酒店盛大开幕。
2014中国大数据技术大会首日全体会议上,University of Delaware电子与计算机工程系教授,计算机系统结构和并行系统实验室创始人暨主任高光荣,带来了演讲“大数据系统核心技术”。高光荣主要介绍了大数据系统面临的严重挑战,大数据系统核心技术简介,数据流与大数据引擎的创新以及大数据系统发展在中国的机遇与挑战。
以下为演讲实录:
今天我们听了很多的报告,大数据到了最高点,距离真正的落地还有一个很长的时间。我只想把我最近做的一些工作和我历史上做一些工作总结起来,我没有很多广告的能力,但是也可能有一两张幻灯片为我做例证。我的演讲有两个方面:第一大数据HYPE Cycle的最新预测,第二怎么把大数据跟云计算结合起来。这个大数据不可能从天上掉下来,不可能把它割裂开,说我突然就有一个办法把我以前超机做的一些事情无关了,我们用另外一套办法把这个性能做上来,这种想法是可以理解的,但是不一定是现实的。在这个场合下我们说实时大数据,一定不要忘记长期的积累在高性能计算上这些积累,特别是中国由于各种需要,我们对高性能技术的工作也是有目共睹的。长沙的机器到现在为止仍然是世界上头一个,说明我们在这方面是一个前沿,我今天没有看到杨学之在这,但是我看到其他好几位其他同事,大数据实际上就是说这两件事情的关系,HPC跟大数据的关系。大数据实际上已经超过了最高炒作的内容,接下来应该是逐渐的走到了落地的阶段,然后有一个稳定的发展。它接着说两件事,一个是刚才我说的,HYPE Cycle大数据,注意是Reak Of inflated Expectations,用大数据做inflated Expectations,我们说的太多经验太少。我在深圳有一个朋友说大数据知识挖掘等等,最要紧对他来讲是钱的挖掘,能不能把大家所有的这些技术最后变成真正的实际效果,这一条我们实例还太少。同时他还有第三条建议,第三条建议就是千万不要忘记和小公司合作。他这个建议是给大公司的CTO、CIO说的,所以我觉得这三条是很好的一个总结,就是当前在HYPE Cycle这个方向。
我这剩下两条说明当前的挑战,这个问题就是说这个引擎要不要革命性的创新,还是说看看革命哪家比我强一点,我赶紧修理我这个,我是不是能超过A,超过A以后哪家比我好一点,还是说这个国家作为一个整体要做革命性的创新。我不说计算机里面的历史,我只想谈谈另外一个领域里的历史。100多年以前,飞机的问题是飞机引擎是不是可以把我们当时对汽车这个引擎的概念适用,不需要做革命性的概念这个事就可以做成,还是我不需要做这个飞机的事,后来你发现有一个新的模型,这个模型就是这个飞行动力学,从地面动力学模型到空间动力学模型,才能真正的造出这个引擎来,不是把汽车这个引擎革新,所以这个模型造成了新的结构,从腿到翅膀然后这个结构又发生了变化。在一百多年前那个历史是从模型到结构,我们计算机的发展实际上也是一样,在计算机历史上重大发现,都是有一个新计算模型一个执行模型,然后这个结构上的发展。我想我们大数据对我们做结构的人和做系统的人这个模型在什么地方?然后就有结构上的影响。
有了这个作为基础我们可以开始谈引擎核心结构的演变。我觉得大数据引擎的分析技术有三项。一项是执行模型和结构的技术。第二个系统软件的技术。第三是引擎的编程模型和优化技术,这三项相辅相成缺一不可的,做HPC的这群人都有过痛苦的经验和深刻的教训,这三方向的发展,在大数据引擎上面这三项也是非常重要的。我今天主要的是Execution Model,执行模型定义的一个API,叫做Execution Model API,然后你发展使得这个模型的定义双方有一个无缝连接,使得它能够达到你所需要的目的。最新的观点在这个上面,是这个Execution Model不仅仅影响这一层API,它同时也影响其他层之间的关系。所以这个事情非常重要,什么是Execution Model?比如说1948年总结的,那个Execution Model活这么多年,所有我们的接口,所有我们串型运算的接口在软件方面硬件方面这么长,我们一直试图整个的领域把成功经验用到并行操作和并行系统的执行模型,很可惜到今天仍没有成功。它的data不仅是程序自身产生的和程序自身确定的静态确定的这些数据,而是需要有动态的数据,什么叫做动态数据?比如所有传感器来的数据。你把问题表现成数学模型化然后编程而是要考虑这些大量随机的事务,Execution Model接入的数据,使这两种数据都可以使你系统里面无缝的结合起来。数据流的Execution Model没有这个旧年,数据里面甭管是可抗性的还是不可抗性,没有想象有一个温度的不可抗性,这个依赖关系没有办法表述。原来1970,1971年,1972年,1980年,这里面证明了Execution Model一致性完整性所有这些都需要重新的考验。我的意思就是说这个事情不能忘记,我们做大规模的处理历史经验非常重要。
什么叫做创新?创新意味着人类积累起来的知识不要忘记,在新环境下怎么让它适应Execution Model这是很重要一部分的创新。我们计算机系统领域有很大矛盾,我们常常非常容易的忘记过去,不是故意的,是事太多了,每年都在追,看看明年有什么,我赶快追,没有这个时间。
下面我用一个动画说明下Execution Model,在执行实现的时候误区在哪?这个误区就是把OS的作用给误解了,我的老师就是OS发起人之一很有名,他去年得最大的奖,他两个贡献,数据流是第二项,第一项是他在操作系统上做的贡献。这个动画就是Mechine Runtime Syelem。这个不是那个Runtime Syelem,这个有很多机器模型实现它,硬件跟Execution Model之间总会有一些坑坑洼洼不齐的地方。比如说你要求某一项操作在你Execution Model上,但是它硬件上,它的指令系统上,或者它系统结构没有直接反馈它,这时候你要做一层软件,它的任务就是补漏洞。这一层软件跟OS没有关系,最大的错误就是让OS执行这套软件。如果你注意最近这三年,美国主要的研究,都是强调Runtime Syelem和OS的关系,Runtime Syelem就是Execution Model跟OS的关系。并不是说OS没有用,但是它的任务是跟Runtime的分工。
系统软件上面并行多核,打破了传统OS控制打破了OS控制一体现象,支持高性能高扩展低能耗,弹性,面临空间的根本性的挑战。第三项有了这个系统,有了结构,当然你有编程模型和优化技术,我只想强调当前优化技术集中在静态优化方法,我们编程模型和优化技术都是假定,所有的都要用芯片来做,优化也是在这上面做。包括我自己的Execution Model做的一些工作都是假定硬件上有芯片,但是都是很小的规模,现在就是最重要的就是有动态调度,有并发多元管理在RUNTIME这里。李永辉教授今天上午的讲话,他第一条我听清楚了就是说即使在英特网上细颗粒度的监控,使得整体的计划变成动态的虚拟化,这个实际上跟那个是一回事,自调整都是建立在这个基础上,程序自己监控自己。
下面是我们有关工作的举例,只有四个例子,第一个例子我们建立数据流为背景动态细粒度多线程引擎核心技术的基地。第二巨型计算机,承担圈套以吸颗度多线程系统软件总体设计和工程实现,成功用于世界领先采用众核芯片技术的句型计算机(NE获投资总额超过三千万USD,2004-2011)。第三、研发超并行执行模型。承担超大模型数据流为背景的引擎执行模型的重大研究课题。四、研发超并行引擎,承担以数据流为基础的RUNTIME。系统软件重大发展研究。
下面初步例证跟Spark比,这是Spark结果是在中国测试的,所以这个HT就是用的数据流的技术,不是完全用,但是它那个思想是数据流的思想。在各个测试定位中你可以看到跟Spark比,在常常用的一些不同组的数据中,有五组数据,你可以看到就是说它的优点是明显的,如果你想问为什么,我人也在这你会后可以问。不仅是这样它的备存的用量实际上比Spark还要小,小5到10倍。
在中国的机遇和挑战,一个叫做他山之石可以攻玉,就像我们高铁一样,高铁不是在我这做的,高铁在欧洲、日本做的,别人做好的东西我们可以学习和借鉴,但是一定要跨越它的发展,这里我用红笔勾出来要从中国制造到中国创造。文章来自:CDA数据分析师官网
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
PowerBI 累计曲线制作指南:从 DAX 度量到可视化落地 在业务数据分析中,“累计趋势” 是衡量业务进展的核心视角 —— 无论是 “ ...
2025-08-15Python 函数 return 多个数据:用法、实例与实战技巧 在 Python 编程中,函数是代码复用与逻辑封装的核心载体。多数场景下,我们 ...
2025-08-15CDA 数据分析师:引领商业数据分析体系构建,筑牢企业数据驱动根基 在数字化转型深化的今天,企业对数据的依赖已从 “零散分析” ...
2025-08-15随机森林中特征重要性(Feature Importance)排名解析 在机器学习领域,随机森林因其出色的预测性能和对高维数据的适应性,被广 ...
2025-08-14t 统计量为负数时的分布计算方法与解析 在统计学假设检验中,t 统计量是常用的重要指标,其分布特征直接影响着检验结果的判断。 ...
2025-08-14CDA 数据分析师与业务数据分析步骤 在当今数据驱动的商业世界中,数据分析已成为企业决策和发展的核心驱动力。CDA 数据分析师作 ...
2025-08-14前台流量与后台流量:数据链路中的双重镜像 在商业数据分析体系中,流量数据是洞察用户行为与系统效能的核心依据。前台流量与 ...
2025-08-13商业数据分析体系构建与 CDA 数据分析师的协同赋能 在企业数字化转型的浪潮中,商业数据分析已从 “可选工具” 升级为 “核 ...
2025-08-13解析 CDA 数据分析师:数据时代的价值挖掘者 在数字经济高速发展的今天,数据已成为企业核心资产,而将数据转化为商业价值的 ...
2025-08-13解析 response.text 与 response.content 的核心区别 在网络数据请求与处理的场景中,开发者经常需要从服务器返回的响应中提取数 ...
2025-08-12MySQL 统计连续每天数据:从业务需求到技术实现 在数据分析场景中,连续日期的数据统计是衡量业务连续性的重要手段 —— 无论是 ...
2025-08-12PyTorch 中 Shuffle 机制:数据打乱的艺术与实践 在深度学习模型训练过程中,数据的呈现顺序往往对模型性能有着微妙却关键的影响 ...
2025-08-12Pandas 多列条件筛选:从基础语法到实战应用 在数据分析工作中,基于多列条件筛选数据是高频需求。无论是提取满足特定业务规则的 ...
2025-08-12人工智能重塑 CDA 数据分析领域:从工具革新到能力重构 在数字经济浪潮与人工智能技术共振的 2025 年,数据分析行业正经历着前所 ...
2025-08-12游戏流水衰退率:计算方法与实践意义 在游戏行业中,流水(即游戏收入)是衡量一款游戏商业表现的核心指标之一。而游戏流水衰退 ...
2025-08-12CDA 一级:数据分析入门的基石 在当今数据驱动的时代,数据分析能力已成为职场中的一项重要技能。CDA(Certified Data Anal ...
2025-08-12破解游戏用户流失困局:从数据洞察到留存策略 在游戏行业竞争白热化的当下,用户流失率已成为衡量产品健康度的核心指标。一款游 ...
2025-08-11数据时代的黄金入场券:CDA 认证解锁职业新蓝海 一、万亿级市场需求下的数据分析人才缺口 在数字化转型浪潮中,数据已成为企业核 ...
2025-08-11DBeaver 实战:实现两个库表结构同步的高效路径 在数据库管理与开发工作中,保持不同环境(如开发库与生产库、主库与从库)的表 ...
2025-08-08t 检验与卡方检验:数据分析中的两大统计利器 在数据分析领域,统计检验是验证假设、挖掘数据规律的重要手段。其中,t 检验和卡 ...
2025-08-08