京公网安备 11010802034615号
经营许可证编号:京B2-20210330
有了这个作为基础我们可以开始谈引擎核心结构的演变。我觉得大数据引擎的分析技术有三项。一项是执行模型和结构的技术。第二个系统软件的技术。第三是引擎的编程模型和优化技术,这三项相辅相成缺一不可的,做HPC的这群人都有过痛苦的经验和深刻的教训,这三方向的发展,在大数据引擎上面这三项也是非常重要的。我今天主要的是Execution Model,执行模型定义的一个API,叫做Execution Model API,然后你发展使得这个模型的定义双方有一个无缝连接,使得它能够达到你所需要的目的。最新的观点在这个上面,是这个Execution Model不仅仅影响这一层API,它同时也影响其他层之间的关系。所以这个事情非常重要,什么是Execution Model?比如说1948年总结的,那个Execution Model活这么多年,所有我们的接口,所有我们串型运算的接口在软件方面硬件方面这么长,我们一直试图整个的领域把成功经验用到并行操作和并行系统的执行模型,很可惜到今天仍没有成功。它的data不仅是程序自身产生的和程序自身确定的静态确定的这些数据,而是需要有动态的数据,什么叫做动态数据?比如所有传感器来的数据。你把问题表现成数学模型化然后编程而是要考虑这些大量随机的事务,Execution Model接入的数据,使这两种数据都可以使你系统里面无缝的结合起来。数据流的Execution Model没有这个旧年,数据里面甭管是可抗性的还是不可抗性,没有想象有一个温度的不可抗性,这个依赖关系没有办法表述。原来1970,1971年,1972年,1980年,这里面证明了Execution Model一致性完整性所有这些都需要重新的考验。我的意思就是说这个事情不能忘记,我们做大规模的处理历史经验非常重要。
什么叫做创新?创新意味着人类积累起来的知识不要忘记,在新环境下怎么让它适应Execution Model这是很重要一部分的创新。我们计算机系统领域有很大矛盾,我们常常非常容易的忘记过去,不是故意的,是事太多了,每年都在追,看看明年有什么,我赶快追,没有这个时间。
下面我用一个动画说明下Execution Model,在执行实现的时候误区在哪?这个误区就是把OS的作用给误解了,我的老师就是OS发起人之一很有名,他去年得最大的奖,他两个贡献,数据流是第二项,第一项是他在操作系统上做的贡献。这个动画就是Mechine Runtime Syelem。这个不是那个Runtime Syelem,这个有很多机器模型实现它,硬件跟Execution Model之间总会有一些坑坑洼洼不齐的地方。比如说你要求某一项操作在你Execution Model上,但是它硬件上,它的指令系统上,或者它系统结构没有直接反馈它,这时候你要做一层软件,它的任务就是补漏洞。这一层软件跟OS没有关系,最大的错误就是让OS执行这套软件。如果你注意最近这三年,美国主要的研究,都是强调Runtime Syelem和OS的关系,Runtime Syelem就是Execution Model跟OS的关系。并不是说OS没有用,但是它的任务是跟Runtime的分工。
系统软件上面并行多核,打破了传统OS控制打破了OS控制一体现象,支持高性能高扩展低能耗,弹性,面临空间的根本性的挑战。第三项有了这个系统,有了结构,当然你有编程模型和优化技术,我只想强调当前优化技术集中在静态优化方法,我们编程模型和优化技术都是假定,所有的都要用芯片来做,优化也是在这上面做。包括我自己的Execution Model做的一些工作都是假定硬件上有芯片,但是都是很小的规模,现在就是最重要的就是有动态调度,有并发多元管理在RUNTIME这里。李永辉教授今天上午的讲话,他第一条我听清楚了就是说即使在英特网上细颗粒度的监控,使得整体的计划变成动态的虚拟化,这个实际上跟那个是一回事,自调整都是建立在这个基础上,程序自己监控自己。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
主讲人简介 张冲,海归统计学硕士,CDA 认证数据分析师,前云南白药集团资深数据分析师,自媒体 Python 讲师,全网课程播放量破 ...
2026-04-10在数据可视化与业务分析中,同比分析是衡量业务发展趋势、识别周期波动的核心手段,其核心逻辑是将当前周期数据与上年同期数据进 ...
2026-04-10在机器学习模型的落地应用中,预测精度并非衡量模型可靠性的唯一标准,不确定性分析同样不可或缺。尤其是在医疗诊断、自动驾驶、 ...
2026-04-10数据本身是沉默的,唯有通过有效的呈现方式,才能让其背后的规律、趋势与价值被看见、被理解、被运用。统计制图(数据可视化)作 ...
2026-04-10在全球化深度发展的今天,跨文化传播已成为连接不同文明、促进多元共生的核心纽带,其研究核心围绕“信息传递、文化解读、意义建 ...
2026-04-09在数据可视化领域,折线图是展示时序数据、趋势变化的核心图表类型之一,其简洁的线条的能够清晰呈现数据的起伏规律。Python ECh ...
2026-04-09在数据驱动的时代,数据分析早已不是“凭经验、靠感觉”的零散操作,而是一套具备固定逻辑、标准化流程的系统方法——这就是数据 ...
2026-04-09长短期记忆网络(LSTM)作为循环神经网络(RNN)的重要改进模型,凭借其独特的门控机制(遗忘门、输入门、输出门),有效解决了 ...
2026-04-08在数据分析全流程中,数据质量是决定分析结论可靠性的核心前提,而异常值作为数据集中的“异类”,往往会干扰统计检验、模型训练 ...
2026-04-08在数字经济飞速发展的今天,数据已渗透到各行各业的核心场景,成为解读趋势、优化决策、创造价值的核心载体。而数据分析,作为挖 ...
2026-04-08在数据分析全流程中,数据处理是基础,图形可视化是核心呈现手段——前者负责将杂乱无章的原始数据转化为干净、规范、可分析的格 ...
2026-04-07在数据分析与统计推断中,p值是衡量假设检验结果显著性的核心指标,其本质是在原假设(通常为“无效应”“无差异”)成立的前提 ...
2026-04-07在数字经济深度渗透的今天,数据已成为企业生存发展的核心资产,企业的竞争本质已转变为数据利用能力的竞争。然而,大量来自生产 ...
2026-04-07Python凭借简洁的语法、丰富的生态库,成为算法开发、数据处理、机器学习等领域的首选语言。但受限于动态类型、解释性执行的特性 ...
2026-04-03在深度学习神经网络中,卷积操作是实现数据特征提取的核心引擎,更是让模型“看懂”数据、“解读”数据的关键所在。不同于传统机 ...
2026-04-03当数字化转型从企业的“战略口号”落地为“生存之战”,越来越多的企业意识到,转型的核心并非技术的堆砌,而是数据价值的深度挖 ...
2026-04-03在日常办公数据分析中,数据透视表凭借高效的汇总、分组功能,成为Excel、WPS等办公软件中最常用的数据分析工具之一。其中,“计 ...
2026-04-02在数字化交互的全场景中,用户的每一次操作都在生成动态的行为轨迹——电商用户的“浏览商品→点击详情→加入购物车”,内容APP ...
2026-04-02在数字化转型深度推进的今天,企业数据已成为驱动业务增长、构建核心竞争力的战略资产,而数据安全则是守护这份资产的“生命线” ...
2026-04-02在数据驱动决策的浪潮中,数据挖掘与数据分析是两个高频出现且极易被混淆的概念。有人将二者等同看待,认为“做数据分析就是做数 ...
2026-04-01