京公网安备 11010802034615号
经营许可证编号:京B2-20210330
大数据的是与不是
在时下的流行语中,很难找出一个比“大数据”更吸引眼球的术语了。1980年,阿尔文 托夫勒在《第三次浪潮》中预言了信息时代的到来会带来数据爆发,约翰 梅西在1998年的美国高等计算机系统协会大会上首次提出“大数据(big data)”一词。什么是大数据?这一概念目前尚未形成统一的定义。几种代表性的观点如下:麦肯锡认为“大数据是指无法在一定时间内用传统数据库软件工具对其内容进行抓取、管理和处理的数据集合”;维基百科认为“大数据是指无法在一定时间内用常规软件工具对其内容进行抓取、管理和处理的数据集”;全球最具权威的 IT研究与顾问咨询公司——高德纳公司认为“大数据是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产”。
大数据时代已经来临,它将在众多领域掀起变革的巨浪,这是勿庸置疑的事实,在以云计算为代表的技术创新大幕的衬托下,这些原本很难收集和使用的数据开始容易被利用起来了,通过各行各业的不断创新,大数据会逐步为人类创造更多的价值,而对于电网企业来说,大数据的应用同样会促进企业的跨越发展。
大数据的本质是事物的时域、空域记录,并非事物的描述数据
对于大数据的特点,IT界通常用Volume(大量)、Velocity(高速)、Variety(多样)、Value(价值)这4个 V来概括。Volume,指数据体量巨大,从TB级别跃升到PB乃至EB级别;Variety,指数据类型繁多。除了传统的结构化数据,大量非结构化、半结构化数据如网络日志、音频、视频、图片等;Value,指价值密度低,但大数据分析的价值高。价值密度的高低与数据总量的大小成反比,以视频为例,一部一小时的视频,在连续不间断监控过程中,可能有用的数据仅仅只有一两秒;Velocity,指变化速度快。大数据不仅量大,而且变化快,大数据的应用依赖于对数据的快速处理。但在笔者看来,对大数据作4V特点的概括是现象而非本质总结。
其实人类文明就是大数据的记录与应用积累,当今社会进入了信息时代,信息化的本质是用 IT技术和方法描述世界,描述事物的内在本质、过程规律和业务规则,信息化的应用过程就是在描述好事物的软件系统中实现人工和 /或机器记录,大数据的本质是事物的时域、空域记录,并非事物的描述数据,大数据成为热门是因为信息化、互联网、终端的普及和应用让我们进入了一个机器自动记录的时代,爆炸性增长的记录数据使传统的人工、单机 /单节点的机器处理能力无法完成记录的分析、挖掘,由此催生了云计算和大数据概念并推动人工智能的工程应用,机器学习等人工智能技术就是机器处理大数据及大数据应用高级模式。
大数据应用的本质是推导规律、预知未来,并非简单的统计分析
在信息化时代以前,人类就有典型的大数据应用,如视觉美学总结的黄金分割(0.618),社会学中的在特定时空范围内存在的“二八”理论。大数据应用的本质是推导规律、预知未来,并非简单的统计分析。在信息化时代,大数据极大依赖信息化及其应用,开展大数据分析也必须应用信息化方法与手段,符合信息化业务驱动、目标导向等原则,没有目标的大数据平台建设或挂大数据“羊头”不利于信息化建设和大数据应用。
而互联网大数据与企业大数据是有区别的,互联网本质是跨区域的信息化网络基础设施,其大量的内容服务和居于互联网社交软件并不存在描述事物的过程即没有对象模型,人们应用互联网留下了应用记录(大量的非结构化数据),分析这些大数据记录的前提是重新构建记录的对象,对记录标识特征。企业信息化一般经过业务标准化和业务流程梳理过程,所以企业的大数据是存在对象描述,但企业应用的困难是我们建设的系统在对象描述上不统一、对象上的记录不完整。所以互联网大数据与企业大数据应用尽管原理与方法一致,但分析工作的重点是有区别的。互联网公司在开展大数据分析的工具、技术方法不完全适用于企业,更不能把互联网大数据的平台建设当做企业大数据应用工作的全部。
区别好对象模型数据与记录数据是大数据分析的基础,尽管描述事物对象的数据也可以达到 PB级,如人类的基因图谱、地球大气层流动模型、电网的网络结构模型等,这些数据不是大数据,在这些对象模型上构建软件并记录的业务变化是大数据。所以在大数据应用方面存在两类数据的预处理,一类是模型数据预处理,另一类是记录数据预处理。模型层面的预处理本质是信息化建设方案的科学性、合理性。记录的完整性很大程度上也是取决于信息化方案,同时也取决于信息系统的应用过程。一旦软件上线,再作数据治理来解决模型之间的不一致性或对记录的二次“模型化”加工是一种方法论上的误导,正确的方法应该是依据企业架构和行业解决方案完善信息化架构,实现企业信息化架构规范和引导下的信息系统建设和应用,在企业层面统筹企业模型、统筹系统结构和功能界面、统一业务系统应用规范。企业的数据治理必须在建设方案中完成,系统建成系统后的数据治理是无效的,当然在系统运行过程中数据库的技术数据治理是必须的。
大数据应用在电网领域大有可为
在电网企业中,电量数据是一组典型的大数据。客户和客户的电表台账是电量数据的宿主对象,采集系统中对客户和电表台账进行建模,各用户电表的时序记录就是电量大数据。下面结合国网江苏电力开展的负荷预测大数据应用简述大数据应用方法。
首先是数据预处理。对象模型的预处理,依托营配调一体化,建立客户和电表台账与电网供电逻辑关系,构建电网各电压层级直至各台区到用户的关联模型;记录数据的预处理,对电量记录电度值进行年度节假日除权回原,去除电量的节假日因素,去除记录奇点和内插补全个别记录缺点等。
其次是分行业回归建立日电量与气温、湿度等因素用电模型,依据实时运行方式累计各台区日电量、日负荷,完成各区域、各电压等级的电量和负荷预测模型的构建,并构建模型机器学习,保持模型的时效性。
最后,由大数据平台给预测模型导入实时气温与前一时段的电量和负荷,实现短期、超短期的全网负荷预测。同样原理,关联宏观GDP与电量指数,结合业扩包装量变化,实现中长期负荷预测。
2015年 ,江苏电网以全样本的用户每日实时采集用电数据,结合十多年用电、业扩、气象等历史数据,建立起涵盖全省各地区、分行业以及25万专变用户和40万台公用变压器的包括温度、湿度、节假日、周末等要素的多维度用电影响模型,模型包含的数据关联关系超过110亿项,开展负荷中长期、短期、超短期预测工作,有效指导了生产工作。
此外,电量大数据的应用在行业内外还有大量的可应用价值,如从用电设备节能潜力分析全社会节能潜力、大用户用电特征分析行业产能利用情况、居民用户家庭活动特征等,大数据应用在电网领域大有可为。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在金融行业的数字化转型进程中,SQL作为数据处理与分析的核心工具,贯穿于零售银行、证券交易、保险理赔、支付结算等全业务链条 ...
2025-12-24在数据分析领域,假设检验是验证“数据差异是否显著”的核心工具,而独立样本t检验与卡方检验则是其中最常用的两种方法。很多初 ...
2025-12-24在企业数字化转型的深水区,数据已成为核心生产要素,而“让数据可用、好用”则是挖掘数据价值的前提。对CDA(Certified Data An ...
2025-12-24数据分析师认证考试全面升级后,除了考试场次和报名时间,小伙伴们最关心的就是报名费了,报 ...
2025-12-23CDA中国官网是全国统一的数据分析师认证报名网站,由认证考试委员会与持证人会员、企业会员以及行业知名第三方机构共同合作,致 ...
2025-12-23在Power BI数据可视化分析中,矩阵是多维度数据汇总的核心工具,而“动态计算平均值”则是矩阵分析的高频需求——无论是按类别计 ...
2025-12-23在SQL数据分析场景中,“日期转期间”是高频核心需求——无论是按日、周、月、季度还是年度统计数据,都需要将原始的日期/时间字 ...
2025-12-23在数据驱动决策的浪潮中,CDA(Certified Data Analyst)数据分析师的核心价值,早已超越“整理数据、输出报表”的基础层面,转 ...
2025-12-23在使用Excel数据透视表进行数据分析时,我们常需要在透视表旁添加备注列,用于标注数据背景、异常说明、业务解读等关键信息。但 ...
2025-12-22在MySQL数据库的性能优化体系中,索引是提升查询效率的“核心武器”——一个合理的索引能将百万级数据的查询耗时从秒级压缩至毫 ...
2025-12-22在数据量爆炸式增长的数字化时代,企业数据呈现“来源杂、格式多、价值不均”的特点,不少CDA(Certified Data Analyst)数据分 ...
2025-12-22在企业数据化运营体系中,同比、环比分析是洞察业务趋势、评估运营效果的核心手段。同比(与上年同期对比)可消除季节性波动影响 ...
2025-12-19在数字化时代,用户已成为企业竞争的核心资产,而“理解用户”则是激活这一资产的关键。用户行为分析系统(User Behavior Analys ...
2025-12-19在数字化转型的深水区,企业对数据价值的挖掘不再局限于零散的分析项目,而是转向“体系化运营”——数据治理体系作为保障数据全 ...
2025-12-19在数据科学的工具箱中,析因分析(Factor Analysis, FA)、聚类分析(Clustering Analysis)与主成分分析(Principal Component ...
2025-12-18自2017年《Attention Is All You Need》一文问世以来,Transformer模型凭借自注意力机制的强大建模能力,在NLP、CV、语音等领域 ...
2025-12-18在CDA(Certified Data Analyst)数据分析师的时间序列分析工作中,常面临这样的困惑:某电商平台月度销售额增长20%,但增长是来 ...
2025-12-18在机器学习实践中,“超小数据集”(通常指样本量从几十到几百,远小于模型参数规模)是绕不开的场景——医疗领域的罕见病数据、 ...
2025-12-17数据仓库作为企业决策分析的“数据中枢”,其价值完全依赖于数据质量——若输入的是缺失、重复、不一致的“脏数据”,后续的建模 ...
2025-12-17在CDA(Certified Data Analyst)数据分析师的日常工作中,“随时间变化的数据”无处不在——零售企业的每日销售额、互联网平台 ...
2025-12-17