京公网安备 11010802034615号
经营许可证编号:京B2-20210330
大数据的是与不是
在时下的流行语中,很难找出一个比“大数据”更吸引眼球的术语了。1980年,阿尔文 托夫勒在《第三次浪潮》中预言了信息时代的到来会带来数据爆发,约翰 梅西在1998年的美国高等计算机系统协会大会上首次提出“大数据(big data)”一词。什么是大数据?这一概念目前尚未形成统一的定义。几种代表性的观点如下:麦肯锡认为“大数据是指无法在一定时间内用传统数据库软件工具对其内容进行抓取、管理和处理的数据集合”;维基百科认为“大数据是指无法在一定时间内用常规软件工具对其内容进行抓取、管理和处理的数据集”;全球最具权威的 IT研究与顾问咨询公司——高德纳公司认为“大数据是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产”。
大数据时代已经来临,它将在众多领域掀起变革的巨浪,这是勿庸置疑的事实,在以云计算为代表的技术创新大幕的衬托下,这些原本很难收集和使用的数据开始容易被利用起来了,通过各行各业的不断创新,大数据会逐步为人类创造更多的价值,而对于电网企业来说,大数据的应用同样会促进企业的跨越发展。
大数据的本质是事物的时域、空域记录,并非事物的描述数据
对于大数据的特点,IT界通常用Volume(大量)、Velocity(高速)、Variety(多样)、Value(价值)这4个 V来概括。Volume,指数据体量巨大,从TB级别跃升到PB乃至EB级别;Variety,指数据类型繁多。除了传统的结构化数据,大量非结构化、半结构化数据如网络日志、音频、视频、图片等;Value,指价值密度低,但大数据分析的价值高。价值密度的高低与数据总量的大小成反比,以视频为例,一部一小时的视频,在连续不间断监控过程中,可能有用的数据仅仅只有一两秒;Velocity,指变化速度快。大数据不仅量大,而且变化快,大数据的应用依赖于对数据的快速处理。但在笔者看来,对大数据作4V特点的概括是现象而非本质总结。
其实人类文明就是大数据的记录与应用积累,当今社会进入了信息时代,信息化的本质是用 IT技术和方法描述世界,描述事物的内在本质、过程规律和业务规则,信息化的应用过程就是在描述好事物的软件系统中实现人工和 /或机器记录,大数据的本质是事物的时域、空域记录,并非事物的描述数据,大数据成为热门是因为信息化、互联网、终端的普及和应用让我们进入了一个机器自动记录的时代,爆炸性增长的记录数据使传统的人工、单机 /单节点的机器处理能力无法完成记录的分析、挖掘,由此催生了云计算和大数据概念并推动人工智能的工程应用,机器学习等人工智能技术就是机器处理大数据及大数据应用高级模式。
大数据应用的本质是推导规律、预知未来,并非简单的统计分析
在信息化时代以前,人类就有典型的大数据应用,如视觉美学总结的黄金分割(0.618),社会学中的在特定时空范围内存在的“二八”理论。大数据应用的本质是推导规律、预知未来,并非简单的统计分析。在信息化时代,大数据极大依赖信息化及其应用,开展大数据分析也必须应用信息化方法与手段,符合信息化业务驱动、目标导向等原则,没有目标的大数据平台建设或挂大数据“羊头”不利于信息化建设和大数据应用。
而互联网大数据与企业大数据是有区别的,互联网本质是跨区域的信息化网络基础设施,其大量的内容服务和居于互联网社交软件并不存在描述事物的过程即没有对象模型,人们应用互联网留下了应用记录(大量的非结构化数据),分析这些大数据记录的前提是重新构建记录的对象,对记录标识特征。企业信息化一般经过业务标准化和业务流程梳理过程,所以企业的大数据是存在对象描述,但企业应用的困难是我们建设的系统在对象描述上不统一、对象上的记录不完整。所以互联网大数据与企业大数据应用尽管原理与方法一致,但分析工作的重点是有区别的。互联网公司在开展大数据分析的工具、技术方法不完全适用于企业,更不能把互联网大数据的平台建设当做企业大数据应用工作的全部。
区别好对象模型数据与记录数据是大数据分析的基础,尽管描述事物对象的数据也可以达到 PB级,如人类的基因图谱、地球大气层流动模型、电网的网络结构模型等,这些数据不是大数据,在这些对象模型上构建软件并记录的业务变化是大数据。所以在大数据应用方面存在两类数据的预处理,一类是模型数据预处理,另一类是记录数据预处理。模型层面的预处理本质是信息化建设方案的科学性、合理性。记录的完整性很大程度上也是取决于信息化方案,同时也取决于信息系统的应用过程。一旦软件上线,再作数据治理来解决模型之间的不一致性或对记录的二次“模型化”加工是一种方法论上的误导,正确的方法应该是依据企业架构和行业解决方案完善信息化架构,实现企业信息化架构规范和引导下的信息系统建设和应用,在企业层面统筹企业模型、统筹系统结构和功能界面、统一业务系统应用规范。企业的数据治理必须在建设方案中完成,系统建成系统后的数据治理是无效的,当然在系统运行过程中数据库的技术数据治理是必须的。
大数据应用在电网领域大有可为
在电网企业中,电量数据是一组典型的大数据。客户和客户的电表台账是电量数据的宿主对象,采集系统中对客户和电表台账进行建模,各用户电表的时序记录就是电量大数据。下面结合国网江苏电力开展的负荷预测大数据应用简述大数据应用方法。
首先是数据预处理。对象模型的预处理,依托营配调一体化,建立客户和电表台账与电网供电逻辑关系,构建电网各电压层级直至各台区到用户的关联模型;记录数据的预处理,对电量记录电度值进行年度节假日除权回原,去除电量的节假日因素,去除记录奇点和内插补全个别记录缺点等。
其次是分行业回归建立日电量与气温、湿度等因素用电模型,依据实时运行方式累计各台区日电量、日负荷,完成各区域、各电压等级的电量和负荷预测模型的构建,并构建模型机器学习,保持模型的时效性。
最后,由大数据平台给预测模型导入实时气温与前一时段的电量和负荷,实现短期、超短期的全网负荷预测。同样原理,关联宏观GDP与电量指数,结合业扩包装量变化,实现中长期负荷预测。
2015年 ,江苏电网以全样本的用户每日实时采集用电数据,结合十多年用电、业扩、气象等历史数据,建立起涵盖全省各地区、分行业以及25万专变用户和40万台公用变压器的包括温度、湿度、节假日、周末等要素的多维度用电影响模型,模型包含的数据关联关系超过110亿项,开展负荷中长期、短期、超短期预测工作,有效指导了生产工作。
此外,电量大数据的应用在行业内外还有大量的可应用价值,如从用电设备节能潜力分析全社会节能潜力、大用户用电特征分析行业产能利用情况、居民用户家庭活动特征等,大数据应用在电网领域大有可为。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
【专访摘要】本次CDA持证专访邀请到拥有丰富物流供应链数据分析经验的赖尧,他结合自身在京东、华莱士、兰格赛等企业的从业经历 ...
2026-05-15在数字化时代,企业的每一次业务优化、每一项技术迭代,都需要回答一个核心问题:这个动作到底能带来多少价值?是提升了用户转化 ...
2026-05-15在数据仓库建设中,事实表与维度表是两大核心组件,二者相互关联、缺一不可,共同构成数据仓库的基础架构。事实表聚焦“发生了什 ...
2026-05-15 很多数据分析师沉迷于复杂的机器学习算法,却忽略了数据分析最基础也最核心的能力——描述性统计。事实上,80%的商业分析问 ...
2026-05-15【核心关键词】互联网、机会、运营、关键词、账户、数字化、后台、客户、成本、网络、数据分析、底层逻辑、市场推广、数据反馈 ...
2026-05-14在Python数据分析中,Pandas作为核心工具库,凭借简洁高效的数据处理能力,成为数据分析从业者的必备技能。其中,基于两列(或多 ...
2026-05-14 很多人把统计学理解为“一堆公式和计算”,却忽略了它的本质——一门让数据“开口说话”的科学。真正的数据分析高手,不是会 ...
2026-05-14在零售行业存量竞争日趋激烈的当下,客户流失已成为侵蚀企业利润的“隐形杀手”——据行业数据显示,零售企业平均客户流失率高达 ...
2026-05-13当流量红利消退、用户需求日趋多元,“凭经验决策、广撒网投放”的传统营销模式早已难以为继。大数据的崛起,为企业营销提供了全 ...
2026-05-13 许多数据分析师精通Excel函数和SQL查询,但当面对一张上万行的销售明细表,要快速回答“哪个地区销量最高”“哪款产品增长最 ...
2026-05-13在手游行业存量竞争日趋激烈、流量成本持续高企的当下,“拉新”早已不是行业核心痛点,“留存”尤其是“付费留存”,成为决定手 ...
2026-05-12 很多数据分析师掌握了Excel函数、会写SQL查询,但当被问到“数据从哪里来”“数据加工有哪些步骤”“如何使用分析工具连接数 ...
2026-05-12用户调研是企业洞察客户需求、优化产品服务、制定运营策略的核心前提,而调研数据的可靠性,直接决定了决策的科学性与有效性。在 ...
2026-05-11在市场竞争日趋激烈、流量成本持续攀升的今天,企业的核心竞争力已从“获取流量”转向“挖掘客户价值”。客户作为企业最宝贵的资 ...
2026-05-11 很多数据分析师精通Excel单元格操作,熟练应用多种公式,但当被问到“表结构数据的基本处理单位是什么”“字段和记录的本质 ...
2026-05-11在互联网运营、产品优化、用户增长等领域,次日留存率是衡量产品价值、用户粘性与运营效果的核心指标,更是判断新用户是否认可产 ...
2026-05-09相关性分析是数据分析领域中用于探究两个或多个变量之间关联强度与方向的核心方法,广泛应用于科研探索、商业决策、医疗研究、社 ...
2026-05-09 数据分析师八成以上的时间在和数据表格打交道,但许多人拿到Excel后习惯性地先算、先分析,结果回头发现漏了一列关键数据, ...
2026-05-09在数据驱动运营的时代,指标是连接业务目标与实际行动的核心桥梁,是企业解读业务现状、发现问题、预判趋势的“量化标尺”。一套 ...
2026-05-08在存量竞争日趋激烈的商业时代,“以客户为中心”早已从口号落地为企业运营的核心逻辑。而客户画像作为打通“了解客户”与“服务 ...
2026-05-08