
数据“沉睡”制约大数据产业发展
小到敲击键盘、迈开步子,大到征信系统、政务记录,数据已成这个时代最具活跃的要素和最有价值的“信息矿产”。无论“互联网+”、物联网还是智能制造,数据触角无所不在,影响着几乎所有产业生态未来走向。
中国信息通信研究院发布的《大数据白皮书(2016)》显示,未来5年,全球数据量将呈指数级增长,但庞大的总量并不意味着可完全有效的开发利用。据了解,除了技术瓶颈外,开放和合作的障碍正在让大量数据陷入“沉睡”。数据原材料的缺乏与信息“孤岛”的形成,严重制约着大数据产业的发展。
壁垒让数据“沉睡”
国际数据公司(IDC)的数据显示,按目前发展趋势,预计2020年全球大数据总存储量将达到44ZB(1ZB约等于10000亿GB)。我国数据总量为909EB(1EB约等于1000亿GB),占全球数据总量的13%。
目前数据层面的壁垒普遍存在于政企、企业间,业内人士表示,针对现状普遍是通过购买和“爬虫”(自动获取网页内容的手段)的方式获取,但数据存在不准确、不全和非结构化等问题。
“相比于行业间的数据流通,政企之间的壁垒更是一块沉睡数据的"集聚地"。”中关村(000931,股吧)大数据产业联盟秘书长赵国栋说,“目前一些上市数据如股权占比、科研数据都是价值密度比较高的"沉睡"数据。”
据中国信息通信研究院2015年对国内800多家企业的调研来看, 企业内部数据仍是大数据的主要来源。当前有32%的企业通过外部购买数据;只有18%的企业使用政府开放数据。
业内人士表示,大数据时代的数据资源广泛散布于政府、行业、企业三个子系统中,其中,信息数据资源80%以上掌握在各级政府部门手里。与此同时,区域部门间基本实现共享的省级地方仅占13%,区域部门间少量实现共享的地市和区县仅占32%和28%,信息共享和业务协同在地市和区县进展缓慢。
“如果更多数据可以开放,将会对产业转型、政务和公共服务效率提升等大有裨益。”上海至信普林科技有限公司总经理顾敏洁说,“比如中国人民银行上海总部自2006年起公开金融信息后,催生了一批金融信息咨询服务公司,其中包括5家上市公司。”
三大原因致数据孤岛“造成数据孤岛的成因是数据割据、技术壁垒和标准缺失。”赵国栋说。观念问题是主观意愿缺失的症结。“政府部门由于缺乏企业间基于共同利益开发这样的主观能动性,导致数据开放滞后。除了政府部门,一些大企业也应该认识到数据合理开放可以造就更好的行业生态价值。”
外部管理规范、法规的缺失也使部分主体对开放数据保持顾虑。“目前如果只遵循"谁的数据谁负责"这一简单的准则,要调动政府部门开放数据的积极性比较困难。”DT大数据产业创新研究院院长陈新河说。
除了主观意愿,技术和标准也是一道“硬门槛”。“比如目前信息共享的安全问题。公共云的运维工作面临着一些新的安全风险和挑战。计算环境从本地到云端的自身安全性是提高了,但由于公共云的运维管理工作必须通过互联网完成,和传统IT环境运维有很大不同,容易造成管理员权限被劫持攻击,造成运维管理账号和凭证泄露等问题。”顾敏洁说。
目前开放的数据同样因格式标准缺失成了“开放的孤岛”。公布类似停车位数量、开放非标准化的图表等形式的数据都是不可机读的。这类“伪开放”并没有真正整合数据的价值。“不同行业数据整合必然需要标准化的数据格式,比如从卫生、人口的角度用数据对"人"进行的描述就是不一样的。”全国信息安全标准化技术委员会大数据标准工作组成员张群说。
“因此目前要开放的应该是底层数据,而不仅提供根据数据分析出来的结果或产品。”业内专家表示,这类数据在技术上应该有其标准形式,可以被计算机抓取、调用,而且在法律上也是可以进行各种使用的。
开放整合数据需围绕应用场景
要打通数据孤岛,一方面是技术上的革新和标准化的推进,同时包括数据安全领域建设。“在物联网时代,需要从政府等层面推进包括身份识别、信息安全系统等庞大的安全体系建设。”赵国栋说。
“目前全国信息技术标准化技术委员会已推进获批了6项大数据领域的标准,包括了大数据技术参考模型、数据能力成熟度评价模型标准等。”张群说。
另一方面,在法律维度,立法推进的前提是明确数据权属。对此,赵国栋建议,可以参照土地管理的做法,将数据权属划分为所有权、处置权、使用权和收益权。“例如处置权应归国家,规定归档、删除的各种条件等。只有权属清楚才能推动法律保护。”
政府数据开放也并非一蹴而就,需要循序渐进。业内人士认为,不涉及隐私和安全的数据可以率先开放,比如气象这类数据。同时政府部门和行业协会可以推动统一数据平台的建设,改变目前碎片化的现状。
杭州市经济和信息化委云计算与大数据产业处处长黄左彦说:“杭州整合数据、搭建平台过程中的经验就是以项目为突破,目前类似"5G"车联网项目、城市数据大脑等都是以交通为突破点。由政府主导政务数据开放共享,企业自带资金深度合作开发,其中包括数据交流。”
“目前观念上有一个原则是被忽视的:即"开放是常规,封闭才是例外"。”陈新河说,“政企间或者政府牵头整合数据仍应围绕应用场景、项目工程来,否则目前"唤醒"的数据早晚也会重新"落满灰尘"。”
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
R 语言:数据科学与科研领域的核心工具及优势解析 一、引言 在数据驱动决策的时代,无论是科研人员验证实验假设(如前文中的 T ...
2025-09-08T 检验在假设检验中的应用与实践 一、引言 在科研数据分析、医学实验验证、经济指标对比等领域,常常需要判断 “样本间的差异是 ...
2025-09-08在商业竞争日益激烈的当下,“用数据说话” 已从企业的 “加分项” 变为 “生存必需”。然而,零散的数据分析无法持续为业务赋能 ...
2025-09-08随机森林算法的核心特点:原理、优势与应用解析 在机器学习领域,随机森林(Random Forest)作为集成学习(Ensemble Learning) ...
2025-09-05Excel 区域名定义:从基础到进阶的高效应用指南 在 Excel 数据处理中,频繁引用单元格区域(如A2:A100、B3:D20)不仅容易出错, ...
2025-09-05CDA 数据分析师:以六大分析方法构建数据驱动业务的核心能力 在数据驱动决策成为企业共识的当下,CDA(Certified Data Analyst) ...
2025-09-05SQL 日期截取:从基础方法到业务实战的全维度解析 在数据处理与业务分析中,日期数据是连接 “业务行为” 与 “时间维度” 的核 ...
2025-09-04在卷积神经网络(CNN)的发展历程中,解决 “梯度消失”“特征复用不足”“模型参数冗余” 一直是核心命题。2017 年提出的密集连 ...
2025-09-04CDA 数据分析师:驾驭数据范式,释放数据价值 在数字化转型浪潮席卷全球的当下,数据已成为企业核心生产要素。而 CDA(Certified ...
2025-09-04K-Means 聚类:无监督学习中数据分群的核心算法 在数据分析领域,当我们面对海量无标签数据(如用户行为记录、商品属性数据、图 ...
2025-09-03特征值、特征向量与主成分:数据降维背后的线性代数逻辑 在机器学习、数据分析与信号处理领域,“降维” 是破解高维数据复杂性的 ...
2025-09-03CDA 数据分析师与数据分析:解锁数据价值的关键 在数字经济高速发展的今天,数据已成为企业核心资产与社会发展的重要驱动力。无 ...
2025-09-03解析 loss.backward ():深度学习中梯度汇总与同步的自动触发核心 在深度学习模型训练流程中,loss.backward()是连接 “前向计算 ...
2025-09-02要解答 “画 K-S 图时横轴是等距还是等频” 的问题,需先明确 K-S 图的核心用途(检验样本分布与理论分布的一致性),再结合横轴 ...
2025-09-02CDA 数据分析师:助力企业破解数据需求与数据分析需求难题 在数字化浪潮席卷全球的当下,数据已成为企业核心战略资产。无论是市 ...
2025-09-02Power BI 度量值实战:基于每月收入与税金占比计算累计税金分摊金额 在企业财务分析中,税金分摊是成本核算与利润统计的核心环节 ...
2025-09-01巧用 ALTER TABLE rent ADD INDEX:租房系统数据库性能优化实践 在租房管理系统中,rent表是核心业务表之一,通常存储租赁订单信 ...
2025-09-01CDA 数据分析师:企业数字化转型的核心引擎 —— 从能力落地到价值跃迁 当数字化转型从 “选择题” 变为企业生存的 “必答题”, ...
2025-09-01数据清洗工具全景指南:从入门到进阶的实操路径 在数据驱动决策的链条中,“数据清洗” 是决定后续分析与建模有效性的 “第一道 ...
2025-08-29机器学习中的参数优化:以预测结果为核心的闭环调优路径 在机器学习模型落地中,“参数” 是连接 “数据” 与 “预测结果” 的关 ...
2025-08-29