
如何解决政府大数据躺在档案柜里“睡大觉”
政府大数据应用效率低 应重视和认知几个问题
近日,第十二届全国政协第三次会议和第十二届全国人大第三次会议正在北京召开中。会上,来自全国各地的代表委员们共商国家大事,热议民生问题,总结过去,规划未来。今年两会两会上,有几个十分引人关注的问题,大数据就是其中一个。
第十二届全国人大代表孙丕恕在会上指出,“随着电子政务建设的不断发展,各级政府积累了大量与公众生产生活息息相关的数据,并成为社会上最大的数据保有者,掌握着全社会信息资源的80%,其中包括3000余个数据库。”而事实上,我国政府大数据利用状况却极不理想,很多政府数据躺在相关部门的档案柜里“睡大觉”。
坚持不懈地呼吁源自一种紧迫感。“西方主要发达国家都将其政府数据开放作为国家战略推动,借助政府数据开放,美国的医疗服务业节省3000亿美元,制造业在产品开发、组装等环节节省50%的成本。”孙丕恕说,目前,上海、北京、青岛等地先后出台了数据开放相关政策,搭建了政府数据开放平台,但也存在一系列问题。
他认为,这些问题集中表现在缺乏顶层设计和统筹规划、推动措施,很多政府部门担心增加工作负担,甚至顾忌数据披露会暴露管理中的不足,因而主动性不强;相关数据安全、隐私保护法律不健全,缺乏统一数据开放标准,地方政府和垂直系统各自为战,造成新的“开放的数据孤岛”。
“在国外,数据开放的工作都有明确的部门来负责,有效推动了这项工作的进展。例如,美国的data.gov是由美国总务管理局(General Services Administration)负责管理,并持续改进该网站。美国行政管理和预算局(Officeof Managementand Budget)负责设计网站的结构与规划。”孙丕恕建议,我国政府数据公开应明确组织机构,制定行动规划,研究制定政府数据开发目录和格式标准,“书同文、车同轨”。
从建设步骤和开放范围来看,他建议按照先易后难、分步实施的原则,逐步在全国分领域、分区域实施。“建议选择试点区域,推动相关部门首先整理社会关注度高,与居民生活、公共服务、社会环境和环境保护等方面相关的数据,例如气象、交通、旅游、物价等部门所掌握的基础数据、业务类数据、管理类数据、统计类数据等。”
除了唤醒“沉睡”的政府数据,在孙丕恕看来,当前应该积极推进金融、电商、公共事业等大型企业数据的开放共享,在信用体系建设方面用好大数据。
“目前,金融信用信息基础数据库已经为1859.6万户企业和其他组织及8.2亿自然人建立了信用档案,这些数据第三方机构很难获得。”孙丕恕说,当前央行征信也在逐步建立信用的共享机制,但大部分局限于金融机构内部,没有有效地向社会开放。电信运营商、水电煤等公共事业机构内也积累了多年的业务数据,互联网公司则收集了大量的用户和企业信用数据,这些公司基于商业利益等不将数据开放,而是基于自有的局部数据开展征信服务业务。“目前,个人征信市场已向民营企业开放,大企业间也在积极谋求数据获取和数据共享的路径,如建立数据开放平台引入或交换第三方数据,但这些都缺乏明确的规范和政策,这一领域的数据壁垒问题亟需解决。”
政府大数据应用,应重视和认识的几个问题:
一是国家优先发展战略。大数据应用领先国家的所有大数据项目,都具有国家优先发展的相关目标(比如数据的开放和已获得,公民更好参与公共事务)。对大数据应用的主要关注点集中于安全、速度、交互性、分析能力,和缺少胜任的专业人员。然而,每个国家的政府基于其独有的环境,有自身的优势、机会和威胁。
二是分析机构。对于跨部门的数据,管理和综合数据需要一个自上而下的统筹。政府应建立一个大数据控制中心以综合各部门既有数据的数据库,包括结构化和非结构化的。此外,政府还需要建立一个先进的分析机构负责开发战略,处理大数据如何通过新技术平台进行管理和分析,如何招募到熟练的从业人员。
三是实时分析。政府需要管理即时更新的大数据,并进行实时分析,同时保护个人信息安全,还需要探索的新技术平台(比如云计算,先进分析和安全技术)。相当多的政府数据在性质上是全球化的,而且能够被用于预防和解决全球事务,因此必须开展全球合作。
四是国际化。各国政府间努力集成和共享地球观测数据。全球地球观测系统,是一个全球性的公共基础设施,产生了综合的、接近实时性的环境数据,目的是为全球使用者和决策制定者提供信息以供分析。政府也需要共享与安全威胁、诈骗和非法活动相关的数据。这种大数据需求不仅需要转换技术,还需要国际化的协作去共享和综合数据。
五是ICT专业公司。政府应该与ICT专业公司合作。例如,亚马逊AWS关联很多公共数据集,包括日本、美国人口调查数据和许多基因组及医疗数据库。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
Pandas 选取特定值所在行:6 类核心方法与实战指南 在使用 pandas 处理结构化数据时,“选取特定值所在的行” 是最高频的操作之 ...
2025-09-30球面卷积神经网络(SCNN) 为解决这一痛点,球面卷积神经网络(Spherical Convolutional Neural Network, SCNN) 应运而生。它通 ...
2025-09-30在企业日常运营中,“未来会怎样” 是决策者最关心的问题 —— 电商平台想知道 “下月销量能否达标”,金融机构想预判 “下周股 ...
2025-09-30Excel 能做聚类分析吗?基础方法、进阶技巧与场景边界 在数据分析领域,聚类分析是 “无监督学习” 的核心技术 —— 无需预设分 ...
2025-09-29XGBoost 决策树:原理、优化与工业级实战指南 在机器学习领域,决策树因 “可解释性强、处理非线性关系能力突出” 成为基础模型 ...
2025-09-29在标签体系的落地链路中,“设计标签逻辑” 只是第一步,真正让标签从 “纸上定义” 变为 “业务可用资产” 的关键,在于标签加 ...
2025-09-29在使用 Excel 数据透视表进行多维度数据汇总时,折叠功能是梳理数据层级的核心工具 —— 通过点击 “+/-” 符号可展开明细数据或 ...
2025-09-28在使用 Pandas 处理 CSV、TSV 等文本文件时,“引号” 是最容易引发格式混乱的 “隐形杀手”—— 比如字段中包含逗号(如 “北京 ...
2025-09-28在 CDA(Certified Data Analyst)数据分析师的技能工具箱中,数据查询语言(尤其是 SQL)是最基础、也最核心的 “武器”。无论 ...
2025-09-28Cox 模型时间依赖性检验:原理、方法与实战应用 在生存分析领域,Cox 比例风险模型(Cox Proportional Hazards Model)是分析 “ ...
2025-09-26检测因子类型的影响程度大小:评估标准、实战案例与管控策略 在检测分析领域(如环境监测、食品质量检测、工业产品合规性测试) ...
2025-09-26CDA 数据分析师:以数据库为基石,筑牢数据驱动的 “源头防线” 在数据驱动业务的链条中,“数据从哪里来” 是 CDA(Certified D ...
2025-09-26线性相关点分布的四种基本类型:特征、识别与实战应用 在数据分析与统计学中,“线性相关” 是描述两个数值变量间关联趋势的核心 ...
2025-09-25深度神经网络神经元个数确定指南:从原理到实战的科学路径 在深度神经网络(DNN)的设计中,“神经元个数” 是决定模型性能的关 ...
2025-09-25在企业数字化进程中,不少团队陷入 “指标困境”:仪表盘上堆砌着上百个指标,DAU、转化率、营收等数据实时跳动,却无法回答 “ ...
2025-09-25MySQL 服务器内存碎片:成因、检测与内存持续增长的解决策略 在 MySQL 运维中,“内存持续增长” 是常见且隐蔽的性能隐患 —— ...
2025-09-24人工智能重塑工程质量检测:核心应用、技术路径与实践案例 工程质量检测是保障建筑、市政、交通、水利等基础设施安全的 “最后一 ...
2025-09-24CDA 数据分析师:驾驭通用与场景指标,解锁数据驱动的精准路径 在数据驱动业务的实践中,指标是连接数据与决策的核心载体。但并 ...
2025-09-24在数据驱动的业务迭代中,AB 实验系统(负责验证业务优化效果)与业务系统(负责承载用户交互与核心流程)并非独立存在 —— 前 ...
2025-09-23CDA 业务数据分析:6 步闭环,让数据驱动业务落地 在企业数字化转型中,CDA(Certified Data Analyst)数据分析师的核心价值,并 ...
2025-09-23