京公网安备 11010802034615号
经营许可证编号:京B2-20210330
大数据国家战略还需跨过几道坎_数据分析师培训
大数据时代的到来,让“数据即资产”成为新的全球大趋势,国家竞争焦点正从对资本、土地、人口、资源/能源的争夺转向对大数据的争夺,大数据颠覆性地改变全球战略格局、国际安全态势、国家治理架构和资源配置模式,引发了巨大的经济社会变革。对于中国而言,只有将大数据上升为国家重大发展战略、上升为提升国家治理体系与治理能力现代化的层面才会实现“变道超车”。
大数据技术的战略意义不在于掌握庞大的数据信息,而在于对这些含有意义的数据进行专业化处理。换言之,如果把大数据比作一种产业,那么这种产业实现盈利的关键,在于提高对数据的“加工能力”,通过“加工”实现数据的“增值”。
全球数据正呈现出惊人的增长态势。根据IBM公司估算,人类自有史以来至2003年所创造的信息量为5EB,而到2011年,人类每两天就能产生5EB的信息量。ID C认为,数据产生成本的下降、投资规模的增加和数据存储能力的增长,最终导致了全球数据增速符合“大数据摩尔定律”,即全球数据量大约每两年翻一番。预计到2020年,全球需要管理的数据量将达到35ZB,是2010年的29倍。
从中国情况看,随着信息化普及程度和应用水平的提升,金融、交通、电信等重点行业和医保、社保、海关等重要领域已经实现或逐步实现了大量、海量业务数据的集中。中国拥有全球第一的人口数、互联网用户数和移动互联网用户数,大数据前景广阔,是全球最重要的大数据市场之一,已经成为名副其实的“世界数据中心”。根据工业和信息化部电子科学技术情报研究所的调查,2011年中国电信、金融、医疗、文化等国家重要基础数据总量约为900PB。中国移动互联网流量在过去18个月中增加了10倍,占到全球互联网流量的10%;淘宝网每天交易达数千万笔,其单日数据产生量超过50TB,存储量超过40PB;百度每天大约要处理60亿次搜索请求,数据量达到几十PB,每日新增数据10TB;上海证券交易所每秒处理近9万笔业务,每日成交笔数达到3亿笔以上;中国联通用户上网记录达每秒83万条,即每月1万亿条,对应数据量为每月300TB。
然而,相比领先国家,中国仍面临诸多战略风险与挑战阻碍大数据在国家治理层面上的应用:
一是缺乏比较明晰的大数据战略顶层设计,大数据作为战略性资源地位尚未凸显,作为基础性资产、以及国家/国民财富的重要地位尚未凸显,特别是与之适应的生产关系、制度安排等仍处于空白。
二是条块分割体制壁垒和“信息孤岛”,阻碍国家治理中的数据开放和共享。围墙里的大数据注定成为死数据。目前我国金融信用信息基础数据库已为1859.6万户企业和其他组织及8.2亿自然人建立了信用档案,但这些数据第三方机构很难获得。长期以来,由于条块分割管理体制限制,各级政府部门间的信息网络往往自成体系、相互割裂,数据难以实现互通共享,导致政府掌握的大数据大都处于割裂、闲置和休眠状态。同时,由于政府部门业务管理信息系统开发和建设的“部门化”,政府信息系统出现“系统林立”和分裂状态,公共信息资源重复采集现象严重。
三是传统治理思维和治理体制在大数据时代明显不适应,数据治国的意识较为滞后。世界范围内,大数据正重构政府、市场、社会三者之间关系模式,使国家治理结构实现从国家独大的治理结构转向多元共治,然而,我国不少政府部门尚未意识到利用大数据改造传统政府治理和政府流程再造的革命性影响。
四是法治建设滞后,维护“数据主权”、数据资产的法律标准框架严重缺失,缺乏有效的大数据思维和法律框架。
五是全球大数据战略博弈升级,我国面临较大数据安全与数据防御风险。当前,借助大数据革命,美国等发达国家全球数据监控能力升级,造成我国数据安全和数据防御风险上升。根据“棱镜门”事件披露的信息,美国政府和大数据公司紧密结成“美国数据情报联合体”,共同对全球数据空间进行整体性监控分析,构筑“数据霸权”。美国“八大金刚”几乎渗透到中国政府、海关、邮政、金融、铁路、民航等各个领域,给国家治理带来异常严峻的数据安全隐患。
大数据革命才刚刚开始,这是一场涉及利益深刻调整的革命。笔者建议尽快打破“碎片化”格局,规划“大数据治国”中长期路线图与实施重点、目标、路径,统筹布局,加快大数据发展核心技术研发,推进开放、共享以及安全方面的相关立法与标准制定,建立大数据产业的市场化资源配置模式,以及“互联互通、共享共治”的制度体系,真正抢占新的全球科技革命和产业革命的战略机遇期,重构国家综合竞争优势。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
平均数是数据分析、数理统计与日常运算中最基础、最常用的统计量,核心作用是浓缩一组数据的整体水平、刻画数据集中趋势。在众多 ...
2026-08-24在MySQL数据库中,InnoDB存储引擎作为主流事务型引擎,默认事务隔离级别为可重复读(Repeatable Read,RR),这与SQL Server、Or ...
2026-08-24 很多数据分析师拿到数据就开始清洗、建模,但当被问到“这批数据属于什么类型——结构化还是非结构化?分类变量还是数值变量 ...
2026-08-24 很多数据分析师画过趋势图、做过业绩预测,但当被问到“这个月销售额增长20%,到底是长期趋势自然增长,还是促销活动的短期 ...
2026-08-21在数据分析与数据可视化工作中,直方图是展示数据分布特征、离散程度、集中区间的核心图表,能够直观呈现数值数据的频次分布规律 ...
2026-08-20在数据分析领域有一句核心准则:垃圾数据进,垃圾数据出。数据清洗是数据分析、数据建模、数据可视化之前的必经前置工序,也是保 ...
2026-08-20 很多数据分析师做过按月份的销售额趋势图,画过按天的流量折线图,但当被问到“时间序列和普通数据有什么本质区别”“季节性 ...
2026-08-20在Python数据分析与数据清洗工作中,Pandas是最核心的数据处理库,DataFrame是结构化数据的标准存储格式。在实时数据采集、循环 ...
2026-08-19在零售行业大数据分析与精细化运营领域,纸尿裤旁摆放啤酒是最经典、最具代表性的商业案例。两种看似毫无关联的商品,一个是婴幼 ...
2026-08-19 很多数据分析师能熟练地计算指标、搭建标签体系,但当被问到“画像到底在解决什么问题”“画像和标签是什么关系”“画像如何 ...
2026-08-19在数据分析、业务监控、质量检测与风险管控工作中,数据波动性是衡量数据稳定性、业务健康度、结果可信度的核心依据。数据波动代 ...
2026-08-18很多分析师在设计标签时思路清晰,但真到落地环节却面临“数据在手,不知如何转化为可用标签”的困境:或因加工方式选择不当导致 ...
2026-08-18在数据分析、业务评价、产品评级、用户分层与综合决策场景中,单一指标往往无法全面、客观地评价事物整体水平。现实中的评价对象 ...
2026-08-18在数理统计、假设检验、数据分析与机器学习领域中,卡方分布(χ²分布)是继正态分布、t分布之后最重要的连续型概率分布之一。 ...
2026-08-17在Python数据清洗、文本校验、账号密码规则校验、脏数据过滤、字符串规整化处理中,正则表达式是最高效、最常用的文本匹配工具。 ...
2026-08-17 很多分析师每天和数据打交道,但当被问到“标签是什么”“标签和指标有什么区别”“标签体系如何设计”时,却常常答不上来。 ...
2026-08-17手游行业具备用户迭代快、竞争激烈、用户粘性易流失的典型特征。随着新游持续上线、玩家审美升级、玩法疲劳等问题出现,存量用户 ...
2026-08-14在数字化产品运营、商业数据分析、业务增长管理中,零散的指标统计无法支撑系统性的业务决策。单一的点击率、转化率、销量数据只 ...
2026-08-14 很多数据分析师每天都在写SQL,但当被问到“数据查询语言(DQL)的本质是什么”“SELECT语句中各子句的书写顺序与实际执行顺 ...
2026-08-14在数据库数据分析、数据清洗、报表统计与业务查询场景中,日期时间是最高频、最核心的基础字段。数据库中存储的日期格式多样,包 ...
2026-08-13