
为何要从数据管理,进化到大数据治理_数据分析师
最近参加了“中国优秀首席信息官(CIO)评选”的颁奖大会,现场很多人都在谈大数据,其中有传统行业、有银行、也有医院。我注意到大部分演讲嘉宾均集中讨论如何应用大数据,或是如何用数据进行创新。
但跟以往的很多会议一样,我很少听到数据作为原材料应该怎么管理。
你可能会说,银行业、通讯业等不是早就在做数据管理了吗?
的确,数据管理(data management)并非新鲜,20年前就有人在做了。但在数据呈指数级增长之下,我们现在讲的数据已跟以往不一样。不仅是数据的大小,而且包括数据的内容、来源、结构等都很不一样。
以往我们可能根本不敢想象,Facebook的日均新增数据量已达到600T。与此同时,无数以往不可能出现的算法和应用也随之呈爆炸式增长。
数据在创新;算法在创新;应用也在创新。我们不禁会问,以往的数据管理思路,能适应新形势的要求吗?
自上而下管理费时失事
在一些传统银行,若你需要看某个数据,就必须拿着申请单找一堆人签字,最后,从一个类似医院取药的视窗中,将按照流程签满字的纸递给数据管理员。
而这个管理员会告诉你,你要等几个小时才可拿到数据。
因他要从一大堆备份中,找出你要的数据,加载完后才能给你。这就是传统的数据管理方式:严格按照自上而下的流程进行,甚至要做到滴水不漏。
后来,这个银行发生了一个对他们来说具有时代意义的改变——那个帮你找数据的管理员,变成了机器人。虽然机器人的效率大大提升了,但数据管理的本质却没有变化。
在大数据时代,数据将会促成新技术的发展,以及更多新数据的产生。
开放的网络环境、频繁的数据更新、丰富的数据种类,加上数据保护的需求激增、数据生态圈的物种增多、流动性加快……这些复杂多变又未知的环境,对于中央式管理是极大的挑战。
试想,若还是按照以往的方式,会出现怎样的情形?
也许,数据的审批人会比数据的使用者还多;也许,数据的创新会停滞不前;也许,数据的应用价值会比现在晚几年才被发现……
数据治理须人人参与
因此,我们必须意识到,数据治理不等同于数据管理,绝非依靠自上而下的贯彻执行便可解决。
相反,数据治理需要每个人的参与和协同,要求每个人都有意识去治理好数据。而且数据治理本身也可以变成应用和创新,成为更多应用和创新的“水、电、煤”。
在数据产生价值之前,不管看数据还是直接应用数据,首先都要注意:数据有没有?数据准不准?粒度细不细?是否稳定的?
若行政总裁每天看的数据都是错误的,或者不是稳定产出的,那么企业依赖数据的决策将付出极高代价。
所以企业若不做数据治理,或者还是按照以往的思维来管理数据,那么,日后对数据的依赖愈深,便可能愈快出问题。
数据治理的新思路,不仅是指组织结构上要从由上而下变成全体协同,而且要在技术上创新,提供更智能的治理工具,帮助大家提高数据质量、保护数据安全及有效控制数据成本。
最后我想说,大数据时代的数据治理,一定是将有形的管理策略化成无形的智能产品,从一纸命令变成根植在每个人脑中的信念和下意识的习惯。我们要用大数据的思维方式,用数据来治理数据。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
PowerBI 累计曲线制作指南:从 DAX 度量到可视化落地 在业务数据分析中,“累计趋势” 是衡量业务进展的核心视角 —— 无论是 “ ...
2025-08-15Python 函数 return 多个数据:用法、实例与实战技巧 在 Python 编程中,函数是代码复用与逻辑封装的核心载体。多数场景下,我们 ...
2025-08-15CDA 数据分析师:引领商业数据分析体系构建,筑牢企业数据驱动根基 在数字化转型深化的今天,企业对数据的依赖已从 “零散分析” ...
2025-08-15随机森林中特征重要性(Feature Importance)排名解析 在机器学习领域,随机森林因其出色的预测性能和对高维数据的适应性,被广 ...
2025-08-14t 统计量为负数时的分布计算方法与解析 在统计学假设检验中,t 统计量是常用的重要指标,其分布特征直接影响着检验结果的判断。 ...
2025-08-14CDA 数据分析师与业务数据分析步骤 在当今数据驱动的商业世界中,数据分析已成为企业决策和发展的核心驱动力。CDA 数据分析师作 ...
2025-08-14前台流量与后台流量:数据链路中的双重镜像 在商业数据分析体系中,流量数据是洞察用户行为与系统效能的核心依据。前台流量与 ...
2025-08-13商业数据分析体系构建与 CDA 数据分析师的协同赋能 在企业数字化转型的浪潮中,商业数据分析已从 “可选工具” 升级为 “核 ...
2025-08-13解析 CDA 数据分析师:数据时代的价值挖掘者 在数字经济高速发展的今天,数据已成为企业核心资产,而将数据转化为商业价值的 ...
2025-08-13解析 response.text 与 response.content 的核心区别 在网络数据请求与处理的场景中,开发者经常需要从服务器返回的响应中提取数 ...
2025-08-12MySQL 统计连续每天数据:从业务需求到技术实现 在数据分析场景中,连续日期的数据统计是衡量业务连续性的重要手段 —— 无论是 ...
2025-08-12PyTorch 中 Shuffle 机制:数据打乱的艺术与实践 在深度学习模型训练过程中,数据的呈现顺序往往对模型性能有着微妙却关键的影响 ...
2025-08-12Pandas 多列条件筛选:从基础语法到实战应用 在数据分析工作中,基于多列条件筛选数据是高频需求。无论是提取满足特定业务规则的 ...
2025-08-12人工智能重塑 CDA 数据分析领域:从工具革新到能力重构 在数字经济浪潮与人工智能技术共振的 2025 年,数据分析行业正经历着前所 ...
2025-08-12游戏流水衰退率:计算方法与实践意义 在游戏行业中,流水(即游戏收入)是衡量一款游戏商业表现的核心指标之一。而游戏流水衰退 ...
2025-08-12CDA 一级:数据分析入门的基石 在当今数据驱动的时代,数据分析能力已成为职场中的一项重要技能。CDA(Certified Data Anal ...
2025-08-12破解游戏用户流失困局:从数据洞察到留存策略 在游戏行业竞争白热化的当下,用户流失率已成为衡量产品健康度的核心指标。一款游 ...
2025-08-11数据时代的黄金入场券:CDA 认证解锁职业新蓝海 一、万亿级市场需求下的数据分析人才缺口 在数字化转型浪潮中,数据已成为企业核 ...
2025-08-11DBeaver 实战:实现两个库表结构同步的高效路径 在数据库管理与开发工作中,保持不同环境(如开发库与生产库、主库与从库)的表 ...
2025-08-08t 检验与卡方检验:数据分析中的两大统计利器 在数据分析领域,统计检验是验证假设、挖掘数据规律的重要手段。其中,t 检验和卡 ...
2025-08-08