京公网安备 11010802034615号
经营许可证编号:京B2-20210330
对话数据技术专家—大数据发展思考
近两年,“大数据”已成为业界和学术界舌尖上的热词,它时刻准备着改造社会,从民生到商业,从医疗到教育……,大数据正成为新的经济推动力和重要的生产资料。但是,在欢呼和激动了数年后,我们更需要认真思考如何利用大数据、如何正确挖掘出大数据的价值。2014年底,Informatica中国区的几位资深技术专家与国内IT媒体记者,就大数据的思维、技术和发展等问题进行了深入探讨与剖析。
大数据思路已有,离成功尚远
大数据真正开始做始于去年,通过两年的尝试、积累,思路已有,但离成功还很远。一些国外的大数据案例、大数据故事无非是商务智能(BI)、数据仓库(BW)的改头换面,新瓶装旧酒而已。就如数据仓库一样,建设了近20年才让每个企业真正承认其价值,大数据也不能期望很快就获得成功,需要一个沉淀时间。
大数据发展可以用一个波浪式的图来形容,现在还处于第一个峰顶,必须经过低谷再升起,几轮反复。这期间,大家可能会看到许多大数据真实的案例,不管是成功的还是失败的都会给我们启示。只要尝试了就不一定完全失败,就如数据仓库建设,几年前很多报告都显示80%的项目失败,但仔细分析后发现,只是在发展过程当中没有达到预期价值而已。前人淌过的路,后边的人可以少走一些雷区。
真正的大数据思维:允许数据的不精确性
以前,由于可获得的数据量比较小,为此我们必须尽量准确的记录下所获得的所有数据,做出个KPI供领导参考,采样过程的精确度被放在重要的地位。显然,这种对精确性的执着是信息缺乏时代的产物。大数据时代,数据的收集问题不再成为困扰,采集全量的数据成为现实,但海量数据的涌现一定会增加数据的混乱性且造成结果的不准确性,如果仍执迷精确性,那么将无法应对这个新的时代。
大数据通常都用概率说话,且大数据处理之前是可以对之进行清洗从而减少部分的错误数据。所以,与致力于避免错误相比,对错误的包容将会带给我们更多信息。其实,允许数据的混杂性和容许结果的不精确性才是我们拥抱大数据的正确态度,只要做到10%准确结果,能够达成业务数十倍的增长即可,这是真正的大数据思维,未来我们应当习惯这种思维。
大数据不是一个纯技术的问题
大数据不是一个纯技术问题,会包含很多管理、业务方面的内容。并不是说,购买了一套数据挖掘工具,组建了一个Hadoop环境,就能称为做了大数据。除了设备、技术上的投资,企业还需要从组织结构、人员意识、管理方式、企业文化等方面都有一个转变。大数据的前期准备工作很多,这是一种思维上的全面变革。大家都是摸着石头过河,走一步想一想,然后再走一步再想,直到最后成功上岸。
在这样的一个过程当中,人们的思想还要跟随大数据技术的发展不断更新,同时也要对一些过去的想法进行纠正和改变。当然,这个时间不会像以前数据仓库那样花费20年,大数据可能会缩短一半时间。因为数据仓库时代是从无到有,而大数据时代是从有到更好,人们已经从建设数据仓库中积累了很多的经验、技术、教训,甚至有效的管理方法,可以很好地借鉴。
大数据技术解决的是非结构化数据的问题,非也
新兴的大数据技术提供了非常有效的手段,让人们可以花很低的代价去分析、处理非结构化的数据,但是这些非结构化数据有一个特点,就是密度还很低,它远不如结构化数据有非常高的价值密度,可能100G的非结构化数据,最终有效的才1G。这表明,非结构化数据是对数据完整度的很大补充,但是并不能说大数据就是做非结构化数据,其实最终的目的还是要发掘数据价值。另外一方面,传统的数据仓库已经能够完成现有结构化数据90%的利用程度,在这种背景下,人们才会把大数据的焦点放在对非结构化的处理上。
当前,非结构化数据大量产生,如机器日志、传感器的数据、社交媒体的数据,都是以非结构化形式存在,而传统的方式对这些数据的处理能力比较欠缺。如果用木桶效应来比喻,首先要把这个短板补上,与结构化数据处理的效率和能力齐平之后,更多的就是围绕数据如何使用来进行更深一步的研究。还要认识到一点,大数据技术能够处理半结构化、非结构化的数据,不过,这些数据总是要转换成结构化的数据才能分析,算法可能输入的是非结构化的,如视频信息,但是刚进来不到10秒就变成结构化,最后显示出来的还是表格式结构化的结果。
大数据应用的必要前提
在纷繁杂乱的大数据面前,没有良好的数据质量,没有更加良好的数据管理策略,用于业务应用的投资将随着应用组合在企业内的增长和扩展而日渐缩水。做大数据,90%的企业走的路子都不可能实现放烟花式的很炫效果,他们首先还是要踏踏实实地解决数据整合、数据质量和主数据管理等问题,而这些恰恰是Informatica公司的核心竞争力所在。
现在,越来越多的企业从以前的粗犷式数据管理方式向精细化方向发展,更加注重数据质量和主数据管理,注重全数据视图的构建等等。目前,Informatica已经有了11个方面,30多小项的解决方案,Informatica数据集成平台提供了将数据转化为可信、可行且可靠的信息资产所需的全部功能,可以随时随地集成任何的数据碎片、控制企业内或“云中”数据、高速传送数据、与合作伙伴共享数据、查找并解决数据质量问题、给予您凭借数据主动采取行动的能力、创建针对最重要数据资产的可靠视图等等,这些技术组合能够天衣无缝地配合运作,且可通过有效利用硬件基础设施来降低总体拥有成本,实现更精细化数据管理。
大数据时代,隐私高于一切
近两年,国家政府着重强调信息安全,企业都非常关注数据安全问题。敏感的个人、财务和健康信息受到多种不同行业和政府数据隐私法规的管制,如果企业无法保持数据隐私,他们就会面临严重的财务和法律惩罚,同时还会在客户与市场信心方面蒙受可观损失。在这种情况下,数据脱敏技术应运而生,并且在最近两年,开始被越来越多的企业用户所采用。Informatica在数据读取和使用两方面使用动态或静态的数据脱敏手段来保证数据的隐私,在保存数据原始特征的同时改变它的数值,从而保护敏感数据免于未经授权的访问,同时又可以进行相关的数据处理。
2014年,Informatica数据安全方案因满足市场热点需求而成为业务增长较快的单元。而另一种市场需求很大的是数据归档类方案。企业经过几年发展,积累了大量历史数据希望存档,Informatica提供了一些运算、存储等系列新技术,能够对历史数据进行归档、留存及分析,实现全生命周期数据的管理。
Informatica的 IDP理念
大数据时代最缺乏的是什么?是对数据能够有效掌握和分析的人,这不仅仅是指高端的数据分析专家,更是包括能够有效的获取和利用数据价值的企业业务人员。Informatica IDP(Intelligent Data Platform)智能数据集成平台,可以让业务部门成为真正数据受益者,IDP直接面向业务部门,将人员、位置与事物以更加智能的方式紧密相连,业务人员可以根据自己的需求,自助式的获得他所要的数据。
从实现手段来看,IDP并不是一个IT工具,更像是一个平台,包括数据的自助式服务、数据的虚拟化等等,这些方法从底层通过技术的手段将各种各样的数据呈现到最终业务用户面前,让他们自由地选择希望使用、浏览、分析什么样的数据,甚至能够参与到数据的操作过程中来。目前IDP还没有落地的产品,但是从发展理念来看,这是将Informatica传统业务、优势产品与智能化产品进行组合的一整套解决方案。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在用户行为分析实践中,很多从业者会陷入一个核心误区:过度关注“当前数据的分析结果”,却忽视了结果的“泛化能力”——即分析 ...
2026-03-13在数字经济时代,用户的每一次点击、浏览、停留、转化,都在传递着真实的需求信号。用户行为分析,本质上是通过收集、整理、挖掘 ...
2026-03-13在金融、零售、互联网等数据密集型行业,量化策略已成为企业挖掘商业价值、提升决策效率、控制经营风险的核心工具。而CDA(Certi ...
2026-03-13在机器学习建模体系中,随机森林作为集成学习的经典算法,凭借高精度、抗过拟合、适配多场景、可解释性强的核心优势,成为分类、 ...
2026-03-12在机器学习建模过程中,“哪些特征对预测结果影响最大?”“如何筛选核心特征、剔除冗余信息?”是从业者最常面临的核心问题。随 ...
2026-03-12在数字化转型深度渗透的今天,企业管理已从“经验驱动”全面转向“数据驱动”,数据思维成为企业高质量发展的核心竞争力,而CDA ...
2026-03-12在数字经济飞速发展的今天,数据分析已从“辅助工具”升级为“核心竞争力”,渗透到商业、科技、民生、金融等各个领域。无论是全 ...
2026-03-11上市公司财务报表是反映企业经营状况、盈利能力、偿债能力的核心数据载体,是投资者决策、研究者分析、从业者复盘的重要依据。16 ...
2026-03-11数字化浪潮下,数据已成为企业生存发展的核心资产,而数据思维,正是CDA(Certified Data Analyst)数据分析师解锁数据价值、赋 ...
2026-03-11线性回归是数据分析中最常用的预测与关联分析方法,广泛应用于销售额预测、风险评估、趋势分析等场景(如前文销售额预测中的多元 ...
2026-03-10在SQL Server安装与配置的实操中,“服务名无效”是最令初学者头疼的高频问题之一。无论是在命令行执行net start启动服务、通过S ...
2026-03-10在数据驱动业务的当下,CDA(Certified Data Analyst)数据分析师的核心价值,不仅在于解读数据,更在于搭建一套科学、可落地的 ...
2026-03-10在企业经营决策中,销售额预测是核心环节之一——无论是库存备货、营销预算制定、产能规划,还是战略布局,都需要基于精准的销售 ...
2026-03-09金融数据分析的核心价值,是通过挖掘数据规律、识别风险、捕捉机会,为投资决策、风险控制、业务优化提供精准支撑——而这一切的 ...
2026-03-09在数据驱动决策的时代,CDA(Certified Data Analyst)数据分析师的核心工作,是通过数据解读业务、支撑决策,而指标与指标体系 ...
2026-03-09在数据处理的全流程中,数据呈现与数据分析是两个紧密关联却截然不同的核心环节。无论是科研数据整理、企业业务复盘,还是日常数 ...
2026-03-06在数据分析、数据预处理场景中,dat文件是一种常见的二进制或文本格式数据文件,广泛应用于科研数据、工程数据、传感器数据等领 ...
2026-03-06在数据驱动决策的时代,CDA(Certified Data Analyst)数据分析师的核心价值,早已超越单纯的数据清洗与统计分析,而是通过数据 ...
2026-03-06在教学管理、培训数据统计、课程体系搭建等场景中,经常需要对课时数据进行排序并实现累加计算——比如,按课程章节排序,累加各 ...
2026-03-05在数据分析场景中,环比是衡量数据短期波动的核心指标——它通过对比“当前周期与上一个相邻周期”的数据,直观反映指标的月度、 ...
2026-03-05