大数据时代 需要一点想象力
今天在业内鼓吹大数据时代即将到来的时候,得到最多的仍然是同样两类反应。虚无派说大数据云山雾罩,看不出有什么钱途。停滞派说大数据有什么新奇,老子的数据很大,挖掘技术很高。我想,今后几年的产业发展又将证明这两类说法的无知与荒谬。
一些不肯认真读点想点东西的人,一看到大数据这个词,就望文生义地想到数据要大,却忘记了大数据的其他基本特性,需要反复加以提醒。
大数据的特性之一是数据的完整性和综合性。很多业内朋友一谈起大数据,就习惯性地盘点起自己那点存货,或者那些可以直接从自身服务中可以获取的东西。考虑到目前互联网的发展还在非常初级的阶段,现有网络服务都是简化,扭曲,片面地对现实世界的浓缩和裁剪,由此产生的数据是零乱的,破碎的,局部的,其中所含有的含金量是极其有限的。如果同意这个世界上的万事万物可以而且正在被数据化和网络化,那么由此产生的大数据就必然是完整的和综合的,不仅包括网络公司通过自身服务所获得的用户行为数据,而且包括社会的,经济的,政治的,自然的方方面面的数据。这些数据当然分散在不同企业,机构和政府部门手中,汇聚整合在一起绝非易事,但操作上的困难并不能否定大数据本身的完整性和综合性。今天之所以讨论大数据时代的到来,是因为互联网发展到目前阶段使得现实世界数据化发展到了一定程度,各种信息终端普及到了一定程度,数据获取的成本降到了一定程度,使得完整和综合的数据不仅是一种理想,也正在变为现实。
大数据的特性之二是数据的开放性和公共性。正是因为完整的综合的大数据难以由一家公司,机构或政府部门所获得,所以大数据必然产生于一个开放的,公共的网络环境之中。这种开放性和公共性的实现取决于若干个网络开放平台或云服务以及一系列受到法律支持或社会公认的数据标准和规范。任何封闭的或单向获取的数据都不可能是大数据,无论这些数据的规模有多大。
大数据的特性之三是数据的动态性和及时性。天体物理学和理论物理学早就依赖于从宇宙间获取的大量数据,类似的学科还有环境生态学,医药学,和自控技术。但是,这和我们今天讨论的大数据不是一回事。今天的大数据是基于互联网的及时动态数据,不是历史的或严格控制环境下产生的东西。
所以,今天我们谈论的大数据是完整综合的,开放公共的,动态及时的,这样的大数据是我们过去从未有机会获取利用过的全新挑战,也是我们未来应该努力去争取利用的全新战略机会。如果有人以为过去积累的那点数据就是大数据,或者过去积累的数据处理利用能力和经验就可以在大数据时代自然领先,那不是无知就是狂妄。
近来媒体上对大数据方向的进展报道颇多,其中一个很能说明我心目中大数据的性质及其利用的前景。据8月30日《纽约时报》的报道:一家名为气候公司(Climate
Corporation)的创业企业每天都会对美国境内超过一百万个地点,未来两年的天气情况进行超过1万次模拟。随后,该公司将根系结构和土壤孔隙度的相关数据,与模拟结果相结合,为成千上万的农民提供农作物保险。
通过遥感获取土壤数据,这和我们过去所熟悉的通过网络服务获取用户网络行为数据不是一回事,数据的概念得以极大的扩充。每天对百万以上地点进行成万次的模拟,其数据量庞大,动态,及时。要想对每块田地提供精准的保险服务,肯定还需要与土地数据相配套的农产品期货数据,气候预测数据,国际贸易数据,国际政治和军事安全数据,国民经济各方面的数据,产业竞争数据,等等。在如此庞杂的大数据基础上推出的商业模式,是创新的,同现有农作物保险方式相比是具备极大竞争力的,是可持续和规模化的。更妙的是,这家公司基于大数据的运营,完全没有进行高额的网络设施投资,只是租用了亚马逊的公共云服务,一个月几万美元而已。
如果留心观察,这样的案例已经很多了,虽然都还比较简单初级,但足以说明问题。如果展开一下我们的想象力,类似上述案例的创新,在即将到来的大数据时代可以在任何行业,任何服务,任何公共管理上出现,由此可能产生的服务和商业模式是无穷尽的。同现有或现在还没有的服务和商业模式相比,服务更加精准,成本更加低廉,利润更加丰厚。这不是目前网络业所熟知的对现有用户数据的挖掘,不是对用户进行更精细的分组,不是现有数据技术的普及应用,而是一个全新的世界,一个全新的网络地球和数据地球。一个理想的前景是,一个以网络业为核心的大数据服务业会成为今后几十年世界经济和社会发展的主要推动力。当然,这事未必一定发生,尤其是在中国。如果我们网络业的朋友们没有雄心,没有想象力,那也可能除了少数公司成为大数据服务业的主力外,其他大部分公司仍然固守在陈旧的网络业内苦苦挣扎,变成大数据时代的传统产业大军中的一员。
数据分析咨询请扫描二维码
CDA数据分析师在中国航信高科技产业园进行了面向测试度量的数据分析培训课程,培训人数近2 ...
2024-05-01CDA数据分析师走进深圳迈瑞生物医疗电子股份有限公司,在迈瑞总部展开了为期两天的培训,本次课程参训人员线上及线下近百人, ...
2024-05-01CDA数据分析师在合肥市对合肥阳光新能源科技有限公司开展了为期8天的企业内训。 合肥阳光新能源科技 ...
2024-05-01CDA数据分析师走进海尔大学,进行了《数据治理与数据中台建设的道与术》专题培训,培训现场爆满,近百人参加了此次培训。 ...
2024-05-01在中国银行苏州分行培训中心开始数据分析师培训,此次培训课程共10天内容,包括Excel、MySQL、概率论与数理统计、SPSS等内容, ...
2024-05-01从实际的业务需求出发,结合行业的典型应用特点,围绕实际的商业问题,探讨数据挖掘、机器学习模型在金融领域的应用,包括获客、信用评分、细分画像、交叉销售、反欺诈、违规识别、时序预测、运筹优化、流程挖掘九个方面,形成 ...
2024-05-01本次培训课程为线上+线下的模式,由于学员编程能力不一、部分学员没有编程基础,故提供统计学、python基 ...
2024-05-01华夏银行信用卡中心-机器学习培训 1、课程亮点 取材于业界一流企业和顶级咨询公司的行业实践;已经被证明是人人 ...
2024-05-01主 题:数据中台建设及数据分析应用主题分享 1. 数据中台市场洞察 2. 主流数据中台产品比较 3. 某企业数据中 ...
2024-05-01围绕“数据驱动”战略,全力打造我行 300 人数字化人才梯队,着力培养数字化管理人才、大数据专业团队 ...
2024-05-01在当今数据驱动的商业环境中,数据分析成为了企业决策的重要依据。通过对大量数据的收集、处理和分析,企业能够更好地理解市场 ...
2024-04-29在人工智能(AI)的世界里,提示词(Prompt)是一种强大的工具,它能够引导AI按照用户的需求产生特定的输出。本文将深入探讨AI ...
2024-04-29CDA立足未来职场,拓展前沿视野——对外经贸大学保险学院举办“三全育人大讲堂”分享行业最新动态。 ...
2024-04-294月2日,CDA数据分析师创始发起人兼协会理事长赵坚毅博士受邀在浙江万里学院举办了一场以“数字化能力在职场中的作用” ...
2024-04-29随机森林(Random Forests)现在机器学习中比较火的一个算法,是一种基于Bagging的集成学习方法,能够很好地处理分类和回归的问 ...
2022-12-23方差分析是数据分析中常用的一种统计分析方法,接下来让我们简单了解一下方差分析的基本思想和原理吧。 方差分析(Analysis ...
2022-12-23来源:关于数据分析与可视化 关于streamlit-aggrid 数据排序 表格样式的调整 数据 ...
2022-08-03作者:麦叔 定义 「把上面晦涩的概念汇成一句话就是:」 ❝ 回调函数就是一个被作为参 ...
2022-08-03现今,高学历人群日益增多,物以稀为贵的高学历光环淡去。无论本科生还是研究生,甚至博士生,求职竞争力都大不如前,就业压力越来越大。
2022-06-01某家企业10个人面试,有9个本科生……如何脱颖而出,除得体的举止和良好的沟通力外,证书成重要筹码,这也是很多人考证的关键所在。
2022-04-14