“大数据”突然间变得无处不在,似乎每个人都想收集、分析大数据、并从中获利,同时也有人在夸耀或者害怕它的巨大影响。不论我们是在讨论利用谷歌庞大的搜索数据来预测流感的爆发还是利用通话记录来预测恐怖活动,又或者是利用航空公司的数据找到买机票的最佳时机,大数据都可以帮上忙。将现代计算技术和数字时代众多的数据结合起来,似乎可以解决任何问题——犯罪,公共卫生,用语的变化,约会的危险,只要我们把这些数据利用起来。
似乎它的拥护者这样宣称。“在接下来的二十年,”记者帕特里克·塔克在他最近的大数据声明中这样写道,“是透明的未来,”“我们可以以一种前所未有的准确度预测未来的诸多领域,甚至包括一些长久以来被认为人类无法干预的领域。”但大数据其实从来没有听上去那么好。
大数据真的像说的那么好?毫无疑问大数据确实是一个有价值的工具,并在某些领域产生了至关重要的影响。比如,几乎近二十年人工智能计算机程序的成功,从谷歌的搜索引擎到IBM的沃森电脑问答系统,都包括了大量数据的处理。但是正是因为它最近如此受欢迎并得到广泛应用,我们需要清晰的看待大数据究竟能做什么和不能做什么。
大数据能告诉我们是什么,但不能告诉我们为什么
首先,尽管大数据能够非常好地检测相关性,特别是那些用小数据集可能无法测出的微妙相关性,但是它并不会告诉我们哪一种相关性是有意义的。比如,大数据分析可能会揭示从2006年到2011你那美国谋杀案比例与IE浏览器的市场份额是极度相关的,都呈急速下降趋势。但是很难相信这两者之间有什么因果关系。又比如,从1998到2007被诊断出的自闭症患者与有机食物的销售具有相关性(都呈急速上升趋势),但是这种相关性本身不会告诉我们饮食和自闭症的关系。
大数据只能是辅助工具
第二,大数据可以辅助科学调查,但不可能成功地完全代替。比如,分子生物学家很想从潜在的DNA序列中推断出蛋白质的三维结构,有一些科学家已经在用大数据来解决这个难题。但是没有任何科学家认为你可以完全依靠处理数据来解决这个难题,不论这个数据分析是多么的强有力,你依旧需要基于对物理和生物化学的理解上来处理这些数据。
基于大数据的工具易造假
第三,基于大数据的很多工具很容易造假。批改学生作文的大数据程序通常依赖于句子长度和用词的复杂性,数据表明这和老师批改的分数很相关。但是一旦学生知道这个程序如何运作,他们就开始写一些长句子并用晦涩的词语而不是去学会如何规范清晰的表达,组成连贯的篇章。甚至谷歌的著名的搜索引擎,这个通常被认为成功的大数据案例也不能免于信息繁杂,无用的搜索结果,一些人为的原因使得一些搜索结果排在前面(搜索广告)。
通过大数据下结论是有风险的
第四,即便大数据的结果没有人为地造假,但是它看上去也不那么有效。比如谷歌预测流感的案例曾经是大数据的典范。2009年,谷歌通过相当大的宣传称它可以通过分析与流感相关的搜索预测流感爆发的趋势,这种准确性和快速甚至超过了疾病控制和预防中心等官方机构。但是几年后,谷歌宣称的流感预测并没有得到好的结果,最近两年,它做的更多地是不准的预测。
最近一篇《科学杂志》的文章解释道,谷歌流感预测的失败很大程度上是因为谷歌搜索引擎自己在不断的更新,这个时候收集的数据未必能够适用于下一个时候收集的数据。正如统计学家冯启思(《数据统治世界》的作者)所说的,依赖于网站的大数据收集常常把一些用不同方法、有不同目的数据整合起来,有时候这会产生负面的影响。从这样的数据样本得出结论是需要冒风险的。
大数据的智能应用会导致错误被加强
第五个需要注意的就是“恶性循环”,这也是因为大量的数据都来自于网络。不论何时,大数据分析的信息源本身就是一种大数据产品,这很可能会导致恶性循环。谷歌翻译等翻译程序是从不同语言中抽取相似的文本去辨别这些语言的翻译模式,比如同样的维基百科条目有两种语言。这是一个很合理的策略,要不是有很多语言并不具有太多相似性,维基百科自己都可以用谷歌翻译写条目。在这种情况下,任何谷歌翻译的错误都会影响维基百科,而这又会反映到谷歌翻译上,使这种错误不断加强。
大数据可能会导致大错误
第六个需要担心的就是太多相关性导致的危险。如果你在两个变量中不断地寻找相关性,那么你很可能会纯粹出于偶然发现虚假的相关性,即便在这些变量中并没有实际意义的联系。缺乏谨慎的检查,大数据的量级会扩大这些错误。
听上去科学的解释未必正确
第七,大数据很容易对那些无法精确的问题给出听上去很科学的解释。比如在过去几个月,基于维基百科的数据给人们排名有两个不同的尝试:根据历史重要性或者文化贡献。其中一本书叫做《谁更强?历史人物真实的排名在哪里》,作者是电脑工程师Steven Skiena 和工程师Charles Ward,另一本叫做《万神殿》,来自于麻省理工学院媒体实验室项目。
这些尝试在某些方面是正确的,耶稣、林肯、莎士比亚确实是极为重要的人物,但是两者都犯了一些严重的错误。《谁更强?》指出法兰西斯.史考特.凯伊(Francis Scott Key )在历史上是19世纪最重要的作家,远远超过简·奥斯汀(第78名)和乔治·爱略特(第380名)。更严重的是,两本书呈现出了利用所谓的精确误导人,而在本质上是模糊升值无意义的。大数据可以把任何事都简化为数字,但是你不应该被这些“科学”的表现愚弄。
罕见事件,大数据不起作用
最后,大数据在分析那些普通事件很在行,但是在分析罕见事件常失败。比如,用大数据处理文本的程序如搜索引擎和翻译程序,常常依赖于所谓的“三字”:连续三个词的序列(比如“in a row”)。可靠的数据信息可以编制常规的三字模型,正是因为他们常出现,但是现有的数据并没有多到足够包括人们可能使用的所有“三字”,因为人们在不断创造新语言。
随便挑一个例子,Rob Lowe 最近为报纸写的书评有九个“三词序列”比如“dumbed-down escapist fare”,这在谷歌的文本里从未出现过。对于这些新鲜词汇谷歌有很多限制,谷歌将“dumbed-down escapist fare”西安翻译为德文然后再翻译为英文,最后出现了这样一个不合逻辑的词语“scaled-flight fare.”Lowe先生的本意和利用大数据的翻译真是完全不搭边。
等等,我们几乎忽略了最后一个问题:炒作。大数据的支持者宣称它是革命性的进步。但是即便是给出大数据的成功例子,比如谷歌流感趋势的预测,即便有用但对于一些更大的事这些显得微不足道。相比19世纪和20世纪的伟大发明比如抗生素,汽车,飞机,大数据所得出的东西实在算不了什么。
我们需要大数据,毫无疑问。但是我们也需要更加清醒的认识到,这只是一种每个人都可以分析的重要资源,并不是什么新技术。
是在讨论利用谷歌庞大的搜索数据来预测流感的爆发还是利用通话记录来预测恐怖活动,又或者是利用航空公司的数据找到买机票的最佳时机,大数据都可以帮上忙。将现代计算技术和数字时代众多的数据结合起来,似乎可以解决任何问题——犯罪,公共卫生,用语的变化,约会的危险,只要我们把这些数据利用起来
似乎它的拥护者这样宣称。“在接下来的二十年,”记者帕特里克·塔克在他最近的大数据声明中这样写道,“是透明的未来,”“我们可以以一种前所未有的准确度预测未来的诸多领域,甚至包括一些长久以来被认为人类无法干预的领域。”但大数据其实从来没有听上去那么好。
大数据真的像说的那么好?毫无疑问大数据确实是一个有价值的工具,并在某些领域产生了至关重要的影响。比如,几乎近二十年人工智能计算机程序的成功,从谷歌的搜索引擎到IBM的沃森电脑问答系统,都包括了大量数据的处理。但是正是因为它最近如此受欢迎并得到广泛应用,我们需要清晰的看待大数据究竟能做什么和不能做什么。
我们需要大数据,毫无疑问。但是我们也需要更加清醒的认识到,这只是一种每个人都可以分析的重要资源,并不是什么新技术。
数据分析咨询请扫描二维码
CDA数据分析师在中国航信高科技产业园进行了面向测试度量的数据分析培训课程,培训人数近2 ...
2024-05-01CDA数据分析师走进深圳迈瑞生物医疗电子股份有限公司,在迈瑞总部展开了为期两天的培训,本次课程参训人员线上及线下近百人, ...
2024-05-01CDA数据分析师在合肥市对合肥阳光新能源科技有限公司开展了为期8天的企业内训。 合肥阳光新能源科技 ...
2024-05-01CDA数据分析师走进海尔大学,进行了《数据治理与数据中台建设的道与术》专题培训,培训现场爆满,近百人参加了此次培训。 ...
2024-05-01在中国银行苏州分行培训中心开始数据分析师培训,此次培训课程共10天内容,包括Excel、MySQL、概率论与数理统计、SPSS等内容, ...
2024-05-01从实际的业务需求出发,结合行业的典型应用特点,围绕实际的商业问题,探讨数据挖掘、机器学习模型在金融领域的应用,包括获客、信用评分、细分画像、交叉销售、反欺诈、违规识别、时序预测、运筹优化、流程挖掘九个方面,形成 ...
2024-05-01本次培训课程为线上+线下的模式,由于学员编程能力不一、部分学员没有编程基础,故提供统计学、python基 ...
2024-05-01华夏银行信用卡中心-机器学习培训 1、课程亮点 取材于业界一流企业和顶级咨询公司的行业实践;已经被证明是人人 ...
2024-05-01主 题:数据中台建设及数据分析应用主题分享 1. 数据中台市场洞察 2. 主流数据中台产品比较 3. 某企业数据中 ...
2024-05-01围绕“数据驱动”战略,全力打造我行 300 人数字化人才梯队,着力培养数字化管理人才、大数据专业团队 ...
2024-05-01在当今数据驱动的商业环境中,数据分析成为了企业决策的重要依据。通过对大量数据的收集、处理和分析,企业能够更好地理解市场 ...
2024-04-29在人工智能(AI)的世界里,提示词(Prompt)是一种强大的工具,它能够引导AI按照用户的需求产生特定的输出。本文将深入探讨AI ...
2024-04-29CDA立足未来职场,拓展前沿视野——对外经贸大学保险学院举办“三全育人大讲堂”分享行业最新动态。 ...
2024-04-294月2日,CDA数据分析师创始发起人兼协会理事长赵坚毅博士受邀在浙江万里学院举办了一场以“数字化能力在职场中的作用” ...
2024-04-29随机森林(Random Forests)现在机器学习中比较火的一个算法,是一种基于Bagging的集成学习方法,能够很好地处理分类和回归的问 ...
2022-12-23方差分析是数据分析中常用的一种统计分析方法,接下来让我们简单了解一下方差分析的基本思想和原理吧。 方差分析(Analysis ...
2022-12-23来源:关于数据分析与可视化 关于streamlit-aggrid 数据排序 表格样式的调整 数据 ...
2022-08-03作者:麦叔 定义 「把上面晦涩的概念汇成一句话就是:」 ❝ 回调函数就是一个被作为参 ...
2022-08-03现今,高学历人群日益增多,物以稀为贵的高学历光环淡去。无论本科生还是研究生,甚至博士生,求职竞争力都大不如前,就业压力越来越大。
2022-06-01某家企业10个人面试,有9个本科生……如何脱颖而出,除得体的举止和良好的沟通力外,证书成重要筹码,这也是很多人考证的关键所在。
2022-04-14