
大数据时代的预测艺术_数据分析师培训
千呼万唤,纳特西尔弗的新书《信号和噪声》终于要在中国上市了。西尔弗的这本书不仅是他之前预测经验的全方位总结,也同时在探索其他领域预测的可行性,比如本书的开篇几章讲的试图还原诸如2008年金融危机、天气预报以及地震等一些失败的预测,这虽然让人觉得有些马后炮的感觉,但西尔弗显然是在为他的理论造势,或者说是在铺垫。所有这些失败都指向一个问题:为什么在这个海量信息的大数据时代,预测还是不可避免的失败?
纳特西尔弗 统计学家、作家和政治网站538.com的创始人。2008年美国大选期间他成功预测出49个州的选举结果,2012年大选期间更是成功预测出全部50个州的选举结果,被称为“神奇小子”。2009年,《时代》周刊将他评选为全球100位最具影响力的人物之一。
由于工作关系,之前不少在美国同行的文章里看到对纳特西尔弗的评价,都对其在数据模型与预测方面的才能赞不绝口。
他也的确是个很有故事的人。从小酷爱数据的他,大学毕业后去毕马威工作四年,期间开始研究网络扑克,随后辞职专心玩网络扑克。再然后他开始研发一套可预测棒球的数据模型,2008年西尔弗利用这套起源于棒球的数据模型几乎成功预测了美国大选结果,当时他在全美50个州选举中,成功预测了49个州的结果。这也使他名声大噪。2012年,西尔弗再上一个台阶,成功预测了美国50个州的大选结果。
互联网对预测与决策的颠覆
我想起最近听到的一些故事,今年微信很火,遇到朋友时免不了要谈谈微信对他们工作的影响。一位身居部门经理职位的朋友A抱怨,从前是部门员工向他们汇报工作,但在公司开通微信群之后,老板、各部门经理以及员工都在这个群里,公司老板对员工的投诉建议非常清楚,这使得这位朋友感到很焦虑,因为他将失去之前信息中介的地位。而另一个朋友B的看法则有所不同,他是一位底层员工,他们公司也开通了微信群,每天大家都在群里讨论公司的事情,有时他们反映的问题马上就得到老板的回应,并迅速解决,于是这位朋友感到微信让公司的决策更加积极和主动。
这件事和预测又有什么关系?从某种意义上说,企业的决策就是对未来的一项预测。企业决策者们通常情况下是站在一种全局的角度去看问题,{CDA数据分析师培训}这得益于传统的企业中心化组织架构,也就是说,企业不同部门分属不同的负责人管理,不同部门的意见和反馈先集中到各自部门领导那里,再通过部门领导反馈给企业老板。这是一种类似于“烟囱式”的汇报结构,于是,摆在CEO或总裁桌上的报告都是经过提炼的数字和问题,决策者们在此基础上做出对企业发展方向的预测。
互联网或微信就彻底颠覆了这一模式。公司所有人都在一个微信群里,任何一个员工反映的问题都会被CEO注意到,公司老板和员工几乎会在同一时间遇到一个问题。诚然,这为公司老板了解基层情况提供了一个非常好的渠道,然而其副作用是,倘若决策者没有全局观,面对一切没有过滤的信息,他还能做出像之前处理来自副总或部门领导精心提取的数据那样处理信息吗?
成功预测的三大准则
尽管去中心化的口号很美好,但现实却很残酷。很多事实也为大数据时代的失败预测提供了某种注脚。在西尔弗的书里,用七章的篇幅,从失败的预测里提炼出三条准则:
首先,必须要有足够的信息,这是一切预测的大前提。如何在预测之前收集足够多的信息就成了预测成功与否的标准,早些年,天气预报一直被人诟病其不够精确,很大程度上还是因为信息太少,导致预测时出现种种偏差。
其次,预测需要一个适当的方法或模型,用来处理第一阶段里收集到的大量信息。
2008年美国金融危机前,就有大量经济学家以及评级机构将信息进行处理后发现,房地产泡沫的危险系数非常高,然而他们因种种原因放过这个结论,如该书里所言:“他们只是不想让“音乐”停下来罢了”,于是就有了这第三个要素:以客观理性的态度对待这些信息以及经过处理后所呈现的数据,譬如在深蓝与卡斯帕罗夫对决中,深蓝就完美诠释了什么是客观与理性,相比而言,卡斯帕罗夫就稍逊一筹,当然你要知道,深蓝只是一台机器。
本书的前7章,涉及政治、经济(金融)、棒球、天气、地震、流行病等多个领域,知识领域跨度之大还是让我们看到了读者的严谨和认真,但本书的精华部分其实是在后半部分。在第八章里,作者抛出了自己预测理论的基础——贝叶斯定理。贝叶斯定理是英国数学家托马斯贝叶斯1763年提出的一个理论,希望通过某种数学的手段,对一件事情发生的可能性进行预测,他也成功地做到了这一点,其定理的核心就是通过已知情况对未知进行预测,而且,相关情况的概率越大,就越有可能预测成功,这和上文提到的三要素有异曲同工之妙。贝叶斯定理如今在投资学中运用得非常广泛,而互联网的很多技术也依赖于贝叶斯定理。
预测的困难性:极客们并不能完全取代球探
尽管贝叶斯定理在预测方面已有非常高的成功率,但作者还是反复强调预测的困难性。我们也可通过成功预测三要素理解作者这样说的原因,你如何保证收集信息的准确性?你如何构建合适的数学模型和工具?你又如何克服预测过程中的私人因素?即使前两个条件都具备,人类自身能摆脱预测中的主观成分吗?这种困难在卡斯帕罗夫对阵深蓝时尤为明显,早在1996年卡氏就曾与深蓝有过交手,当时卡氏以4比2胜出,但这条新闻并未引起多大反响。一年后,改进版的深蓝终于3.5:2.5打败了卡氏。卡斯帕罗夫曾回忆当时他的头脑非常混乱,完全不想比赛。而对手——深蓝,依然保持最冷静的“心态”。无怪乎有媒体赛后称深蓝并没有赢得比赛,而是卡斯帕罗夫输掉了比赛。
在NBA历史上,林书豪或许是球探们最失败的预测之一,当年被八家球队拒绝,好容易进入纽约尼克斯,在默默无闻中开始他的职业生涯,直到某天他才迎来人生第一个机会,并一举成名,这也再次佐证了作者的无奈,的确“统计学使让球运动发生了革命,但计算机极客们并不能完全取代球探。”但如今,这些球探们真的很需要计算机来帮助他们做出预测。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
“纲举目张,执本末从。”若想在数据分析领域有所收获,一套合适的学习教材至关重要。一套优质且契合需求的学习教材无疑是那关键 ...
2025-06-092025 年,数据如同数字时代的 DNA,编码着人类社会的未来图景,驱动着商业时代的运转。从全球互联网用户每天产生的2.5亿TB数据, ...
2025-05-27CDA数据分析师证书考试体系(更新于2025年05月22日)
2025-05-26解码数据基因:从数字敏感度到逻辑思维 每当看到超市货架上商品的排列变化,你是否会联想到背后的销售数据波动?三年前在零售行 ...
2025-05-23在本文中,我们将探讨 AI 为何能够加速数据分析、如何在每个步骤中实现数据分析自动化以及使用哪些工具。 数据分析中的AI是什么 ...
2025-05-20当数据遇见人生:我的第一个分析项目 记得三年前接手第一个数据分析项目时,我面对Excel里密密麻麻的销售数据手足无措。那些跳动 ...
2025-05-20在数字化运营的时代,企业每天都在产生海量数据:用户点击行为、商品销售记录、广告投放反馈…… 这些数据就像散落的拼图,而相 ...
2025-05-19在当今数字化营销时代,小红书作为国内领先的社交电商平台,其销售数据蕴含着巨大的商业价值。通过对小红书销售数据的深入分析, ...
2025-05-16Excel作为最常用的数据分析工具,有没有什么工具可以帮助我们快速地使用excel表格,只要轻松几步甚至输入几项指令就能搞定呢? ...
2025-05-15数据,如同无形的燃料,驱动着现代社会的运转。从全球互联网用户每天产生的2.5亿TB数据,到制造业的传感器、金融交易 ...
2025-05-15大数据是什么_数据分析师培训 其实,现在的大数据指的并不仅仅是海量数据,更准确而言是对大数据分析的方法。传统的数 ...
2025-05-14CDA持证人简介: 万木,CDA L1持证人,某电商中厂BI工程师 ,5年数据经验1年BI内训师,高级数据分析师,拥有丰富的行业经验。 ...
2025-05-13CDA持证人简介: 王明月 ,CDA 数据分析师二级持证人,2年数据产品工作经验,管理学博士在读。 学习入口:https://edu.cda.cn/g ...
2025-05-12CDA持证人简介: 杨贞玺 ,CDA一级持证人,郑州大学情报学硕士研究生,某上市公司数据分析师。 学习入口:https://edu.cda.cn/g ...
2025-05-09CDA持证人简介 程靖 CDA会员大咖,畅销书《小白学产品》作者,13年顶级互联网公司产品经理相关经验,曾在百度、美团、阿里等 ...
2025-05-07相信很多做数据分析的小伙伴,都接到过一些高阶的数据分析需求,实现的过程需要用到一些数据获取,数据清洗转换,建模方法等,这 ...
2025-05-06以下的文章内容来源于刘静老师的专栏,如果您想阅读专栏《10大业务分析模型突破业务瓶颈》,点击下方链接 https://edu.cda.cn/g ...
2025-04-30CDA持证人简介: 邱立峰 CDA 数据分析师二级持证人,数字化转型专家,数据治理专家,高级数据分析师,拥有丰富的行业经验。 ...
2025-04-29CDA持证人简介: 程靖 CDA会员大咖,畅销书《小白学产品》作者,13年顶级互联网公司产品经理相关经验,曾在百度,美团,阿里等 ...
2025-04-28CDA持证人简介: 居瑜 ,CDA一级持证人国企财务经理,13年财务管理运营经验,在数据分析就业和实践经验方面有着丰富的积累和经 ...
2025-04-27