
大数据技术存在局限 经验直觉不可或缺
大数据将(Erik Brynjolfsson)称,大数据将取代想法、范例、组织以及人们思考世界的方式。
这些前卫的预测的前提是:Web浏览记录、传感器信号、GPS跟踪和社交网络信息等数据能够以前所未有的程度面向衡量和监控人类及设备的行为敞开大门。通过计算机算法,可以预测出人类的许多事情,如购物、约会或投票等。
业内专家预计,最终的结果就是:世界变得越来越智能,企业的工作效率越来越高,消费者获得的服务质量越来越高,人们所做出的决定也越来越合理。
我之前写过不少关于大数据的文章,但在2012年底这个特殊的时刻,我想应该是反思、 提问和质疑大数据的时刻。
从商业评估中挖掘实用启示并非新鲜事物。100多年前,弗雷德里克温斯洛泰勒(Frederick Winslow Taylor)的名著《科学管理原理》就是大数据的前身。泰勒的评估工具是秒表,为员工的每一个行动进行定时和监测。泰勒及其助手利用这种时间和动作研究模式来重新设计最有效的工作方式。
但如果这种方法被过度夸大,就成为了卓别林《摩登时代》(Modern Times)所讽刺的对象。此后,人们对于这种量化方法的热情也开始跌宕起伏。
通常,互联网被大数据倡导者作为成功的数据业务的范例,这其中以谷歌为代表。而如今,许多大数据技术,如数学模型、预测算法和人工智能软件等已被华尔街所广泛应用。
在本月的麻省理工学院大会上,当被问及大数据领域一些重大失败案例时,几乎没有人能够说出这样的失败案例。后来,麻省理工学院斯隆管理学院(Sloan School of Management)教授罗伯特莱格伯恩(Roberto Rigobon)称,金融危机毫无疑问影响了数据业务。他说:对冲基金在全球都是失败的。
问题是,数学模型是一种简化。这种模型源自自然科学,根据物理定律,流体中的粒子行为是可以预测的。
在如此众多的大数据应用中,一个数学模型通常附带关于人类行为、兴趣和偏好的精确数据。这种方法在金融等领域的危险性也是有目共睹,美国哥伦亚亚大学金融工程学系主任曼纽尔德曼(Emanuel Derman)在他的书中《Models. Behaving. Badly》中就详细阐述了其危险性。
纽约创业公司Media6Degrees首席科学家克劳迪娅珀利彻(Claudia Perlich)称:你可以用数据来欺骗自己,我担心大数据出现泡沫。珀利彻担心许多人将自己称为数据科学家,但并未做足功课,反而给该领域抹黑。
珀利彻认为,大数据似乎将面临劳动力瓶颈。她说:我们的技能提升速度还远不够。麦肯锡全球学会(McKinsey Global Institute)去年发布的一份报告显示,美国需要14万名至19万名具有深度分析经验的工作者,以及150万名更加精通数据的经理人,无论是已退休人士还是已受聘人士。
哈佛商学研客座教授托马斯达文波特(Thomas H. Davenport)正在写一本名为《Keeping Up With the Quants》的新书,旨在帮助经理人来应对大数据挑战。达文波特认为,管理大数据项目的一个重要部分是要问正确的问题:如何定义问题?你需要哪些数据?来自哪里?等等。
谷歌调研(Google Research)高级统计师雷切尔查特(Rachel Schutt)称,如果建模人员能够思考伦理维度(ethical dimensions)等问题,那就会更好地服务于社会。查特说:模型不仅仅是预测,它们还可以让事情真正发生。
模型能够创建数据科学家所谓的行为循环(behavioral loop),如果一个人被提供足够的数据,都能对自己的行为进行指导。
以Facebook为例,将个人数据上传到自己的Facebook页面,Facebook的软件就会跟踪你的点击和搜索。通过算法来评估这些数据,然后再提供好友的建议。
但这种通过软件跟踪用户的行为却引发了隐私担忧,难道大数据将迎来数字监控的到来?
我个人最大的担忧是,当前确定我们个人数字世界的算法过于简单,不够智能。这也是艾利帕里瑟(Eli Pariser)所著《The Filter Bubble: What the Internet Is Hiding From You》所探讨的问题之一。
令人鼓舞的是,像珀利彻和查特这些有思想的数据科学家意识到了大数据技术的局限和不足。他们认为,听取数据是重要的,但经验和直觉同样重要。
在麻省理工学院大会上,查特被问及如何才能成为一名优秀的数据科学家,她说,需要计算机科学和数学技能,拥有好奇心,具有创新意识,以数据和经验为行动准则。她说:我不会把机器神化。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
Python HTTP 请求工具对比:urllib.request 与 requests 的核心差异与选择指南 在 Python 处理 HTTP 请求(如接口调用、数据爬取 ...
2025-09-12解决 pd.read_csv 读取长浮点数据的科学计数法问题 为帮助 Python 数据从业者解决pd.read_csv读取长浮点数据时的科学计数法问题 ...
2025-09-12CDA 数据分析师:业务数据分析步骤的落地者与价值优化者 业务数据分析是企业解决日常运营问题、提升执行效率的核心手段,其价值 ...
2025-09-12用 SQL 验证业务逻辑:从规则拆解到数据把关的实战指南 在业务系统落地过程中,“业务逻辑” 是连接 “需求设计” 与 “用户体验 ...
2025-09-11塔吉特百货孕妇营销案例:数据驱动下的精准零售革命与启示 在零售行业 “流量红利见顶” 的当下,精准营销成为企业突围的核心方 ...
2025-09-11CDA 数据分析师与战略 / 业务数据分析:概念辨析与协同价值 在数据驱动决策的体系中,“战略数据分析”“业务数据分析” 是企业 ...
2025-09-11Excel 数据聚类分析:从操作实践到业务价值挖掘 在数据分析场景中,聚类分析作为 “无监督分组” 的核心工具,能从杂乱数据中挖 ...
2025-09-10统计模型的核心目的:从数据解读到决策支撑的价值导向 统计模型作为数据分析的核心工具,并非简单的 “公式堆砌”,而是围绕特定 ...
2025-09-10CDA 数据分析师:商业数据分析实践的落地者与价值创造者 商业数据分析的价值,最终要在 “实践” 中体现 —— 脱离业务场景的分 ...
2025-09-10机器学习解决实际问题的核心关键:从业务到落地的全流程解析 在人工智能技术落地的浪潮中,机器学习作为核心工具,已广泛应用于 ...
2025-09-09SPSS 编码状态区域中 Unicode 的功能与价值解析 在 SPSS(Statistical Product and Service Solutions,统计产品与服务解决方案 ...
2025-09-09CDA 数据分析师:驾驭商业数据分析流程的核心力量 在商业决策从 “经验驱动” 向 “数据驱动” 转型的过程中,商业数据分析总体 ...
2025-09-09R 语言:数据科学与科研领域的核心工具及优势解析 一、引言 在数据驱动决策的时代,无论是科研人员验证实验假设(如前文中的 T ...
2025-09-08T 检验在假设检验中的应用与实践 一、引言 在科研数据分析、医学实验验证、经济指标对比等领域,常常需要判断 “样本间的差异是 ...
2025-09-08在商业竞争日益激烈的当下,“用数据说话” 已从企业的 “加分项” 变为 “生存必需”。然而,零散的数据分析无法持续为业务赋能 ...
2025-09-08随机森林算法的核心特点:原理、优势与应用解析 在机器学习领域,随机森林(Random Forest)作为集成学习(Ensemble Learning) ...
2025-09-05Excel 区域名定义:从基础到进阶的高效应用指南 在 Excel 数据处理中,频繁引用单元格区域(如A2:A100、B3:D20)不仅容易出错, ...
2025-09-05CDA 数据分析师:以六大分析方法构建数据驱动业务的核心能力 在数据驱动决策成为企业共识的当下,CDA(Certified Data Analyst) ...
2025-09-05SQL 日期截取:从基础方法到业务实战的全维度解析 在数据处理与业务分析中,日期数据是连接 “业务行为” 与 “时间维度” 的核 ...
2025-09-04在卷积神经网络(CNN)的发展历程中,解决 “梯度消失”“特征复用不足”“模型参数冗余” 一直是核心命题。2017 年提出的密集连 ...
2025-09-04