京公网安备 11010802034615号
经营许可证编号:京B2-20210330
对于大数据,这些认识上的bug你必须要知道
虽然大数据的发展(包括新型的非结构化数据和数据分析工具)正影响着各行各业,但关于大数据也有一些误解。
误解一:算法能解决一切问题请输入标题
我把这个误解称为神奇的算法。有关大数据的早期报道造成了一种假象:要想打造智能城市和企业,只要将功能最强大的电脑凑在一起,让它们去分析手头上的非结构化数据,找出规律,其中的商业洞见自然会浮现出来。但事实上,数据分析并不是这样完成的。
除了机器的运算,要使大数据发生效用还需要许多人力专家的参与,这是因为:数据的质量和准确性相当重要。数据是怎样收集的?误差率如何?样本是否有代表性?如果进行比对,不同的数据库中数据格式是否相同?因此,数据处理中的许多工作还需要人工操作,其中的尺度计算机很难拿捏。
受编程人员的主观影响,数据分析的算法也会出现各种偏差。比如,某个程序可以帮助企业筛选出最佳应聘者的简历,但是基于过去招聘经历的筛选结果并不一定能满足公司未来所需要的技能。
更重要的是,管理者需要提出关于数据的对的问题。公司现阶段最关心的结果是什么?数据呈现的哪些模式可以直接为公司所用?算法在寻找答案方面越来越游刃有余,但关键还要知道寻找什么问题的答案,这需要人来提出恰当的问题。凯撒娱乐的首席商务官塔里克·肖卡特曾这样说:“如果仅关注数据,那你可能将一无所获。我总是提醒我的团队去思考,你想要回答什么问题。”
误解二:相关分析至上
发现一种模式往往是不够的。许多评论家一再指出,有了大数据,数据科学再也不需要考虑因果关系,只关注相关关系即可。这种观点的潜在逻辑在于,通过大数据分析得到的规律近乎事实,无须再依赖人们所认知的因果判断。
显然这种观点是不可取的。管理者需要分清简单的相关分析和因果分析之间的差异,以及这种差异什么时候重要,什么时候不重要,这一点非常关键。简而言之,如果仅仅是为了做预测,看数据之间的相关关系便已足够;但如果你想改变前提条件,就必须考虑因果关系。
回到斯特林格的例子——就是发现降低城市树木修剪预算会引发诉讼数量增加的那个检察官。如果树木修剪预算不是引发诉讼数量变化的真正原因,那么提高树木修剪预算的方案就不会奏效。在这个例子里,搞清因果关系是很重要的。
还有一个例子,试想你的广告策划团队发现,俄亥俄州的已婚女性对你们的头发护理产品广告更感兴趣,但是你显然不能通过鼓励俄亥俄州的女性结婚来增加产品销量(这将影响前提条件)。相反,发现这一规律后,你可能会考虑将产品定位于俄亥俄州的已婚女性群体。在这种情形下,仅需要知道相关关系就可以了。
误解三:大数据是万金油
有时候人们将大数据与数据战略混为一谈。在很多情况下,企业完全可以建立宝贵的数据库,将之应用到战略中,而不一定非要使用大数据。
数据并不一定非要“大”(非结构化)才有用。从结构化的数据中(如顾客的点击行为——顾客一般会点击网页的什么位置、什么时候下拉屏幕、停留了多长时间、是否将商品放入购物车等)照样可以得到许多有价值的信息。即使在像脸书这样为许多世界大型服务器集群提供大数据的企业,其工程师每天处理的大多数问题也可以在一台运转良好的电脑上完成。数据战略的关键在于为企业提供价值,有时候需要大数据,有时候并不需要。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在Power BI数据可视化分析中,切片器是连接用户与数据的核心交互工具,其核心价值在于帮助使用者快速筛选目标数据、聚焦分析重点 ...
2026-04-23以数为据,以析促优——数据分析结果指导临床技术改进的实践路径 临床技术是医疗服务的核心载体,其水平直接决定患者诊疗效果、 ...
2026-04-23很多数据分析师每天盯着GMV、DAU、转化率,但当被问到“哪些指标是所有企业都需要的”“哪些指标是因行业而异的”“北极星指标和 ...
2026-04-23近日,由 CDA 数据科学研究院重磅发布的《2026 全球数智化人才指数报告》,被中国教育科学研究院官方账号正式收录, ...
2026-04-22在数字化时代,客户每一次点击、浏览、下单、咨询等行为,都在传递其潜在需求与决策倾向——这些按时间顺序串联的行为轨迹,构成 ...
2026-04-22数据是数据分析、建模与业务决策的核心基石,而“数据清洗”作为数据预处理的核心环节,是打通数据从“原始杂乱”到“干净可用” ...
2026-04-22 很多数据分析师每天盯着GMV、转化率、DAU等数字看,但当被问到“什么是指标”“指标和维度有什么区别”“如何搭建一套完整的 ...
2026-04-22在数据分析与业务决策中,数据并非静止不变的数值,而是始终处于动态波动之中——股市收盘价的每日涨跌、企业月度销售额的起伏、 ...
2026-04-21在数据分析领域,当研究涉及多个自变量与多个因变量之间的复杂关联时,多变量一般线性分析(Multivariate General Linear Analys ...
2026-04-21很多数据分析师精通描述性统计,能熟练计算均值、中位数、标准差,但当被问到“用500个样本如何推断10万用户的真实满意度”“这 ...
2026-04-21在数据处理与分析的全流程中,日期数据是贯穿业务场景的核心维度之一——无论是业务报表统计、用户行为追踪,还是风控规则落地、 ...
2026-04-20在机器学习建模全流程中,特征工程是连接原始数据与模型效果的关键环节,而特征重要性分析则是特征工程的“灵魂”——它不仅能帮 ...
2026-04-20很多数据分析师沉迷于复杂的机器学习算法,却忽略了数据分析最基础也最核心的能力——描述性统计。事实上,80%的商业分析问题, ...
2026-04-20在数字化时代,数据已成为企业决策的核心驱动力,数据分析与数据挖掘作为解锁数据价值的关键手段,广泛应用于互联网、金融、医疗 ...
2026-04-17在数据处理、后端开发、报表生成与自动化脚本中,将 SQL 查询结果转换为字符串是一项高频且实用的操作。无论是拼接多行数据为逗 ...
2026-04-17面对一份上万行的销售明细表,要快速回答“哪个地区卖得最好”“哪款产品增长最快”“不同客户类型的购买力如何”——这些看似复 ...
2026-04-17数据分析师一天的工作,80% 的时间围绕表格结构数据展开。从一张销售明细表到一份完整的分析报告,表格结构数据贯穿始终。但你真 ...
2026-04-16在机器学习无监督学习领域,Kmeans聚类因其原理简洁、计算高效、可扩展性强的优势,成为数据聚类任务中的主流算法,广泛应用于用 ...
2026-04-16在机器学习建模实践中,特征工程是决定模型性能的核心环节之一。面对高维数据集,冗余特征、无关特征不仅会增加模型训练成本、延 ...
2026-04-16在数字化时代,用户是产品的核心资产,用户运营的本质的是通过科学的指标监测、分析与优化,实现“拉新、促活、留存、转化、复购 ...
2026-04-15