
大数据分析:大数据小数据,有用的就是好数据
大数据到底有多大?
在 2001 年,道格 · 莱尼(Doug Laney)写下了一篇具有开创性意义的文章。在这篇文章中,莱尼描绘了一直困扰着他的客户的一个数据问题。莱尼的客户受困于体量(Volume)过于庞大的数据,这些数据正在以爆发式的速度(Velocity)增长,同时数据所呈现的形式也非常多样化(Variety)。莱尼的体量、速度和多样化理论得到了广泛认可,并被称为「大数据的三重奏」。
遗憾的是,许多人并没有抓住莱尼的重点。他在文章中所描述的是大数据所蕴含的问题,而不是优势。
想要收集大数据其实并不容易,而且收集和使用的成本往往非常高昂。与此同时,在一般情况下大数据和具体商业问题的关联度其实并不明显,遑论大数据往往不能满足品质标准的要求。况且在面对大数据时,管理数据所投入的资源并不能在分析、二次研究以及执行等环节中使用。由此看来,大数据对于许多人而言其实并不是一个祝福。相反,大数据有可能会严重摊薄企业在数据分析环节所需要的资源。
数据2
和其他问题相比,某些问题往往会显得更加重要,而某些问题则往往会显得更为复杂。但即便是在解决那些非常重要或复杂问题的时候,我们也不一定需要体量庞大的数据。
我最喜欢的例子之一是载人航天计划,你只需要考虑想要活着将人送到太空所需要的所有信息和计算,就不难理解这是一个多么复杂的问题。载人航天任务所涉及的数据包括:
宇航员的身体状况和医学信息
地理测量学(航天器的位置)和重力场
气象学,云层量和辐射平衡
大气物理学
磁场强度
宇宙射线和辐射捕获量
电磁辐射(紫外线、X 射线和伽玛射线
这份清单只是所需清单中的一小部分,但它所包含的信息量已经非常庞大。甚至连笔者本人也不清楚这些信息到底意味着什么,他只是从一份老旧的 NASA 文件中找到这份清单。(有谁知道行星际介质的测量方法吗?)
载人航天计划所需要的数据到底有多少?与之匹配的计算能力又该有多少?这两个问题的答案你能猜出来吗?
笔者曾有幸和「水星计划」(Mercury Project,美国第一个载人航天计划)的编程人员露西 · 西蒙 · 拉科夫(Lucy Simon Rakov)进行会谈,她向我描述了项目所使用的电脑。据拉科夫描述,尽管项目中的电脑性能非常强大,但内存却只有 300 千字节。你没有看错,不是「艾字节」,不是「拍字节」,也不是「兆字节」,而是「千字节」!
换而言之,只要你足够聪明,你就可以凭借内存极小的设备将航空器送上太空,要知道 300 千字节的内存甚至连存储一张大一点的图片也不够。由此看来,小小的空间其实也大有所为!
尽管如此,大数据有时会变得相当宝贵,与其价值相比,处理中的烦恼和成本甚至也变得不值一提。
大数据有什么好处?
大数据可以针对用户提供定制化的细节数据,有了这些数据,你可以作出更加明智的决策。实际上,有了大数据的帮助,你在顷刻间即可完成上千项决策。
如果说你可以一个接着一个地观察用户,你会更了解他们的习惯、喜好和需求。你会更了解如何和他们相处。只要数据的准确度和质量得当,大数据可以让你以定制化的方式与用户保持亲近,就像对待朋友一样。
你可以通过分析数据中的节为用户提供个性化服务,客户可以从你身上获得类似于亚马逊(Amazon)或者 Netflix 的针对性服务。更加显著的例子是在线婚恋网站的配对服务。
我需要大数据吗?
除非你已经可以在工作中善用日常更小级别的数据,否则大数据对你而言还言之过早。更重要的是,不论面对的是大数据还是小数据,最重要的是你可以善用数据,并将其转化成自己的强力武器。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
Python HTTP 请求工具对比:urllib.request 与 requests 的核心差异与选择指南 在 Python 处理 HTTP 请求(如接口调用、数据爬取 ...
2025-09-12解决 pd.read_csv 读取长浮点数据的科学计数法问题 为帮助 Python 数据从业者解决pd.read_csv读取长浮点数据时的科学计数法问题 ...
2025-09-12CDA 数据分析师:业务数据分析步骤的落地者与价值优化者 业务数据分析是企业解决日常运营问题、提升执行效率的核心手段,其价值 ...
2025-09-12用 SQL 验证业务逻辑:从规则拆解到数据把关的实战指南 在业务系统落地过程中,“业务逻辑” 是连接 “需求设计” 与 “用户体验 ...
2025-09-11塔吉特百货孕妇营销案例:数据驱动下的精准零售革命与启示 在零售行业 “流量红利见顶” 的当下,精准营销成为企业突围的核心方 ...
2025-09-11CDA 数据分析师与战略 / 业务数据分析:概念辨析与协同价值 在数据驱动决策的体系中,“战略数据分析”“业务数据分析” 是企业 ...
2025-09-11Excel 数据聚类分析:从操作实践到业务价值挖掘 在数据分析场景中,聚类分析作为 “无监督分组” 的核心工具,能从杂乱数据中挖 ...
2025-09-10统计模型的核心目的:从数据解读到决策支撑的价值导向 统计模型作为数据分析的核心工具,并非简单的 “公式堆砌”,而是围绕特定 ...
2025-09-10CDA 数据分析师:商业数据分析实践的落地者与价值创造者 商业数据分析的价值,最终要在 “实践” 中体现 —— 脱离业务场景的分 ...
2025-09-10机器学习解决实际问题的核心关键:从业务到落地的全流程解析 在人工智能技术落地的浪潮中,机器学习作为核心工具,已广泛应用于 ...
2025-09-09SPSS 编码状态区域中 Unicode 的功能与价值解析 在 SPSS(Statistical Product and Service Solutions,统计产品与服务解决方案 ...
2025-09-09CDA 数据分析师:驾驭商业数据分析流程的核心力量 在商业决策从 “经验驱动” 向 “数据驱动” 转型的过程中,商业数据分析总体 ...
2025-09-09R 语言:数据科学与科研领域的核心工具及优势解析 一、引言 在数据驱动决策的时代,无论是科研人员验证实验假设(如前文中的 T ...
2025-09-08T 检验在假设检验中的应用与实践 一、引言 在科研数据分析、医学实验验证、经济指标对比等领域,常常需要判断 “样本间的差异是 ...
2025-09-08在商业竞争日益激烈的当下,“用数据说话” 已从企业的 “加分项” 变为 “生存必需”。然而,零散的数据分析无法持续为业务赋能 ...
2025-09-08随机森林算法的核心特点:原理、优势与应用解析 在机器学习领域,随机森林(Random Forest)作为集成学习(Ensemble Learning) ...
2025-09-05Excel 区域名定义:从基础到进阶的高效应用指南 在 Excel 数据处理中,频繁引用单元格区域(如A2:A100、B3:D20)不仅容易出错, ...
2025-09-05CDA 数据分析师:以六大分析方法构建数据驱动业务的核心能力 在数据驱动决策成为企业共识的当下,CDA(Certified Data Analyst) ...
2025-09-05SQL 日期截取:从基础方法到业务实战的全维度解析 在数据处理与业务分析中,日期数据是连接 “业务行为” 与 “时间维度” 的核 ...
2025-09-04在卷积神经网络(CNN)的发展历程中,解决 “梯度消失”“特征复用不足”“模型参数冗余” 一直是核心命题。2017 年提出的密集连 ...
2025-09-04