京公网安备 11010802034615号
经营许可证编号:京B2-20210330
大数据时代,我们需要这样的思考方式
相比小数据,大数据一定是复杂的。然而,复杂性对于我们来说,绝对是一个机会而不应是一个问题。面对大数据时代的扑面而来,如何拥抱大数据,我们需要从思考方式的转变开始。
维克托•迈尔•舍恩伯格和肯尼斯•库克耶在《大数据时代》中告诉我们大数据的4V特点,即Volume(大量)、Velocity(高速)、Variety(多样)、Veracity(真实)。相比小数据,大数据一定是复杂的。然而,复杂性对于我们来说,绝对是一个机会而不应是一个问题。面对大数据时代的扑面而来,如何拥抱大数据,从思考方式的转变开始。
小数据时代,我们对于数据的存储与检索一直依赖于分类法和索引法,分类和索引是一种清晰获取数据的机制设计,这种机制是以预设场域为前提的。这种结构化数据库的预设场域能够卓越地展示数据的整齐排列与准确存储,毫无疑问,这与追求数据的精确性目标是完全一致的,在数据稀缺与问题清晰的年代,这种基于预设的结构化数据库能够有效的回答人们的问题,并且这种数据库在不同的时间能够提供一致的结果。
面对大数据,由于数据的海量、混杂等特征会使预设的数据库系统崩溃。其实,数据的纷繁杂乱才真正呈现出世界的复杂性和不确定性特征,想要获得大数据的价值,承认混乱而不是对抗或避免混乱才是一种可行的路径。为此,伴随着大数据的涌现,出现了非关系型数据库,它不需要预先设定记录结构,而且允许处理各种各样形形色色参差不齐的数据。因为包容了结构的多样性,这些无需预设的非关系型数据库设计能够处理和存储更多的数据,成为大数据时代的重要应对手段。如微软的数据库设计专家Pat Helland所言:“我们再也不能假装活在一个齐整的世界里。”
统计学家通过分析发现,采样分析的精确性随着采样随机性的增加而大幅提高,但与样本数量的增加关系不大。这个发现对于小数据时代无疑是非常鼓舞人心的,随机采样获得了巨大的成功,并成为现代社会测量领域的核心思想。随机样本的基础是采样的绝对随机性,然而,如此严格意义的随机实现起来是非常困难的,一旦采样过程存在任何偏见,分析结果将相去甚远,况且随机样本带给我们的只能是事先预设问题的答案。这种缺乏延展性的结果,无疑会使我们错失更多的问题域。
大数据时代,数据的收集问题不再成为我们的困扰,采集全量的数据成为现实。全量数据带给我们视角上的宏观与高远,这将使我们可以站在更高的层级全貌看待问题,看见曾经被淹没的数据价值,发现藏匿在整体中有趣的细节。因为拥有全部或几乎全部的数据,就能使我们获得从不同的角度更细致更全面的观察研究数据的可能性,从而使得大数据的分析过程成为惊喜的发现过程和问题域的拓展过程。
小数据时代,由于可获得的数据量比较小,为此我们必须尽量准确的记录下所获得的所有数据,从而引发了测量工具的优化工作;由于数据处理手段的限制,能被我们利用的数据基本限于能适用于传统数据库的结构化数据;由于采用的是随机采样,因此采样过程的精确度被放在重要的地位。显然,这种对精确性的执着是信息缺乏时代和模拟时代的产物。
大数据时代,海量数据的涌现一定会增加数据的混乱性且造成结果的不准确性,如果仍然执迷的依循准确性,那么我们将无法应对这个新的时代。与数据的混杂性可能带来的结果错误性的增加相比,由数据量的扩张带给我们的新洞察、新趋势和新价值更有意义,因为大数据通常都用概率说话,何况大数据的处理之前是可以对之进行数据清洗从而减少部分的错误数据。所以,与致力于避免错误相比,对错误的包容将会带给我们更多信息。其实,允许数据的混杂性和容许结果的不精确性才是我们拥抱大数据的正确态度,只有让步和接受甚至欣赏不精确性,才能看到大数据带给我们的美好前景,未来我们应当习惯这种思维。
算法是挖掘数据价值的工具,因此算法的研究一直以来是提升数据利用效率的重要路径。小数据时代,在数据的限制无法突破的情形下,对数据信息和价值的获取渴求使得对算法的研究越来越深入,发明的算法越来越复杂。而事实表明,当数据量以指数级扩张时,原来在小数量级的数据中表现很差的简单算法,准确率会大幅提高;与之相反的是,在少量数据情况下运行得最好的复杂算法,在加入更多数据时,其算法的优势则不在显现。为此,更多的数据比算法系统显得更智能更重要,大数据的简单算法比小数据的复杂算法更有效。
小数据时代,由于数据可获得性和计算能力的有限性,使得我们对于问题的研究需要在假设的基础上进行验证,并探究“为什么”,而始于假设的分析研究非常容易受偏见支配。
大数据时代,快速发展的数据存储、数据传输、数据获取、数据处理等系列技术群,为我们对于问题的研究提供了新的视野和有价值的预测,并使我们获得更多以往所不曾被关注的联系与动态,探究“是什么”成为我们发现世界了解世界的更便捷的途径,且不会受先验假设的偏见影响。
小数据时代,信息的匮乏会使我们趋向于采用因果关系范式去快速理解问题并做出决策,虽然这种因果关系可能并不存在,但这是我们理解和解释世界的一条捷径。在人类力量有限性凸显的时候,这种认知捷径往往能带给我们一种认知上的安慰感和安全感,仿佛世界就是因果性的存在着。
由于大数据时代对于数据的研究不再拘泥于对因果关系的探究,这将会使我们完全有条件向关联、非关联等相关关系探究的转变。类似啤酒与尿布存在相关性的经典案例不胜枚举。海量数据不断被制造与我们对于数据搜集、存储、传输、处理能力的日益提高,是大数据时代的当下特征。基于互联网、云计算等现代化手段,对海量的数据进行统计性的搜索、比较、分析、归纳,我们会发现,原本似乎毫不相干的事物之间存在着较高的关联度,这是传统的因果分析、逻辑推理调研难以解释也无法企及的。
当然,相关关系并不是大数据洞察的终结目标。在很多情况下,一旦我们完成了对大数据的相关关系分析,而又不再满足于仅仅“是什么”时,我们就会继续朝向因果关系的研究,寻求“为什么”,并且基于相关关系的分析,进一步寻求因果关系将会大大降低其分析成本。其实,因果关系就是一种特殊的相关关系。
小数据时代,我们基于对社会运作情境的假设,通过收集和分析数据来验证这种假设;通过数据的检验,原有假设不成立,意味着我们将重新开始新的假设并重新收集和分析新的数据,直到我们的验证通过为止。因此,小数据时代,我们的决策与行动是审慎的。
大数据时代,我们不再受限于传统的思维模式和隐含的假定,我们需要对大数据分析的工具理论,通过对大数据的分析,大数据会为我们呈现出新的深刻洞见和释放出巨大的价值。我们在大数据的指导下探索世界并且不再受制于各种假设,这将使我们势必要以积极的姿态随时接收着来自数据的洞察,并做出快速的决策与行动,因为机会和价值很快就会被刷新,大数据的价值也正是在于将及时的信息及时的传递给及时需要的人手中并及时的做出决策和行动。可以预见的未来必然是,得数据者得天下。
其实,我们只是站在一个很长过程的起点上。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
B+树作为数据库索引的核心数据结构,其高效的查询、插入、删除性能,离不开节点间指针的合理设计。在日常学习和数据库开发中,很 ...
2026-01-30在数据库开发中,UUID(通用唯一识别码)是生成唯一主键、唯一标识的常用方式,其标准格式包含4个短横线(如550e8400-e29b-41d4- ...
2026-01-30商业数据分析的价值落地,离不开标准化、系统化的总体流程作为支撑;而CDA(Certified Data Analyst)数据分析师,作为经过系统 ...
2026-01-30在数据分析、质量控制、科研实验等场景中,数据波动性(离散程度)的精准衡量是判断数据可靠性、稳定性的核心环节。标准差(Stan ...
2026-01-29在数据分析、质量检测、科研实验等领域,判断数据间是否存在本质差异是核心需求,而t检验、F检验是实现这一目标的经典统计方法。 ...
2026-01-29统计制图(数据可视化)是数据分析的核心呈现载体,它将抽象的数据转化为直观的图表、图形,让数据规律、业务差异与潜在问题一目 ...
2026-01-29箱线图(Box Plot)作为数据分布可视化的核心工具,能清晰呈现数据的中位数、四分位数、异常值等关键统计特征,广泛应用于数据分 ...
2026-01-28在回归分析、机器学习建模等数据分析场景中,多重共线性是高频数据问题——当多个自变量间存在较强的线性关联时,会导致模型系数 ...
2026-01-28数据分析的价值落地,离不开科学方法的支撑。六种核心分析方法——描述性分析、诊断性分析、预测性分析、规范性分析、对比分析、 ...
2026-01-28在机器学习与数据分析领域,特征是连接数据与模型的核心载体,而特征重要性分析则是挖掘数据价值、优化模型性能、赋能业务决策的 ...
2026-01-27关联分析是数据挖掘领域中挖掘数据间潜在关联关系的经典方法,广泛应用于零售购物篮分析、电商推荐、用户行为路径挖掘等场景。而 ...
2026-01-27数据分析的基础范式,是支撑数据工作从“零散操作”走向“标准化落地”的核心方法论框架,它定义了数据分析的核心逻辑、流程与目 ...
2026-01-27在数据分析、后端开发、业务运维等工作中,SQL语句是操作数据库的核心工具。面对复杂的表结构、多表关联逻辑及灵活的查询需求, ...
2026-01-26支持向量机(SVM)作为机器学习中经典的分类算法,凭借其在小样本、高维数据场景下的优异泛化能力,被广泛应用于图像识别、文本 ...
2026-01-26在数字化浪潮下,数据分析已成为企业决策的核心支撑,而CDA数据分析师作为标准化、专业化的数据人才代表,正逐步成为连接数据资 ...
2026-01-26数据分析的核心价值在于用数据驱动决策,而指标作为数据的“载体”,其选取的合理性直接决定分析结果的有效性。选对指标能精准定 ...
2026-01-23在MySQL查询编写中,我们习惯按“SELECT → FROM → WHERE → ORDER BY”的语法顺序组织语句,直觉上认为代码顺序即执行顺序。但 ...
2026-01-23数字化转型已从企业“可选项”升级为“必答题”,其核心本质是通过数据驱动业务重构、流程优化与模式创新,实现从传统运营向智能 ...
2026-01-23CDA持证人已遍布在世界范围各行各业,包括世界500强企业、顶尖科技独角兽、大型金融机构、国企事业单位、国家行政机关等等,“CDA数据分析师”人才队伍遵守着CDA职业道德准则,发挥着专业技能,已成为支撑科技发展的核心力量。 ...
2026-01-22在数字化时代,企业积累的海量数据如同散落的珍珠,而数据模型就是串联这些珍珠的线——它并非简单的数据集合,而是对现实业务场 ...
2026-01-22