京公网安备 11010802034615号
经营许可证编号:京B2-20210330
千万不要被大数据洗脑和挟持
钱钟书先生写过一篇妙文,说从整个历史来看,古代其实相当于人类的小孩子时期,先前是幼稚的,经过了千百年的长进,慢慢才到了现代。时代越是古旧,它的历史就越短,时代越是在后,它积累的阅历越是深厚,年龄就越多。所以,总结来说,我们反而是我们祖父的前辈,上古三代反不如现代悠久古老。
现代人完全可以这样对待我们的历史和传统。我们的时代正在用这样的一种方式瓦解经典,时间再也不是淘洗作品的永恒标准,因为传统无法解释现代人的经验,历史也无法应对高速变化的现实,共识已经瓦解成了个人主义的炮灰,经典备受质疑,经典之中也许并无圣人之言,很可能都是无用的废话——如果按照现如今大数据的标准,所有的经典都应该抛弃在垃圾堆,因为其中撰写的都是无用之言和可疑之言,缺乏合理的大数据的论证。
这话说得有些滑稽,但确实是切中要害的现实概括:大数据神话正在横扫一切领域。原本我们以为大数据只能在科学等实证领域兴风作浪,后来才发现,大数据神话的野心是掌控一切现实,就连人文学科,也同样需要大数据的支撑,没有大数据支撑的文章都是耍流氓。以前,我们写文章会习惯性地写,苏格拉底说过,未经省察的人生是不值得过的。现在写作就会说,根据统计数据显示,或者根据某份权威的调查报告的统计数字,未经省察的人生幸福指数只有20%-40%左右。我们时代最流行的阅读是别人替你读书,把书的内容划重点,归纳和总结出各种所谓的“干货”和教条,然后塞给你,你马上就觉得自己变成了博学多知的百科全书——这就是现在“逻辑思维”正在推广的学习方式。我们渴望的知识不再是经过时间的淘洗依然存在的经典,我们最想获得的知识是维基百科。
按照现在最时髦的理论——其实就是流行的《未来简史》《大数据时代》之类通俗读物——人类所有的知识都可以归纳为某种算法。比如在中世纪,获得知识的公式是:知识=经文 逻辑。简单说就是,如果你先想要知道某个问题的答案,中世纪的人会阅读相关经文,然后用中世纪逻辑来理解经文的确切含义。
而进入了科学革命时代之后,这个算法的公式就是:知识=实证数据 数学。以地球的形状为例,我们就要搜集相关的实证数据,观察太阳、月亮和行星,积累了足够的观测值,再用数学工具加以分析,利用三角学进行推断。
很显然,以上的两个公式就算是正确的,帮助我们解决了很多问题,但仍然具有很大的缺陷,它无法处理我们的人生价值和意义问题。所以,某些以创造公式为己任的人,又费尽脑汁创造了一个获得伦理知识的公式:知识=体验 敏感性。就是说,如果我们想知道任何道德问题的答案,我们需要连接到自己的内心体验,并以最大的敏感性来观察它。
但是这个就很模糊了,体验不能用数据测量,敏感性更是无迹可循,唯一依靠的只有自己的感觉。如何对自己的感觉进行量化,或者用流行的大数据进行统计呢?如果这些都属模糊的数据,这种知识如何获得?所以在伦理学领域,或者在我们寻找人生意义的问题上,无法用一个统一的公式获得共识——幸好如此,否则我们都利用这种算法计算我们的感受,那人生还有什么意外的乐趣?
我不知道大数据时代到来对生活影响有多大。我只知道,任何数据都无法解决我人生各个阶段的意义,更无法解决抑郁、自杀、快乐、苦闷等情绪上的问题。换句话说,千万不要被大数据洗脑和挟持,我们不是大数据的人质,大数据应该是我们解决某种问题的方式。好像在每一个时代都会有这样一个走火入魔的时期,我们有上帝和神学统治一切的时期,然后是启蒙理性统治的时代,现在是大数据时代。但它们都不能成为简化人生的公式和算法。就算人工智能可以使用各种算法赢得未来,就算机器战胜了人的大脑,它只能说明人类的大脑比机器聪明,而不是相反,更不会让我们对其顶礼膜拜。对我们而言,无论是人工智能,还是大数据,它们只能成为人类寻找生命意义的工具,而不是目的。它们代替不了人类的未来。
试读
那些被认为内向的人经常会提到,比起面对多个人,他们在一对一的交谈中感觉更自在。别人也认为他们是很棒的聆听者,因为他们更注重谈话深度,而不是广度。通常情况下关键就在于开启对话的方式。你可以从一个小话题开始,询问别人的名字,或者问问他们是否有小孩或者宠物,用一些活跃气氛的话语开始交谈。一旦你找到对方深有所感的兴趣点或者关注点,谈话就会自然而然地展开。
——珍妮弗·康维勒
《内向者沟通圣经》
说到底,自己现在几岁了?连这都不清不楚。不,即使计算,也可想而知。自己度过的每一天,跟牛皮纸一样薄,没有厚度。那种东西,管他叠上多少张,都厚不到哪儿去吧。一分和一秒差不多了。一回神,往往一两个小时已经过去。那么十年、百年应该也差不到哪儿去。既然如此,算了也白算。——[日]京极夏彦
《百鬼夜行 阳》
散步这件事——我认为是人类的日常中最自然的行为,同时,也有很重要的意义。此外,散步这一行为是否具有目的性,也是值得考虑的一点。
散步是件非常自由的事。没有目的地的条件限制,也没有时间的束缚。而且,走路的步调及速度都是自由的,还讲究心情闲适。散步时,偶尔的立足停顿也是必需的。
——[日] 谷口治郎
《散步去》
中国人讲“情”,跟“爱”又不一样,“情”好像是宇宙的一种原动力,一切的发生就靠这个“情”字,它比那个“爱”字深广幽微。曹雪芹是用一个宇宙性、神话性的东西来说这个“情”字,“情”字还不够,还有“情根”,情一生根,麻烦了!《牡丹亭》里面有句话:“情根一点是无生债。”情一生根以后这个债就还不完了。
——白先勇
《白先勇细说红楼梦》
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
指标体系是企业数字化分析、业务监控、经营决策的核心基础框架,是将零散数据转化为可衡量、可对比、可落地业务价值的关键体系。 ...
2026-10-08随着市场竞争日趋饱和,同质化低价竞争逐渐陷入内卷僵局,传统以价格、渠道、促销为核心的营销模式边际效益持续递减。在此背景下 ...
2026-10-08 很多数据分析师画过趋势图、做过业绩预测,但当被问到“这个月销售额增长20%,到底是长期趋势自然增长,还是促销活动的短期 ...
2026-10-08你有没有想过,手机里点外卖、刷社交软件、转一笔账,背后到底是谁在替你"记着账"? 答案其实很简单:数据库,以及跟它对话的那 ...
2026-10-07CDA数据分析师 出品 作者:李诗怡 一、数据分析四大思维 1. 对比思维:没有对比就没有分析 核心观点:单独一个数字没有意义,有 ...
2026-10-05Kimball 是方法,星型模型是它产出的形状。 很多人把"Kimball vs 星型模型"当成一道选择题——这本身就是个误会:Kimball 是动词 ...
2026-10-05写在开头 老板在微信上甩来一句: "帮我看下为什么销量跌了。" ” 你回工位,打开 SQL,开始写。查订单表、拉近三个月、按 ...
2026-10-03CDA数据分析师 出品 作者:李诗怡 1. 事实表 vs 维度表 对比维度 事实表 维度表 核心问题 记录“业务发生了什么事” 描述 ...
2026-10-02做数据聚合时,PySpark的groupBy()确实能完成统计,这也是它的本职工作。但它有一个根本性局限:每一组数据,最终只能返回一行 ...
2026-10-01热力地图是数据可视化中极具辨识度与实用性的空间分析图表,结合地理空间维度与数据密度特征,通过颜色深浅、色阶渐变直观展示数 ...
2026-09-30 很多数据分析师做过按月份的销售额趋势图,画过按天的流量折线图,但当被问到“时间序列和普通数据有什么本质区别”“季节性 ...
2026-09-30同样是“银行数据岗”,在国有大行总行数据中心、在一家城商行的零售部、在银行系金融科技子公司、在保险公司,工作内容、成长节 ...
2026-09-29在数据分析与统计学研究中,数据往往不是独立存在的,不同变量之间普遍存在相互关联、相互影响的关系。相关性统计分析是挖掘变量 ...
2026-09-29 导读:大多数人只把 dataclasses 当成偷懒工具,用来少写 __init__、__repr__ 这类魔法方法。但它的能力远不止于此。本文带 ...
2026-09-29 很多数据分析师能熟练地计算指标、搭建标签体系,但当被问到“画像到底在解决什么问题”“画像和标签是什么关系”“画像如何 ...
2026-09-29在MySQL数据库运维与业务开发中,行业普遍存在“数据达到千万级就必须分表”的说法。但在实际生产环境中,千万条数据并不是强制 ...
2026-09-28CDA数据分析师 出品 作者:李诗怡 1. 5W1H 分析法 定义:经典系统性思维框架,通过六个核心维度对问题进行全方位拆解与剖析,确 ...
2026-09-28 很多分析师在设计标签时思路清晰,但真到落地环节却面临“数据在手,不知如何转化为可用标签”的困境:或因加工方式选择不当 ...
2026-09-28CDA数据分析师 出品 作者:李诗怡 1. 用户标签体系 定义: 通过一系列高度精炼的特征标识,对用户属性、行为与偏好进行量化刻画 ...
2026-09-24Pandas是Python生态中用于表格数据处理的核心库,广泛应用于数据清洗、统计运算、报表输出、数据分析建模等场景。在处理极大数值 ...
2026-09-24