
大数据时代下数学建模还有作用吗
一直以来很想回答这个问题。只是后来发现我想说的很多回答者已经回答过了。今天看了「拒绝用QQ邮箱发应聘邮件的求职者是否合理?」的有关讨论,突然发现,在这个问题里面,可以把我的「没处答的一些话」写下来。
我曾经有一次讨论过有关机器学习的事情,我很相信这样的方法可以为我们「解决」某些问题提供帮助,但是他对这些方法很不喜欢,因为「解决」问题跟「理解」问题是两码事。大数据时代的各种统计学习方法可以为我们解决许多问题,但我们却不知道为什么会这样。
有了大数据,我们直接从数据里面就得出来很多奇妙的结论。例如杨宣指出的,在「不通过」这个分类之下,qq 邮箱是概率排名前五的强特征。这就是「大数据时代」(或者其它各种各样类型的「实证研究」)为我们解决的一个问题——至少 HR 们筛掉 qq 邮箱在统计的意义上是有些理性依据的。
但是是不是有什么东西被我们错过了呢?
今年暑假的某一天,我听一个我很尊重的老师批评了目前在做复杂系统有关问题时,主要基于统计的那些研究者,他们做出来的一些东西。我们都知道现在做这些问题的研究者可以发表很多很好的文章,但是这些文章缺少了某些东西。
以往,如果我写了一篇论文,发现某个结论,并且在文中提出得出这个结论可能的一个原因,甚至提出来一个数学模型,这个模型可以解释我从数据分析中得到的那个结论。要是把我写的这篇文章投稿到比较好的期刊,审稿人必然会提意见——你提出了一种产生这个结论的原因,可是你怎样排除掉其它的原因呢?如果你不能排除掉其它的因素的影响,那我们很遗憾只能拒绝掉你的文章了。
在大数据时代,审稿人们还能以此为理由拒绝掉别人的文章吗?这些数据这么珍贵,甚至有的是从运营商、航空公司、网站和志愿者处花费了金钱和时间才得到的,提出这样的一个解释就已经很好了……可是我们很可能会距离理解各种问题越来越远。在大数据时代,通过各种统计的方法,我们可以得到许多有意思的结论,但是这些结论不能让我们心安。就像「用 qq 邮箱的求职者很可能有着较低的简历质量」也可能会是一个从大数据分析得到的结果,可是我们不会知道为什么会这样。公开这些结论,甚至可能招致他人的批评。每个人可能有不同的看法,也会自己提出对这个问题的解释,即每个人都会对这个结论提出自己的「模型」,并把自己的「模型」跟这个结论等价起来。如果「模型」不能排除其它因素的影响,那么你可以提出你的理论来解释这个问题,而我也可以提出我的模型来解释这个结论,我们最终会无法说服他人。遗憾的是,正因为我们的结论来自大数据,很多时候我们很难再找出「对照实验」的那些数据了,杂志社没有办法说「如果你能排除掉其它的因素的影响,我们就发表你的文章」。我们很可能会距离「为什么」越来越远。
而如果把「大数据」和「数学模型」对立起来,则这里所说的「模型」便是另一码事了。这里的「模型」与「机制」「假设」「简化」等等更接近。有了「模型」,我们就可以从「纯粹理性」而非「实践理性」的高度让你心安。就像每个 HR 都可以提出无数个讨厌 qq 邮箱求职者的理由,只可惜,这些模型都是你个人的角度,大家攻击起来实在容易。我们或许会越来越难摒弃掉这些偏见,因为没有一个可以让大家都相信的「理论」(或者「模型」)。我们只知道结论。
这时候,如果你是天才的建模者,提出一个能被大家公认的模型,并排除掉其它也可能造成这一现象的干扰因素,那就是真正的大神了。我比较悲观,因为我自己也会在实用的结论面前满足。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
用 Power BI 制作地图热力图:基于经纬度数据的实践指南 在数据可视化领域,地图热力图凭借直观呈现地理数据分布密度的优势,成 ...
2025-07-24解析 insert into select 是否会锁表:原理、场景与应对策略 在数据库操作中,insert into select 是一种常用的批量数据插入语句 ...
2025-07-24CDA 数据分析师的工作范围解析 在数字化时代的浪潮下,数据已成为企业发展的核心资产之一。CDA(Certified Data Analyst)数据分 ...
2025-07-24从 CDA LEVEL II 考试题型看 Python 数据分析要点 在数据科学领域蓬勃发展的当下,CDA(Certified Data Analyst)认证成为众多从 ...
2025-07-23用 Python 开启数据分析之旅:从基础到实践的完整指南 在数据驱动决策的时代,数据分析已成为各行业不可或缺的核心能力。而 Pyt ...
2025-07-23鸢尾花判别分析:机器学习中的经典实践案例 在机器学习的世界里,有一个经典的数据集如同引路明灯,为无数初学者打开了模式识别 ...
2025-07-23解析 response.text 与 response.content 的核心区别 在网络数据请求与处理的场景中,开发者经常需要从服务器返回的响应中提取数 ...
2025-07-22解析神经网络中 Softmax 函数的核心作用 在神经网络的发展历程中,激活函数扮演着至关重要的角色,它们为网络赋予了非线性能力, ...
2025-07-22CDA数据分析师证书考取全攻略 一、了解 CDA 数据分析师认证 CDA 数据分析师认证是一套科学化、专业化、国际化的人才考核标准, ...
2025-07-22左偏态分布转正态分布:方法、原理与实践 左偏态分布转正态分布:方法、原理与实践 在统计分析、数据建模和科学研究中,正态分 ...
2025-07-22你是不是也经常刷到别人涨粉百万、带货千万,心里痒痒的,想着“我也试试”,结果三个月过去,粉丝不到1000,播放量惨不忍睹? ...
2025-07-21我是陈辉,一个创业十多年的企业主,前半段人生和“文字”紧紧绑在一起。从广告公司文案到品牌策划,再到自己开策划机构,我靠 ...
2025-07-21CDA 数据分析师的职业生涯规划:从入门到卓越的成长之路 在数字经济蓬勃发展的当下,数据已成为企业核心竞争力的重要来源,而 CD ...
2025-07-21MySQL执行计划中rows的计算逻辑:从原理到实践 MySQL 执行计划中 rows 的计算逻辑:从原理到实践 在 MySQL 数据库的查询优化中 ...
2025-07-21在AI渗透率超85%的2025年,企业生存之战就是数据之战,CDA认证已成为决定企业存续的生死线!据麦肯锡全球研究院数据显示,AI驱 ...
2025-07-2035岁焦虑像一把高悬的利刃,裁员潮、晋升无望、技能过时……当职场中年危机与数字化浪潮正面交锋,你是否发现: 简历投了10 ...
2025-07-20CDA 数据分析师报考条件详解与准备指南 在数据驱动决策的时代浪潮下,CDA 数据分析师认证愈发受到瞩目,成为众多有志投身数 ...
2025-07-18刚入职场或是在职场正面临岗位替代、技能更新、人机协作等焦虑的打工人,想要找到一条破解职场焦虑和升职瓶颈的系统化学习提升 ...
2025-07-182025被称为“AI元年”,而AI,与数据密不可分。网易公司创始人丁磊在《AI思维:从数据中创造价值的炼金术 ...
2025-07-18CDA 数据分析师:数据时代的价值挖掘者 在大数据席卷全球的今天,数据已成为企业核心竞争力的重要组成部分。从海量数据中提取有 ...
2025-07-18