
我最近写了一篇题为数据科学家、数据工程师和其他数据职业的文章,解释说,在这篇文章中,我尽了最大努力简明扼要地定义和区分了五种流行的数据相关职业。在那篇文章中,每一个职业都得到了非常高水平的单句总结,数据科学家被描述如下,以供参考:
数据科学家主要关注数据、从数据中提取的洞察力以及数据可以讲述的故事。
除了我为每个职业写的额外的几个段落之外,我试图提出一个单一的总体差异特性,其中五个可以一起工作成一个流程图,也许由一个有抱负的数据专业人员使用,以帮助确定哪个职业可能最适合他们。
我收到了一些读者的反馈,这些反馈表明,我过于关注预测分析,将其作为数据科学家职业的一个定义性特征,我对这一特征的依赖可能会让人觉得数据科学家比其他任何事情都更擅长预测分析--而其他数据专业人员可能根本不会这样做。
这种建设性的批评很自然地让我思考:数据科学家与其他数据专业人员的区别还在于什么?数据科学家使用的技术技能、特定的技术语言、系统和工具很多。数据科学家--以及其他各种专业人员--也有许多软技能,用于在他们的职业生涯中出类拔萃。但是,成功的数据科学家的一些固有特征是什么,要么是随着数据科学家进入这个行业而来的,要么是他们进入这个行业后可以发展的?
以下是我提出的五件事,作为一个整体,有助于将数据科学家与其他职业区分开来。
让我们首先指出,所有的数据科学家角色都是不同的,但它们都有一些共同的连接线程,希望这些点有助于连接这些线程中的一些线程。
这个特性的焦点是我受到一些抨击的原因。然而,我要在这里加倍说明,预测分析思维模式是数据科学家的主要定义特征之一,也许比任何其他特征都更重要。它是唯一的定义特性吗?当然不。应该在流程图中使用它来将数据科学家从所有其他职业中分离出来吗?回想起来,不,可能不。
数据科学家进行预测分析吗?绝对。非数据科学家也是吗?当然。但是,如果我把data Scientisht放在预测分析的一端,而把<在这里插入其他数据专业人员>放在另一端,我希望data Scientisht总是能落地。
但这不仅仅是预测分析在特定情况下的应用;这是一种心态。这不仅仅是一种分析性的心态(减去预测性的),而是一种总是考虑如何利用我们已经知道的东西来发现我们还不知道的东西的心态。这表明预测性是方程的一个组成部分。
在我看来,数据科学家的头脑中不仅仅有预测,但在这种心态下工作是定义角色的特征之一,也是许多其他职业,无论是与数据相关的还是其他职业,都不具备的特征。其他确实有这种特点的人可能会把它放在对该职业有价值的人名单的后面。
显然,利用我们所知道的来找出我们所不知道的是不够的。数据科学家必须对他们有一种其他角色不一定需要有的好奇心(注意,我没有说其他人绝对不有这种好奇心)。好奇心几乎是预测分析心态的另一面:当预测分析心态寻求用y解决x时,好奇心将首先确定y是什么。
天生的好奇心是成为一个有用的数据科学家所必需的,故事结束了。如果你是那种早上醒来一整天都不去想宇宙奇迹的人--在任何层面上--数据科学都不适合你。
在杀死它之前,好奇心是这只猫作为一名成功的数据科学家的漫长而成功的职业生涯的原因。
这里有一个深刻的哲理:世界是一个复杂的地方。一切都以某种方式联系在一起,远远超出了显而易见的范围,这导致了现实世界的层层复杂性。复杂系统与其他复杂系统相互作用,产生自己的额外复杂系统,宇宙也是如此。这个复杂的游戏不仅仅是认识到大局:大局在什么地方适合大局,等等?
但这不仅仅是哲学上的。这个现实世界的无限复杂网络被数据科学家所认识。他们感兴趣的是了解尽可能多的相关互动,无论是潜在的还是其他的,因为他们解决了他们的问题。他们寻找与情况相关的已知未知、已知未知和未知未知,理解任何给定的变化都可能在其他地方产生意想不到的后果。
数据科学家的工作是尽可能多地了解相关系统,并利用他们的好奇心和预测性分析心态来尽可能多地解释这些系统的操作和交互,以便即使在调整时也能保持它们平稳运行。如果你不能理解为什么没有人能够完全解释经济是如何运作的,数据科学就不适合你。
现在我们来到了我们必须的“跳出框框思考”的特征。我们不是在某种程度上鼓励每个人都这样做吗?我们当然知道。但我不是这个意思。
记住,数据科学家不是在真空中工作的;我们与各种类型的不同角色一起工作,在我们的旅程中遇到各种不同的领域专家。这些领域专家有特殊的方法来看待他们的特定领域,即使是在跳出框框思考的时候。作为一名数据科学家,拥有一套独特的技能和一种特殊类型的心态--我将在这里尽我所能以某种方式描述这一点--您可以从领域专家所在的盒子之外解决问题。你可以成为一双新的眼睛,用新的眼光看待问题--当然,前提是你足够好地理解问题。你的创造力将帮助你产生新的想法和观点。
这并不是要削弱领域专家;事实上恰恰相反。我们数据科学家是他们的支持,并带来了一套经过培训的技能来做我们所做的事情,我们(希望)能够在我们的支持角色中带来一个新的视角,为领域专家能够在他们所做的事情上出类拔萃做出贡献。这一新的视角将由数据科学家的创造性思维驱动,这种创造性与好奇心相结合,将导致能够提出问题并寻求答案。
当然,我们需要技术、统计和其他技能来跟进这些问题,但如果我们没有创造力去思考有趣和不明显的方法来调查并最终提供答案,这些技能就毫无用处了。这就是为什么数据科学家必须天生具有创造性。
每个人都需要能够与他人有效沟通,无论他们在生活中处于何种地位。数据科学家也没有什么不同。
但除此之外,数据科学家在向其他利益相关者解释他们的工作时,经常不得不做一些手把手的工作,这些利益相关者可能没有--也可能没有意愿--完全沉浸在统计分析电影宇宙™中。一个数据科学家必须能够从A点叙述某人到B点,即使这个人几乎不知道这两个点中的任何一个到底是什么。说白了,讲故事就是能够从一些数据和你的分析过程中编织出一个现实的叙事:我们是如何从这个到这个的。
这不仅仅是简单地陈述事实;数据科学家必须看到利益相关者在等式中的位置,并使叙述旅程相关--也许用有用的视觉或其他道具来帮助完成众所周知的交易。
这种讲故事不像虚构的讲故事;它更像是“花式解释”,或者提供一个为听者量身定制的直观解释。你不会在睡觉前给一个五岁的孩子讲斯蒂芬·金的故事,就像你不会向从事研发的人深究关于供应链指标的枯燥、冗长的叙述一样。注意你的听众。
这种讲故事在本质上也不具有说服力;是解释性的。我们不是数据政治家,我们是数据科学家。科学家为了使别人屈从于他们的意志而歪曲统计数据,这是没有好处的。把这个留给当选的官员。
我希望这有助于描绘一幅我认为是一个成功的数据科学家的重要特征的丰富画面。我祝你事业顺利。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
PowerBI 累计曲线制作指南:从 DAX 度量到可视化落地 在业务数据分析中,“累计趋势” 是衡量业务进展的核心视角 —— 无论是 “ ...
2025-08-15Python 函数 return 多个数据:用法、实例与实战技巧 在 Python 编程中,函数是代码复用与逻辑封装的核心载体。多数场景下,我们 ...
2025-08-15CDA 数据分析师:引领商业数据分析体系构建,筑牢企业数据驱动根基 在数字化转型深化的今天,企业对数据的依赖已从 “零散分析” ...
2025-08-15随机森林中特征重要性(Feature Importance)排名解析 在机器学习领域,随机森林因其出色的预测性能和对高维数据的适应性,被广 ...
2025-08-14t 统计量为负数时的分布计算方法与解析 在统计学假设检验中,t 统计量是常用的重要指标,其分布特征直接影响着检验结果的判断。 ...
2025-08-14CDA 数据分析师与业务数据分析步骤 在当今数据驱动的商业世界中,数据分析已成为企业决策和发展的核心驱动力。CDA 数据分析师作 ...
2025-08-14前台流量与后台流量:数据链路中的双重镜像 在商业数据分析体系中,流量数据是洞察用户行为与系统效能的核心依据。前台流量与 ...
2025-08-13商业数据分析体系构建与 CDA 数据分析师的协同赋能 在企业数字化转型的浪潮中,商业数据分析已从 “可选工具” 升级为 “核 ...
2025-08-13解析 CDA 数据分析师:数据时代的价值挖掘者 在数字经济高速发展的今天,数据已成为企业核心资产,而将数据转化为商业价值的 ...
2025-08-13解析 response.text 与 response.content 的核心区别 在网络数据请求与处理的场景中,开发者经常需要从服务器返回的响应中提取数 ...
2025-08-12MySQL 统计连续每天数据:从业务需求到技术实现 在数据分析场景中,连续日期的数据统计是衡量业务连续性的重要手段 —— 无论是 ...
2025-08-12PyTorch 中 Shuffle 机制:数据打乱的艺术与实践 在深度学习模型训练过程中,数据的呈现顺序往往对模型性能有着微妙却关键的影响 ...
2025-08-12Pandas 多列条件筛选:从基础语法到实战应用 在数据分析工作中,基于多列条件筛选数据是高频需求。无论是提取满足特定业务规则的 ...
2025-08-12人工智能重塑 CDA 数据分析领域:从工具革新到能力重构 在数字经济浪潮与人工智能技术共振的 2025 年,数据分析行业正经历着前所 ...
2025-08-12游戏流水衰退率:计算方法与实践意义 在游戏行业中,流水(即游戏收入)是衡量一款游戏商业表现的核心指标之一。而游戏流水衰退 ...
2025-08-12CDA 一级:数据分析入门的基石 在当今数据驱动的时代,数据分析能力已成为职场中的一项重要技能。CDA(Certified Data Anal ...
2025-08-12破解游戏用户流失困局:从数据洞察到留存策略 在游戏行业竞争白热化的当下,用户流失率已成为衡量产品健康度的核心指标。一款游 ...
2025-08-11数据时代的黄金入场券:CDA 认证解锁职业新蓝海 一、万亿级市场需求下的数据分析人才缺口 在数字化转型浪潮中,数据已成为企业核 ...
2025-08-11DBeaver 实战:实现两个库表结构同步的高效路径 在数据库管理与开发工作中,保持不同环境(如开发库与生产库、主库与从库)的表 ...
2025-08-08t 检验与卡方检验:数据分析中的两大统计利器 在数据分析领域,统计检验是验证假设、挖掘数据规律的重要手段。其中,t 检验和卡 ...
2025-08-08