京公网安备 11010802034615号
经营许可证编号:京B2-20210330
当我第一次从金融学过渡到数据科学时,我觉得自己就像站在了世界之巅--我在我梦想的领域找到了一份工作,我的职业轨迹已经确定,我只会低着头努力工作,哪里会出错?嗯,有几件事……在接下来的一年里,作为一名数据科学家,我很高兴我发现自己在职业生涯早期犯了几个错误。这样,我就有时间在为时已晚之前进行反思和纠正。过了一会儿,我意识到这些错误是相当普遍的。事实上,我已经观察到我周围的很多DS仍然在犯这些错误,而没有意识到从长远来看,这些错误可能会损害他们的数据生涯。
如果我的5条麦肯锡教给我的让你成为更好的数据科学家的经验教训是我从最好的方面学到的,那么本文中的经验教训是我辛苦学到的,我希望我能帮助你避免犯同样的错误。
在成长过程中,人们总是根据我们如何遵守规则和秩序来评价我们,尤其是在学校里。如果你遵循课本,练习考试,只要投入艰苦的学习,你就会成为优等生。许多人似乎把这种“步兵”的心态带到了他们的工作环境中。在我看来,正是这种心态阻碍了许多数据科学家最大限度地发挥他们的影响,并从同行中脱颖而出。我观察到很多DS,尤其是低年级的DS,认为他们对决策过程没有什么贡献,宁愿退居二线,被动地执行为他们做出的决策。这引发了一个恶性循环--你对这些讨论的贡献越少,利益相关者就越不可能让你参与未来的会议,你在未来做出贡献的机会也就越少。
让我给你一个具体的例子,在模型开发的情况下,一个步兵和一个思想伙伴之间的区别。在数据收集和功能集思广益会议中,以前的我总是被动地记录涉众的建议,这样我就可以在以后“完美”地实现它们。当有人提出一个特性,我知道我们没有数据,我不会说任何基于假设,他们更资深,他们一定知道一些我忽略了。但你猜怎么着,他们没有。我后来会面临这样的情况,即我们集思广益的50%的特性将需要额外的数据收集,这将危及我们的项目截止日期。结果,我经常发现自己最终处于坏消息传递者的不受欢迎的位置。如今,我努力成为一个思想伙伴,我在谈话的早期就参与进来,并利用我作为最接近数据的人的独特地位。通过这种方式,我可以在早期管理涉众的期望,并提出建议来帮助团队前进。
如何避免这种情况:
我想成为一名数据工程师还是数据科学家?我想处理市场和销售数据还是地理空间分析?您可能已经注意到,到目前为止,我在本文中一直使用术语DS作为许多与数据相关的职业道路(例如,数据工程师、数据科学家、数据分析师等)的通用术语。这是因为在当今的数据世界中,这些标题之间的界限是如此模糊,尤其是在较小的公司中。我观察到许多数据科学家认为自己只是构建模型的数据科学家,而不关注任何业务方面,或者数据工程师只关注数据管道,而不想知道公司正在进行的任何建模。
最好的数据人才是那些能够身兼数职或至少能够理解其他数据角色的流程的人。如果您想在早期阶段或成长阶段的初创企业工作,这尤其方便,因为那里的功能可能还没有那么专业化,而且您需要灵活并涵盖各种与数据相关的职责。即使你在一个明确定义的工作概要中,随着时间的推移,你获得了更多的经验,你可能会发现你有兴趣过渡到一个不同类型的数据角色。如果你不把自己和你的技能归类于一个特定角色的狭隘焦点,这个支点会容易得多。
如何避免这种情况:
自满扼杀生命
每个士兵都知道这一点,每个DS也应该知道。对自己的数据技能沾沾自喜,而不花时间学习新的技能是一个常见的错误。在数据领域这样做比在其他一些领域更危险,因为数据科学是一个相对较新的领域,仍在经历剧烈的变化和发展。不断有新的算法、新的工具,甚至新的编程语言被引入。
如果你不想成为那个在2021年仍然只知道如何使用STATA的数据科学家(他存在,我和他一起工作过),那么你需要跟上该领域的发展。
如何避免这种情况:
如果你只有一把锤子,一切看起来都像钉子。不要成为那个什么都想用ML的DS。当我第一次进入数据科学的世界时,我对我在学校学到的所有花哨的模型感到非常兴奋,迫不及待地想在现实世界的问题上尝试所有这些模型。但现实世界与学术研究不同,80/20规则总是在发挥作用。
在我之前的一篇关于“麦肯锡教给我的5堂课”的文章中,我写到了商业影响和可解释性有时比你的模型的准确性多出几个百分点更重要。有时,假设驱动的Excel模型可能比多层神经网络更有意义。在这种情况下,不要过度弯曲你的分析肌肉,使你的方法矫枉过正。相反,发挥你的商业实力,做一个同样具有商业头脑的DS。
如何避免这种情况:
在我的文章 "建立伟大的数据文化的6个基本步骤 "中,我写到如果公司没有伟大的数据文化,数据科学家的生活可能是可怕的和无益的。事实上,我已经听到很多DS抱怨那些没有生产力的临时数据请求,这些请求应该很容易被利益相关者以自给自足的方式处理(例如,在Looker中把一个汇总从每月改为每天,这简直包括两次点击)。不要认为改变这种文化是别人的工作。如果你想看到改变,就去做吧。毕竟,谁比数据科学家自己更有能力建立数据文化和教育利益相关者了解数据?帮助建立公司的数据文化将使你和你的利益相关者的生活更容易。
如何避免这种情况:
我确实想指出,在你的职业生涯中犯错是可以的。最重要的是从这些错误中吸取教训,并在将来避免它们。或者更好的是,把它们写下来帮助别人避免犯同样的错误。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在Python数据分析与数据清洗工作中,Pandas是最核心的数据处理库,DataFrame是结构化数据的标准存储格式。在实时数据采集、循环 ...
2026-08-19在零售行业大数据分析与精细化运营领域,纸尿裤旁摆放啤酒是最经典、最具代表性的商业案例。两种看似毫无关联的商品,一个是婴幼 ...
2026-08-19 很多数据分析师能熟练地计算指标、搭建标签体系,但当被问到“画像到底在解决什么问题”“画像和标签是什么关系”“画像如何 ...
2026-08-19在数据分析、业务监控、质量检测与风险管控工作中,数据波动性是衡量数据稳定性、业务健康度、结果可信度的核心依据。数据波动代 ...
2026-08-18很多分析师在设计标签时思路清晰,但真到落地环节却面临“数据在手,不知如何转化为可用标签”的困境:或因加工方式选择不当导致 ...
2026-08-18在数据分析、业务评价、产品评级、用户分层与综合决策场景中,单一指标往往无法全面、客观地评价事物整体水平。现实中的评价对象 ...
2026-08-18在数理统计、假设检验、数据分析与机器学习领域中,卡方分布(χ²分布)是继正态分布、t分布之后最重要的连续型概率分布之一。 ...
2026-08-17在Python数据清洗、文本校验、账号密码规则校验、脏数据过滤、字符串规整化处理中,正则表达式是最高效、最常用的文本匹配工具。 ...
2026-08-17 很多分析师每天和数据打交道,但当被问到“标签是什么”“标签和指标有什么区别”“标签体系如何设计”时,却常常答不上来。 ...
2026-08-17手游行业具备用户迭代快、竞争激烈、用户粘性易流失的典型特征。随着新游持续上线、玩家审美升级、玩法疲劳等问题出现,存量用户 ...
2026-08-14在数字化产品运营、商业数据分析、业务增长管理中,零散的指标统计无法支撑系统性的业务决策。单一的点击率、转化率、销量数据只 ...
2026-08-14 很多数据分析师每天都在写SQL,但当被问到“数据查询语言(DQL)的本质是什么”“SELECT语句中各子句的书写顺序与实际执行顺 ...
2026-08-14在数据库数据分析、数据清洗、报表统计与业务查询场景中,日期时间是最高频、最核心的基础字段。数据库中存储的日期格式多样,包 ...
2026-08-13在数据统计分析与数据清洗工作中,箱线图是一种简洁高效、客观性强的数据可视化图表,能够直观呈现数据集的分布特征、离散程度和 ...
2026-08-13 很多数据分析师写过无数个SELECT查询,但当被问到“如何新建一张表来固化中间数据”“创建视图和创建物理表有什么区别”“视 ...
2026-08-13在自动化办公、数据采集、定时统计、日志清理、系统监控等场景中,程序往往需要按照固定时间间隔重复执行指定任务,这种运行机制 ...
2026-08-12在数据分析日常工作中,Excel数据筛选是数据清洗、数据提取、样本筛选的核心基础操作。传统Excel手动筛选、函数筛选方式,面对多 ...
2026-08-12 很多数据分析师精通Excel函数和数据透视表,但当被问到“数据从哪里来”“表和视图有什么区别”“数据库管理系统和SQL是什么 ...
2026-08-12在数据分析、统计建模、数据挖掘与商业调研过程中,原始数据往往无法做到绝对干净规整。受系统故障、人工录入失误、设备误差、突 ...
2026-08-11在数据分析工作中,聚类分析是典型的无监督学习方法,核心作用是依据数据自身的多维特征,将相似样本自动划分为若干类别,实现“ ...
2026-08-11