京公网安备 11010802034615号
经营许可证编号:京B2-20210330
以下是受此博客启发的KDnuggets民意调查结果:
放松!数据科学家不会在10年内灭绝,但角色会改变
随着人工智能的进步继续突飞猛进,在基线上获得数据科学已经变得越来越民主化。该领域的传统进入壁垒,如缺乏数据和计算能力,已经被扫除,不断涌现的新数据初创公司(有些公司每天只需一杯咖啡就能访问数据),所有强大的云计算都消除了对昂贵的现场硬件的需求。除了三位一体的先决条件之外,实现的技能和诀窍可以说已经成为数据科学中最普遍的方面。人们不需要看很远就能找到兜售口号的在线教程,如“在几秒钟内实现X模型”,“在几行代码内将Z方法应用于数据”。在一个数字世界里,即时满足已经成为游戏的名称。虽然提高可访问性在表面上并不有害,但在令人眼花缭乱的软件库和闪亮的新模型之下,数据科学的真正目的已经变得模糊,有时甚至被遗忘。因为它不是为了这样做而运行复杂的模型,也不是为了优化任意的性能度量,而是用作解决现实世界问题的工具。
一个简单但相关的例子是Iris数据集。有多少人用它来演示一个算法,而不留心思考萼片是什么,更不用说为什么我们要测量它的长度了?虽然对于可能更有兴趣在他们的曲目中添加一种新模式的初露头角的从业者来说,这些似乎是微不足道的考虑,但对于植物学家埃德加·安德森来说,这并不是微不足道的,他编目了所讨论的属性来理解鸢尾花的变异。尽管这是一个人为的例子,但它展示了一个简单的观点;主流变得更加专注于“做”数据科学,而不是“应用”数据科学。然而,这种失调并不是数据科学家衰落的原因,而是一种症状。为了了解问题的根源,我们必须后退一步,鸟瞰一下。
数据科学有一个奇怪的区别,它是少数几个让实践者没有领域的研究领域之一。药学专业的学生成为药剂师,法律专业的学生成为律师,会计专业的学生成为会计师。数据科学专业的学生因此必须成为数据科学家?但是什么的数据科学家?数据科学的广泛应用是一把双刃剑。一方面,它是一个强大的工具箱,可以应用于任何生成和捕获数据的行业。另一方面,这些工具的普遍适用性意味着用户很少会在此之前对所述行业有真正的领域知识。然而,在数据科学兴起的时候,这个问题并不重要,因为雇主们在没有完全理解它是什么以及如何将它完全集成到他们的公司中的情况下,就急于利用这项新生的技术。
然而,近十年后,企业和它们所处的环境都发生了变化。他们现在努力与以既定行业标准为基准的大型根深蒂固的团队一起实现数据科学的成熟度。迫切的招聘需求已经转向问题解决者和批判性思维者,他们了解业务、各自的行业及其利益相关者。导航几个软件包或反流几行代码的能力不再足够,数据科学从业者也不再被编码的能力所定义。no code、AutoML解决方案(如DataRobot、RapidMiner和Alteryx)的日益流行就证明了这一点。
数据科学家将在10年内灭绝(要么放弃),或者至少角色头衔将是。展望未来,被统称为数据科学的技能集将由新一代精通数据的业务专家和主题专家承担,他们能够用自己深刻的领域知识进行分析,无论他们是否会编码。他们的头衔将反映他们的专业知识,而不是他们展示专业知识的手段,无论是合规专家、产品经理还是投资分析师。我们不需要回头看很远就能找到历史性的先例。在电子表格出现的时候,数据输入专家是非常令人垂涎的,但现在,正如Cole Nussbaumer Knaflic(“用数据讲故事”的作者)恰当地观察到的那样,熟练使用Microsoft Office suite是最低限度的。在此之前,用打字机触摸打字的能力被认为是一项专业技能,然而随着个人计算机的可访问性,它也被认为是一项专业技能。
最后,对于那些考虑从事数据科学工作或开始学习的人来说,经常回顾一下你无疑会遇到的维恩图可能会对你有很好的帮助。它将数据科学描述为统计学、编程和领域知识的汇合。尽管每一个都占有相等份额的相交面积,但有些可能会保证比其他的更高的权重。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在企业数据化运营体系中,同比、环比分析是洞察业务趋势、评估运营效果的核心手段。同比(与上年同期对比)可消除季节性波动影响 ...
2025-12-19在数字化时代,用户已成为企业竞争的核心资产,而“理解用户”则是激活这一资产的关键。用户行为分析系统(User Behavior Analys ...
2025-12-19在数字化转型的深水区,企业对数据价值的挖掘不再局限于零散的分析项目,而是转向“体系化运营”——数据治理体系作为保障数据全 ...
2025-12-19在数据科学的工具箱中,析因分析(Factor Analysis, FA)、聚类分析(Clustering Analysis)与主成分分析(Principal Component ...
2025-12-18自2017年《Attention Is All You Need》一文问世以来,Transformer模型凭借自注意力机制的强大建模能力,在NLP、CV、语音等领域 ...
2025-12-18在CDA(Certified Data Analyst)数据分析师的时间序列分析工作中,常面临这样的困惑:某电商平台月度销售额增长20%,但增长是来 ...
2025-12-18在机器学习实践中,“超小数据集”(通常指样本量从几十到几百,远小于模型参数规模)是绕不开的场景——医疗领域的罕见病数据、 ...
2025-12-17数据仓库作为企业决策分析的“数据中枢”,其价值完全依赖于数据质量——若输入的是缺失、重复、不一致的“脏数据”,后续的建模 ...
2025-12-17在CDA(Certified Data Analyst)数据分析师的日常工作中,“随时间变化的数据”无处不在——零售企业的每日销售额、互联网平台 ...
2025-12-17在休闲游戏的运营体系中,次日留存率是当之无愧的“生死线”——它不仅是衡量产品核心吸引力的首个关键指标,更直接决定了后续LT ...
2025-12-16在数字化转型浪潮中,“以用户为中心”已成为企业的核心经营理念,而用户画像则是企业洞察用户、精准决策的“核心工具”。然而, ...
2025-12-16在零售行业从“流量争夺”转向“价值深耕”的演进中,塔吉特百货(Target)以两场标志性实践树立了行业标杆——2000年后的孕妇精 ...
2025-12-15在统计学领域,二项分布与卡方检验是两个高频出现的概念,二者都常用于处理离散数据,因此常被初学者混淆。但本质上,二项分布是 ...
2025-12-15在CDA(Certified Data Analyst)数据分析师的工作链路中,“标签加工”是连接原始数据与业务应用的关键环节。企业积累的用户行 ...
2025-12-15在Python开发中,HTTP请求是与外部服务交互的核心场景——调用第三方API、对接微服务、爬取数据等都离不开它。虽然requests库已 ...
2025-12-12在数据驱动决策中,“数据波动大不大”是高频问题——零售店长关心日销售额是否稳定,工厂管理者关注产品尺寸偏差是否可控,基金 ...
2025-12-12在CDA(Certified Data Analyst)数据分析师的能力矩阵中,数据查询语言(SQL)是贯穿工作全流程的“核心工具”。无论是从数据库 ...
2025-12-12很多小伙伴都在问CDA考试的问题,以下是结合 2025 年最新政策与行业动态更新的 CDA 数据分析师认证考试 Q&A,覆盖考试内容、报考 ...
2025-12-11在Excel数据可视化中,柱形图因直观展示数据差异的优势被广泛使用,而背景色设置绝非简单的“换颜色”——合理的背景色能突出核 ...
2025-12-11在科研实验、商业分析或医学研究中,我们常需要判断“两组数据的差异是真实存在,还是偶然波动”——比如“新降压药的效果是否优 ...
2025-12-11