
13招神技 让你在数据科学和数据分析工作中脱颖而出
文 | Tavish Srivastava
翻译 | 36大数据翻译组-望天
来自36大数据
我有幸在很早参与了一个大数据科学项目,我非常喜欢其中的工作,甚至我意识到我的努力可以增加一些公司的价值。
然而,可悲的是,只有不到30%的数据科学项目最终实施了。我备受打击的意识到我的努力被浪费了。但是,我不是唯一的一个。几乎,每一个分析家都有同样失望的感觉。
即使在今天,数据科学行业面临的真正挑战是企业和分析人员之间缺乏协调。令我惊讶的是,我甚至注意到,这些人更喜欢坐在同一个办公室里坐在一起。
如果这两种技能的专业人士很普遍,我们就可以看到一个实施可能性更高的项目。在过去的四年里,我花了很多时间思考使一个项目成功的最佳实践。
我发现,如果有个对症的人坐在你的办公室,他能明确定义业务问题,并且诱导你突破思维定式,你将突破管窥限制。
因此,你在数据科学/分析工作中正在取得成功时,我建议你遵循下面提到的提示。这些都是尝试和测试的总结。为了获得最大的利益,我建议你遵守。我从他们身上已经受益。现在轮到你了!
以下是优先顺序
在你开始解决问题之前请先掌握业务
我知道你是一个数据分析师,所有你关心的都是数字。但是,一个令人敬畏的业务分析师和一般数据分析师有哪些不同呢?那就是他们对业务理解的潜质。你应该在开始你的第一个项目之前试着去了解企业。下面是一些你应该需要探索的东西:
客户信息:活动客户总数,月客户流失,业务上的业务组合定义。
经营策略:我们如何获得新客户,渠道有哪些?我们如何留住有价值的客户?
产品信息:你的客户如何被你的产品吸引?你如何通过你的产品赚钱?你的产品是直接盈利者还是媒介工具?
如果你能回答这些问题,你对开始你的第一个项目已入门。
想想你是正在解决一个潜在问题,还是只是一个结果
我观察到,分析师瞄准的甚至不是问题的主要目标。例如,让我们想象一下,我们发现,一个客户在拨打客户服务电话,谈话更多的是他在放弃服务。
现在,如果我们开始解决降低客户服务的呼叫数量的方法,我们可能不会降低流失率。相反,在你没有过失的情况下,我已经看到你客户较高的不满。这可能是一个简单的致命伤,你会拒绝进入这种简单的陷阱。但是,现实生活中的问题几乎难以发现。我想说,解决一个明确的问题要比找到解决问题的正确方法要容易的多。
花费更多的时间在找到正确的评估指标和完成工作需要的必备条件
这个可能是对分析师来说是非常容易解决的一个难题,但也是最容易导致失败的一个陷阱。让我用几个简单例子来做解释。
假设,你将要建一个营销活动的目标模型,你将选择哪个指标来评估你的模型:
KS正态分布统计
等分提升指数
AUC-ROC曲线
Log-Likelihood 对数似然数
在这种模型中,我常会选择KS正态分布曲线。等分提升指数只能给你在某个特定等分的评估,因此,它可能不会帮助我们找到巨大的目标人群和突破点。AUC-ROC曲线可以对整体人群评估,不适合在这个模型中。对数似然数可能是最大的最不适合这个模型,因为所有的事情是顺序排名而不是实际概率。
使用发散-收敛的思维过程,以避免过早收敛
我已经看到这在许多行业是最大的问题。当今的商界领袖在他们所做的一切中寻求创新。
要真正的创新,您可以遵从发散-收敛的系统方法。在某种程度上,你需要对将要到来的进行发散思维,通过这种方法你得到更多的经验。我们的意思是想所有的可能方式,在可行性、时间发展、传统方式等各个方面破解难题。但是,你确信你已经发散到足够大了,你需要立即应用所有的约束条件来缩小方法。
打破行业壁垒想到替代解决方案
分析正在使用在每一个可能的行业中。但是,为什么我们不能超越传统的方法,在其他行业寻找解决方案?
例如,一个应用于电子商务行业的推荐视频解决方案可以像Analytics Vidhya公司在博客门户使用一样好。唯一的方法就是与其他行业的人进行互动,通过分析来学习他们奋斗的成果。
与业务伙伴共同前行
从你的分析事业的第一天起,你应该与业务伙伴进行互动。我常常会看到一件一般会出错的事,分析师和业务伙伴就解决方案交流很不频繁,业务合作伙伴想远离技术细节从业务角度进行分析,这确实对项目不利。在模型实施和模型建模中保持持续的互动是非常重要的。
思考最简单的让你的想法落地的方案
我知道你是一个数据分析师,喜欢用复杂的想法让业务人士迷惑。和业务人士使用如此复杂的讨论可以帮助你快速结束眼前的谈话,但会降低成功实施的可能性
以下是你需要做的:一旦你输出一个指标,尽量找出一个简单的方式,可以让企业更容易理解。让我给你这个方法的一个例子。我们试图找出那些一旦有机会,就可以做的非常好的代理商,我们想出不同层次的人群和他们预期的表现。然而,我们不得不选择一个可以区分人群组合的方式。我们所做的很简单:我们实施了差别收费策略,以改变申请人的组合和我们群体的组合。
当做一个业务组件的时候,确保你把它放到它们的语言场景中
目标指标永远不是你分析的最终产品。它只是一个业务组件!因此,你需要在使你的想法更清晰和更有效而投入大量的精力。尝试学习能与你的听众更好连接在一起的术语,思考你的商业伙伴想寻找什么,假象你是他们的鞋子。
给企业领导做讲演的时候学会使用业务语言
我最近开始为我的一个项目学习中文。整个项目都非常简单,但我发现,即使有一个强大的模型,在销售它的时候我犯了个错误。原因是我对他们内部讨论的理解一篇空白。使用你的听众的语言是非常重要的。我看到非常简单的模型被赞赏和最聪明的模型被拒绝。唯一的区别是分析师在介绍他们的模型时使用的业务语言。
积极跟进落实计划
最后来的但不是最不重要的,一旦每个人都相信你的模型的有效性,会发生什么。你的工作还没有完成。建立每月项目跟进计划,了解项目如何实施,是否在正常的进行。
积极参与数据类的比赛
随着时间的发展,你会意识到一件事情:分析行业的变化非常快。然而,如果你是喜欢待在自己舒适区的一个人,你很快就会发现你的技能都过时了。我发现一个非常有用的方法就是参与数据类的科学竞赛,并与同行竞争/学习。 Kaggle 和Analytics Vidhya就是一些非常好的比赛。
通过博客和书本学习关于分析方面的最新工具和技术
《Programming Collective Intelligence》集体智慧编程
《Machine Learning for Hackers》黑客机器学习
《The Elements of Statistical Learning: Data Mining, Inference, and Prediction》统计学习的要素:数据挖掘、推理和预测
《Learning from Data》从数据中学习
《Pattern Recognition and Machine Learning》模式识别与机器学习
学习最新的工具,以了解什么是可能的,什么不是
走出你在SAS、R、 编程的安乐窝,试着学习最新的技术来掌握大数据,Spark和java将是我对入手的建议。
本文链接http://www.36dsj.com/archives/37512
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
R 语言:数据科学与科研领域的核心工具及优势解析 一、引言 在数据驱动决策的时代,无论是科研人员验证实验假设(如前文中的 T ...
2025-09-08T 检验在假设检验中的应用与实践 一、引言 在科研数据分析、医学实验验证、经济指标对比等领域,常常需要判断 “样本间的差异是 ...
2025-09-08在商业竞争日益激烈的当下,“用数据说话” 已从企业的 “加分项” 变为 “生存必需”。然而,零散的数据分析无法持续为业务赋能 ...
2025-09-08随机森林算法的核心特点:原理、优势与应用解析 在机器学习领域,随机森林(Random Forest)作为集成学习(Ensemble Learning) ...
2025-09-05Excel 区域名定义:从基础到进阶的高效应用指南 在 Excel 数据处理中,频繁引用单元格区域(如A2:A100、B3:D20)不仅容易出错, ...
2025-09-05CDA 数据分析师:以六大分析方法构建数据驱动业务的核心能力 在数据驱动决策成为企业共识的当下,CDA(Certified Data Analyst) ...
2025-09-05SQL 日期截取:从基础方法到业务实战的全维度解析 在数据处理与业务分析中,日期数据是连接 “业务行为” 与 “时间维度” 的核 ...
2025-09-04在卷积神经网络(CNN)的发展历程中,解决 “梯度消失”“特征复用不足”“模型参数冗余” 一直是核心命题。2017 年提出的密集连 ...
2025-09-04CDA 数据分析师:驾驭数据范式,释放数据价值 在数字化转型浪潮席卷全球的当下,数据已成为企业核心生产要素。而 CDA(Certified ...
2025-09-04K-Means 聚类:无监督学习中数据分群的核心算法 在数据分析领域,当我们面对海量无标签数据(如用户行为记录、商品属性数据、图 ...
2025-09-03特征值、特征向量与主成分:数据降维背后的线性代数逻辑 在机器学习、数据分析与信号处理领域,“降维” 是破解高维数据复杂性的 ...
2025-09-03CDA 数据分析师与数据分析:解锁数据价值的关键 在数字经济高速发展的今天,数据已成为企业核心资产与社会发展的重要驱动力。无 ...
2025-09-03解析 loss.backward ():深度学习中梯度汇总与同步的自动触发核心 在深度学习模型训练流程中,loss.backward()是连接 “前向计算 ...
2025-09-02要解答 “画 K-S 图时横轴是等距还是等频” 的问题,需先明确 K-S 图的核心用途(检验样本分布与理论分布的一致性),再结合横轴 ...
2025-09-02CDA 数据分析师:助力企业破解数据需求与数据分析需求难题 在数字化浪潮席卷全球的当下,数据已成为企业核心战略资产。无论是市 ...
2025-09-02Power BI 度量值实战:基于每月收入与税金占比计算累计税金分摊金额 在企业财务分析中,税金分摊是成本核算与利润统计的核心环节 ...
2025-09-01巧用 ALTER TABLE rent ADD INDEX:租房系统数据库性能优化实践 在租房管理系统中,rent表是核心业务表之一,通常存储租赁订单信 ...
2025-09-01CDA 数据分析师:企业数字化转型的核心引擎 —— 从能力落地到价值跃迁 当数字化转型从 “选择题” 变为企业生存的 “必答题”, ...
2025-09-01数据清洗工具全景指南:从入门到进阶的实操路径 在数据驱动决策的链条中,“数据清洗” 是决定后续分析与建模有效性的 “第一道 ...
2025-08-29机器学习中的参数优化:以预测结果为核心的闭环调优路径 在机器学习模型落地中,“参数” 是连接 “数据” 与 “预测结果” 的关 ...
2025-08-29