京公网安备 11010802034615号
经营许可证编号:京B2-20210330
他说数据科学家就是做算术的,还说这是件好事
两年前,一项来自LinkedIn的调查结果显示,“统计分析和数据挖掘”是2014年最大的求职法宝。在大数据技术飞速发展的今天,数据科学家成了炙手可热的大红人。
数据科学家是谁?干嘛的?他们好找工作吗?
度娘说,
666的样子啊。不过太严肃了,我都没听懂,and what about you?
还有一种听起来就像人话的多了,
“你擅长数学,会用Python编程,而且还对某个行业了如指掌?如果你拥有这样的技能集,那你就有可能当上数据科学家。”
嗯,“技能集”。技能集?!能吃吗?
是不是对当上数据科学家再不敢奢望,但如果我告诉你,有一些看上去站着说话不腰疼的人说了这样的话,
“ 数据科学家大多只做算术,这是件好事。”
比如这位——在Basecamp(37signals公司旗下一款项目管理软件 )团队工作的Noah。很多时候他被人称为“数据科学家”,但在他自己看来,大部分情况下他只是做做算术,而且他也很喜欢。
这是Noah在过去几周里所做的一些工作,每一项都是为了应对Basecamp在实际业务中面临的问题:
分析来自不同国家用户的对话内容、试用完成度和平均帐单数量 确定人们当人们登录至一个现有帐户时偶然注册Basecamp的比例,以及长期以来这个现象的变化情况 分析和报告一些Basecamp产品的财务业绩 对帐户所有者进行调查并分析 对一项影响Basecamp用户行为特征的AB测试进行分析
在过去的两周里,Noah所做过的最“复杂”的数学是一些有力的分析和重要测试。他工作的大部分是写SQL queries 来获取数据,对数据进行基本的运算(计算差异,百分比等),绘制结果,并写下注释或建议。
注意昂~可没有编码任何算法、构建推荐引擎昂~也没有部署深度学习系统,或是建立一个神经网络昂~
为什么没有?可能因为现在 Basecamp 还不需要那些东西吧。
在繁花似锦的“数据科学”下有个不怎么光彩的小秘密,那就是大多数人谈论的所谓的数据科学,并不是企业实际需要的东西。企业需要的是准确和可操作的信息,来帮助他们决定如何花费他们的时间和资源。通常一个通过机器学习解决业务中小问题的最佳解决方案,往往只需要高质量的数据,以及一个如何使用最简单的方法解决问题的理念。
也行有人会说,Noah描述的价值并不来自“数据科学”,而是“商业智能”或“数据分析”。我没有资格对数据妄下主观定义,但不管你叫它什么 - 它仍然是对那些花费时间从事数据工作的人,最有价值的方式。
在Noah他们那儿,相当多希望进入“数据科学”领域的朋友都给他发来邮件,希望得到一些建议。在这些邮件中不乏这样的问题:
Dear诺亚,我是应该先得到一个硕士学位?还是应该参加一堆Kaggle比赛?
Noah的建议非常简单:兄弟,都不用。你就学习最基础的数学就行了。然后你再知道如何编写基本的SQL查询,了解企业的经营方式,以及想要成功它需要什么。如果你想成为一名对企业有价值的贡献者,就利用你的周末时间真正进入一家小企业“体验生活”,实际工作一把,而不是参加什么数据挖掘竞赛。去与客户交谈,去注意哪些产品畅销,哪些没有。去试着想想推动业务的经济形式,以及你如何能帮助它更得更多的成功。
所以,知道问题是什么才是迈入精英数据科学家梯队的关键一步。但不要那么傻白甜,因为上面说的技能集,该攒还是得攒!
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数字化转型全面渗透的产业背景下,数据分析已成为互联网、金融、零售、制造等几乎所有行业的核心岗位能力。很多初学者对数据分 ...
2026-06-23在企业并购、股权定价、投融资评估、资产核算等资本市场核心场景中,市场法是应用最广泛、市场认可度最高的企业价值评估方法。传 ...
2026-06-23 许多数据分析师精通Excel函数和SQL查询,但当面对一张上万行的销售明细表,要快速回答“哪个地区销量最高”“哪款产品增长最 ...
2026-06-23【核心关键词】运营、证书、金融、客户、产品、软件、销售额、量化、科技、数据分析、金融行业、证券类软件、业务流程、金融机 ...
2026-06-22在企业方案选型、产品迭代评审、供应商筛选、运营效果复盘等决策场景中,单一指标的优劣判断往往无法支撑科学决策。一套转化效果 ...
2026-06-22 很多数据分析师掌握了Excel函数、会写SQL查询,但当被问到“数据从哪里来”“数据加工有哪些步骤”“如何使用分析工具连接数 ...
2026-06-22【核心关键词】软件、洞察力、大数据、产品、经验、硬件、流量、创新、决策、数据安全、网络安全、数据分析、决策制定、数据挖 ...
2026-06-18在方案选型、效果复盘、产品评估、供应商筛选等各类业务决策场景中,仅凭单一指标下结论往往会陷入 “以偏概全” 的误区。多维度 ...
2026-06-18 很多数据分析师精通Excel单元格操作,但当被问到“表结构数据的基本处理单位是什么”“字段和记录的本质区别”“为什么表结 ...
2026-06-18在数据分析、用户运营与业务增长的工作体系中,漏斗拆解是最基础也最高频的问题定位方法。很多业务场景下,我们只能看到最终的转 ...
2026-06-17在数据库开发、数据清洗与报表统计场景中,数值类型转换为日期是高频刚需操作。业务系统常以 Unix 时间戳、整型日期(如20240617 ...
2026-06-17 数据分析师八成以上的时间在和数据表格打交道,但许多人拿到Excel后习惯性地先算、先分析,结果回头发现漏了一列关键数据, ...
2026-06-17【核心关键词】数据库、电商、知识、产品、数据产品、监管业务、产品经理、业务系统、用户行为分析、用户分析、数据分析、电商 ...
2026-06-16在 Python 动态类型与面向对象的编程体系中,变量定义与类实例化是构建代码逻辑的两大核心基石。变量是数据存储、传递与运算的基 ...
2026-06-16 很多数据分析师每天与Excel打交道,但当被问到“表格结构数据和表结构数据有什么区别”“数据类型误判会引发哪些分析错误” ...
2026-06-16在 MySQL 查询性能优化体系中,索引是降低查询耗时、提升数据库吞吐的核心手段。其中联合索引与覆盖索引是实际开发中最高频的两 ...
2026-06-15在数据仓库建设与商业智能分析体系中,维度建模是应用最广泛的建模方法论,而事实表与维度表是维度建模的两大核心构件,共同构成 ...
2026-06-15 很多数据分析师能熟练计算指标,但当被问到“这家企业的核心业务目标是什么”“如何把模糊的战略目标拆解为可量化的指标”“ ...
2026-06-15在数据分析、业务监控、运营复盘等场景中,列值趋势计算是核心需求之一。无论是分析销售额的月度增长、用户活跃的变化趋势、库存 ...
2026-06-12在数字经济深度渗透的当下,消费者的购买行为已从过去的 “被动接受” 转变为 “主动决策”。流量红利消退、获客成本攀升、用户 ...
2026-06-12