京公网安备 11010802034615号
经营许可证编号:京B2-20210330
对于数据科学领域来说,现在是一个令人振奋的时期。它是新兴的研究领域,但是却在飞速的发展。如今数据科学领域需要大量的数据科学家,而他们在硅谷年人均收入则超过10万美元。哪里有优厚的薪酬,哪里就会有相当多的人会尽可能的拿到这样的薪酬。而数据科学技能的不足意味着很多人都要学习或者尝试着学习数据科学。
学习数据科学的第一步通常都是问问自己:我要怎样学习数据科学?这个问题的回复是我们要上一系列的课程和阅读一些书籍,并且我们需要先从线性代数或统计学开始学习。一年前,在学习过程中我也有过类似的经历。当时我不懂编程,但是我知道我想要从事数据领域。
我难以解释在只给了一个很大的没有任何说明的资源库目录下极其不明确的方向情况下怎样学习数据科学的,好比我的老师直接给我一叠相关的教材并说“把这些书全部读完”。在上学期间我曾为此而苦恼过。如果我是以这样的方式来学习数据科学,我肯定不久就会放弃。
有些人认为读一些相关书籍是最好的学习方式,而我则认为尝试建模和实践里面的东西是最好的学习方式。此时,这学习的过程鼓舞着我,同时我也清楚自己为什么要学。总之,最好的学习方式就是当你在学习它的时候,你可以立即使用有效的技能。从我和初学者这些年的交谈中,我知道很多这些想法的分享。
这就是我为什么不建议你在入门的时候学习线性代数或统计学了。如果你想要学好数据科学,你首先就应该要学会如何热爱数据,对怎样理解它深感兴趣。
通过阅读以下内容让你明白应该如何熟练掌握数据科学。
一个你可在数据科学领域进行的可视化操作例子(来源经济刊物)。
学会如何爱上数据
几乎没有人会谈到学习的动机。数据科学是一门宽泛且模糊的领域,这让你感到无从下手,真的很难。没有学习它的动机,你会在学习过程中半途而废,并开始认为你学不下去了,其实错不在你-与教学相关。
你需要一些东西能激发你不断学习的欲望,甚至在午夜时分,你开始认为这些公式看起来都觉得模糊的时候,你此时在思考如果这些公式能让我在夜晚的时候通过我的神经网络系统琢磨出其中的名堂。
此时你需要一些东西可以让你找到线性代数、统计学和神经网络系统之间的联系,而且可以让你不再犹豫我下一步我该学些什么。
而我学习数据科学的切入点是如何分析股市行情,尽管在那时我还不清楚它是什么。一些我曾编写过如何预测股市行情的程序代码是没有涉及统计学的。但我清楚我目前所做的努力还不够,仍需要日以夜际的完善其功能。
当时我在为了不断的完善我的编程能力而废寝忘食。我对股票市场为之着迷。我在学着如何热爱数据。也正因如此,我不断的被激励着去学习任何能让我程序更好的知识。
我知道,不是所有人都对股市行情的预测为之着迷,但是需找一些你想要学习的知识是相当重要的。
在此,我们可以试着了解一些关于你的城市中新奇而有趣的问题、在网上映射所有设备、发现每一位NBA球员所打的位置、在地图上显示每年难民的分布情况,甚至其它一些相关的东西。数据科学伟大之处就是你可以在工作的过程中找到无限的乐趣,它们都是提出问题并获得解决问题的过程。
你可在此随心所欲的做一切你想做的事,而且保证不受周围环境的干扰。
2.在实践的过程中学习
学习一些与神经网络系统、图像识别以及其尖端科技相关的内容是很重要的。然而很多数据科学知识并不涉及以下内容:
l 90%的工作将会是数据清洗。
l 深入了解几个算法远胜于对很多算法只懂一点点。
如果你熟练的掌握线性回归分析,k均值聚类分析,以及逻辑回归分析,能够解释和理解结果,且利用它们来很好的完成你需要做的项目,与你只知道任何单个算法,且不知道用它们对比,你会觉的将更有能力。
l 很多时候,你所使用的算法,它会变成函数库的一种形式(你几乎不需要写你的SVM-这需要耗费你相当长的时间)。
综上所述,学习数据科学的最好方式就是学习如何完成一个项目。通过完成一个项目,你会获得一些立即实用且有效的技能。你也有一个不错的方式构建工程组。
开启项目之旅需要你找到一个喜欢的数据集,从数据集里解决一些感兴趣的问题,并重复上述步骤。
这里有一些相关链接可以让你找到能运用到你做项目的数据集。
100+ 有趣统计数据集
数据集子板
机器学习数据库
另一种方法(也就是我所使用的方法)就是需找一个深层次的问题,预测股市行情,并把它们分解成若干个小问题。我首先连接到雅虎的经济API(应用程序接口),并获取每日价格数据。然后我在此基础上创建一些指标,用于显示过去几天的平均价格,同时一次来预测未来的走势(这里没有用到真实的算法,仅方法分析而已)。然后效果并不是很明显,因此我要学习一些统计学的内容,然后使用线性回归分析。然后我再连接到其他API应用程序接口,并爬取每一分钟的数据,把它们存储到SQL数据库中。然后不断重复操作,直到选出一个合适的算法。
关于这些最棒的事情是学习的内容。我并不仅是学习SQL的相关句法,同时还应用他们来储存价格数据,并且所学习到的内容是单纯学习SQL语句的10倍。学习这些知识而不去运用的话你会很难熟练掌握这些知识,而且你也没有做足准备来完成一个真正意义上的数据科学工作。
这些家伙尝试预测股票行情,显然需要一些数据科学。
3.学会与他人交流心得
数据科学家经常需要把他们分析出来的结果展示给其他人看。而这样的工作技能可以在一定程度上区分是一个一般数据科学家还是一个伟大数据科学家。
交流心得的一部分在于需要我们理解一个项目的主题及其理论,而另一部分则是明白如何清晰的整理结果。这最后一小部分则是能清楚地解释你分析出来的结果。
也许做到有效且到位的传达一个复杂而抽象的概念是非常困难的,但是你可以尝试以下几点:
创建一个博客。把你的数据分析结果写到你的博客上。
尝试去教你那些不懂技术的朋友以及家人一些数据科学的相关概念。你会惊讶的发现你在赐教的过程中能大大的帮助你理解这些概念。
尝试在聚会中说出一些与其相关的内容。
尝试用Github管理你所有的分析。
尝试活跃在Quora,DataTau,以及机器学习子书签社区。
4.从同行学习
你可以在与别人的合作中学到非常多的知识。在数据科学领域,团队合作完成项目相当重要。
这里有一些不错的想法:
可以在用户间的聚会中找一些能与你共事的人。
可对开源包作以份贡献。
可以给一些曾经写过一些有趣的数据分析博客的并能与你合作的人发消息。
可以尝试在keggle,一个机器学习竞赛平台上参与其中,并且看一下你是否能从中找到一个可以和你组队的人。
5.不断的增加工作的难度
你是否会感觉到你在完成一个项目时会感到如此的安逸和放松?这是否会是你最后一次使用一个星期前更新的概念?是时候要做一些有难度的项目了。数据科学犹如你要攀登一座陡峭的山峰,如果你停止前进,你会很容易失败。
如果你觉得你现阶段过得如此安逸,这里有几个建议:
尝试使用一个更大的数据集,学习和使用Spark。
看一下你是否能使用一个运行时间更少的算法。
想想如何把你的算法扩展到多处理器?你可以做到吗?
多掌握一些你所常用的算法的相关理论。它会改变你的假设吗?
尝试教导新手做一些你在做的事情。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在主成分分析(PCA)的学习与实践中,“主成分载荷矩阵”和“成分矩阵”是两个高频出现但极易混淆的核心概念。两者均是主成分分 ...
2026-01-07在教学管理、学生成绩分析场景中,成绩分布图是直观呈现成绩分布规律的核心工具——通过图表能快速看出成绩集中区间、高分/低分 ...
2026-01-07在数据分析师的工作闭环中,数据探索与统计分析是连接原始数据与业务洞察的关键环节。CDA(Certified Data Analyst)作为具备专 ...
2026-01-07在数据处理与可视化场景中,将Python分析后的结果导出为Excel文件是高频需求。而通过设置单元格颜色,能让Excel中的数据更具层次 ...
2026-01-06在企业运营、业务监控、数据分析等场景中,指标波动是常态——无论是日营收的突然下滑、用户活跃度的骤升,还是产品故障率的异常 ...
2026-01-06在数据驱动的建模与分析场景中,“数据决定上限,特征决定下限”已成为行业共识。原始数据经过采集、清洗后,往往难以直接支撑模 ...
2026-01-06在Python文件操作场景中,批量处理文件、遍历目录树是高频需求——无论是统计某文件夹下的文件数量、筛选特定类型文件,还是批量 ...
2026-01-05在神经网络模型训练过程中,开发者最担心的问题之一,莫过于“训练误差突然增大”——前几轮还平稳下降的损失值(Loss),突然在 ...
2026-01-05在数据驱动的业务场景中,“垃圾数据进,垃圾结果出”是永恒的警示。企业收集的数据往往存在缺失、异常、重复、格式混乱等问题, ...
2026-01-05在数字化时代,用户行为数据已成为企业的核心资产之一。从用户打开APP的首次点击,到浏览页面的停留时长,再到最终的购买决策、 ...
2026-01-04在数据分析领域,数据稳定性是衡量数据质量的核心维度之一,直接决定了分析结果的可靠性与决策价值。稳定的数据能反映事物的固有 ...
2026-01-04在CDA(Certified Data Analyst)数据分析师的工作链路中,数据读取是连接原始数据与后续分析的关键桥梁。如果说数据采集是“获 ...
2026-01-04尊敬的考生: 您好! 我们诚挚通知您,CDA Level III 考试大纲将于 2025 年 12 月 31 日实施重大更新,并正式启用,2026年3月考 ...
2025-12-31“字如其人”的传统认知,让不少“手残党”在需要签名的场景中倍感尴尬——商务签约时的签名歪歪扭扭,朋友聚会的签名墙不敢落笔 ...
2025-12-31在多元统计分析的因子分析中,“得分系数”是连接原始观测指标与潜在因子的关键纽带,其核心作用是将多个相关性较高的原始指标, ...
2025-12-31对CDA(Certified Data Analyst)数据分析师而言,高质量的数据是开展后续分析、挖掘业务价值的基础,而数据采集作为数据链路的 ...
2025-12-31在中介效应分析(或路径分析)中,间接效应是衡量“自变量通过中介变量影响因变量”这一间接路径强度与方向的核心指标。不同于直 ...
2025-12-30数据透视表是数据分析中高效汇总、多维度分析数据的核心工具,能快速将杂乱数据转化为结构化的汇总报表。在实际分析场景中,我们 ...
2025-12-30在金融投资、商业运营、用户增长等数据密集型领域,量化策略凭借“数据驱动、逻辑可验证、执行标准化”的优势,成为企业提升决策 ...
2025-12-30CDA(Certified Data Analyst),是在数字经济大背景和人工智能时代趋势下,源自中国,走向世界,面向全行业的专业技能认证,旨 ...
2025-12-29