当获得一份数据集时,你会怎么做? 立马撩起袖管进行分析么?这不是一个好建议。无数的经验告诉我们,如果分析师不先行了解数据集的质量,后续的推断分析是事倍功半的。 正确的处理方法是先 ...
2017-04-07
《釜山行》是一部丧尸灾难片,其人物少、关系简单,非常适合我们学习文本处理。这个项目将介绍共现在关系中的提取,使用 R 编写代码实现对《釜山行》文本的人物关系进行分析 使用到的R包 li ...
2017-04-06来自 Glassdoor 的最新数据可以告诉我们各大科技公司最近在招聘面试时最喜欢向候选人提什么问题。首先有一个令人惋惜的结论:根据统计,几乎所有的公司都有着自己的不同风格。由于 Glassdoor 允许匿名提交内容,很 ...
2017-04-05
前言 在大数据时代,很多公司开始利用数据、分析数据,以协助自己做出正确的市场决策。数据的来源多种多样,而社交媒体是一个重要的数据来源渠道。那么国外的公司是如何挖掘社交媒体数据的呢? 在小学 ...
2017-03-31
本文使用银联智惠信息服务(上海)有限公司 提供的2016年线下城市消费力大数据,对中国的地域差异进行了一个小小的研究。 选取了全国 300 余个地级市作为研究对象,并以城市发展水平和所属地理区位对城 ...
2017-03-30
概述 HBase 是一个开源的非关系型分布式数据库(NoSQL),基于谷歌的 BigTable 建模,是一个高可靠性、高性能、高伸缩的分布式存储系统,使用 HBase 技术可在廉价 PC Server 上搭建起大规模结构化 ...
2017-03-29
各类 paper 是有一定的借鉴意义的,不过这主要是学术界在单个问题上的细化,要真正从研究领域落地到大数据的处理还有很多工作要做。 一、工程上的处理流程 工程上的处理流程具体包括 ...
2017-03-28
前言 工作和家庭难以兼顾吗?美国程序员小哥实力演绎如何在带娃的同时,在一年内获得五项开发者认证和第二学位的。 我边工作边带娃的场景 CD Baby 的创始人 Derek Sivers 曾说:“所 ...
2017-03-27
于是我希望,在七周成为数据分析师的系列后,把数据化运营作为第二个系列来完成。每次写文章,对自己也是一种总结和提升。 下面是一份「简略」的大纲,更恰当地说是草稿。当不久的将来开始正式写 ...
2017-03-23
[泰坦尼克号问题之背景] 就是那个大家都熟悉的『Jack and Rose』的故事,豪华游艇倒了,大家都惊恐逃生,可是救生艇的数量有限,无法人人都有,副船长发话了『lady and kid first!』,所以是否获救其实 ...
2017-03-22
1、电视媒体 大数据应用案例之电视媒体——对于体育爱好者,追踪电视播放的最新运动赛事几乎是一件不可能的事情,因为有超过上百个赛事在 8000 多个电视频道播出。而现在市面上有开发者开发了一个 ...
2017-03-21
1.北漂都是哪里人 根据第六次全国人口普查数据,北漂的来源地有非常明显的特征—— 其实只看该省入京的绝对数量,已经基本能发现一些端倪,但还不够确信。我们再加上一个数据佐证,即“流入北京人口占当 ...
2017-03-20
最近有篇31岁员工因PPT做的太丑而被公司炒了的消息火了朋友圈, 看到这条消息后艺术细胞极端匮乏如作者的奇葩网店数据分析员小奇开始坐立不安了。因为明天就是向老板汇报去年网店运营销售情况的日子, ...
2017-03-17
Growth Hacking 这个词在过去一两年开始迅速从硅谷传播到国内,也诞生了一系列专注于企业数据分析业务的明星初创公司,如 GrowingIO,神策数据,诸葛IO 等。 Growth Hacking 简单的来说就是用数据驱动的方式 ...
2017-03-16
这次,罂粟姐姐悄悄告诉你们 Excel 数据透视表的 10 个秘密。当然,如果有 1 个及以上的秘密是你之前不知道的,就果断打赏转发吧。(如果你全知道,呃……大神求带~) 1、手动刷新和定时刷新 ...
2017-03-15
我们都熟悉“人工智能”这一概念。毕竟,这个词常常在热门电影中出现,如《终结者》、《黑客帝国》、《机械姬》。 但最近你也可能常常听到其他术语,如“机器学习”和“深度学习”,这些词有时与人工智能交 ...
2017-03-14
数据科学是一个蓬勃发展的产业,相关大数据的职业也成为热门,给人才发展带来带来了很多机会。数据科学家、数据工程师等已经成为大数据行业最热门的职位。今天让我们先来看一下这两种职业之间的区别,具体的工作, ...
2017-03-13
本篇内容主要是面向机器学习初学者,介绍常见的机器学习算法,当然,欢迎同行交流。 哲学要回答的基本问题是从哪里来、我是谁、到哪里去,寻找答案的过程或许可以借鉴机器学习的套路:组织数据->挖掘知识->预测未来。 ...
2017-03-10
Fairygodboss 通过对美国职场女性的调查,同时结合著名研究机构的研究数据,发布了一份 50 多页的 16 年女性工作现状调查报告,以下是内容的节选。研究结果涉及到女性工作现状的方方面面,并且对从企 ...
2017-03-09
概述:本文基于 R 语言,通过一个逻辑回归构建汽车贷款申请信用评级的案例,来为大家简单介绍信用风险模型及建模流程、R 语言实现、及中间需要注意的一些问题。包含的主要内容有以下几部分: ● 信用 ...
2017-03-08教材入口:https://edu.cda.cn/goods/show/3151 “纲举目张,执本末从。” 若想在数据分析领域有所收获,一套合适的学习教材至 ...
2025-11-04【2025最新版】CDA考试教材:CDA教材一级:商业数据分析(2025)__商业数据分析_cda教材_考试教材 (cdaglobal.com) ...
2025-11-04在数字化时代,数据挖掘不再是实验室里的技术探索,而是驱动商业决策的核心能力 —— 它能从海量数据中挖掘出 “降低成本、提升 ...
2025-11-04在 DDPM(Denoising Diffusion Probabilistic Models)训练过程中,开发者最常困惑的问题莫过于:“我的模型 loss 降到多少才算 ...
2025-11-04在 CDA(Certified Data Analyst)数据分析师的工作中,“无监督样本分组” 是高频需求 —— 例如 “将用户按行为特征分为高价值 ...
2025-11-04当沃尔玛数据分析师首次发现 “啤酒与尿布” 的高频共现规律时,他们揭开了数据挖掘最迷人的面纱 —— 那些隐藏在消费行为背后 ...
2025-11-03这个问题精准切中了配对样本统计检验的核心差异点,理解二者区别是避免统计方法误用的关键。核心结论是:stats.ttest_rel(配对 ...
2025-11-03在 CDA(Certified Data Analyst)数据分析师的工作中,“高维数据的潜在规律挖掘” 是进阶需求 —— 例如用户行为包含 “浏览次 ...
2025-11-03在 MySQL 数据查询中,“按顺序计数” 是高频需求 —— 例如 “统计近 7 天每日订单量”“按用户 ID 顺序展示消费记录”“按产品 ...
2025-10-31在数据分析中,“累计百分比” 是衡量 “部分与整体关系” 的核心指标 —— 它通过 “逐步累加的占比”,直观呈现数据的分布特征 ...
2025-10-31在 CDA(Certified Data Analyst)数据分析师的工作中,“二分类预测” 是高频需求 —— 例如 “预测用户是否会流失”“判断客户 ...
2025-10-31在 MySQL 实际应用中,“频繁写入同一表” 是常见场景 —— 如实时日志存储(用户操作日志、系统运行日志)、高频交易记录(支付 ...
2025-10-30为帮助教育工作者、研究者科学分析 “班级规模” 与 “平均成绩” 的关联关系,我将从相关系数的核心定义与类型切入,详解 “数 ...
2025-10-30对 CDA(Certified Data Analyst)数据分析师而言,“相关系数” 不是简单的数字计算,而是 “从业务问题出发,量化变量间关联强 ...
2025-10-30在构建前向神经网络(Feedforward Neural Network,简称 FNN)时,“隐藏层数目设多少?每个隐藏层该放多少个神经元?” 是每个 ...
2025-10-29这个问题切中了 Excel 用户的常见困惑 —— 将 “数据可视化工具” 与 “数据挖掘算法” 的功能边界混淆。核心结论是:Excel 透 ...
2025-10-29在 CDA(Certified Data Analyst)数据分析师的工作中,“多组数据差异验证” 是高频需求 —— 例如 “3 家门店的销售额是否有显 ...
2025-10-29在数据分析中,“正态分布” 是许多统计方法(如 t 检验、方差分析、线性回归)的核心假设 —— 数据符合正态分布时,统计检验的 ...
2025-10-28箱线图(Box Plot)作为展示数据分布的核心统计图表,能直观呈现数据的中位数、四分位数、离散程度与异常值,是质量控制、实验分 ...
2025-10-28在 CDA(Certified Data Analyst)数据分析师的工作中,“分类变量关联分析” 是高频需求 —— 例如 “用户性别是否影响支付方式 ...
2025-10-28