京公网安备 11010802034615号
经营许可证编号:京B2-20210330
很多数据分析师精通Excel函数和透视表,但当被问到“数据从哪里来”“表和视图有什么区别”“数据库管理系统和SQL是什么关系”时,却常常答不上来。在企业的真实工作场景中,数据很少是现成的Excel文件,而是存储在各类数据库中的结构化信息。掌握数据库的核心概念,是数据分析师从“会处理数据”走向“会获取数据”的必经之路。
”
小林是一名数据分析师,入职某零售企业后接到的第一个任务是:“从销售系统数据库中提取近3个月的订单明细数据”。小林打开数据库工具,面对那一排排陌生的表名和字段名,他发现——自己很清楚“分析Excel数据”该怎么算,却不知道“把数据从数据库里弄出来”的第一步是什么。
在企业环境中,数据资产几乎都沉淀在数据库中,而非现成的Excel文件。数据分析师日常工作中面临的“数据从哪来、怎么取、取完怎么用”等基础问题,都绕不开对数据库的理解。
数据库(Database)是一个有组织的数据集合,旨在高效地存储、管理和检索数据。数据库是存放企业数据资产的“核心大本营”,也是CDA数据分析师工作的“数据起点”。
根据数据模型的差异,数据库可分为关系型数据库和非关系型数据库。
关系型数据库(RDBMS) 是一种基于关系模型的数据库系统,使用结构化的表格来存储数据,表与表之间通过关系进行连接。典型代表:MySQL、Oracle、PostgreSQL、SQL Server等。核心优势:支持ACID事务(原子性、一致性、隔离性、持久性),适合复杂查询和事务密集型场景。例如金融系统对数据的准确性和完整性要求极高,会优先选择关系型数据库。适用场景:事务处理、数据管理、复杂查询等场景。
非关系型数据库(NoSQL) 是一类不使用传统关系模型来存储数据的数据库。分类:按存储结构可分为键值型(如Redis)、文档型(如MongoDB)、列族型(如Cassandra)、图型等。核心优势:水平扩展性强、读写性能高,适合海量数据、低延迟的场景。例如,Redis通过内存存储和单线程模型实现微秒级响应。适用场景:海量数据存储、高并发写入、灵活的数据结构。
在关系型数据库中,表(Table) 是数据的基本单位,由行和列组成。每一行代表一条记录,描述一个完整的业务事件;每一列代表一个字段,描述一种业务属性(如订单金额)。主键(Primary Key) 是表中唯一标识每一行的字段或字段组合,确保数据的唯一性,主键不能为空值。外键(Foreign Key) 是指向另一个表主键的字段,用于建立表与表之间的关系,维护数据的完整性。
在数据分析和多表查询中,主键始终是CDA分析师处理多表关联的“锚点”。
表是存储数据的实体容器,视图则是基于一个或多个表的查询结果构建的虚拟表。掌握表和视图的区别,是CDA一级“数据库应用”部分的明确考点要求。
数据表是数据库中用于物理存储数据的实体结构,相当于“数据档案柜”。核心特征:占用物理存储空间;数据独立存在;可直接修改数据内容。
视图是基于一个或多个表的查询结果构建的虚拟表,其本身不存储数据,仅在内部封装了查询语句。每次访问视图时,数据库会重新执行其关联的查询逻辑,返回最新的数据结果。
视图的主要作用:
| 对比维度 | 数据表 | 视图 | CDA选择建议 |
|---|---|---|---|
| 数据存储 | 物理存储数据,占用空间 | 仅存查询逻辑,不存数据 | 长期稳定数据→表;实时关联数据→视图 |
| 数据更新 | 可直接增删改查 | 操作受限制(聚合函数、去重场景无法修改) | 需修改数据→表;仅查询→视图 |
| 查询效率 | 直接读取数据 | 每次访问需动态执行查询语句 | 大数据量频繁访问→表;临时查询→视图 |
| 依赖关系 | 独立存在 | 依赖底层基本表,源表变化时视图自动更新 | 需动态数据→视图;稳定结构→表 |
SQL(结构化查询语言,Structured Query Language) 是操作关系型数据库的标准编程语言,几乎适用于所有的主流关系型数据库管理系统。
核心规则:SQL中可以使用表别名和列别名来增强代码可读性,但存在执行顺序限制。SQL语句的执行顺序为:FROM → JOIN → WHERE → GROUP BY → HAVING → SELECT → ORDER BY。别名在WHERE子句后计算,因此WHERE子句中不能使用列别名,但SELECT、FROM和JOIN子句中可以使用表别名。
熟知层要求能够选取需要的列、过滤重复的行、筛选符合条件的行。
SELECT 字段1, 字段2 FROM 表名; 仅查询必要字段能显著减少I/O开销。SELECT DISTINCT 字段 FROM 表名;1. 对查询结果排序(ORDER BY)与限制(LIMIT):SELECT … FROM … ORDER BY 字段名 ASC/DESC; 升序(ASC)或降序(DESC)排序。LIMIT子句用于限制返回记录数。
2. 在查询结果中创建新列(使用AS设置别名):SELECT 字段1, 字段1 * 0.5 AS ‘计算列名称’ FROM 表名;
3. 分组汇总和筛选(GROUP BY + HAVING):GROUP BY配合聚合函数实现数据分组(SUM求和、AVG平均值、COUNT计数、MAX最大值、MIN最小值)。HAVING子句在数据分组之后执行筛选。
WHERE在数据聚合前筛选原始数据行;HAVING在数据聚合后筛选分组后的结果。
4. 多表横向连接查询(JOIN考点) :在企业真实数据中,一张表的信息永远不够,必须连接多个表才能完成完整分析。考试要求重点掌握三种连接方式:
| 连接类型 | 核心逻辑 | 实际业务场景 |
|---|---|---|
| 内连接(INNER JOIN) | 只返回两张表中都匹配的记录 | 分析已付款的订单及其客户信息 |
| 左连接(LEFT JOIN) | 返回左表全部记录,右表匹配不上显示NULL | 保留所有用户,匹配其订单记录 |
| 右连接(RIGHT JOIN) | 返回右表全部记录,左表匹配不上显示NULL | 与左连接对称,应用较少 |
5. 多表纵向合并查询(UNION / UNION ALL) :UNION ALL合并结果集保留所有行(含重复行,速度快);UNION会对合并后的结果集执行去重操作。
6. 子查询(嵌套查询) :在SELECT内部嵌套另一个SELECT语句,通常与IN、NOT IN、EXISTS等关键字组合使用,解决“筛选条件依赖另一张表统计结果”的复杂问题。
DATABASE、DBMS与SQL三者是CDA一级考试中的一组核心关联概念。
你是某电商公司的CDA数据分析师。数据库中有三张核心表:
分析任务:筛选出近3个月的已支付订单,统计每个城市已支付订单的总金额(GMV),并筛选出GMV大于10万元的城市。
阶段一:数据获取与多表横向连接(INNER JOIN)
SELECT
u.city,
o.order_amt,
o.order_date
FROM orders o
INNER JOIN user u ON o.user_id = u.user_id
WHERE o.order_status = '已支付'
AND o.order_date >= DATE_SUB(CURDATE(), INTERVAL 3 MONTH);
阶段二:分组汇总与分组筛选(GROUP BY + HAVING)
SELECT
u.city,
SUM(o.order_amt) AS city_gmv
FROM orders o
INNER JOIN user u ON o.user_id = u.user_id
WHERE o.order_status = '已支付'
AND o.order_date >= DATE_SUB(CURDATE(), INTERVAL 3 MONTH)
GROUP BY u.city
HAVING city_gmv > 100000
ORDER BY city_gmv DESC;
关键考点:WHERE在分组之前筛选原始订单数据;GROUP BY按城市聚合;HAVING在聚合计算之后筛选结果;ORDER BY最终排序输出。这个完整流程覆盖了CDA一级要求的主要SQL核心语法,从数据连接到条件筛选、从分组汇总到筛选输出,展现了数据库查询在业务分析中的实际应用。
这就是一套完整的“数据连接 → 条件过滤 → 分组汇总 → 分组筛选 → 排序输出”的SQL实战流程。
”
很多数据分析师会写SELECT * FROM,但当被问到“表和视图有什么区别”“内连接和左连接分别适用什么场景”“GROUP BY和HAVING的执行顺序是什么”时,却答不上来。
2025年新考纲进一步强化了对SQL实际应用能力的考核,更侧重考查考生工作中的实际操作技能,确保认证价值与个人职业能力成长深度契合。新教材拓展了跨数据库通用查询语法,由旧版仅针对MySQL扩展到覆盖SQL Server等主流数据库,并强化了模型合理性检验等实战内容。
数据库应用(PART 8)是CDA一级“从数据接入走向分析输出”的全链路枢纽,将表结构处理、SQL查询与业务数据分析紧密衔接。这部分考核贯穿数据库分类的领会、表视图差异的熟记到SQL多表连接与子查询的综合应用,确保每一位CDA分析师都具备从企业核心数据库中高效、准确获取数据的核心能力。
下一步行动:
SELECT加聚合函数进行分组统计,熟悉GROUP BY和HAVING的执行顺序INNER JOIN和LEFT JOIN连接用户表和订单表,对比数据量增减逻辑差异数据库是企业数据的“心脏”,SQL是CDA数据分析师与这颗心脏对话的“标准语言”;掌握它们,你才能真正让数据为你所用。
”

数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
CDA数据分析师 出品 作者:李诗怡 定义区别 · 场景举例 · 指标分类 · 计算方法 知识体系总览 模块 包含内容 一、核 ...
2026-10-09在数据分析工作流中,业务数据大多存储在各类关系型数据库内,例如MySQL、PostgreSQL、SQLite等。Pandas是Python生态中主流的数 ...
2026-10-09在数字化精细化运营时代,海量用户存在需求差异、行为差异、价值差异与偏好差异。如果企业采用“一刀切”的统一营销、统一服务、 ...
2026-10-09 很多数据分析师拿到数据就开始清洗、建模,但当被问到“这批数据属于什么类型——结构化还是非结构化?分类变量还是数值变量 ...
2026-10-09指标体系是企业数字化分析、业务监控、经营决策的核心基础框架,是将零散数据转化为可衡量、可对比、可落地业务价值的关键体系。 ...
2026-10-08随着市场竞争日趋饱和,同质化低价竞争逐渐陷入内卷僵局,传统以价格、渠道、促销为核心的营销模式边际效益持续递减。在此背景下 ...
2026-10-08 很多数据分析师画过趋势图、做过业绩预测,但当被问到“这个月销售额增长20%,到底是长期趋势自然增长,还是促销活动的短期 ...
2026-10-08你有没有想过,手机里点外卖、刷社交软件、转一笔账,背后到底是谁在替你"记着账"? 答案其实很简单:数据库,以及跟它对话的那 ...
2026-10-07CDA数据分析师 出品 作者:李诗怡 一、数据分析四大思维 1. 对比思维:没有对比就没有分析 核心观点:单独一个数字没有意义,有 ...
2026-10-05Kimball 是方法,星型模型是它产出的形状。 很多人把"Kimball vs 星型模型"当成一道选择题——这本身就是个误会:Kimball 是动词 ...
2026-10-05写在开头 老板在微信上甩来一句: "帮我看下为什么销量跌了。" ” 你回工位,打开 SQL,开始写。查订单表、拉近三个月、按 ...
2026-10-03CDA数据分析师 出品 作者:李诗怡 1. 事实表 vs 维度表 对比维度 事实表 维度表 核心问题 记录“业务发生了什么事” 描述 ...
2026-10-02做数据聚合时,PySpark的groupBy()确实能完成统计,这也是它的本职工作。但它有一个根本性局限:每一组数据,最终只能返回一行 ...
2026-10-01热力地图是数据可视化中极具辨识度与实用性的空间分析图表,结合地理空间维度与数据密度特征,通过颜色深浅、色阶渐变直观展示数 ...
2026-09-30 很多数据分析师做过按月份的销售额趋势图,画过按天的流量折线图,但当被问到“时间序列和普通数据有什么本质区别”“季节性 ...
2026-09-30同样是“银行数据岗”,在国有大行总行数据中心、在一家城商行的零售部、在银行系金融科技子公司、在保险公司,工作内容、成长节 ...
2026-09-29在数据分析与统计学研究中,数据往往不是独立存在的,不同变量之间普遍存在相互关联、相互影响的关系。相关性统计分析是挖掘变量 ...
2026-09-29 导读:大多数人只把 dataclasses 当成偷懒工具,用来少写 __init__、__repr__ 这类魔法方法。但它的能力远不止于此。本文带 ...
2026-09-29 很多数据分析师能熟练地计算指标、搭建标签体系,但当被问到“画像到底在解决什么问题”“画像和标签是什么关系”“画像如何 ...
2026-09-29在MySQL数据库运维与业务开发中,行业普遍存在“数据达到千万级就必须分表”的说法。但在实际生产环境中,千万条数据并不是强制 ...
2026-09-28