京公网安备 11010802034615号
经营许可证编号:京B2-20210330
很多数据分析师写过无数个SELECT查询,但当被问到“如何新建一张表来固化中间数据”“创建视图和创建物理表有什么区别”“视图的优缺点分别是什么”时,却常常陷入支支吾吾的困境。其实,SELECT只是从表中“取”数据,而CREATE TABLE和CREATE VIEW才是主动“建”数据载体的能力——前者是“用数据”,后者是“造工具”。
”
小林是刚进公司一年多的数据分析师,写复杂SQL是日常,颇受团队认可。在一次分析任务中,他发现业务系统导出的原始表中有大量重复订单、字段类型混乱、缺少日期索引,导致每次分析前都要重复做清洗和关联工作,效率大降。技术主管建议:“你把清洗后的中间数据固化成一张表,下次直接用就行。”小林恍然:原来许多分析效率低下的根源,在于只会“取”不会“建”。而视图将复杂的查询逻辑封装为一张“虚拟表”,能极大简化上层取数。
熟练掌握表和视图的创建,是CDA分析师从“被动取数人”走向“主动数据赋能”的必备技能。本文将从CDA认证的知识体系出发,系统解析创建数据表和创建视图的本质差异、核心语法、实际应用与考试高频考点。
对分析师而言,表与视图并非“二选一”的工具,而是“分工不同、协同配合”的搭档。要高效使用两者,需先明确其本质差异。
数据表是数据库中用于物理存储数据的实体结构。所有原始数据或经过处理的核心数据都以表的形式持久化存储。其核心特征是:
对CDA分析师而言,创建表的核心价值体现在三个方面:
分析师常用表类型包括:原始数据表(存储业务系统直接生成的原始数据)、中间表(存储数据预处理后的中间结果)和结果表(存储最终分析结论)。
视图是基于一个或多个表的查询结果构建的虚拟表,本身不存储数据,仅保存查询逻辑。当分析师调用视图时,数据库会根据预设的查询逻辑,从原始数据表中实时提取数据并呈现。其核心特征是:
视图的核心价值体现在三个层面:
| 对比维度 | 数据表(Table) | 视图(View) | 选择建议 |
|---|---|---|---|
| 数据存储 | 物理存储,占用磁盘空间 | 逻辑存储,仅保存查询语句 | 高频复用且数据稳定→表;实时性要求高→视图 |
| 数据操作 | 支持增删改查(CRUD) | 数据只读,无法直接修改 | 需修改数据→表;仅查询→视图 |
| 查询效率 | 直接读取数据,效率高 | 每次访问需执行查询 | 大数据量分析→表;简单查询→视图 |
| 依赖关系 | 独立存在 | 依赖基础表 | 需动态适配→视图;稳定结构→表 |
表是“实体存储”,数据长期保存、可修改;视图是“虚拟查询”,不存储数据、仅保存逻辑,数据随原始表实时更新。
DDL(Data Definition Language,数据定义语言)是SQL语言四大分类之一,主要用于定义和管理数据库中的所有数据对象,包括数据库本身、数据表、索引和视图等。其核心关键字包括CREATE(创建)、DROP(删除)、ALTER(修改)、RENAME(重命名)、TRUNCATE(清空数据)。
创建表的过程是设计其存储规则和业务结构。核心逻辑是“明确数据需求→设计表结构→编写CREATE TABLE语句→验证数据完整性”。
基本语法结构如下:
CREATE TABLE [IF NOT EXISTS] 表名 (
列名1 数据类型 [列级约束] [默认值],
列名2 数据类型 [列级约束] [默认值],
……
[表级约束(主键、外键、唯一约束等)]
);
字段是数据表中最基本的存储单元,每个字段需要定义明确的数据类型与约束规则,以确保数据的一致性和完整性。
常见数据类型:
| 数据类型类别 | 常见类型 | 使用场景 |
|---|---|---|
| 整数类型 | INT、BIGINT、SMALLINT | 存储订单数、年龄、库存量等非小数数值 |
| 字符类型 | CHAR(n)、VARCHAR(n) | 存储姓名、邮箱、城市等文本。VARCHAR可变长度,更节省空间 |
| 日期与时间 | DATE、DATETIME、TIMESTAMP | 记录时间轴,便于排序与趋势分析 |
| 浮点与定点 | FLOAT、DOUBLE、DECIMAL(p,s) | 表示金额、百分比等精度敏感的数据 |
常见约束类型:
假设某电商平台需要创建一张订单固化分析表,用于后续销售趋势计算:
CREATE TABLE order_analysis_base (
order_id VARCHAR(50) PRIMARY KEY, -- 主键约束
user_id VARCHAR(50) NOT NULL, -- 非空约束
user_city VARCHAR(50) DEFAULT '未知', -- 默认值约束
order_amount DECIMAL(10,2) NOT NULL, -- 精度可控
order_status VARCHAR(20) CHECK (order_status IN ('已支付','未支付','已取消')),
order_date TIMESTAMP NOT NULL,
product_category VARCHAR(50)
);
在表创建后,可通过ALTER和DROP对表结构进行动态管理:
| 操作类型 | 语法示例 | 说明 |
|---|---|---|
| 修改表名 | ALTER TABLE 旧表名 RENAME TO 新表名; |
确保下游依赖同步修改 |
| 新增字段 | ALTER TABLE 表名 ADD 新字段名 数据类型; |
注意大批量表避免锁表 |
| 修改字段 | ALTER TABLE 表名 MODIFY 字段名 新数据类型; |
确认原业务是否依赖旧类型 |
| 删除字段/表 | ALTER TABLE 表名 DROP 字段名; / DROP TABLE 表名; |
⚠️操作不可逆,执行前做好备份 |
视图的创建语法是将SELECT查询封装为可复用的虚拟表:
CREATE VIEW view_name AS
SELECT column1, column2, ...
FROM table_name
WHERE condition;
视图的优点:
视图的缺点:
假设某电商平台需要封装“用户消费画像”查询:
CREATE VIEW v_user_consumption AS
SELECT
u.user_id,
u.user_name,
u.city,
SUM(o.order_amount) AS total_spent,
COUNT(o.order_id) AS order_count,
AVG(o.order_amount) AS avg_order_value
FROM users u
INNER JOIN orders o ON u.user_id = o.user_id
WHERE o.order_status = '已支付'
GROUP BY u.user_id, u.user_name, u.city;
创建成功后,分析师只需执行SELECT * FROM v_user_consumption WHERE city = '北京';即可获取北京地区的用户消费画像,无需重复编写多表关联和分组汇总的复杂SQL。
某电商平台需要每日统计“各城市近30天已支付订单的GMV”,用于运营早报推送。
为避免每日反复跨业务订单表进行大规模连接,首先生成一张固化表作为中间存储:
CREATE TABLE daily_city_order (
stat_date DATE NOT NULL,
city_code VARCHAR(20) NOT NULL,
total_gmv DECIMAL(12,2) NOT NULL,
PRIMARY KEY (stat_date, city_code)
);
为了方便运营同学直接取数,创建一张视图封装核心业务口径:
CREATE VIEW v_city_gmv_30days AS
SELECT
city_code,
SUM(total_gmv) AS gmv_last_30days
FROM daily_city_order
WHERE stat_date >= CURDATE() - INTERVAL 30 DAY
GROUP BY city_code;
后续运营早报系统直接查询视图即可稳定获取结果:
SELECT * FROM v_city_gmv_30days ORDER BY gmv_last_30days DESC;
这就是一套完整的“创建表固化中间数据 → 创建视图封装业务逻辑 → 上层直接调用”的表与视图协同实战流程。
”
很多数据分析师能写复杂的SELECT和JOIN,但当被问到“为什么要建这张中间表”“视图是否可以随意修改里面的数据”“底层基表结构被改对视图有什么影响”时,往往答不上来。
会写SELECT是“用数据”,会建表和视图是“造工具” 。创建表是在为数据仓储打下坚实的地基;创建视图则是在地基上铺设高效取数的管道。只有掌握两者的创建与管理,才能让数据真正体系化、可管理化、可复用化。
在2025年新考纲的背景下,CDA一级明确要求掌握创建表与视图的操作逻辑——这不仅是考试大纲的考核要求,更是每一位数据分析师在真实工作中将“数据资产”转化为“决策能力”的必备技能。
下一步行动:
CREATE TABLE 和 CREATE VIEW 共同构成了数据分析师手中的“建设权”——构建稳健的数据骨架,封装可复用的分析逻辑,让数据真正成为资产。
”

数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在MySQL数据库运维与业务开发中,行业普遍存在“数据达到千万级就必须分表”的说法。但在实际生产环境中,千万条数据并不是强制 ...
2026-09-28CDA数据分析师 出品 作者:李诗怡 1. 5W1H 分析法 定义:经典系统性思维框架,通过六个核心维度对问题进行全方位拆解与剖析,确 ...
2026-09-28 很多分析师在设计标签时思路清晰,但真到落地环节却面临“数据在手,不知如何转化为可用标签”的困境:或因加工方式选择不当 ...
2026-09-28CDA数据分析师 出品 作者:李诗怡 1. 用户标签体系 定义: 通过一系列高度精炼的特征标识,对用户属性、行为与偏好进行量化刻画 ...
2026-09-24Pandas是Python生态中用于表格数据处理的核心库,广泛应用于数据清洗、统计运算、报表输出、数据分析建模等场景。在处理极大数值 ...
2026-09-24随着数字经济快速发展,数据已成为核心生产要素,各行各业的业务沉淀、用户行为、设备运行、市场交易均产生海量数据。数据处理作 ...
2026-09-24 很多分析师每天和数据打交道,但当被问到“标签是什么”“标签和指标有什么区别”“标签体系如何设计”时,却常常答不上来。 ...
2026-09-24在时序数据分析中,大部分业务数据并非持续平稳变化,而是会在某些时间节点出现突然抬升、断崖下跌、趋势反转、波动异变等现象, ...
2026-09-23在统计学与数据分析中,研究多组数据差异最常用的方法为单因素方差分析与事后多重比较。很多数据分析初学者容易混淆两者功能,认 ...
2026-09-23 很多数据分析师每天都在写 SQL,但当被问到“DQL 的本质是什么”“SELECT 子句的书写顺序与执行顺序为何不同”“INNER JOIN ...
2026-09-23 很多数据分析师写过无数个SELECT查询,但当被问到“如何新建一张表来固化中间数据”“创建视图和创建物理表有什么区别”“视 ...
2026-09-22CDA数据分析师 出品 作者:李诗怡 1. 金字塔原理 定义: 一种“先总后分、先结论后原因”的思考和表达方式。顶层为核心观点,中 ...
2026-09-22数据收集是数据分析、数据挖掘与数字化运营的源头工作,数据收集的完整性、准确性、时效性直接决定后续数据分析结果的可信度与业 ...
2026-09-21箱线图是数据分析中用于识别数据分布、判断离散程度、筛查异常值的核心图表。相比于直方图、趋势图,箱线图可以精准区分正常数据 ...
2026-09-21 很多数据分析师精通Excel函数和数据透视表,但当被问到“数据从哪里来”“表和视图有什么区别”“数据库管理系统和SQL是什么 ...
2026-09-21在数据库数据查询与数据分析工作中,日期时间是最常用的数据类型之一。原始数据库中存储的日期格式多为标准时间戳、年月日时分秒 ...
2026-09-20在时序数据分析中,增长率是衡量数据涨跌幅度、研判发展趋势、识别周期波动的核心指标,主要分为环比增长率与同比增长率。传统Ex ...
2026-09-20 很多企业团队并非缺乏指标,而是陷入“指标失控”:仪表盘上堆满实时跳动的数据,却无法回答“当前瓶颈在哪、下一步该做什么 ...
2026-09-20CDA数据分析师 出品 作者:李诗怡 STP模型(营销战略三步法) 定义: 现代营销战略核心框架,通过市场细分(S)、目标市场选择( ...
2026-09-18在互联网产品迭代、运营优化、界面改版与策略升级过程中,主观经验判断容易造成决策偏差、盲目改版、资源浪费等问题。AB实验(AB ...
2026-09-18