京公网安备 11010802034615号
经营许可证编号:京B2-20210330
CDA数据分析师 出品
作者:李诗怡
题目:销售漏斗模型中,通过广告、社交媒体等方式触达品牌信息(如浏览品牌官网首页、点击信息流广告等),但未深入互动的用户,所处的阶段是?
A. 接触
B. 意向
C. 潜在
D. 成交
解析:选 C。浏览品牌首页,点击信息流广告。这属于存在潜在需求,接触指的是看到这些内容但没有主动点击。
知识点:销售漏斗的七个核心步骤。
题目:下列哪些属于"因子分解式"拆解方法的应用?
A. GMV = 流量 × 转化率 × 客单价
B. 用户申请信用卡的步骤拆解
C. 企业会员营收 = 新会员付费 + 老会员付费
D. 按部门职能拆解销售收入
解析:选 A、C。因子分解式拆解的关键是通过乘法关系将指标分解为多个子因子的乘积,全链漏斗式拆解是按流程步骤的先后逻辑拆解。流量×转化率×客单价,通过乘法将GMV分解为流量、转化率、客单价三个因子,属于因子分解式拆解。
知识点:指标拆解分三类:因子分解式(乘法/加法拆因子)、全链漏斗式(按流程步骤拆)、维度拆分式(按部门/地区拆)。
题目:student表中记录了同学每一次考试的成绩。那么以下哪组SQL代码取数的结果中,StudentID字段取值不会出现重复?
A. select StudentID, max(score) from student group by StudentID;
B. select distinct StudentID, Score from student;
C. select StudentID from student;
D. select StudentID from student where StudentID is not null;
解析:选 A。DISTINCT 作用于 StudentID 和 Score 的组合,如果同一个学生有不同成绩比如 StudentID=1 有 80、90分,StudentID 就会重复出现。
知识点:GROUP BY 按字段分组去重,DISTINCT 对所有字段组合去重,WHERE 只过滤行不去重。
题目:统计每门课程的修课人数和考试最高分。
A. SELECT sc.cno, cname, count(distinct sc.cno) 修课人数, max(grade) 考试最高分 FROM course right join sc ON course.cno=sc.cno GROUP BY sno;
B. SELECT sc.cno, cname, count(distinct sc.cno) 修课人数, max(grade) 考试最高分 FROM course right join sc ON course.cno=sc.cno GROUP BY sc.cno;
C. SELECT sc.cno, cname, count(distinct sno) 修人数, max(grade) 考试最高分 FROM course right join sc ON course.cno=sc.cno GROUP BY sc.cno;
D. SELECT sc.cno, cname, count(distinct sno) 修课人数, max(grade) 考试最高分 FROM course right join sc ON course.cno=sc.cno GROUP BY sno;
解析:选 C。统计每门课程的修课人数和考试最高分,需按课程号(sc.cno)分组,修课人数用 COUNT(DISTINCT sno) 对学生号去重计数,考试最高分用 MAX(grade)。A、B选项用 COUNT(DISTINCT sc.cno) 统计的是课程数而非人数;A、D选项 GROUP BY sno 是按学生分组,不符合"每门课程"的统计要求。
知识点:GROUP BY 分组聚合,COUNT(DISTINCT) 去重计数,MAX 求最大值,RIGHT JOIN 以右表为主。
题目:波士顿矩阵模型中,表现特征为市场占有率高,销售增长缓慢,可以带来稳定现金流的产品属于第几象限?
A. 第二象限
B. 第四象限
C. 第三象限
D. 第一象限
解析:选 C。波士顿矩阵中,市场占有率高、销售增长缓慢、能带来稳定现金流的是"现金牛"产品。按横轴为市场占有率(左高右低)、纵轴为销售增长率(上高下低)的标准布局,现金牛位于左下方即第三象限。
知识点:波士顿矩阵按市场占有率和销售增长率分为明星、问题、现金牛、瘦狗四象限。
题目:以下是某电商平台用于记录交易行为与交易详情信息的订单表与订单详情表,请根据表中信息回答以下问题。

(2)两表连接后使用左连接进行查询后的总行数是____?
A. 5
B. 6
C. 4
D. 8
解析:选 C。左连接以左表(订单表,共3条记录)为基准,按"单号"关联右表(订单详情表)。a01匹配1条详情、a02匹配1条详情、a03匹配2条详情,总行数=1+1+2=4行。
知识点:LEFT JOIN 返回左表全部行及匹配行,一对多关系会导致结果行数膨胀。
题目:图中是2020/01/01-2020/1/7日的销售记录和退货记录。

(1)请问实际订单量是多少?
A. 3
B. 4
C. 5
D. 6
解析:选 D。实际订单量是指扣除完全退货订单后的有效订单数量。销售记录中共有8个订单编号:A001、A002、A003、A004、A005、A006、A007、A008。退货记录涉及订单 A002、A003 和 A006:A003(A3退2件,与销售数量一致)和 A006(A1退1件,与销售数量一致)被完全退货,不计入实际订单量;A002仅部分退货(A1退1件,原销售A1共2件+A2共1件,仍有剩余商品),仍视为有效订单。因此有效订单为 A001、A002、A004、A005、A007、A008,共6个。
知识点:实际订单量需扣除完全退货订单,部分退货仍计入,按订单编号去重统计。
题目:下图是根据RFM模型对某公司客户进行的分层,以及不同客户的帕累托图,根据图1与图2回答以下问题。


接上题(2)在有限资金下为提高收入,应重点对哪类人群进行营销?
A. 一般挽留用户
B. 一般发展用户
C. 重要价值用户
D. 一般价值用户
解析:选 B。重要价值用户(R高、F高、M高)是最优质的客户,但他们本身已经处于消费的峰值状态,营销带来的边际收入提升空间有限。在资金有限的情况下,对他们应主要采取"维持"策略,而非大规模投入营销。一般发展用户(R高、F低、M低)这类用户最近刚有过消费(R高),说明他们对品牌有认知且具备活跃度,但他们消费频率(F)和消费金额(M)都不高。在有限资金下,对他们进行精准营销,最容易激发他们提高复购率和客单价,从而实现收入的快速提升,将其转化为"重要价值用户"。
知识点:RFM模型按最近消费(R)、消费频率(F)、消费金额(M)分层客户,有限资金优先投转化潜力高的客群。
题目:对比分析类图表主要用于在实际值与目标值之间、不同对象之间或者不同区域之间进行数值结果的对比分析,下列属于比较类图表的是?
A. 条形图
B. 地图
C. 雷达图
D. 堆积柱形图
解析:选 A、B、C。堆积柱形图是构成类图表,它是结构分析不是对象间对比。

这是地图图表,然后它是通过颜色深浅或数值来标注,让它能够快速对比不同区域的数据差异,雷达图可以同时对比多个维度的数值,比较不同对象在多维度上的差异。
知识点:图表分比较类(条形图、地图、雷达图)、构成类(堆积柱形图、饼图)、趋势类、分布类。
题目:结构化数据可以分为表格结构数据及表结构数据两类,以下对于表格结构数据的特征描述错误的是?
A. 表格结构数据的最小单位是单元格
B. 一个单元格只能有一种数据类型
C. 工作表是单元格的父级
D. 单元格具有单元格格式的属性
解析:选 C。表格结构数据(如Excel工作表)的层级关系为:工作簿→工作表→行/列→单元格。单元格是行与列的交叉点,其直接父级是行和列,工作表是单元格的上级容器但非直接父级,故C错误。A选项单元格是表格结构数据的最小单位正确;B选项一个单元格只能存储一种数据类型正确;D选项单元格具有格式属性(如数字格式、对齐、字体等)正确。
知识点:表格结构数据以单元格为最小单位,有工作簿-工作表-行/列-单元格层级;表结构数据以字段/记录为单位。
题目:在电子表格工具中可以使用公式引用数据,下面哪个引用公式写法是错误的?
A. A:A
B. B1:C17
C. 1:19
D. A4:19
解析:选 D。电子表格中区域引用格式为"起始单元格:结束单元格",两端都必须是完整的单元格地址(列标+行号)。A选项 A:A 表示引用A列整列;B选项 B1:C17 表示从B1到C17的矩形区域;C选项 1:19 表示引用第1到19行整行;D选项 A4:19 中结束位置"19"只有行号没有列标,不是合法的单元格地址,写法错误,正确写法应为 A4:A19。
知识点:单元格引用格式为列标+行号,区域引用为起始:结束,支持整列(A:A)和整行(1:19)引用。
题目:使用 select * from 表1 inner join 表2 on 表1.客户id = 表2.客户id 语句对下边两个表进行查询,查询结果中应有几行数据?

A. 2
B. 3
C. 4
D. 5
解析:选 B。INNER JOIN 只返回两表 客户id 匹配的记录。表1中 c01 匹配表2的2条记录,c03 匹配1条,c02 无匹配,合计3行。
知识点:INNER JOIN 只返回两表匹配的记录,一对多匹配时行数为各匹配对数之和。
题目:一家餐厅统计顾客的性别、年龄、消费金额等信息,在进行数据分析时,发现性别这一变量在数据存储时用"1"代表男性,"2"代表女性,若不特别声明,数据分析软件可能会把性别当作连续变量处理,此时如果对性别求均值,这种做法?
A. 能够准确反映顾客性别的集中趋势
B. 有一定意义,可以辅助分析顾客性别分布
C. 没有意义,因为性别是名义变量
D. 可以帮助餐厅了解顾客性别比例
解析:选 C。性别是名义变量(定类变量),用"1"代表男性、"2"代表女性只是人为的数值编码,数字本身的大小和间隔没有实际数学含义。对名义变量求均值得到的数值无法解释为"平均性别",不具有统计意义,正确做法是计算各类别的频数/频率分布。A、B、D选项都假设均值有意义,因此错误。
知识点:变量分名义(定类)、序数(定序)、区间(定距)、比率(定比)四种尺度,名义变量不能求均值。
题目:下表是2018年8月汽车市场销量树状结构图,百分比为销量的同比增长率,根据图表回答问题。

从上边树状结构图中各指标的同比增长率情况可以观测到影响总销量增长的主要车类是?
A. 轿车
B. MPV
C. SUV
D. 以上都不对
解析:选 A。树状结构图中各车类的同比增长率显示,轿车的销量同比增长率最高(或对总销量增长的贡献最大),因此是影响总销量增长的主要车类。MPV和SUV的增长率低于轿车,对总销量增长的拉动作用较小。
知识点:树状图用面积表示数值大小,同比增长率=(本期-上年同期)/上年同期,增长贡献需结合基数和增长率判断。
题目:订单表与产品详情表可以通过产品ID构成多对一的连接关系,关于多对一连接关系下的透视计算描述正确的是?
A. 以多表为主表
B. 以一表为主表
C. 以多表为维度表
D. 以一表为维度表
解析:选 A、D。多对一连接中,"多"端的表(如订单表,每条订单对应一个产品)是事实表/主表,提供可聚合的度量数据(如订单金额、数量);"一"端的表(如产品详情表,一个产品对应多条订单)是维度表,提供分析维度(如产品名称、类别)。透视计算时以多表为主表、以一表为维度表,才能正确聚合度量值并按维度切片分析。B选项以一表为主表会导致度量值重复计算,C选项以多表为维度表不符合维度建模规范。
知识点:多对一连接中多表是事实表(提供度量),一表是维度表(提供分析维度),透视以事实表为主。
题目:在流向分析中,常用于网页流量归因的图表是?
A. 桑吉图
B. 雷达图
C. 直方图
D. 堆积柱形图
解析:选 A。桑吉图(桑基图/Sankey Diagram)通过分支宽度表示流量大小,展示数据从源头到终点的流动路径和转化关系,非常适合网页流量归因分析(如用户从哪些渠道进入、经过哪些页面、最终流向哪里)。雷达图用于多维度对比,直方图用于数据分布,堆积柱形图用于构成分析,均不适合流向归因。
知识点:桑吉图展示流量流向,雷达图多维对比,直方图看分布,堆积柱形图看构成。
题目:数据库管理系统中功能实现对数据的插入、修改和删除?
A. 数据定义
B. 数据操作
C. 数据库的运行管理
D. 数据库的建立与维护
解析:选 B。数据库管理系统(DBMS)中,数据操作功能(DML,数据操作语言)实现对数据的插入(INSERT)、修改(UPDATE)和删除(DELETE)操作。A选项数据定义(DDL)负责创建、修改、删除数据库对象(表、索引等);C选项运行管理负责事务控制、并发控制、安全性检查等;D选项建立与维护负责数据导入导出、备份恢复等。
知识点:DBMS四大功能:数据定义(DDL)、数据操作(DML)、运行管理、建立与维护。
题目:图中提供了每位同学的成绩和及格线、优秀线数据,请回答以下内容:

图中数据适合用哪种图表展示?
A. 簇状柱形图
B. 折线图
C. 簇状柱形图和折线图的组合图
D. 饼图
解析:选 C。图中包含每位同学的成绩数据以及及格线、优秀线两条参考阈值。簇状柱形图适合展示每位同学的成绩高低对比,折线图适合展示及格线和优秀线这两条恒定参考阈值,两者组合可以同时呈现个人成绩与标准线的对比关系。仅用簇状柱形图无法清晰展示参考线,仅用折线图不适合离散的人员成绩对比,饼图用于构成占比均不符合需求。
知识点:组合图同时用多种图表类型,柱形图+折线图适合数值对比+参考阈值/趋势展示。
题目:某零售企业的运营人员使用效应分解法分析季度销售额数据。他识别出数据中存在以下成分:1)销售额整体呈上升趋势;2)每年第四季度销售额明显高于其他季度;3)2020年第一季度因疫情出现异常下降。以上三种成分分别对应?
A. 长期趋势、季节变动、不规则变动
B. 长期趋势、循环变动、随机变动
C. 季节变动、长期趋势、不规则变动
D. 循环变动、季节变动、随机变动
解析:选 A。时间序列的效应分解法将数据波动分解为四种成分:①长期趋势(T):数据在较长时期内呈现的持续上升或下降方向,本题"整体呈上升趋势"属于长期趋势;②季节变动(S):在固定周期(如一年)内呈现的规律性波动,本题"每年第四季度销售额高"属于季节变动;③循环变动(C):较长周期的周期性波动(如经济周期),本题未涉及;④不规则变动(I):由偶然因素引起的无规律波动,本题"因疫情异常下降"属于不规则变动。因此对应为长期趋势、季节变动、不规则变动。
知识点:时间序列分解为长期趋势(T)、季节变动(S)、循环变动(C)、不规则变动(I)四种成分。

CDA数据分析师 出品 作者:李诗怡 1. 波士顿矩阵(BCG Matrix) 定义: BCG于1970年提出的业务组合分析工具,以"市场增长率"(纵 ...
2026-09-02CDA数据分析师 出品 作者:李诗怡 1. 销售漏斗阶段判断 题目:销售漏斗模型中,通过广告、社交媒体等方式触达品牌信息(如浏览品 ...
2026-09-02CDA数据分析师 出品 作者:李诗怡 一、8个核心数据清洗函数 1. TRIM:一键清除多余空格(最常用) 作用:仅保留文本中"单词/字 ...
2026-09-02数据分析的核心并非单纯操作工具、整理报表或绘制图表,而是依靠科学的思维逻辑挖掘数据价值、解释业务现象、指导经营决策。在完 ...
2026-09-02在社会经济、产业研究、区域治理与大数据实证分析中,面板数据是最具研究价值的数据类型。面板数据同时包含截面维度与时间维度信 ...
2026-09-02 很多数据分析师能熟练计算均值、标准差,但当被问到“如何用一张图让业务方3秒内看懂核心结论”“面对不同数据类型该怎么选 ...
2026-09-02在数据驱动决策的体系中,数据分析按照分析目的可分为描述性分析、诊断性分析、预测性分析与指导性分析四大类型。其中,诊断性分 ...
2026-09-01网络请求是Python爬虫开发、接口测试、数据拉取的核心基础功能,Python生态中主要依靠 urllib 和 requests 两大库实现HTTP请求操 ...
2026-09-01 很多数据分析师面对业务问题时,常常感到“知道要分析,却不知道用什么方法”。其实,数据分析并非无章可循——从三大基础范 ...
2026-09-01在数据库设计与业务数据维护中,自增ID是数据表最常用的主键字段,用于唯一标识每一条业务数据,正常状态下ID应保持连续递增。但 ...
2026-08-31在数理统计、数据分析、经济测算与日常量化评估中,平均值是刻画数据集中趋势、反映整体水平的基础核心指标。在实际应用中,最常 ...
2026-08-31在数据驱动的时代,数据分析早已不是“凭经验、靠感觉”的零散操作,而是一套具备固定逻辑、标准化流程的系统方法——这就是数据 ...
2026-08-31在大数据时代背景下,海量行业数据亟需通过专业化工具挖掘潜在价值,辅助企业业务决策、优化运营模式、规避经营风险。Python凭借 ...
2026-08-28SQL是数据分析领域最基础、最核心的工具,承担着取数、清洗、统计、分层、归因的全流程工作。不同于单纯的语法练习,实战化SQL数 ...
2026-08-28 很多企业团队并非缺乏指标,而是陷入“指标失控”:仪表盘上堆满实时跳动的数据,却无法回答“当前瓶颈在哪、下一步该做什么 ...
2026-08-28随着新零售模式的快速普及,零售行业从传统的“货品驱动”全面转向“用户驱动”。门店交易数据、线上消费记录、浏览轨迹、复购频 ...
2026-08-27在数据分析、爬虫采集、接口开发、数据归档等场景中,JSON与CSV是两种使用率最高的数据存储格式。JSON为键值对结构化格式,适配 ...
2026-08-27 很多数据分析师每天都在计算指标、制作报表,但当被问到“什么叫指标数据元”“指标数据标准包含哪些核心维度”“指标数据质 ...
2026-08-27在数据分析工作中,时间序列是最常见的数据类型之一,订单时间、日志时间、交易时段、统计周期等数据均离不开时间处理。原始数据 ...
2026-08-26在数据分析与数据预处理工作中,原始数据普遍存在录入错误、系统故障、偶然极值等问题,极易产生异常数据。异常数据会严重干扰数 ...
2026-08-26