
因子模型举例:主成分分析
我之前提到的因子风险主要包括经济的(知利率)、基本面的(如账面市值比率)和技术的(如前期收益率)。获得一个包含大童股票的投资组合因子风险的历史数据,并用于对因子模型进行回测,对于独立交易员来说是非常昂贵且不切实际的。不过,有一种因子模型,其构建只依核于历史收益率。这个方法叫做主成分分析(PCA)。
用主成分分析构建因子风险和因子收益率,必须假设因子风险在估计的时间段内是不变的(时间独立)。(这排除了表示均值回归或惯性的因子,因为这些因子风险都与前期收益率有关)。更重要的是,如果假设因子收益率之间“不相关”,协方差矩阵bbT就是对角矩阵。如果用协方差矩阵RRT的特征向量作为APT方程R=Xb+u中矩阵X的列向量,可知bbT的确是对角矩阵,并且矩阵RRT的特征值正好扰是因子收益率b的方差。但是,如果因子数量与股票数量相等,我们就不需要使用因子分析了,因为只要选取几个具有较大特征位的特征向黄就能构成矩阵X。特征向量的个数是一个需要优化的交易模型参数。
下面的MATLAB程序展示了一个对S&P60。小盘股使用主成分分析的可能交易策略。这一策略仅设因于收益率具有惯性,即从本期到下期。因于收益率的值保持不变。因此,可以买入基于这些因子的期望收益率最高的股票,卖出期望收益率最低的股票。如果发现这一策略的平均收益率为负,表明对收益率具有惯性的假设是不合适的,或者策略的特有收益率太大了以至于策略失效。
clear;
%使用回望交易日作为佑计区间(训练集),以此来决定因子风险
%回望期交易日为252天,因子5个
%交易策略为:购买下一个交易日期望收益率最高的50只股票topN = 50;
%选用SP600小盘股做测试(此MATLAB二进制辑入丈件包含交易日,股票,开盘价,最高价,最低价,收盘价)
load('IJR 20080114');
mycls=fillMissingData(cl);
positionsTable=zeros (size(cl));
写dailyret的行是在不同时间段上的观察值
dailyret=(mycls一lagl(mycls))/lagl(mycls);
for t=lookback+1:length(tday)
% R的列是不同的观刻对象
R=dailyret(t-lookback+一:t.:)’;
%不考虑所有收益率缺失的股票
hasData=find(all(isfinite(R),2));
R=R(hasData,:);
avgR=smartmean(R,2);
%移去均值
R=R-repmat(avgR,[1 size(R,2)]);
%计算不同股票收益率的协方差拒阵
covR= smartcov(R');
% X是因子风险矩阵,B是因子收益率的方差
%用covR的特征值作为X的列向量
[X,B]=eig(covR);
%保留的因子数为numFactors
X(:,1:size(X,2)-numFactors) =[];
% b是从时间t-1到t的因子收益率
results=ols(R(:,end),X);b= results.beta;
% Rexp是假设因子收益率保持常数时。下一个时间段的期望收益率
Rexp=avgR+X*b;
[foo idxSort]=sort(Rexp,'ascend');
%做空期望收益率最低的50只股票
positionsTable(t,hasData(idxSort(1:topN)))=-1;
%做多期望收益率最高的50只股票
positionsTable(t,. ..
hasData(idxSort(end-opN+1:end)))=1;
end
%计算交易策略的每日收益率
ret=...
smartsum(backshift(1,positionsTable).*dailyret,2);
%计算交易策略的年化收益率
avgret=smartmean(ret)*252%收益率很低
%avgret=
%
%-1.8099
程序中使用了smartcov函数来计算多只股票日收益平向量的协方差矩阵。与MATLAB内置的cov函数不同,smartcov函数忽略了收益率缺失的交易日(包括NaN值)。
function y=smartcov(x)
% n个有限元素的协方差
% 行为观测值,列为变量
% 用N标准化,而非N-1
y= NaN (size(x,2) , size(x, 2 ));
xc= NaN(size(x));
goodstk=find(~all(isnan(x),1));
xc(:,goodstk)=...
x(:,goodstk)-repmat(smartmean(x(:,goodstk),1),...
[size(x,1)1];%移去均值
for m=1:length(goodstk)
for n=m:length(goodstk)
y(goodstk(m),goodstk(n))=...
smartmean(xc(:,goodstk(m)).
*..xc(:,goodstk(n)));
y(goodstk(n),goodstk(m))=y(goodstk(m) ,goodstk(n));
end
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
SQL Server 中 CONVERT 函数的日期转换:从基础用法到实战优化 在 SQL Server 的数据处理中,日期格式转换是高频需求 —— 无论 ...
2025-09-18MySQL 大表拆分与关联查询效率:打破 “拆分必慢” 的认知误区 在 MySQL 数据库管理中,“大表” 始终是性能优化绕不开的话题。 ...
2025-09-18CDA 数据分析师:表结构数据 “获取 - 加工 - 使用” 全流程的赋能者 表结构数据(如数据库表、Excel 表、CSV 文件)是企业数字 ...
2025-09-18DSGE 模型中的 Et:理性预期算子的内涵、作用与应用解析 动态随机一般均衡(Dynamic Stochastic General Equilibrium, DSGE)模 ...
2025-09-17Python 提取 TIF 中地名的完整指南 一、先明确:TIF 中的地名有哪两种存在形式? 在开始提取前,需先判断 TIF 文件的类型 —— ...
2025-09-17CDA 数据分析师:解锁表结构数据特征价值的专业核心 表结构数据(以 “行 - 列” 规范存储的结构化数据,如数据库表、Excel 表、 ...
2025-09-17Excel 导入数据含缺失值?详解 dropna 函数的功能与实战应用 在用 Python(如 pandas 库)处理 Excel 数据时,“缺失值” 是高频 ...
2025-09-16深入解析卡方检验与 t 检验:差异、适用场景与实践应用 在数据分析与统计学领域,假设检验是验证研究假设、判断数据差异是否 “ ...
2025-09-16CDA 数据分析师:掌控表格结构数据全功能周期的专业操盘手 表格结构数据(以 “行 - 列” 存储的结构化数据,如 Excel 表、数据 ...
2025-09-16MySQL 执行计划中 rows 数量的准确性解析:原理、影响因素与优化 在 MySQL SQL 调优中,EXPLAIN执行计划是核心工具,而其中的row ...
2025-09-15解析 Python 中 Response 对象的 text 与 content:区别、场景与实践指南 在 Python 进行 HTTP 网络请求开发时(如使用requests ...
2025-09-15CDA 数据分析师:激活表格结构数据价值的核心操盘手 表格结构数据(如 Excel 表格、数据库表)是企业最基础、最核心的数据形态 ...
2025-09-15Python HTTP 请求工具对比:urllib.request 与 requests 的核心差异与选择指南 在 Python 处理 HTTP 请求(如接口调用、数据爬取 ...
2025-09-12解决 pd.read_csv 读取长浮点数据的科学计数法问题 为帮助 Python 数据从业者解决pd.read_csv读取长浮点数据时的科学计数法问题 ...
2025-09-12CDA 数据分析师:业务数据分析步骤的落地者与价值优化者 业务数据分析是企业解决日常运营问题、提升执行效率的核心手段,其价值 ...
2025-09-12用 SQL 验证业务逻辑:从规则拆解到数据把关的实战指南 在业务系统落地过程中,“业务逻辑” 是连接 “需求设计” 与 “用户体验 ...
2025-09-11塔吉特百货孕妇营销案例:数据驱动下的精准零售革命与启示 在零售行业 “流量红利见顶” 的当下,精准营销成为企业突围的核心方 ...
2025-09-11CDA 数据分析师与战略 / 业务数据分析:概念辨析与协同价值 在数据驱动决策的体系中,“战略数据分析”“业务数据分析” 是企业 ...
2025-09-11Excel 数据聚类分析:从操作实践到业务价值挖掘 在数据分析场景中,聚类分析作为 “无监督分组” 的核心工具,能从杂乱数据中挖 ...
2025-09-10统计模型的核心目的:从数据解读到决策支撑的价值导向 统计模型作为数据分析的核心工具,并非简单的 “公式堆砌”,而是围绕特定 ...
2025-09-10