京公网安备 11010802034615号
经营许可证编号:京B2-20210330
用R语言进行简单线性回归分析,数据出自何晓群--应用回归分析,语言如下所示:
x y
3.4 26.2
1.8 17.8
4.6 31.3
2.3 23.1
3.1 27.5
5.5 36
0.7 14.1
3 22.3
2.6 19.6
4.3 31.3
2.1 24
1.1 17.3
6.1 43.2
4.8 36.4
3.8 26.1
#-------------------------------------------------------------#数据准备
fire <- read.table('D:/fire.txt', head = T)
#-------------------------------------------------------------#回归分析
plot(fire$y ~ fire$x)
fire.reg <- lm(fire$y ~ fire$x, data = fire) #回归拟合
summary(fire.reg) #回归分析表
anova(fire.reg) #方差分析表
abline(fire.reg, col = 2, lty = 2) #拟合直线
#-------------------------------------------------------------#残差分析
fire.res <- residuals(fire.reg) #残差
fire.sre <- rstandard(fire.reg) #学生化残差
plot(fire.sre)
abline(h = 0)
text(11, fire.sre[11], label = 11, adj = (-0.3), col = 2) #标注点
#-------------------------------------------------------------#预测与控制
attach(fire) #连接
fire.reg <- lm(y ~ x) #这种回归拟合简单
fire.points <- data.frame(x = c(3.5, 4))
fire.pred <- predict(fire.reg, fire.points, interval = 'prediction', level = 0.95) #预测:置信区间
fire.pred
detach(fire) #取消连接
--------------------------------------------------------------------------------------------------
#附自编的过程程序:(R最大的好处是可以自己编想要的程序和函数,尤其没有内置函数的时候)
fire <- read.table('D:/fire.txt', head = T)
attach(fire)
--------------------------------------------
lxy <- function(x){
sum <- 0
sum0 <- 0
for(i in 1:length(x)){
sum0 <- (x[i] - mean(x)) * (y[i]-mean(y))
sum <- sum + sum0}
sum}
---------------------------------------------------------------------------------
#用这个就不需要循环了
lxy <- function(x){
mid <- (x - mean(x)) * (y-mean(y))
sum <- sum(mid)
sum}
#对于数据框、列表等数据对象要善用apply()函数。
---------------------------------------------------------------------------------
lxx <- function(x){
sum <- 0
sum0 <- 0
for(i in 1:length(x)){
sum0 <- (x[i] - mean(x))^2
sum <- sum + sum0}
sum}
Lxx <- lxx(x)
Lyy <- lxx(y)
Lxy <- lxy(x)
b1 <- Lxy / Lxx; b1 #回归系数斜率
b0 <- mean(y) - b1 * mean(x); b0 #回归系数截距
residu <- y - (b0 + b1*x); residu #残差
r <- Lxy / sqrt(Lxx * Lyy); r #相关系数
rsqure <- r^2; rsqure #决定系数
adrsqure <- 1 - ((length(x)-1)/(length(x)-2))*(1-r^2) #调整后的决定系数
----------------------------------------------------------------------------------
esrequre <- function(x){ #求标准差平方估计值
sum <- 0
sum0 <- 0
for(i in 1:length(x)){
sum0 <- residu[i]^2
sum <- sum + sum0}
residusqure <- sum/(length(x)-2)
residusqure}
esterreq <- esrequre(x); esterreq #标准差平方估计值(MSE)
ester <- sqrt(esrequre(x)); ester #标准差估计值(回归分析表给出的标准误差)
val_t <- b1*sqrt(Lxx) / ester; val_t #检验回归系数斜率b1的t值
SSe <- function(x){ #求残差平方和
sum <- 0
sum0 <- 0
for(i in 1:length(x)){
sum0 <- residu[i]^2
sum <- sum + sum0}
sum}
SSE <- SSe(x); SSE #残差平方和
MSE <- SSE/(length(x)-2); MSE #残差均方和
SSr <- function(x){
sum <- 0
sum0 <- 0
for(i in 1:length(x)){
sum0 <- ((b0 + b1*x[i]) - mean(y))^2
sum <- sum + sum0}
sum}
SSR <- SSr(x); SSR #回归平方和
MSR <- SSR/1; MSR #回归均方和
val_F <- SSR / MSE; val_F #检验回归方程F值
hi <- 1/length(x) + (x-mean(x))^2/Lxx #杠杆值
ZRE <- residu / ester; ZRE #标准化残差
SRE <- residu/(ester*sqrt(1-hi)); SRE #学生化残差
Y <- function(x){b0 + b1 * x} #点估计
Y(3.5)
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
指标体系是企业数字化分析、业务监控、经营决策的核心基础框架,是将零散数据转化为可衡量、可对比、可落地业务价值的关键体系。 ...
2026-10-08随着市场竞争日趋饱和,同质化低价竞争逐渐陷入内卷僵局,传统以价格、渠道、促销为核心的营销模式边际效益持续递减。在此背景下 ...
2026-10-08 很多数据分析师画过趋势图、做过业绩预测,但当被问到“这个月销售额增长20%,到底是长期趋势自然增长,还是促销活动的短期 ...
2026-10-08你有没有想过,手机里点外卖、刷社交软件、转一笔账,背后到底是谁在替你"记着账"? 答案其实很简单:数据库,以及跟它对话的那 ...
2026-10-07CDA数据分析师 出品 作者:李诗怡 一、数据分析四大思维 1. 对比思维:没有对比就没有分析 核心观点:单独一个数字没有意义,有 ...
2026-10-05Kimball 是方法,星型模型是它产出的形状。 很多人把"Kimball vs 星型模型"当成一道选择题——这本身就是个误会:Kimball 是动词 ...
2026-10-05写在开头 老板在微信上甩来一句: "帮我看下为什么销量跌了。" ” 你回工位,打开 SQL,开始写。查订单表、拉近三个月、按 ...
2026-10-03CDA数据分析师 出品 作者:李诗怡 1. 事实表 vs 维度表 对比维度 事实表 维度表 核心问题 记录“业务发生了什么事” 描述 ...
2026-10-02做数据聚合时,PySpark的groupBy()确实能完成统计,这也是它的本职工作。但它有一个根本性局限:每一组数据,最终只能返回一行 ...
2026-10-01热力地图是数据可视化中极具辨识度与实用性的空间分析图表,结合地理空间维度与数据密度特征,通过颜色深浅、色阶渐变直观展示数 ...
2026-09-30 很多数据分析师做过按月份的销售额趋势图,画过按天的流量折线图,但当被问到“时间序列和普通数据有什么本质区别”“季节性 ...
2026-09-30同样是“银行数据岗”,在国有大行总行数据中心、在一家城商行的零售部、在银行系金融科技子公司、在保险公司,工作内容、成长节 ...
2026-09-29在数据分析与统计学研究中,数据往往不是独立存在的,不同变量之间普遍存在相互关联、相互影响的关系。相关性统计分析是挖掘变量 ...
2026-09-29 导读:大多数人只把 dataclasses 当成偷懒工具,用来少写 __init__、__repr__ 这类魔法方法。但它的能力远不止于此。本文带 ...
2026-09-29 很多数据分析师能熟练地计算指标、搭建标签体系,但当被问到“画像到底在解决什么问题”“画像和标签是什么关系”“画像如何 ...
2026-09-29在MySQL数据库运维与业务开发中,行业普遍存在“数据达到千万级就必须分表”的说法。但在实际生产环境中,千万条数据并不是强制 ...
2026-09-28CDA数据分析师 出品 作者:李诗怡 1. 5W1H 分析法 定义:经典系统性思维框架,通过六个核心维度对问题进行全方位拆解与剖析,确 ...
2026-09-28 很多分析师在设计标签时思路清晰,但真到落地环节却面临“数据在手,不知如何转化为可用标签”的困境:或因加工方式选择不当 ...
2026-09-28CDA数据分析师 出品 作者:李诗怡 1. 用户标签体系 定义: 通过一系列高度精炼的特征标识,对用户属性、行为与偏好进行量化刻画 ...
2026-09-24Pandas是Python生态中用于表格数据处理的核心库,广泛应用于数据清洗、统计运算、报表输出、数据分析建模等场景。在处理极大数值 ...
2026-09-24