AMA2634 统计导论:从描述统计、概率分布到统计推断与线性回归

统计学不是一份需要背诵的公式清单。它真正研究的是:面对带有随机性、噪声和有限样本的数据,我们怎样描述现象、量化不确定性,并对总体作出有边界的判断。

本文根据 AMA2634 Introduction to Statistics 的 10 讲课程资料整理,主线是:

1
2
3
4
5
6
7
8
9
数据与抽样
-> 描述统计
-> 概率模型
-> 随机变量与分布
-> 抽样分布和中心极限定理
-> 参数估计
-> 假设检验
-> 两总体比较
-> 相关与回归

读完以后,不仅应该会代公式,还应该能判断:为什么采用这个统计量、公式依赖什么假设、结论可以说到什么程度,以及什么时候不能使用它。

配套学习资料

下面的课程讲义可以和正文配合阅读。建议先读对应章节,再用讲义中的例题检查自己是否真正理解了定义、假设与计算过程。

课程资料仅作为配套复习材料使用。完整教材未随文章公开上传;正文已经独立整理了核心概念和推导,不依赖下载资料也可以连续阅读。

1. 统计学到底在做什么

统计学通常分成两部分。

描述统计只描述手头已有的数据,包括:

  • 频数表、直方图、箱线图;
  • 均值、中位数、众数;
  • 方差、标准差、四分位距;
  • 数据分布的中心、离散程度和形状。

推断统计则从样本出发,对总体作出带有不确定性的判断,包括:

  • 用样本均值估计总体均值;
  • 构造置信区间;
  • 检验某个总体参数是否等于指定值;
  • 比较两个总体的均值、比例或方差;
  • 分析变量之间的关系并进行预测。

两者的差别可以写成:

1
2
描述统计:What happened in this dataset?
推断统计:What can this sample tell us about the population?

总体、样本、参数与统计量

  • 总体 Population:研究对象的全集。
  • 样本 Sample:从总体中抽取的一部分对象。
  • 参数 Parameter:描述总体的数值,例如总体均值 μ\mu、总体方差 σ2\sigma^2。
  • 统计量 Statistic:只由样本计算的数值,例如样本均值 Xˉ\bar X、样本方差 S2S^2。

推断统计的基本矛盾是:总体参数未知,但我们只能观察有限样本。因此统计量本身也是随机变量,不同样本会得到不同结果。

2. 变量类型决定分析方法

选择图表、统计量和检验方法之前,必须先判断变量类型。

定性变量与定量变量

定性变量 Categorical Variable表示类别:

  • 性别、地区、血型;
  • 满意/不满意;
  • 教育程度。

定量变量 Quantitative Variable表示数值:

  • 年龄、身高、收入;
  • 每日访问量;
  • 考试成绩。

定量变量还能分为:

  • 离散变量:取可数值,例如订单数、事故次数;
  • 连续变量:可在区间中取任意值,例如温度、时间、重量。

四个测量尺度

尺度 特征 示例 合适统计量
Nominal 只有类别,没有顺序 血型、地区 频数、众数
Ordinal 有顺序,间距不一定相等 满意度、等级 中位数、分位数
Interval 差值有意义,没有真实零点 摄氏温度 均值、标准差
Ratio 有真实零点,比例有意义 收入、重量、年龄 所有常用统计量

不能对名义变量计算“平均类别”,也不能因为满意度编码为 1-5,就自动假设 1 到 2 与 4 到 5 的心理距离相同。

3. 抽样设计比模型选择更早决定结论质量

统计模型只能处理已经收集到的数据,不能自动修复糟糕的抽样设计。

常见概率抽样

  1. 简单随机抽样:每个个体被抽中的概率相同。
  2. 系统抽样:随机选择起点,每隔 kk 个抽一个。
  3. 分层抽样:先按重要特征分层,再从每层抽样。
  4. 整群抽样:先随机抽取若干群组,再调查群组中的个体。

如果总体中不同群体差异明显,分层抽样通常比同样样本量的简单随机抽样更稳定。例如调查大学生消费时,可以按年级分层,避免样本几乎全来自大一学生。

观察研究与实验研究

观察研究只记录自然发生的数据;实验研究主动施加处理,并尽量随机分配受试者。

1
相关关系 + 观察数据 != 因果关系

如果发现“喝咖啡的人学习时间更长”,不能直接推出咖啡导致学习时间增长。专业、考试压力和作息习惯都可能是混杂变量。

4. 从原始数据到频数分布和图形

原始数据通常难以直接阅读,需要经过整理:

1
Raw Data -> Frequency Table -> Graph -> Numerical Summary

分组频数分布

对跨度较大的连续数据,可划分为若干组。若数据范围为 R=xmax⁡−xmin⁡R=x_{\max}-x_{\min},计划使用 kk 组,可先取组宽:

w≈Rk.w \approx \frac{R}{k}.

合理的分组需要满足:互斥、连续、穷尽,通常使用相同组宽。分组会损失信息,所以只应当用于展示,而不是替代原始数据保存。

图表应该回答什么问题

图表 适合回答的问题
Bar Chart 各类别频数有何差异
Pareto Chart 哪些类别贡献最大
Histogram 连续变量的分布形状如何
Frequency Polygon 多组分布如何比较
Ogive 某个阈值以下的累计比例是多少
Time Series Plot 指标随时间怎样变化
Stem-and-leaf 小样本的分布和原始值是什么
Boxplot 中心、离散程度和异常值如何

直方图使用连续区间,柱子应相连;条形图表示离散类别,柱子通常分开。这是两者最直观的区别。

5. 集中趋势:均值不是唯一的“平均数”

算术平均数

样本均值为:

xˉ=1n∑i=1nxi.\bar{x}=\frac{1}{n}\sum_{i=1}^{n}x_i.

它使用了全部观测值,代数性质好,但容易受极端值影响。

中位数

将数据排序后,中位数是中间位置的数。它对极端值更稳健,因此收入、房价和等待时间等右偏分布常用中位数描述。

众数

众数是出现次数最多的值,也是名义变量可以使用的中心统计量。数据可能没有众数,也可能有多个众数。

加权均值

若不同观测具有权重 wiw_i,则:

xˉw=∑iwixi∑iwi.\bar{x}_w=\frac{\sum_i w_i x_i}{\sum_i w_i}.

课程总评、投资组合收益率和分组数据均值都属于加权平均。

均值与中位数如何选择

1
2
3
4
近似对称、异常值少 -> 均值
明显偏态、存在极端值 -> 中位数
类别变量 -> 众数
观测重要性不同 -> 加权均值

不要只报告一个中心值。均值相同的两个数据集,离散程度和分布形状可能完全不同。

6. 离散程度:为什么样本方差除以 n-1

总体方差定义为:

σ2=1N∑i=1N(xi−μ)2.\sigma^2=\frac{1}{N}\sum_{i=1}^{N}(x_i-\mu)^2.

如果总体均值未知,用样本均值替代它,样本方差写成:

S2=1n−1∑i=1n(Xi−Xˉ)2.S^2=\frac{1}{n-1}\sum_{i=1}^{n}(X_i-\bar X)^2.

为什么不是除以 nn?因为偏差满足:

∑i=1n(Xi−Xˉ)=0.\sum_{i=1}^{n}(X_i-\bar X)=0.

一旦前 n−1n-1 个偏差确定,最后一个偏差也被确定,只剩 n−1n-1 个自由度。更重要的是可以推导:

E[∑i=1n(Xi−Xˉ)2]=(n−1)σ2.\mathbb E\left[\sum_{i=1}^{n}(X_i-\bar X)^2\right]=(n-1)\sigma^2.

因此:

E[S2]=σ2,\mathbb E[S^2]=\sigma^2,

也就是说除以 n−1n-1 后,S2S^2 才是总体方差的无偏估计量。这项修正称为 Bessel’s correction。

变异系数

不同单位或均值尺度下,可使用:

CV=sxˉ×100%.CV=\frac{s}{\bar x}\times 100\%.

标准差为 10 对平均值 20 和平均值 100 的意义完全不同,CV 描述的是相对波动。

Chebyshev 不等式

对任何具有有限方差的分布:

P(∣X−μ∣<kσ)≥1−1k2,k>1.P(|X-\mu|<k\sigma)\ge 1-\frac{1}{k^2},\quad k>1.

它不要求正态分布。例如至少 75%75\% 的观测落在均值的两个标准差内,因为 1−1/22=0.751-1/2^2=0.75。

7. 概率:统计推断的语言

样本空间记作 Ω\Omega,事件是 Ω\Omega 的子集。

加法公式

P(A∪B)=P(A)+P(B)−P(A∩B).P(A\cup B)=P(A)+P(B)-P(A\cap B).

若 A,BA,B 互斥,则 P(A∩B)=0P(A\cap B)=0。

条件概率

P(A∣B)=P(A∩B)P(B).P(A\mid B)=\frac{P(A\cap B)}{P(B)}.

独立性

若:

P(A∩B)=P(A)P(B),P(A\cap B)=P(A)P(B),

则 A,BA,B 独立。互斥和独立完全不同:两个概率非零的互斥事件不可能独立,因为一个发生会让另一个不可能发生。

Bayes 公式

P(A∣B)=P(B∣A)P(A)P(B).P(A\mid B)=\frac{P(B\mid A)P(A)}{P(B)}.

Bayes 公式说明:后验概率由似然和先验共同决定。即使医学检测灵敏度很高,当疾病非常罕见时,阳性结果对应的真实患病概率仍可能不高。

8. 离散随机变量与四个常用分布

离散随机变量 XX 的概率质量函数满足:

p(x)=P(X=x),∑xp(x)=1.p(x)=P(X=x),\qquad \sum_x p(x)=1.

期望与方差为:

E[X]=∑xxp(x),\mathbb E[X]=\sum_x xp(x),

Var⁡(X)=E[X2]−(E[X])2.\operatorname{Var}(X)=\mathbb E[X^2]-\bigl(\mathbb E[X]\bigr)^2.

Binomial 二项分布

适用条件:固定 nn 次独立试验、每次只有成功/失败、成功概率 pp 不变。

X∼Bin⁡(n,p),P(X=x)=(nx)px(1−p)n−x.X\sim\operatorname{Bin}(n,p),\qquad P(X=x)=\binom nx p^x(1-p)^{n-x}.

E[X]=np,Var⁡(X)=np(1−p).\mathbb E[X]=np,\qquad \operatorname{Var}(X)=np(1-p).

Multinomial 多项分布

二项分布的多类别推广。每次试验可能落入 kk 个类别,类别概率之和为 1。

Poisson 泊松分布

适合描述固定时间或空间区间内的稀有事件次数:

P(X=x)=e−λλxx!,E[X]=Var⁡(X)=λ.P(X=x)=\frac{e^{-\lambda}\lambda^x}{x!}, \qquad \mathbb E[X]=\operatorname{Var}(X)=\lambda.

典型应用包括单位时间呼叫数、事故数和网页请求数。

Hypergeometric 超几何分布

从有限总体中不放回抽样时使用:

P(X=x)=(Kx)(N−Kn−x)(Nn).P(X=x)=\frac{\binom Kx\binom{N-K}{n-x}}{\binom Nn}.

二项分布通常对应独立或近似独立的重复试验;超几何分布因为不放回,试验之间并不独立。

9. 正态分布与标准化

若 X∼N(μ,σ2)X\sim N(\mu,\sigma^2),密度函数为:

f(x)=1σ2πexp⁡[−(x−μ)22σ2].f(x)=\frac{1}{\sigma\sqrt{2\pi}} \exp\left[-\frac{(x-\mu)^2}{2\sigma^2}\right].

标准化:

Z=X−μσ∼N(0,1).Z=\frac{X-\mu}{\sigma}\sim N(0,1).

标准化把不同量纲的问题转化为同一个标准正态分布问题。经验法则是:

1
2
3
mu +/- 1 sigma : about 68%
mu +/- 2 sigma : about 95%
mu +/- 3 sigma : about 99.7%

正态分布经验法则

正态近似二项分布时,需要连续性修正。例如:

P(X≤10)≈P(Y<10.5),P(X\le 10)\approx P(Y<10.5),

其中 Y∼N(np,np(1−p))Y\sim N(np,np(1-p))。

10. 中心极限定理:为什么均值可以近似正态

设 X1,…,XnX_1,\ldots,X_n 独立同分布,总体均值为 μ\mu,方差为 σ2<∞\sigma^2<\infty。样本均值:

Xˉ=1n∑i=1nXi.\bar X=\frac{1}{n}\sum_{i=1}^{n}X_i.

先计算其期望和方差:

E[Xˉ]=μ,\mathbb E[\bar X]=\mu,

Var⁡(Xˉ)=1n2∑i=1nVar⁡(Xi)=σ2n.\operatorname{Var}(\bar X) =\frac{1}{n^2}\sum_{i=1}^{n}\operatorname{Var}(X_i) =\frac{\sigma^2}{n}.

所以样本均值的标准差,也就是标准误,为:

SE(Xˉ)=σn.SE(\bar X)=\frac{\sigma}{\sqrt n}.

中心极限定理进一步说明,当 nn 足够大时:

Xˉ−μσ/n→dN(0,1).\frac{\bar X-\mu}{\sigma/\sqrt n} \xrightarrow{d}N(0,1).

关键点是:原总体不一定正态,但样本均值的分布会逐渐接近正态。

中心极限定理模拟

样本量增大产生两个效果:

  1. 抽样分布更接近正态。
  2. 标准误按 1/n1/\sqrt n 缩小。

这也是置信区间和假设检验能够成立的核心桥梁。

11. 点估计:什么叫“好估计量”

估计总体参数的统计量通常从三个角度评价。

无偏性

E[θ^]=θ.\mathbb E[\hat\theta]=\theta.

长期重复抽样时,估计量平均不会系统性偏高或偏低。

一致性

θ^n→Pθ.\hat\theta_n\xrightarrow{P}\theta.

样本量增大时,估计量越来越接近真实参数。

有效性

在同样无偏的估计量中,方差更小的估计量更有效。

注意:无偏不等于好。单个观测 X1X_1 是 μ\mu 的无偏估计,但方差为 σ2\sigma^2;样本均值 Xˉ\bar X 的方差只有 σ2/n\sigma^2/n,稳定得多。

12. 从枢轴量推导置信区间

“估计值 ±\pm 临界值 ×\times 标准误”不是需要死记的模板,它来自对一个概率不等式的反解。

设 X1,…,Xn∼iidN(μ,σ2)X_1,\ldots,X_n\overset{iid}{\sim}N(\mu,\sigma^2),并暂时假设 σ\sigma 已知。因为

Xˉ∼N(μ,σ2n),\bar X\sim N\left(\mu,\frac{\sigma^2}{n}\right),

所以不含未知参数的标准化统计量

Z=Xˉ−μσ/n∼N(0,1)Z=\frac{\bar X-\mu}{\sigma/\sqrt n}\sim N(0,1)

称为枢轴量。若 z1−α/2z_{1-\alpha/2} 表示标准正态分布的 1−α/21-\alpha/2 分位点,则

P(−z1−α/2≤Z≤z1−α/2)=1−α.P\left(-z_{1-\alpha/2}\le Z\le z_{1-\alpha/2}\right)=1-\alpha.

把 ZZ 展开并对 μ\mu 解不等式:

P(Xˉ−z1−α/2σn≤μ≤Xˉ+z1−α/2σn)=1−α.P\left( \bar X-z_{1-\alpha/2}\frac{\sigma}{\sqrt n} \le \mu \le \bar X+z_{1-\alpha/2}\frac{\sigma}{\sqrt n} \right)=1-\alpha.

因此 μ\mu 的 (1−α)(1-\alpha) 置信区间为

Xˉ±z1−α/2σn.\boxed{\bar X\pm z_{1-\alpha/2}\frac{\sigma}{\sqrt n}}.

为什么未知方差时使用 t 分布

若总体正态但 σ\sigma 未知,有两个事实:

Z=Xˉ−μσ/n∼N(0,1),Z=\frac{\bar X-\mu}{\sigma/\sqrt n}\sim N(0,1),

U=(n−1)S2σ2∼χn−12,U=\frac{(n-1)S^2}{\sigma^2}\sim\chi^2_{n-1},

并且 ZZ 与 UU 相互独立。于是

ZU/(n−1)=Xˉ−μS/n∼tn−1.\frac{Z}{\sqrt{U/(n-1)}} =\frac{\bar X-\mu}{S/\sqrt n} \sim t_{n-1}.

反解这个 t 枢轴量,得到

Xˉ±t1−α/2,n−1Sn.\boxed{\bar X\pm t_{1-\alpha/2,n-1}\frac{S}{\sqrt n}}.

t 分布尾部更厚,正是因为用随机变量 SS 替代 σ\sigma 后多了一层估计误差。自由度增大时,SS 越来越稳定,t 分布也逐渐接近标准正态。

总体比例的近似区间

若 X∼Bin⁡(n,p)X\sim\operatorname{Bin}(n,p),则 p^=X/n\hat p=X/n,并且

E(p^)=p,Var⁡(p^)=p(1−p)n.E(\hat p)=p, \qquad \operatorname{Var}(\hat p)=\frac{p(1-p)}{n}.

利用中心极限定理并用 p^\hat p 代替未知的 pp,得到常见的 Wald 区间:

p^±z1−α/2p^(1−p^)n.\hat p\pm z_{1-\alpha/2} \sqrt{\frac{\hat p(1-\hat p)}{n}}.

它要求 np^n\hat p 和 n(1−p^)n(1-\hat p) 足够大。小样本或比例接近 0、1 时,Wilson 区间通常比 Wald 区间更可靠。

置信度、区间宽度与样本量

已知 σ\sigma 时,误差界为

E=z1−α/2σn.E=z_{1-\alpha/2}\frac{\sigma}{\sqrt n}.

对 nn 反解:

n=⌈(z1−α/2σE)2⌉.\boxed{n=\left\lceil \left(\frac{z_{1-\alpha/2}\sigma}{E}\right)^2 \right\rceil}.

这揭示了三个直接关系:置信度越高,临界值越大;总体波动越大,区间越宽;误差缩小一半,样本量约需扩大四倍。

频率学派中,μ\mu 是固定未知常数,随机的是抽样得到的区间。95% 置信度表示:无限次重复抽样并用同一程序构造区间,约 95% 的区间会覆盖真实 μ\mu,并不表示某个已经算出的区间有 95% 概率包含 μ\mu。

13. 假设检验的数学结构

假设检验不是“证明 H0H_0 真或假”,而是在预先限制误报概率的前提下,设计一个由样本决定的决策规则。

考虑最清楚的情形:

X1,…,Xn∼iidN(μ,σ2),σ 已知,X_1,\ldots,X_n\overset{iid}{\sim}N(\mu,\sigma^2), \qquad \sigma\text{ 已知},

检验

H0:μ=μ0vsH1:μ>μ0.H_0:\mu=\mu_0 \quad\text{vs}\quad H_1:\mu>\mu_0.

在 H0H_0 下,

Z=Xˉ−μ0σ/n∼N(0,1).Z=\frac{\bar X-\mu_0}{\sigma/\sqrt n}\sim N(0,1).

若希望第一类错误概率为 α\alpha,选择临界值 z1−αz_{1-\alpha},并规定

Z>z1−αZ>z_{1-\alpha}

时拒绝 H0H_0。因为

Pμ0(Z>z1−α)=α,P_{\mu_0}(Z>z_{1-\alpha})=\alpha,

所以这个拒绝域的大小恰好是 α\alpha。用原始样本均值表示,同一规则为

Xˉ>c,c=μ0+z1−ασn.\bar X>c, \qquad c=\mu_0+z_{1-\alpha}\frac{\sigma}{\sqrt n}.

这个推导说明:显著性水平不是观察数据后临时决定的数字,而是构造拒绝域时预先写入检验程序的错误上限。

单侧与双侧拒绝域

检验方向必须由研究问题在看数据前确定:

H1:μ>μ0:Z>z1−α,H1:μ<μ0:Z<−z1−α,H1:μ≠μ0:∣Z∣>z1−α/2.\begin{aligned} H_1:\mu>\mu_0&:\quad Z>z_{1-\alpha},\\ H_1:\mu<\mu_0&:\quad Z<-z_{1-\alpha},\\ H_1:\mu\ne\mu_0&:\quad |Z|>z_{1-\alpha/2}. \end{aligned}

双侧检验把 α\alpha 平分给两个尾部,因此在相同 α\alpha 下临界值更高。看完数据再把双侧改成单侧,会人为降低 p 值并破坏原先声明的错误率。

14. 第一类错误、第二类错误与统计功效

检验结论和真实状态形成四种情况:

真实情况 不拒绝 H0H_0 拒绝 H0H_0
H0H_0 为真 正确决策 第一类错误,概率 α\alpha
H0H_0 为假 第二类错误,概率 β\beta 正确发现,概率 1−β1-\beta

第一类错误是“本来没有效应却报告有效应”,第二类错误是“效应真实存在却没有检出”。但 β\beta 不是一个脱离真实参数的固定常数:真实均值离 μ0\mu_0 越远,通常越容易检出。

严格推导 β(μ)\beta(\mu)

继续使用右尾 z 检验。拒绝条件是 Xˉ>c\bar X>c,因此当真实均值为 μ1>μ0\mu_1>\mu_0 时,第二类错误概率为

β(μ1)=Pμ1(不拒绝 H0)=Pμ1(Xˉ≤c)=Pμ1(Xˉ−μ1σ/n≤c−μ1σ/n)=Φ(z1−α−(μ1−μ0)nσ).\begin{aligned} \beta(\mu_1) &=P_{\mu_1}(\text{不拒绝 }H_0)\\ &=P_{\mu_1}(\bar X\le c)\\ &=P_{\mu_1}\left( \frac{\bar X-\mu_1}{\sigma/\sqrt n} \le \frac{c-\mu_1}{\sigma/\sqrt n} \right)\\ &=\Phi\left( z_{1-\alpha}- \frac{(\mu_1-\mu_0)\sqrt n}{\sigma} \right). \end{aligned}

于是功效函数为

π(μ1)=1−β(μ1)=1−Φ(z1−α−(μ1−μ0)nσ).\boxed{ \pi(\mu_1)=1-\beta(\mu_1) =1-\Phi\left( z_{1-\alpha}- \frac{(\mu_1-\mu_0)\sqrt n}{\sigma} \right) }.

令标准化效应量

d=μ1−μ0σ,d=\frac{\mu_1-\mu_0}{\sigma},

则功效只通过 dnd\sqrt n 受到效应量与样本量影响:

π(d)=1−Φ(z1−α−dn).\pi(d)=1-\Phi\left(z_{1-\alpha}-d\sqrt n\right).

这解释了为什么“大样本很容易显著”:即使 dd 很小,只要 nn 足够大,dnd\sqrt n 仍可能越过临界值。统计显著不自动等于实际重要。

双侧检验的功效函数

对 H1:μ≠μ0H_1:\mu\ne\mu_0,令

λ=(μ1−μ0)nσ,z∗=z1−α/2.\lambda=\frac{(\mu_1-\mu_0)\sqrt n}{\sigma}, \qquad z^*=z_{1-\alpha/2}.

在真实均值 μ1\mu_1 下,检验统计量服从 N(λ,1)N(\lambda,1),所以

π(μ1)=Pμ1(∣Z∣>z∗)=Pμ1(Z<−z∗)+Pμ1(Z>z∗)=Φ(−z∗−λ)+1−Φ(z∗−λ).\begin{aligned} \pi(\mu_1) &=P_{\mu_1}(|Z|>z^*)\\ &=P_{\mu_1}(Z<-z^*)+P_{\mu_1}(Z>z^*)\\ &=\Phi(-z^*-\lambda)+1-\Phi(z^*-\lambda). \end{aligned}

当 μ1=μ0\mu_1=\mu_0 时 λ=0\lambda=0,功效等于 α\alpha;当 ∣μ1−μ0∣|\mu_1-\mu_0| 增大时,功效趋近于 1。

假设检验的功效曲线

α\alpha、β\beta、样本量与效应量的权衡

在样本量和真实效应固定时,降低 α\alpha 会把拒绝阈值推得更远,因此 β\beta 上升、功效下降。不能同时免费地把两类错误都压低;增加样本量才是同时改善它们的主要方法。

功效会在以下情况下提高:

  • 样本量 nn 增大;
  • 真实效应 ∣μ1−μ0∣|\mu_1-\mu_0| 增大;
  • 数据标准差 σ\sigma 减小;
  • 在方向确有理论依据时使用单侧检验;
  • 放宽显著性水平 α\alpha,但代价是更多第一类错误。

从目标功效反推样本量

对右尾检验,若希望在真实差异 Δ=μ1−μ0>0\Delta=\mu_1-\mu_0>0 下达到功效 1−β1-\beta,由

1−β=1−Φ(z1−α−Δnσ)1-\beta =1-\Phi\left(z_{1-\alpha}-\frac{\Delta\sqrt n}{\sigma}\right)

反解得到

n=⌈[(z1−α+z1−β)σΔ]2⌉.\boxed{ n=\left\lceil \left[ \frac{(z_{1-\alpha}+z_{1-\beta})\sigma}{\Delta} \right]^2 \right\rceil }.

例如 μ0=100\mu_0=100、σ=15\sigma=15,希望以 α=0.05\alpha=0.05 的右尾检验检测 Δ=5\Delta=5,目标功效为 0.80。因为

z0.95=1.645,z0.80=0.842,z_{0.95}=1.645, \qquad z_{0.80}=0.842,

所以

n=⌈[(1.645+0.842)155]2⌉=56.n=\left\lceil \left[\frac{(1.645+0.842)15}{5}\right]^2 \right\rceil =56.

双侧检验的常用规划近似是把 z1−αz_{1-\alpha} 换成 z1−α/2z_{1-\alpha/2}。真实研究还要考虑失访、方差估计误差、多重比较和模型偏离,因此通常需要预留样本。

15. p 值从哪里来,以及它不能回答什么

p 值是在 H0H_0 所规定的抽样分布下,把“当前结果或更极端结果”全部加起来的尾部概率。设观测统计量为 zobsz_{obs}:

H1:μ>μ0:p=1−Φ(zobs),H1:μ<μ0:p=Φ(zobs),H1:μ≠μ0:p=2[1−Φ(∣zobs∣)].\begin{aligned} H_1:\mu>\mu_0&:\quad p=1-\Phi(z_{obs}),\\ H_1:\mu<\mu_0&:\quad p=\Phi(z_{obs}),\\ H_1:\mu\ne\mu_0&:\quad p=2[1-\Phi(|z_{obs}|)]. \end{aligned}

以双侧检验为例,若 zobs=2.10z_{obs}=2.10,则

p=2[1−Φ(2.10)]≈0.0357.p=2[1-\Phi(2.10)]\approx0.0357.

所以在 α=0.05\alpha=0.05 下拒绝 H0H_0,但在 α=0.01\alpha=0.01 下不拒绝。p 值不是“结论按钮”,它只是数据与某个特定原假设不相容程度的连续刻度。

当检验统计量连续且 H0H_0 成立时,p 值服从 U(0,1)U(0,1)。因此

PH0(p≤α)=α,P_{H_0}(p\le\alpha)=\alpha,

这正是“以 p 值不超过 α\alpha 为拒绝规则”能够控制第一类错误的原因。

p 值并不是:

  • P(H0∣data)P(H_0\mid\text{data}),也就是原假设为真的后验概率;
  • 结果“由随机造成”的概率;
  • 效应量或实际重要性的大小;
  • 下一次实验能够重复成功的概率。

p>αp>\alpha 只表示当前数据没有提供足够强的反对证据,应写“未能拒绝 H0H_0”,不能写“接受 H0H_0”。低功效研究尤其容易出现“没有显著差异”,但这可能只是样本不足。

多重检验为什么增加误报

若做 mm 个相互独立、每个水平为 α\alpha 的检验,至少出现一次第一类错误的概率为

P(至少一次误报)=1−(1−α)m.P(\text{至少一次误报})=1-(1-\alpha)^m.

当 m=20m=20、α=0.05\alpha=0.05 时,这个概率约为 0.642,而不是 0.05。Bonferroni 方法用 α/m\alpha/m 作为每次检验阈值,可由并集上界控制总体错误率:

P(⋃j=1m第 j 次误报)≤∑j=1mαm=α.P\left(\bigcup_{j=1}^{m}\text{第 }j\text{ 次误报}\right) \le\sum_{j=1}^{m}\frac{\alpha}{m}=\alpha.

16. 常见检验统计量的推导与选择

单总体均值:z 检验与 t 检验

当 σ\sigma 已知时,直接使用

Z=Xˉ−μ0σ/n.Z=\frac{\bar X-\mu_0}{\sigma/\sqrt n}.

当 σ\sigma 未知且总体正态时,由第 12 节的 t 枢轴量得到

T=Xˉ−μ0S/n∼tn−1.T=\frac{\bar X-\mu_0}{S/\sqrt n}\sim t_{n-1}.

小样本 t 检验依赖总体近似正态;大样本时,中心极限定理使它对温和的非正态更稳健,但严重偏态和极端值仍需检查。

单总体比例

在 H0:p=p0H_0:p=p_0 下,二项分布给出

E(p^)=p0,Var⁡(p^)=p0(1−p0)n.E(\hat p)=p_0, \qquad \operatorname{Var}(\hat p)=\frac{p_0(1-p_0)}{n}.

因此原假设标准误必须使用 p0p_0:

Z=p^−p0p0(1−p0)/n.Z=\frac{\hat p-p_0} {\sqrt{p_0(1-p_0)/n}}.

这与置信区间中常用 p^\hat p 估计标准误不同,因为检验是在问“若 p=p0p=p_0,当前偏差有多反常”。

单总体方差

若总体正态,则

(n−1)S2σ2∼χn−12.\frac{(n-1)S^2}{\sigma^2}\sim\chi^2_{n-1}.

检验 H0:σ2=σ02H_0:\sigma^2=\sigma_0^2 时使用

χobs2=(n−1)S2σ02.\chi^2_{obs}=\frac{(n-1)S^2}{\sigma_0^2}.

该结论对总体正态性较敏感,因为样本方差的精确卡方分布是在正态假设下得到的。

两个独立均值:Welch t 检验

若两组独立,且不假设方差相等,

E(Xˉ1−Xˉ2)=μ1−μ2,E(\bar X_1-\bar X_2)=\mu_1-\mu_2,

Var⁡(Xˉ1−Xˉ2)=σ12n1+σ22n2.\operatorname{Var}(\bar X_1-\bar X_2) =\frac{\sigma_1^2}{n_1}+\frac{\sigma_2^2}{n_2}.

用样本方差替代未知总体方差,得到

T=(Xˉ1−Xˉ2)−Δ0S12/n1+S22/n2.T=\frac{(\bar X_1-\bar X_2)-\Delta_0} {\sqrt{S_1^2/n_1+S_2^2/n_2}}.

其自由度用 Welch-Satterthwaite 近似:

ν≈(S12/n1+S22/n2)2(S12/n1)2n1−1+(S22/n2)2n2−1.\nu\approx \frac{(S_1^2/n_1+S_2^2/n_2)^2} {\dfrac{(S_1^2/n_1)^2}{n_1-1} +\dfrac{(S_2^2/n_2)^2}{n_2-1}}.

Welch 检验允许方差与样本量不同,通常适合作为独立两样本均值比较的默认方法。

配对样本为什么能提高功效

同一对象的前后测量不是两个独立样本。令

Di=Xi−Yi,D_i=X_i-Y_i,

则问题转化为检验 H0:μD=μD,0H_0:\mu_D=\mu_{D,0}:

T=Dˉ−μD,0SD/n.T=\frac{\bar D-\mu_{D,0}}{S_D/\sqrt n}.

配对的优势可以从差值方差看出:

Var⁡(X−Y)=σX2+σY2−2ρσXσY.\operatorname{Var}(X-Y) =\sigma_X^2+\sigma_Y^2-2\rho\sigma_X\sigma_Y.

当前后测量正相关,即 ρ>0\rho>0 时,差值方差会被减小,标准误下降,功效提高。若忽略配对关系,不仅模型错误,也会浪费这部分个体内信息。

两个总体比例

检验 H0:p1=p2=pH_0:p_1=p_2=p 时,原假设要求两组共享同一个比例,因此使用合并估计

p^=x1+x2n1+n2.\hat p=\frac{x_1+x_2}{n_1+n_2}.

在 H0H_0 下,

Var⁡(p^1−p^2)=p(1−p)(1n1+1n2),\operatorname{Var}(\hat p_1-\hat p_2) =p(1-p)\left(\frac1{n_1}+\frac1{n_2}\right),

所以

Z=p^1−p^2p^(1−p^)(1/n1+1/n2).Z=\frac{\hat p_1-\hat p_2} {\sqrt{\hat p(1-\hat p)(1/n_1+1/n_2)}}.

两个总体方差

若两个独立总体均为正态,且 H0:σ12=σ22H_0:\sigma_1^2=\sigma_2^2,则

F=S12S22∼Fn1−1,n2−1.F=\frac{S_1^2}{S_2^2}\sim F_{n_1-1,n_2-1}.

F 检验对非正态和异常值非常敏感,实际数据中常用 Levene 或 Brown-Forsythe 检验替代。

置信区间与双侧检验的对偶性

对双侧检验

H0:θ=θ0vsH1:θ≠θ0,H_0:\theta=\theta_0 \quad\text{vs}\quad H_1:\theta\ne\theta_0,

所有在水平 α\alpha 下不会被拒绝的 θ0\theta_0 集合,恰好构成 (1−α)(1-\alpha) 置信区间。因此:

θ0∉CI1−α⟺p<α.\theta_0\notin CI_{1-\alpha} \quad\Longleftrightarrow\quad p<\alpha.

例如 95% 置信区间为 [2.1,5.4][2.1,5.4]:检验 H0:θ=0H_0:\theta=0 会拒绝,而检验 H0:θ=3H_0:\theta=3 不会拒绝。置信区间通常比一个孤立的 p 值更有解释力,因为它同时给出效应方向、合理大小和估计精度。

17. 相关与回归:关系不等于因果

Pearson 相关系数

r=∑i(xi−xˉ)(yi−yˉ)∑i(xi−xˉ)2∑i(yi−yˉ)2.r=\frac{\sum_i(x_i-\bar x)(y_i-\bar y)} {\sqrt{\sum_i(x_i-\bar x)^2\sum_i(y_i-\bar y)^2}}.

它满足 −1≤r≤1-1\le r\le1,描述两个变量的线性关系方向和强度。

注意:

  • r=0r=0 只表示无线性相关,不代表完全没有关系;
  • 极端值可能显著改变 rr;
  • 相关系数没有单位;
  • 相关不等于因果。

最小二乘回归

简单线性回归模型:

Yi=β0+β1Xi+εi.Y_i=\beta_0+\beta_1X_i+\varepsilon_i.

最小二乘法选择 b0,b1b_0,b_1,使残差平方和最小:

SSE=∑i=1n(yi−b0−b1xi)2.SSE=\sum_{i=1}^{n}(y_i-b_0-b_1x_i)^2.

对 b0,b1b_0,b_1 求偏导并令其为 0,可以得到:

b1=∑i(xi−xˉ)(yi−yˉ)∑i(xi−xˉ)2,b_1=\frac{\sum_i(x_i-\bar x)(y_i-\bar y)} {\sum_i(x_i-\bar x)^2},

b0=yˉ−b1xˉ.b_0=\bar y-b_1\bar x.

斜率 b1b_1 表示 XX 每增加一个单位,YY 的条件均值预计改变多少。

决定系数

R2=1−SSESST.R^2=1-\frac{SSE}{SST}.

在简单线性回归中 R2=r2R^2=r^2。它表示模型解释的样本变异比例,但高 R2R^2 不代表模型因果正确,也不保证外推可靠。

回归诊断

线性回归通常检查:

  1. 线性关系;
  2. 误差独立;
  3. 同方差性;
  4. 残差近似正态;
  5. 不存在支配结果的异常点。

残差图若呈漏斗形,提示异方差;若呈弯曲结构,提示线性模型遗漏了非线性关系。

线性回归与残差诊断

18. Python 实战:把概念跑一遍

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
import numpy as np
import pandas as pd
from scipy import stats

rng = np.random.default_rng(42)
group_a = rng.normal(loc=72, scale=8, size=40)
group_b = rng.normal(loc=77, scale=9, size=45)

# 描述统计
summary = pd.DataFrame({"A": group_a, "B": pd.Series(group_b)})
print(summary.describe())

# A 组均值的 95% t 置信区间
n = len(group_a)
mean = group_a.mean()
se = stats.sem(group_a)
ci = stats.t.interval(0.95, df=n - 1, loc=mean, scale=se)
print("mean:", mean, "95% CI:", ci)

# Welch 两独立样本 t 检验
result = stats.ttest_ind(group_a, group_b, equal_var=False)
print("t statistic:", result.statistic)
print("p value:", result.pvalue)

# 效应量 Cohen's d
pooled_sd = np.sqrt(
((len(group_a) - 1) * group_a.var(ddof=1)
+ (len(group_b) - 1) * group_b.var(ddof=1))
/ (len(group_a) + len(group_b) - 2)
)
cohens_d = (group_b.mean() - group_a.mean()) / pooled_sd
print("Cohen's d:", cohens_d)

# 右尾 z 检验的理论功效
alpha = 0.05
mu0 = 100
mu1 = 105
sigma = 15
n = 56

z_critical = stats.norm.ppf(1 - alpha)
noncentrality = (mu1 - mu0) * np.sqrt(n) / sigma
power = 1 - stats.norm.cdf(z_critical - noncentrality)
print("theoretical power:", power)

# 给定目标功效,反推样本量
target_power = 0.80
z_power = stats.norm.ppf(target_power)
required_n = np.ceil(
((z_critical + z_power) * sigma / (mu1 - mu0)) ** 2
).astype(int)
print("required sample size:", required_n) # 56

不要只输出 p-value。一个更完整的分析至少应报告:

1
样本量 + 描述统计 + 效应估计 + 置信区间 + p-value + 方法假设

19. 统计方法选择速查表

问题 数据结构 常用方法
一个总体均值是否等于给定值 连续变量,σ\sigma 未知 One-sample t-test
两个独立总体均值是否不同 两组独立连续数据 Welch t-test
同一对象前后是否变化 配对连续数据 Paired t-test
一个总体比例是否等于给定值 二分类结果 One-proportion z-test / exact test
两组比例是否不同 两组二分类结果 Two-proportion z-test / chi-square
一个总体方差是否等于给定值 正态连续数据 Chi-square variance test
两个总体方差是否相同 两组正态连续数据 F-test;稳健替代为 Levene
两个连续变量是否线性相关 成对连续数据 Pearson correlation
用一个连续变量预测另一个 响应与预测变量 Simple linear regression

如果正态性或异常值问题严重,可考虑非参数方法,例如 Mann-Whitney U、Wilcoxon signed-rank 和 Spearman correlation。

20. 最容易犯的错误

  1. 看到 p-value 很小就认为效应一定很大。
  2. p-value 大于 0.05 就宣布“两个总体完全相同”。
  3. 忽略独立、正态、同方差等方法假设。
  4. 对偏态且有极端值的数据只报告均值。
  5. 把相关关系写成因果关系。
  6. 用训练数据上的高 R2R^2 证明预测模型可靠。
  7. 在看完数据后反复修改假设,却仍按一次检验解释 p-value。
  8. 同时做大量检验却不控制多重比较错误。
  9. 只报告显著性,不报告置信区间和效应量。
  10. 把“95% 置信”解释成参数有 95% 概率落在已算出的区间里。

21. 一条真正连贯的统计学习路线

这 10 讲不是彼此孤立的章节。它们可以压缩成一条推理链:

1
2
3
4
5
6
7
8
9
10
抽样决定数据是否有代表性
-> 描述统计帮助理解样本
-> 概率刻画随机性
-> 分布描述统计量的随机规律
-> CLT 给出样本均值的近似分布
-> 标准误衡量抽样波动
-> 置信区间给出参数的合理范围
-> 假设检验量化反对基准假设的证据
-> 两样本方法比较群体
-> 回归把关系、解释和预测统一起来

真正掌握统计学,不是记住更多公式,而是看到一个问题时能够回答:

  1. 总体和样本分别是什么?
  2. 变量属于什么类型?
  3. 数据怎样产生,是否存在偏差?
  4. 我需要描述、估计、比较还是预测?
  5. 方法依赖哪些假设?
  6. 结论中的不确定性有多大?

当这六个问题能够答清楚,公式就不再是一堆孤立符号,而是同一套推断逻辑的不同工具。

AMA2634 统计导论:从描述统计、概率分布到统计推断与线性回归

https://richardf123.github.io/2026/09/30/ama2634-introduction-to-statistics-guide/

作者

RichardF

发布于

2026-09-30

更新于

2026-09-30

许可协议

Click to play