概率论与数理统计复习资料
总览知识地图与四条主线
先把地图装进脑子,再背细节:概率论从模型出发(公理、随机变量、分布),数理统计从数据出发(样本、估计、检验)——两者靠"大数定律与中心极限定理"这座桥相连。每个统计结论都必须同时回答三件事:条件(独立性、矩存在、正态性)、结论(分布、无偏性、相合性)、量级(收敛速度、置信水平、检验功效)。点击图中节点可跳到对应条目。
四条主线速记:① 概率基础——样本空间与概率公理(可加性)→ 条件概率与贝叶斯公式(乘法公式)→ 独立性(两两独立 ≠ 相互独立);② 随机变量与分布——分布函数(三性质)→ 离散 / 连续型常见分布(0-1、二项、Poisson、均匀、指数、正态)→ 多维联合与边际 → 随机变量函数与卷积;③ 数字特征与极限——期望 / 方差(线性性、Cauchy-Schwarz)→ 特征函数(唯一性)→ Chebyshev 不等式 → 大数定律(频率 → 概率)→ 中心极限定理(正态近似);④ 统计推断——样本与统计量(S² 无偏性)→ 三大抽样分布(χ² / t / F)→ 点估计(矩估计 / MLE)→ 区间估计(枢轴量法)→ 假设检验(两类错误、Neyman-Pearson 引理)。枢纽是独立性与正态性:前者决定卷积与方差可加,后者贯穿抽样分布与中心极限。
01事件与概率
本章建立概率的"公理语言":一切结论从三条公理推出。核心技能有三——用集合运算拆事件、用条件概率改换视角(贝叶斯)、用独立性简化计算。注意区分"两两独立"与"相互独立"。
样本空间 \(\Omega\):随机试验全部可能结果的集合;事件:\(\Omega\) 的子集;事件域 \(\mathcal F\):对可数并、补集封闭的 \(\sigma\)-代数。
概率 \(P:\mathcal F\to[0,1]\) 满足 Kolmogorov 公理:(1) 规范性 \(P(\Omega)=1\);(2) 非负性 \(P(A)\ge0\);(3) 可列可加性:互不相容事件列 \(A_1,A_2,\dots\) 有 \(P(\bigcup_i A_i)=\sum_i P(A_i)\)。
(1) \(P(\varnothing)=0\);(2) 有限可加性:\(A_i\) 互不相容 ⟹ \(P(\bigcup_{i=1}^{n}A_i)=\sum_{i=1}^{n}P(A_i)\);(3) 对立事件 \(P(A^c)=1-P(A)\);(4) 减法:\(A\subset B\implies P(B\setminus A)=P(B)-P(A)\),且 \(P(A)\le P(B)\)(单调性);(5) 加法公式:\(P(A\cup B)=P(A)+P(B)-P(AB)\);三事件:\(P(A\cup B\cup C)=\sum P(A)-\sum P(AB)+P(ABC)\)。
证明
(1) 取 \(A_i=\varnothing\) 互不相容,可列可加性给 \(P(\varnothing)=P(\varnothing)+P(\varnothing)+\cdots\),故 \(P(\varnothing)=0\)。
(3) \(A\cup A^c=\Omega\) 且不相容:\(P(A)+P(A^c)=1\)。
(4) \(B=A\cup(B\setminus A)\) 且不相容,故 \(P(B)=P(A)+P(B\setminus A)\ge P(A)\)。
(5) \(A\cup B=A\cup(B\setminus AB)\),且 \(B=(AB)\cup(B\setminus A)\) 不相容:\(P(B)=P(AB)+P(B\setminus A)\)。代入 \(P(A\cup B)=P(A)+P(B)-P(AB)\)。三事件用两次二事件公式归纳。
\(P(A)>0\) 时,事件 \(B\) 在 \(A\) 发生条件下的(条件)概率
\[P(B\mid A)=\frac{P(AB)}{P(A)}.\]
固定 \(A\) 时,\(P(\cdot\mid A)\) 仍是 \(\mathcal F\) 上的概率(满足三条公理)。乘法公式:\(P(AB)=P(A)P(B\mid A)=P(B)P(A\mid B)\),可推广到 \(n\) 个事件。
设 \(B_1,\dots,B_n\) 是 \(\Omega\) 的一个划分(两两不相容且并集为 \(\Omega\),\(P(B_i)>0\)),则
\[P(A)=\sum_{i=1}^{n}P(B_i)P(A\mid B_i)\qquad(\text{全概率公式});\]
\[P(B_j\mid A)=\frac{P(B_j)P(A\mid B_j)}{\sum_{i=1}^{n}P(B_i)P(A\mid B_i)}\qquad(\text{贝叶斯公式}).\]
全概率公式是"由因到果"(按先验加权平均),贝叶斯公式是"由果溯因":后验概率 ∝ 先验 × 似然。
证明
全概率:\(A=A\cap\Omega=A\cap(\bigcup_i B_i)=\bigcup_i(AB_i)\),各项两两不相容,由可列可加性 \(P(A)=\sum_i P(AB_i)=\sum_i P(B_i)P(A\mid B_i)\)(乘法公式)。
贝叶斯:由条件概率定义 \(P(B_j\mid A)=\frac{P(B_jA)}{P(A)}\),分子用乘法公式、分母用全概率公式,即得。
事件 \(A,B\) 独立:\(P(AB)=P(A)P(B)\)。两两独立:任意两个事件独立。相互独立:对任意子集 \(I\subset\{1,\dots,n\}\) 有 \(P(\bigcap_{i\in I}A_i)=\prod_{i\in I}P(A_i)\)(全体交集公式全部成立)。
注意:独立 ≠ 互斥(互斥要求 \(AB=\varnothing\),正概率时反而强依赖)。运算法则:\(A,B\) 独立 ⟹ \(A,B^c\) 与 \(A^c,B^c\) 也独立。
相互独立 ⟹ 两两独立;反之不成立:存在三个事件两两独立但不相互独立(此时 \(P(A_1A_2A_3)\ne P(A_1)P(A_2)P(A_3)\))。
经典反例(Bernstein):从 \(\{1,2,3,4\}\) 等可能取一点,令 \(A_1=\{1,2\}\)、\(A_2=\{1,3\}\)、\(A_3=\{1,4\}\)。每对交集为单点,概率 \(1/4=(1/2)^2\);但 \(A_1A_2A_3=\{1\}\),\(P=\frac14\ne\frac18\)。
证明(反例验证)
样本空间等可能,\(P(A_i)=\frac{2}{4}=\frac12\)。两两交集:\(A_1\cap A_2=\{1\}\),\(P(A_1A_2)=\frac14=P(A_1)P(A_2)\),其余两对同理——两两独立成立。三交集:\(A_1A_2A_3=\{1\}\),\(P=\frac14\),而 \(\prod_iP(A_i)=\frac18\ne\frac14\)——不满足相互独立的"全体公式",故三者不相互独立。
02随机变量与分布
本章把事件语言翻译成函数语言:分布函数统一刻画一切随机变量;离散型看分布律,连续型看密度。重点:常见分布的参数与特征、随机变量函数的分布(分布函数法 + 单调变换公式)。
随机变量:可测函数 \(X:\Omega\to\mathbb R\)(对任意区间 \(I\),\(\{X\in I\}\in\mathcal F\))。分布函数
\[F(x)=P(X\le x),\qquad x\in\mathbb R.\]
三性质(充要):(1) 单调不减;(2) 右连续:\(\lim_{x\to a^+}F(x)=F(a)\);(3) \(\lim_{x\to-\infty}F(x)=0,\ \lim_{x\to+\infty}F(x)=1\)。分布函数与分布(概率测度)一一对应。
取值至多可数:分布律 \(P(X=x_k)=p_k\),满足 \(p_k\ge0,\ \sum p_k=1\)。常见离散分布:
0-1 分布 \(B(1,p)\)(\(P(X=1)=p\));二项 \(X\sim B(n,p)\):\(P(X=k)=\binom{n}{k}p^k(1-p)^{n-k}\)(\(n\) 次独立重复试验的成功次数);Poisson \(X\sim P(\lambda)\):\(P(X=k)=\frac{\lambda^k}{k!}e^{-\lambda}\)(稀有事件计数);几何分布(首次成功所需试验次数);超几何分布(不放回抽样中的成功数)。
存在密度函数 \(f\ge0\) 使 \(F(x)=\int_{-\infty}^{x}f(t)\,\mathrm{d}t\)。此时 \(P(X=a)=0\)(单点概率为零,但并非不可能事件),
\[P(a 常见连续分布:均匀 \(U(a,b)\);指数 \(\mathrm{Exp}(\lambda)\)(\(f=\lambda e^{-\lambda x}\),无记忆性);正态 \(N(\mu,\sigma^2)\);Gamma(指数之和)、Beta、\(\chi^2\)(第 6 章)。
复习时按"背景 → 分布律/密度 → 参数 → 期望方差"四要素记忆。正态族 \(N(\mu,\sigma^2)\) 密度 \(\frac{1}{\sqrt{2\pi}\sigma}e^{-(x-\mu)^2/2\sigma^2}\);标准正态 \(\Phi(x)\) 表值与分位数 \(z_\alpha\)(\(\Phi(z_\alpha)=1-\alpha\))是统计推断的公共查表工具。
分布间关系(记忆锚点):\(B(n,p)\overset{n\to\infty}{\longrightarrow}P(np)\)(泊松近似);二项与超几何互化;\(N(0,1)^2\) 之和 → \(\chi^2\)(第 6 章);指数是 \(\Gamma(1,\lambda)\)。
设 \(Y=g(X)\):
(1) 离散型:合并相同取值 \(P(Y=y)=\sum_{x:g(x)=y}P(X=x)\);
(2) 连续型(分布函数法):\(F_Y(y)=P(g(X)\le y)\) 化归为 \(X\) 的事件再积分;
(3) 单调变换(Jacobi 公式):\(g\) 严格单调可微、\(g^{-1}=h\),则 \(f_Y(y)=f_X(h(y))\,|h'(y)|\)。线性变换特例:\(Y=aX+b\) ⟹ \(f_Y(y)=\frac1{|a|}f_X(\frac{y-b}{a})\)。
证明(单调情形)
设 \(g\) 严格递增、可微,\(h=g^{-1}\)。\(F_Y(y)=P(Y\le y)=P(X\le h(y))=F_X(h(y))\)。两边对 \(y\) 求导(链式法则):\(f_Y(y)=f_X(h(y))\cdot h'(y)\)。递减时 \(F_Y(y)=P(X\ge h(y))=1-F_X(h(y))\),求导得 \(f_Y(y)=-f_X(h(y))h'(y)\)。两情形合并即 \(f_Y=f_X(h)|h'|\)。非单调时把定义域按单调区间分段后相加(分布函数法更通用)。
03多维随机变量
本章把单个随机变量升级为向量:联合分布 ⟹ 边际分布(积分/求和掉一维)⟹ 条件分布(比值);独立性等价于联合 = 边际之积。函数分布的卷积公式是"和的分布"的标准工具。
二维随机向量 \((X,Y)\) 的联合分布函数 \(F(x,y)=P(X\le x,\ Y\le y)\)。边际分布函数:\(F_X(x)=\lim_{y\to+\infty}F(x,y)=P(X\le x)\)。
离散型:联合分布律 \(p_{ij}=P(X=x_i,Y=y_j)\),边际 \(p_{i\cdot}=\sum_j p_{ij}\)。连续型:联合密度 \(f(x,y)\),边际密度 \(f_X(x)=\int_{-\infty}^{\infty}f(x,y)\,\mathrm{d}y\)。
离散型:\(P(Y=y_j\mid X=x_i)=\frac{p_{ij}}{p_{i\cdot}}\)(\(p_{i\cdot}>0\))。连续型:
\[f_{Y\mid X}(y\mid x)=\frac{f(x,y)}{f_X(x)}\qquad(f_X(x)>0).\]
条件密度满足密度性质;\(E(Y\mid X=x)=\int y\,f_{Y\mid X}(y\mid x)\,\mathrm{d}y\) 是条件期望。
\(X,Y\) 独立 ⟺ 对一切 \(x,y\):\(F(x,y)=F_X(x)F_Y(y)\);连续型 ⟺ \(f(x,y)=f_X(x)f_Y(y)\) 几乎处处;离散型 ⟺ \(p_{ij}=p_{i\cdot}p_{\cdot j}\) 对一切 \(i,j\)。
推论:独立 ⟹ 不相关(第 4 章:\(\mathrm{Cov}(X,Y)=0\)),反之不成立;但二维正态时"独立 ⟺ 不相关"(特殊豁免)。
证明(连续型)
⟸:若联合密度可分离 \(f(x,y)=f_X(x)f_Y(y)\),则对任意矩形 \(A\times B\):\(P(X\in A,Y\in B)=\int_A\int_B f_X(x)f_Y(y)\,\mathrm{d}y\,\mathrm{d}x=P(X\in A)P(Y\in B)\)。由矩形生成 \(\sigma\)-代数(Caratheodory 扩张),对一切 Borel 集成立,故独立。
⟹:若独立,由定义 \(F=F_XF_Y\);连续型时混合偏导 \(\frac{\partial^2F}{\partial x\partial y}=f_X(x)f_Y(y)\)(几乎处处)为联合密度。
\(X,Y\) 独立。离散型:
\[P(X+Y=z)=\sum_{x}P(X=x)P(Y=z-x);\]
连续型:
\[f_{X+Y}(z)=\int_{-\infty}^{\infty}f_X(x)f_Y(z-x)\,\mathrm{d}x.\]
再生性:独立正态和仍正态(\(N(\mu_1+\mu_2,\sigma_1^2+\sigma_2^2)\))、独立 Poisson 和仍 Poisson(\(\lambda_1+\lambda_2\))、独立二项和仍二项(\(p\) 相同)。
证明(分布函数法)
\(F_{X+Y}(z)=P(X+Y\le z)=\iint_{x+y\le z}f_X(x)f_Y(y)\,\mathrm{d}x\,\mathrm{d}y\)(独立性把联合密度写成乘积)。内层对 \(y\) 积分、变量替换 \(t=x+y\):
\(\int_{-\infty}^{\infty}f_X(x)\Big(\int_{-\infty}^{z-x}f_Y(y)\,\mathrm{d}y\Big)\,\mathrm{d}x=\int_{-\infty}^{\infty}f_X(x)F_Y(z-x)\,\mathrm{d}x\)。对 \(z\) 求导(Leibniz):\(f_{X+Y}(z)=\int f_X(x)f_Y(z-x)\,\mathrm{d}x\)。
04数字特征
本章给分布"降维"成少数指标:期望(位置)、方差(离散度)、协方差与相关系数(线性关联)。核心论证工具是 Cauchy-Schwarz 不等式;特征函数是唯一性定理与中心极限定理的杠杆。
离散型:\(E X=\sum_k x_k p_k\)(要求 \(\sum|x_k|p_k<\infty\));连续型:\(E X=\int_{-\infty}^{\infty}x f(x)\,\mathrm{d}x\)(要求 \(\int|x|f<\infty\),否则期望不存在,如 Cauchy 分布)。
LOTUS(函数期望,无需先求 \(g(X)\) 的分布):\(E g(X)=\sum g(x_k)p_k\) 或 \(\int g(x)f(x)\,\mathrm{d}x\);多维 \(E g(X,Y)=\iint g(x,y)f(x,y)\,\mathrm{d}x\,\mathrm{d}y\)。
(1) 线性性:\(E(aX+bY+c)=aEX+bEY+c\)(不需独立性);(2) 非负性:\(X\ge0\implies EX\ge0\);(3) 单调性:\(X\le Y\implies EX\le EY\);(4) 常数 \(E c=c\);(5) 独立性:\(X,Y\) 独立 ⟹ \(E(XY)=EX\cdot EY\)(逆不真)。
证明(离散型线性性)
\(E(aX+bY+c)=\sum_{i,j}(ax_i+by_j+c)P(X=x_i,Y=y_j)\)(把 \(aX+bY+c\) 看作二维函数用 LOTUS 的离散版)
\(=a\sum_i x_i\sum_j p_{ij}+b\sum_j y_j\sum_i p_{ij}+c\sum_{i,j}p_{ij}=aEX+bEY+c\)。
独立性 ⟹ \(E(XY)\):\(E(XY)=\sum_{i,j}x_iy_jp_ip_j=(\sum_i x_ip_i)(\sum_j y_jp_j)=EX\cdot EY\)。逆命题不成立(见 7.3 反例:\(Y=X^2\) 时可积不独立)。
方差 \(\mathrm{Var}(X)=E[(X-EX)^2]=E X^2-(EX)^2\);标准差 \(\sqrt{\mathrm{Var}(X)}\)。
协方差 \(\mathrm{Cov}(X,Y)=E[(X-EX)(Y-EY)]=E(XY)-EX\cdot EY\);相关系数
\[\rho_{XY}=\frac{\mathrm{Cov}(X,Y)}{\sqrt{\mathrm{Var}X\,\mathrm{Var}Y}}.\]
不相关:\(\rho=0\)(或 \(\mathrm{Cov}=0\))。不相关 ≠ 独立:独立 ⟹ 不相关,反之不成立。
(1) \(\mathrm{Var}(aX+b)=a^2\mathrm{Var}(X)\);(2) \(\mathrm{Var}(X+Y)=\mathrm{Var}X+\mathrm{Var}Y+2\mathrm{Cov}(X,Y)\)——独立时 \(\mathrm{Var}(X+Y)=\mathrm{Var}X+\mathrm{Var}Y\)(方差可加只需不相关);(3) Cauchy-Schwarz:\(|E(XY)|\le\sqrt{E X^2 E Y^2}\),从而 \(|\rho_{XY}|\le1\),且 \(|\rho|=1\) ⟺ 几乎必然线性相关 \(Y=aX+b\);(4) \(\mathrm{Cov}\) 双线性。
证明(Cauchy-Schwarz)
对任意实数 \(t\):\(0\le E[(tX-Y)^2]=t^2E X^2-2tE(XY)+E Y^2\) 是关于 \(t\) 的二次式恒非负,判别式 \(\le0\):\((2E(XY))^2-4E X^2 E Y^2\le0\),即 \(|E(XY)|\le\sqrt{E X^2}\sqrt{E Y^2}\)。
取 \(X-EX,\ Y-EY\) 代入得 \(|\mathrm{Cov}|\le\sqrt{\mathrm{Var}X\,\mathrm{Var}Y}\),除以分母即 \(|\rho|\le1\)。等号条件:判别式 = 0 即 \(tX-Y=0\) 几乎必然,故线性相关。
k 阶原点矩 \(\mu_k=E X^k\)、中心矩 \(E(X-EX)^k\)。矩母函数 \(M_X(t)=E e^{tX}\)(未必处处存在)。特征函数(对一切分布存在):
\[\varphi_X(t)=E e^{itX}=\int e^{itx}\,\mathrm{d}F(x).\]
矩展开:\(\varphi_X(t)=1+itEX-\frac{t^2}{2}EX^2+\cdots\)(\(E|X|^k<\infty\) 时)。
(1) 唯一性:分布函数与特征函数一一对应(\(F\) 可由 \(\varphi\) 反演:\(F(x)-F(x-0)=\lim_{T\to\infty}\frac1{2\pi}\int_{-T}^{T}\frac{e^{-itx}-e^{-it(x-h)}}{it}\varphi(t)\,\mathrm{d}t\) 类公式);(2) 线性:\(\varphi_{aX+b}(t)=e^{itb}\varphi_X(at)\);(3) 独立和:\(X,Y\) 独立 ⟹ \(\varphi_{X+Y}(t)=\varphi_X(t)\varphi_Y(t)\)(特征函数是卷积的乘法化);(4) 导数矩:\(E X^k=i^{-k}\varphi^{(k)}(0)\)。
证明要点
(3) 独立性 ⟹ \(E e^{it(X+Y)}=E(e^{itX}e^{itY})=E e^{itX}\,E e^{itY}\)(期望乘积定理,定理 4.2(5))。(4) 在 \(E|X|^k<\infty\) 与 \(t\) 的小邻域内对 \(\int e^{itx}\,\mathrm{d}F\) 作 \(k\) 次求导与积分交换(控制收敛),得 \(\varphi^{(k)}(t)=E[(ix)^k e^{itx}]\),代 \(t=0\) 即 \(i^k E X^k\)。
(1) 唯一性由 Fourier 反演;这保证"特征函数相同 ⟹ 分布相同"——第 5 章 CLT 与第 6 章正态判定的关键工具。
05大数定律与中心极限定理
本章是概率论 → 统计推断的桥:大数定律说"样本均值趋于总体均值"(收敛性),中心极限定理说"误差的分布趋于正态"(分布形状)。两种收敛模式的区别必须分清。
随机变量列 \(X_n\) 与 \(X\)(同一概率空间):
依概率收敛:\(\forall\varepsilon>0,\ P(|X_n-X|>\varepsilon)\to0\)(记 \(X_n\xrightarrow{P}X\));几乎必然收敛:\(P(\lim X_n=X)=1\)(记 \(X_n\xrightarrow{\mathrm{a.s.}}X\),最强常用收敛);r 阶矩收敛:\(E|X_n-X|^r\to0\);依分布收敛:分布函数逐点收敛 \(F_n(x)\to F(x)\)(\(F\) 的连续点处)。
关系:a.s. ⟹ P;r 阶矩 ⟹ P;P ⟹ 依分布(逆命题不成立,见 7.3 反例)。
\(X\) 有方差 \(\sigma^2<\infty\),则对任意 \(\varepsilon>0\):
\[P(|X-EX|\ge\varepsilon)\le\frac{\mathrm{Var}(X)}{\varepsilon^2}.\]
含义:方差给出偏离均值概率的普适上界(无需分布假设)。特例:\(\varepsilon=k\sigma\) 时 \(P(|X-EX|\ge k\sigma)\le1/k^2\)(约 4.5% 当 \(k=\sqrt{2}\) 时约 1/2 需 \(k=\sqrt2\)——不查表的口径)。
证明(Markov 不等式)
先证 Markov 不等式:\(Y\ge0\) 且 \(EY<\infty\) ⟹ \(P(Y\ge\varepsilon)\le\frac{EY}{\varepsilon}\)。由指示函数 \(\mathbf 1_{\{Y\ge\varepsilon\}}\le Y/\varepsilon\)(逐点),两边取期望:\(P(Y\ge\varepsilon)\le EY/\varepsilon\)。
取 \(Y=(X-EX)^2\)(非负):\(P((X-EX)^2\ge\varepsilon^2)\le\frac{E(X-EX)^2}{\varepsilon^2}=\frac{\mathrm{Var}X}{\varepsilon^2}\),即 \(P(|X-EX|\ge\varepsilon)\le\frac{\mathrm{Var}X}{\varepsilon^2}\)。
Chebyshev 弱大数定律:\(X_i\) 两两不相关、方差一致有界(\(\mathrm{Var}X_i\le C\)),则 \(\bar X_n=\frac1n\sum_{i=1}^{n}X_i\xrightarrow{P}E\bar X_n\)(独立同分布时 \(\xrightarrow{P}\mu\))。
Khinchin 弱大数定律:\(X_i\) iid、\(E|X_1|<\infty\),则 \(\bar X_n\xrightarrow{P}\mu\)(只需一阶矩,不需方差)。
Bernoulli:独立重复试验中频率 \(\frac{n_A}{n}\xrightarrow{P}P(A)\)——概率的频率定义依据。
证明(Chebyshev 路线)
\(\mathrm{Var}(\bar X_n)=\frac1{n^2}\sum_i\mathrm{Var}X_i\le\frac{C}{n}\to0\)(两两不相关 ⟹ 方差可加)。由 Chebyshev 不等式(定理 5.2)对 \(\bar X_n\) 应用:
\(P(|\bar X_n-E\bar X_n|\ge\varepsilon)\le\frac{\mathrm{Var}(\bar X_n)}{\varepsilon^2}\le\frac{C}{n\varepsilon^2}\to0\),即依概率收敛。Khinchin 版用截尾法 + 特征函数(或 Markov 不等式)替换方差估计,条件放宽到一阶矩。
Lindeberg-Levy 中心极限定理:\(X_i\) iid,\(EX=\mu,\ \mathrm{Var}X=\sigma^2<\infty\),则
\[\frac{\sum_{i=1}^{n}X_i-n\mu}{\sigma\sqrt n}=\frac{\bar X_n-\mu}{\sigma/\sqrt n}\xrightarrow{d}N(0,1),\]
即 \(P\Big(\frac{\bar X_n-\mu}{\sigma/\sqrt n}\le x\Big)\to\Phi(x)\)。de Moivre-Laplace(特例):二项 \(B(n,p)\) 标准化后近似 \(N(0,1)\),带连续性修正 \(P(a\le X\le b)\approx\Phi(\frac{b+0.5-np}{\sqrt{npq}})-\Phi(\frac{a-0.5-np}{\sqrt{npq}})\)。
证明(特征函数法)
设 \(Y_i=(X_i-\mu)/\sigma\),\(E Y_i=0\),\(\mathrm{Var}Y_i=1\)。特征函数展开(定理 4.6(4)):\(\varphi_Y(t)=1-\frac{t^2}{2}+o(t^2)\)(二阶矩有限 ⟹ 余项小)。标准化和 \(S_n=\frac1{\sqrt n}\sum Y_i\) 的特征函数(独立 ⟹ 乘积):
\(\varphi_{S_n}(t)=[\varphi_Y(t/\sqrt n)]^n=\Big[1-\frac{t^2}{2n}+o(\frac{t^2}{n})\Big]^n\to e^{-t^2/2}\)。
由连续性定理(特征函数收敛 ⟹ 分布收敛)与 \(e^{-t^2/2}\) 是 \(N(0,1)\) 的特征函数,得 \(S_n\xrightarrow{d}N(0,1)\)。
06数理统计基础
本章从"总体分布已知"翻转到"从样本反推总体":样本必须是简单随机样本(iid);统计量是样本的函数(不含未知参数);三大抽样分布(\(\chi^2,t,F\))是正态总体推断的公共词汇表。
总体:研究对象的某个数量指标 \(X\)(随机变量,分布 \(F\) 未知);个体:总体的一个元素。样本:从中抽取的 \(n\) 个个体 \(X_1,\dots,X_n\)。
简单随机样本:\(X_i\) 相互独立且与总体同分布(iid)——这是绝大多数经典统计方法的前提假设。样本的联合密度 \(=\prod_{i=1}^{n}f(x_i)\)。
统计量:样本的不含未知参数的函数 \(T=T(X_1,\dots,X_n)\)。常用:
样本均值 \(\bar X=\frac1n\sum_{i=1}^{n}X_i\);样本方差 \(S^2=\frac1{n-1}\sum_{i=1}^{n}(X_i-\bar X)^2\)(除以 \(n-1\)!);样本 \(k\) 阶矩 \(A_k=\frac1n\sum X_i^k\)。抽样分布 = 统计量的分布。
总体 \(EX=\mu,\ \mathrm{Var}X=\sigma^2\)(有限),样本 iid:
(1) \(E\bar X=\mu\),\(\mathrm{Var}(\bar X)=\sigma^2/n\)(大数定律 ⟹ \(\bar X\xrightarrow{P}\mu\),相合);(2) \(E S^2=\sigma^2\)(无偏,除以 \(n-1\) 的原因);(3) \(\frac1n\sum(X_i-\bar X)^2\) 有偏(偏小),无偏修正因子 \(n/(n-1)\)。
证明(S² 的无偏性)
先算 \(\sum_i(X_i-\bar X)^2=\sum_i X_i^2-n\bar X^2\)(展开交叉项消去)。取期望:
\(E\sum_i(X_i-\bar X)^2=\sum_i E X_i^2-nE\bar X^2\)。其中 \(EX_i^2=\sigma^2+\mu^2\),\(E\bar X^2=\mathrm{Var}(\bar X)+(E\bar X)^2=\sigma^2/n+\mu^2\)。
代入:\(=n(\sigma^2+\mu^2)-n(\sigma^2/n+\mu^2)=(n-1)\sigma^2\)。故 \(E S^2=\frac{1}{n-1}(n-1)\sigma^2=\sigma^2\),无偏。
(1) \(\chi^2\) 分布:\(Z_i\) iid \(N(0,1)\),\(\chi^2(n)=\sum_{i=1}^{n}Z_i^2\)(自由度 \(n\))。性质:\(E\chi^2=n\),\(\mathrm{Var}=2n\),可加性 \(\chi^2(n)+\chi^2(m)=\chi^2(n+m)\)(独立)。
(2) \(t\) 分布:\(Z\sim N(0,1)\),\(\chi^2\sim\chi^2(n)\) 独立,\(t(n)=\frac{Z}{\sqrt{\chi^2/n}}\)。对称、重尾(\(n>1\) 时有均值 0;\(n=1\) 即 Cauchy)。
(3) \(F\) 分布:\(\chi_1^2\sim\chi^2(n_1)\),\(\chi_2^2\sim\chi^2(n_2)\) 独立,\(F(n_1,n_2)=\frac{\chi_1^2/n_1}{\chi_2^2/n_2}\)。性质:\(1/F(n_1,n_2)\sim F(n_2,n_1)\);\(t^2(n)\sim F(1,n)\)。
\(X_i\) iid \(N(\mu,\sigma^2)\),\(\bar X,\ S^2\) 如定义 6.2,则
(1) \(\bar X\sim N(\mu,\sigma^2/n)\);(2) \(\frac{(n-1)S^2}{\sigma^2}\sim\chi^2(n-1)\);(3) \(\bar X\) 与 \(S^2\) 独立;(4) \(t=\frac{\bar X-\mu}{S/\sqrt n}\sim t(n-1)\)(方差未知时检验均值,第 7 章);(5) 两正态总体方差比 \(\frac{S_1^2/\sigma_1^2}{S_2^2/\sigma_2^2}\sim F(n_1-1,n_2-1)\)。
证明要点
(1) 正态的线性组合仍正态(再生性,定理 3.4),\(E\bar X=\mu,\ \mathrm{Var}=\sigma^2/n\)。
(2)(3) 作正交变换(Helmert 变换)\(Y=QX\):取正交阵 \(Q\) 使首行 \(\propto(1,\dots,1)\),则 \(Y_1=\sqrt n\bar X\),其余 \(Y_2,\dots,Y_n\) 独立同 \(N(0,\sigma^2)\) 且与 \(Y_1\) 独立(正交变换保持独立正态)。而 \(\sum(X_i-\bar X)^2=\sum_{i=2}^{n}Y_i^2\),故除以 \(\sigma^2\) 后 \(\sim\chi^2(n-1)\),且与 \(\bar X\)(即 \(Y_1\))独立。
(4) 由 (1)(2)(3) 与 \(t\) 分布定义(\(Z=\frac{\bar X-\mu}{\sigma/\sqrt n}\sim N(0,1)\) 与 \(\chi^2\) 独立)。
07参数估计、假设检验与速查
收束全册:点估计(矩估计 / MLE)给出参数的最优猜测,区间估计(枢轴量法)给出不确定性的定量刻画,假设检验(两类错误 + Neyman-Pearson 引理)给出决策规则。随后是核心证明清单、高频是非辨析、常见反例与自检清单。"先陈述条件,再给结论"——iid、正态性、方差已知与否决定用哪个统计量。
用样本估计总体参数 \(\theta\)。矩估计:令样本矩 = 总体矩(\(A_k=E X^k\) 的理论矩含 \(\theta\)),解方程得 \(\hat\theta\)。
极大似然估计(MLE):对样本 \((x_1,\dots,x_n)\),似然函数 \(L(\theta)=\prod_{i=1}^{n}f(x_i;\theta)\)(离散为分布律乘积);MLE 是使 \(L\)(或对数似然 \(\ell=\ln L\))最大的 \(\hat\theta\)。连续可微时解似然方程 \(\ell'(\theta)=0\)(须验证极大)。
(1) 无偏性:\(E\hat\theta=\theta\)(对一切 \(\theta\));有偏时可修正(如 \(S^2\) 对 \(n-1\) 修正);
(2) 有效性:无偏估计中方差越小越好(最小方差无偏 MVU);
(3) 相合性:\(\hat\theta_n\xrightarrow{P}\theta\)(大样本逼近,由大数定律与矩的连续性保证);
(4) MLE 的性质(正则条件下):相合、渐近正态 \(\sqrt n(\hat\theta-\theta)\xrightarrow{d}N(0,I^{-1}(\theta))\)(\(I\) 为 Fisher 信息),且渐近有效——"大样本最优"。
证明要点(MLE 渐近正态)
得分函数 \(S_n(\theta)=\frac{\partial\ln L}{\partial\theta}=\sum_i\frac{\partial\ln f(X_i;\theta)}{\partial\theta}\)。由矩性质,\(E S_n(\theta)=0\),\(\mathrm{Var}S_n(\theta)=n I(\theta)\)(Fisher 信息,\(I(\theta)=E(\frac{\partial\ln f}{\partial\theta})^2=-E\frac{\partial^2\ln f}{\partial\theta^2}\))。
由 CLT,\(S_n(\theta)/\sqrt{nI(\theta)}\xrightarrow{d}N(0,1)\)。对 \(\ell'(\hat\theta)=0\) 在真值 \(\theta\) 处 Taylor 展开(中值定理):\(0=\ell'(\theta)+\ell''(\theta^*)(\hat\theta-\theta)\),即 \(\sqrt n(\hat\theta-\theta)=-\frac{\ell'(\theta)/\sqrt n}{\ell''(\theta^*)/n}\)。分子依分布收敛 \(N(0,I(\theta))\)、分母依概率收敛于 \(-I(\theta)\),Slutsky 定理 ⟹ \(\sqrt n(\hat\theta-\theta)\xrightarrow{d}N(0,I^{-1}(\theta))\)。
置信区间:对 \(\alpha\in(0,1)\),统计量对 \((\hat\theta_L,\hat\theta_U)\) 满足 \(P(\hat\theta_L\le\theta\le\hat\theta_U)\ge1-\alpha\),称置信水平 \(1-\alpha\)。频率解释:反复抽样中,约 \(1-\alpha\) 比例的区间覆盖真值(不是"参数落在该区间的概率")。
枢轴量法:找枢轴量 \(Q=Q(X_1,\dots,X_n;\theta)\)——分布已知且不含未知参数、但含 \(\theta\)——由 \(P(q_{\alpha/2}\le Q\le q_{1-\alpha/2})=1-\alpha\) 反解出 \(\theta\) 的区间。例:正态均值 \(\frac{\bar X-\mu}{S/\sqrt n}\sim t(n-1)\) 是枢轴量。
| 待估参数(条件) | 枢轴量 | 置信区间(\(1-\alpha\)) |
|---|---|---|
| \(\mu\),\(\sigma^2\) 已知 | \(Z=\frac{\bar X-\mu}{\sigma/\sqrt n}\sim N(0,1)\) | \(\bar X\pm z_{\alpha/2}\frac{\sigma}{\sqrt n}\) |
| \(\mu\),\(\sigma^2\) 未知 | \(t=\frac{\bar X-\mu}{S/\sqrt n}\sim t(n-1)\) | \(\bar X\pm t_{\alpha/2}(n-1)\frac{S}{\sqrt n}\) |
| \(\sigma^2\),\(\mu\) 未知 | \(\frac{(n-1)S^2}{\sigma^2}\sim\chi^2(n-1)\) | \(\Big(\frac{(n-1)S^2}{\chi^2_{\alpha/2}(n-1)},\ \frac{(n-1)S^2}{\chi^2_{1-\alpha/2}(n-1)}\Big)\) |
| \(p\)(比例),大样本 | \(Z=\frac{\hat p-p}{\sqrt{p(1-p)/n}}\xrightarrow{d}N(0,1)\) | \(\hat p\pm z_{\alpha/2}\sqrt{\frac{\hat p(1-\hat p)}{n}}\) |
单侧区间:分位数取 \(z_\alpha\)(单尾)。样本量确定:区间半宽 \(d=z_{\alpha/2}\sigma/\sqrt n\) ⟹ \(n=(z_{\alpha/2}\sigma/d)^2\)。
原假设 \(H_0\) vs 备择假设 \(H_1\)。两类错误:第一类(弃真)\(\alpha=P(\text{拒绝 }H_0\mid H_0\text{ 真})\),第二类(纳伪)\(\beta=P(\text{接受 }H_0\mid H_1\text{ 真})\)。检验水平:控制 \(\alpha\le\alpha_0\)(常用 0.05/0.01)。功效 \(1-\beta\)。
Neyman-Pearson 引理:检验 \(H_0:\theta=\theta_0\) vs \(H_1:\theta=\theta_1\)(简单假设)时,在水平 \(\alpha\) 的检验中,似然比检验
\[\text{拒绝 }H_0 \iff \frac{L(\theta_1)}{L(\theta_0)}>k\qquad(\text{阈值 }k\text{ 由 }\alpha\text{ 决定})\]
是最优势检验(功效最大)。复合假设情形推广为一致最优势(UMP,需单边备择 + 单调似然比)。
证明(NP 引理要点)
设任意水平 \(\alpha\) 的检验函数 \(\phi(x)\in[0,1]\)(拒绝概率),似然比检验 \(\phi^*(x)=\mathbf1\{L(\theta_1)/L(\theta_0)>k\}+\gamma\mathbf1\{\cdot=k\}\)(随机化处理等号)。
关键不等式:对任意 \(\phi\),\((L_1-L_0)(\phi^*-\phi)\ge0\) 逐点成立(\(\phi^*=1\) 处 \(L_1>kL_0\),\(\phi^*=0\) 处 \(L_1 \(\int\phi^*L_1-\int\phi L_1\ge k\big(\int\phi^*L_0-\int\phi L_0\big)\ge k(\alpha-\alpha)=0\)(\(\phi^*\) 水平 \(\alpha\) 而 \(\phi\) 水平 \(\le\alpha\))。故 \(\int\phi^*L_1\ge\int\phi L_1\),即 \(\phi^*\) 功效不小于任何水平 \(\alpha\) 检验——最优势。
均值检验:\(\sigma\) 已知用 Z 统计量,未知用 t 统计量(\(t(n-1)\));方差检验用 \(\chi^2\);两总体比较用 t / F。p 值:在原假设下,观测到"当前或更极端"数据的概率。决策:\(p<\alpha\) 拒绝 \(H_0\);p 值越小证据越强。注意:p 值不是 \(H_0\) 为真的概率。
7.1 核心证明清单(按优先级)
| 证明 | 核心步骤速记 |
|---|---|
| ① 概率基本性质 | 可列可加性 + 集合分解(\(A\cup B=A\cup(B\setminus AB)\)) |
| ② 全概率 / 贝叶斯 | 划分拆 \(A=\bigcup AB_i\) + 可加性;条件概率定义代换 |
| ③ 相互独立 ⟹ 两两独立 | 取 \(I\) 为二元子集;反例验证 \(1/4\ne1/8\) |
| ④ 分布函数三性质 | 单调(事件包含)、右连续(单调事件列极限)、极限(\(\Omega\) 升列) |
| ⑤ 单调变换密度公式 | \(F_Y=F_X\circ h\),链式求导 + 绝对值 |
| ⑥ 卷积公式 | 分布函数法 + Leibniz 求导;独立性 ⟹ 密度乘积 |
| ⑦ 期望线性性 | 二维 LOTUS + 边际化 \(\sum_j p_{ij}=p_{i\cdot}\) |
| ⑧ Cauchy-Schwarz / |ρ|≤1 | 二次式 \(E(tX-Y)^2\ge0\) 判别式 ≤0;等号 ⟹ 线性相关 |
| ⑨ 特征函数独立和 | \(E e^{it(X+Y)}=E e^{itX}E e^{itY}\)(期望乘积定理) |
| ⑩ Chebyshev 不等式 | Markov 不等式(\(\mathbf1_{\{Y\ge\varepsilon\}}\le Y/\varepsilon\))+ \(Y=(X-EX)^2\) |
| ⑪ 弱大数定律 | \(\mathrm{Var}\bar X\le C/n\) + Chebyshev 上界 |
| ⑫ Lindeberg-Levy CLT | 特征函数展开 \(1-t^2/2+o(t^2)\),\((1-\frac{t^2}{2n})^n\to e^{-t^2/2}\),连续性定理 |
| ⑬ S² 无偏性 | \(\sum(X_i-\bar X)^2=\sum X_i^2-n\bar X^2\),两边取期望 |
| ⑭ 正态抽样分布定理 | Helmert 正交变换:\(\bar X\perp S^2\),\(\chi^2(n-1)\) 来源 |
| ⑮ MLE 渐近正态 | 得分函数 Taylor 展开 + CLT + Slutsky |
| ⑯ Neyman-Pearson 引理 | \((L_1-L_0)(\phi^*-\phi)\ge0\) 逐点 + 积分比较功效 |
7.2 高频是非辨析
| 命题 | 判断 | 理由 / 反例 |
|---|---|---|
| 概率为 0 的事件是不可能事件 | 否 | 连续型 \(P(X=a)=0\) 但可能发生(定义 2.3) |
| 相互独立 ⟹ 两两独立 | 是 | 定义 1.5:全体公式含二元情形;反之否(Bernstein 反例) |
| 独立 ⟺ 不相关 | 否 | 独立 ⟹ 不相关恒真;反之仅二维正态等特殊情形成立(定理 3.3 推论) |
| \(E(XY)=EX\cdot EY\) ⟺ 独立 | 否 | 该式只说明不相关(Cov=0),反例 \(Y=X^2\) |
| \(\mathrm{Var}(X+Y)=\mathrm{Var}X+\mathrm{Var}Y\) ⟺ 独立 | 否 | 只需不相关(定理 4.4(2)),无需独立 |
| \(|\rho_{XY}|=1\) ⟺ 线性相关 | 是 | Cauchy-Schwarz 等号条件(定理 4.4) |
| 分布函数相同 ⟹ 分布相同 | 是 | 分布函数与分布一一对应(定义 2.1);特征函数唯一性同理 |
| 依概率收敛 ⟹ 依分布收敛 | 是 | 定义 5.1 的关系链;反之不成立 |
| 弱大数定律要求方差存在 | 否 | Khinchin 版只需一阶矩(定理 5.3);Chebyshev 版才需方差 |
| 样本方差除以 n 还是 n−1 | n−1 | \(E S^2=\sigma^2\) 无偏(定理 6.3);除以 n 有偏 |
| MLE 一定无偏 | 否 | 一般相合、渐近无偏;如正态方差 MLE \(\frac1n\sum(X_i-\bar X)^2\) 有偏 |
| 95% 置信区间意味着参数以 95% 概率落入其中 | 否 | 频率解释:重复抽样中 95% 的区间覆盖(定义 7.2) |
| p 值 < α ⟹ 拒绝 H₀ | 是 | p 值是 H₀ 下"当前或更极端"的概率(定义 7.5);p 值大不证明 H₀ 真 |
7.3 常见反例清单
- 概率 0 但可能发生:连续型取单点 \(P(X=a)=0\)——"概率为 0"与"不可能"是两回事。
- 两两独立不相互独立:Bernstein 三分事件(定理 1.6),\(P(A_1A_2A_3)=1/4\ne1/8\)。
- 不相关但非独立:\(X\sim U(-1,1)\),\(Y=X^2\)——\(\mathrm{Cov}=E X^3=0\)(对称),但 \(Y\) 由 \(X\) 完全决定。
- 期望存在方差无穷:Pareto/学生 t 分布(自由度 2):一阶矩有限、二阶矩发散,Chebyshev 不等式不可用。
- Cauchy 分布无期望:\(\int|x|f=\infty\),大数定律不适用(样本均值不收敛)。
- 依分布收敛但不依概率收敛:\(X_n=X\)(同分布)但 \(X_n\) 与 \(X\) 独立——分布相同却不趋近于同一取值。
- CLT 的失效:方差无穷(重尾)时标准化和不趋于正态,而趋于稳定分布——正态近似需二阶矩。
- MLE 有偏:正态方差 \(\hat\sigma^2=\frac1n\sum(X_i-\bar X)^2\),\(E\hat\sigma^2=\frac{n-1}{n}\sigma^2\ne\sigma^2\)。
- 置信区间的误读:一次实现后"该区间包含 \(\theta\) 的概率"不是 95%——\(\theta\) 与区间都已固定,概率语言失效(频率解释)。
7.4 考前自检清单
- 能否从概率公理推出加法公式与全概率公式(划分 + 可加性)?
- 能否构造两两独立但不相互独立的三事件反例?
- 能否默写分布函数三性质并说明为什么它们刻画分布?
- 能否用分布函数法 / Jacobi 公式求 \(Y=g(X)\) 的密度?
- 能否证明 \(|ρ|≤1\)(Cauchy-Schwarz)并说明等号意义?
- 能否证明 Chebyshev 不等式,并从它推出弱大数定律?
- 能否叙述 Lindeberg-Levy CLT 的条件、结论与特征函数证明主线?
- 能否证明 \(E S^2=\sigma^2\)(n−1 的来历)?
- 能否写出正态总体均值(方差已知 / 未知)的置信区间与对应枢轴量?
- 能否叙述 Neyman-Pearson 引理并说明它为什么给出最优势检验?