概率论与数理统计 · 复习手册DEFINITION · THEOREM · PROOF · RELATION
PROBABILITY & STATISTICS · REVIEW NOTES

概率论与数理统计复习资料

7 章 + 知识地图 定义 19 条 定理 17 条(含 16 个可折叠证明) 分布 + 估计 + 检验清单

总览知识地图与四条主线

先把地图装进脑子,再背细节:概率论从模型出发(公理、随机变量、分布),数理统计从数据出发(样本、估计、检验)——两者靠"大数定律与中心极限定理"这座桥相连。每个统计结论都必须同时回答三件事:条件(独立性、矩存在、正态性)、结论(分布、无偏性、相合性)、量级(收敛速度、置信水平、检验功效)。点击图中节点可跳到对应条目。

随机性与统计推断 概率模型 ↔ 数据推断 P1 概率论基础 · 测度语言 概率公理 全概率 / 贝叶斯 独立性 加法公式 / 条件概率 P2 随机变量与分布 分布函数 常见分布族 离散 / 连续 / 函数分布 多维随机变量 联合 · 边际 · 条件 和的分布(卷积) P3 数字特征与极限定理 期望 / 方差 Chebyshev 不等式 大数定律 中心极限定理 P4 统计推断 统计量 / 抽样分布 点估计 区间估计 假设检验 · NP 引理 正态总体抽样 χ² / t / F 分布 S² 无偏性 备注:概率论"从模型到数据"(已知分布算概率),数理统计"从数据到模型"(由样本反推分布)——大数定律与中心极限定理是两者的桥。 概率论主线 统计推断主线 ⟹ 蕴含 / 推导

四条主线速记:概率基础——样本空间与概率公理(可加性)→ 条件概率与贝叶斯公式(乘法公式)→ 独立性(两两独立 ≠ 相互独立);② 随机变量与分布——分布函数(三性质)→ 离散 / 连续型常见分布(0-1、二项、Poisson、均匀、指数、正态)→ 多维联合与边际 → 随机变量函数与卷积;③ 数字特征与极限——期望 / 方差(线性性、Cauchy-Schwarz)→ 特征函数(唯一性)→ Chebyshev 不等式 → 大数定律(频率 → 概率)→ 中心极限定理(正态近似);④ 统计推断——样本与统计量(S² 无偏性)→ 三大抽样分布(χ² / t / F)→ 点估计(矩估计 / MLE)→ 区间估计(枢轴量法)→ 假设检验(两类错误、Neyman-Pearson 引理)。枢纽是独立性正态性:前者决定卷积与方差可加,后者贯穿抽样分布与中心极限。

01事件与概率

本章建立概率的"公理语言":一切结论从三条公理推出。核心技能有三——用集合运算拆事件、用条件概率改换视角(贝叶斯)、用独立性简化计算。注意区分"两两独立"与"相互独立"。

定义 1.1 · 样本空间与概率公理

样本空间 \(\Omega\):随机试验全部可能结果的集合;事件:\(\Omega\) 的子集;事件域 \(\mathcal F\):对可数并、补集封闭的 \(\sigma\)-代数。

概率 \(P:\mathcal F\to[0,1]\) 满足 Kolmogorov 公理:(1) 规范性 \(P(\Omega)=1\);(2) 非负性 \(P(A)\ge0\);(3) 可列可加性:互不相容事件列 \(A_1,A_2,\dots\) 有 \(P(\bigcup_i A_i)=\sum_i P(A_i)\)。

定理 1.2 · 概率的基本性质

(1) \(P(\varnothing)=0\);(2) 有限可加性:\(A_i\) 互不相容 ⟹ \(P(\bigcup_{i=1}^{n}A_i)=\sum_{i=1}^{n}P(A_i)\);(3) 对立事件 \(P(A^c)=1-P(A)\);(4) 减法:\(A\subset B\implies P(B\setminus A)=P(B)-P(A)\),且 \(P(A)\le P(B)\)(单调性);(5) 加法公式:\(P(A\cup B)=P(A)+P(B)-P(AB)\);三事件:\(P(A\cup B\cup C)=\sum P(A)-\sum P(AB)+P(ABC)\)。

证明

(1) 取 \(A_i=\varnothing\) 互不相容,可列可加性给 \(P(\varnothing)=P(\varnothing)+P(\varnothing)+\cdots\),故 \(P(\varnothing)=0\)。

(3) \(A\cup A^c=\Omega\) 且不相容:\(P(A)+P(A^c)=1\)。

(4) \(B=A\cup(B\setminus A)\) 且不相容,故 \(P(B)=P(A)+P(B\setminus A)\ge P(A)\)。

(5) \(A\cup B=A\cup(B\setminus AB)\),且 \(B=(AB)\cup(B\setminus A)\) 不相容:\(P(B)=P(AB)+P(B\setminus A)\)。代入 \(P(A\cup B)=P(A)+P(B)-P(AB)\)。三事件用两次二事件公式归纳。

定义 1.3 · 条件概率

\(P(A)>0\) 时,事件 \(B\) 在 \(A\) 发生条件下的(条件)概率

\[P(B\mid A)=\frac{P(AB)}{P(A)}.\]

固定 \(A\) 时,\(P(\cdot\mid A)\) 仍是 \(\mathcal F\) 上的概率(满足三条公理)。乘法公式:\(P(AB)=P(A)P(B\mid A)=P(B)P(A\mid B)\),可推广到 \(n\) 个事件。

定理 1.4 · 全概率公式与贝叶斯公式

设 \(B_1,\dots,B_n\) 是 \(\Omega\) 的一个划分(两两不相容且并集为 \(\Omega\),\(P(B_i)>0\)),则

\[P(A)=\sum_{i=1}^{n}P(B_i)P(A\mid B_i)\qquad(\text{全概率公式});\]

\[P(B_j\mid A)=\frac{P(B_j)P(A\mid B_j)}{\sum_{i=1}^{n}P(B_i)P(A\mid B_i)}\qquad(\text{贝叶斯公式}).\]

全概率公式是"由因到果"(按先验加权平均),贝叶斯公式是"由果溯因":后验概率 ∝ 先验 × 似然。

证明

全概率:\(A=A\cap\Omega=A\cap(\bigcup_i B_i)=\bigcup_i(AB_i)\),各项两两不相容,由可列可加性 \(P(A)=\sum_i P(AB_i)=\sum_i P(B_i)P(A\mid B_i)\)(乘法公式)。

贝叶斯:由条件概率定义 \(P(B_j\mid A)=\frac{P(B_jA)}{P(A)}\),分子用乘法公式、分母用全概率公式,即得。

定义 1.5 · 独立性

事件 \(A,B\) 独立:\(P(AB)=P(A)P(B)\)。两两独立:任意两个事件独立。相互独立:对任意子集 \(I\subset\{1,\dots,n\}\) 有 \(P(\bigcap_{i\in I}A_i)=\prod_{i\in I}P(A_i)\)(全体交集公式全部成立)。

注意:独立 ≠ 互斥(互斥要求 \(AB=\varnothing\),正概率时反而强依赖)。运算法则:\(A,B\) 独立 ⟹ \(A,B^c\) 与 \(A^c,B^c\) 也独立。

定理 1.6 · 相互独立与两两独立

相互独立 ⟹ 两两独立;反之不成立:存在三个事件两两独立但不相互独立(此时 \(P(A_1A_2A_3)\ne P(A_1)P(A_2)P(A_3)\))。

经典反例(Bernstein):从 \(\{1,2,3,4\}\) 等可能取一点,令 \(A_1=\{1,2\}\)、\(A_2=\{1,3\}\)、\(A_3=\{1,4\}\)。每对交集为单点,概率 \(1/4=(1/2)^2\);但 \(A_1A_2A_3=\{1\}\),\(P=\frac14\ne\frac18\)。

证明(反例验证)

样本空间等可能,\(P(A_i)=\frac{2}{4}=\frac12\)。两两交集:\(A_1\cap A_2=\{1\}\),\(P(A_1A_2)=\frac14=P(A_1)P(A_2)\),其余两对同理——两两独立成立。三交集:\(A_1A_2A_3=\{1\}\),\(P=\frac14\),而 \(\prod_iP(A_i)=\frac18\ne\frac14\)——不满足相互独立的"全体公式",故三者不相互独立。

关系:本章是全部后续的起点:公理(1.1)是唯一出发点(可列可加性支撑一切"极限"型结论);加法公式(1.2)与 全概率/贝叶斯(1.4)分别处理"并事件"与"部分信息下的概率";独立性(1.5-1.6)直接决定第 4 章"方差可加"与第 5 章大数定律的条件——两两独立与相互独立之差会在概率统计各处以反例形式反复出现。

02随机变量与分布

本章把事件语言翻译成函数语言:分布函数统一刻画一切随机变量;离散型看分布律,连续型看密度。重点:常见分布的参数与特征、随机变量函数的分布(分布函数法 + 单调变换公式)。

定义 2.1 · 随机变量与分布函数

随机变量:可测函数 \(X:\Omega\to\mathbb R\)(对任意区间 \(I\),\(\{X\in I\}\in\mathcal F\))。分布函数

\[F(x)=P(X\le x),\qquad x\in\mathbb R.\]

三性质(充要):(1) 单调不减;(2) 右连续:\(\lim_{x\to a^+}F(x)=F(a)\);(3) \(\lim_{x\to-\infty}F(x)=0,\ \lim_{x\to+\infty}F(x)=1\)。分布函数与分布(概率测度)一一对应。

定义 2.2 · 离散型随机变量

取值至多可数:分布律 \(P(X=x_k)=p_k\),满足 \(p_k\ge0,\ \sum p_k=1\)。常见离散分布

0-1 分布 \(B(1,p)\)(\(P(X=1)=p\));二项 \(X\sim B(n,p)\):\(P(X=k)=\binom{n}{k}p^k(1-p)^{n-k}\)(\(n\) 次独立重复试验的成功次数);Poisson \(X\sim P(\lambda)\):\(P(X=k)=\frac{\lambda^k}{k!}e^{-\lambda}\)(稀有事件计数);几何分布(首次成功所需试验次数);超几何分布(不放回抽样中的成功数)。

定义 2.3 · 连续型随机变量

存在密度函数 \(f\ge0\) 使 \(F(x)=\int_{-\infty}^{x}f(t)\,\mathrm{d}t\)。此时 \(P(X=a)=0\)(单点概率为零,但并非不可能事件),

\[P(a

常见连续分布:均匀 \(U(a,b)\);指数 \(\mathrm{Exp}(\lambda)\)(\(f=\lambda e^{-\lambda x}\),无记忆性);正态 \(N(\mu,\sigma^2)\);Gamma(指数之和)、Beta、\(\chi^2\)(第 6 章)。

定义 2.4 · 常见分布一览

复习时按"背景 → 分布律/密度 → 参数 → 期望方差"四要素记忆。正态族 \(N(\mu,\sigma^2)\) 密度 \(\frac{1}{\sqrt{2\pi}\sigma}e^{-(x-\mu)^2/2\sigma^2}\);标准正态 \(\Phi(x)\) 表值与分位数 \(z_\alpha\)(\(\Phi(z_\alpha)=1-\alpha\))是统计推断的公共查表工具。

分布间关系(记忆锚点):\(B(n,p)\overset{n\to\infty}{\longrightarrow}P(np)\)(泊松近似);二项与超几何互化;\(N(0,1)^2\) 之和 → \(\chi^2\)(第 6 章);指数是 \(\Gamma(1,\lambda)\)。

定理 2.5 · 随机变量函数的分布

设 \(Y=g(X)\):

(1) 离散型:合并相同取值 \(P(Y=y)=\sum_{x:g(x)=y}P(X=x)\);

(2) 连续型(分布函数法):\(F_Y(y)=P(g(X)\le y)\) 化归为 \(X\) 的事件再积分;

(3) 单调变换(Jacobi 公式):\(g\) 严格单调可微、\(g^{-1}=h\),则 \(f_Y(y)=f_X(h(y))\,|h'(y)|\)。线性变换特例:\(Y=aX+b\) ⟹ \(f_Y(y)=\frac1{|a|}f_X(\frac{y-b}{a})\)。

证明(单调情形)

设 \(g\) 严格递增、可微,\(h=g^{-1}\)。\(F_Y(y)=P(Y\le y)=P(X\le h(y))=F_X(h(y))\)。两边对 \(y\) 求导(链式法则):\(f_Y(y)=f_X(h(y))\cdot h'(y)\)。递减时 \(F_Y(y)=P(X\ge h(y))=1-F_X(h(y))\),求导得 \(f_Y(y)=-f_X(h(y))h'(y)\)。两情形合并即 \(f_Y=f_X(h)|h'|\)。非单调时把定义域按单调区间分段后相加(分布函数法更通用)。

关系:分布函数(2.1)是连接事件与分布的统一语言;离散/连续两种类型(2.2-2.3)对应两种积分(求和 / 积分);常见分布(2.4)是后续所有例子的弹药库;函数分布(2.5)直接服务第 3 章多维函数的分布(卷积是其特例)与第 7 章枢轴量法。

03多维随机变量

本章把单个随机变量升级为向量:联合分布 ⟹ 边际分布(积分/求和掉一维)⟹ 条件分布(比值);独立性等价于联合 = 边际之积。函数分布的卷积公式是"和的分布"的标准工具。

定义 3.1 · 联合分布与边际分布

二维随机向量 \((X,Y)\) 的联合分布函数 \(F(x,y)=P(X\le x,\ Y\le y)\)。边际分布函数:\(F_X(x)=\lim_{y\to+\infty}F(x,y)=P(X\le x)\)。

离散型:联合分布律 \(p_{ij}=P(X=x_i,Y=y_j)\),边际 \(p_{i\cdot}=\sum_j p_{ij}\)。连续型:联合密度 \(f(x,y)\),边际密度 \(f_X(x)=\int_{-\infty}^{\infty}f(x,y)\,\mathrm{d}y\)。

定义 3.2 · 条件分布

离散型:\(P(Y=y_j\mid X=x_i)=\frac{p_{ij}}{p_{i\cdot}}\)(\(p_{i\cdot}>0\))。连续型:

\[f_{Y\mid X}(y\mid x)=\frac{f(x,y)}{f_X(x)}\qquad(f_X(x)>0).\]

条件密度满足密度性质;\(E(Y\mid X=x)=\int y\,f_{Y\mid X}(y\mid x)\,\mathrm{d}y\) 是条件期望。

定理 3.3 · 独立性的判定

\(X,Y\) 独立 ⟺ 对一切 \(x,y\):\(F(x,y)=F_X(x)F_Y(y)\);连续型 ⟺ \(f(x,y)=f_X(x)f_Y(y)\) 几乎处处;离散型 ⟺ \(p_{ij}=p_{i\cdot}p_{\cdot j}\) 对一切 \(i,j\)。

推论:独立 ⟹ 不相关(第 4 章:\(\mathrm{Cov}(X,Y)=0\)),反之不成立;但二维正态时"独立 ⟺ 不相关"(特殊豁免)。

证明(连续型)

⟸:若联合密度可分离 \(f(x,y)=f_X(x)f_Y(y)\),则对任意矩形 \(A\times B\):\(P(X\in A,Y\in B)=\int_A\int_B f_X(x)f_Y(y)\,\mathrm{d}y\,\mathrm{d}x=P(X\in A)P(Y\in B)\)。由矩形生成 \(\sigma\)-代数(Caratheodory 扩张),对一切 Borel 集成立,故独立。

⟹:若独立,由定义 \(F=F_XF_Y\);连续型时混合偏导 \(\frac{\partial^2F}{\partial x\partial y}=f_X(x)f_Y(y)\)(几乎处处)为联合密度。

定理 3.4 · 和的分布(卷积公式)

\(X,Y\) 独立。离散型:

\[P(X+Y=z)=\sum_{x}P(X=x)P(Y=z-x);\]

连续型:

\[f_{X+Y}(z)=\int_{-\infty}^{\infty}f_X(x)f_Y(z-x)\,\mathrm{d}x.\]

再生性:独立正态和仍正态(\(N(\mu_1+\mu_2,\sigma_1^2+\sigma_2^2)\))、独立 Poisson 和仍 Poisson(\(\lambda_1+\lambda_2\))、独立二项和仍二项(\(p\) 相同)。

证明(分布函数法)

\(F_{X+Y}(z)=P(X+Y\le z)=\iint_{x+y\le z}f_X(x)f_Y(y)\,\mathrm{d}x\,\mathrm{d}y\)(独立性把联合密度写成乘积)。内层对 \(y\) 积分、变量替换 \(t=x+y\):

\(\int_{-\infty}^{\infty}f_X(x)\Big(\int_{-\infty}^{z-x}f_Y(y)\,\mathrm{d}y\Big)\,\mathrm{d}x=\int_{-\infty}^{\infty}f_X(x)F_Y(z-x)\,\mathrm{d}x\)。对 \(z\) 求导(Leibniz):\(f_{X+Y}(z)=\int f_X(x)f_Y(z-x)\,\mathrm{d}x\)。

关系:本章是第 2 章的自然升级:边际(3.1)与条件(3.2)分别回答"忽略一个维度"与"已知一个维度";独立性判定(3.3)是第 4 章方差分解与第 5 章大数定律的前提;卷积(3.4)与特征函数(第 4 章)形成"和的分布"的双通道——卷积是积分语言、特征函数是乘积语言。

04数字特征

本章给分布"降维"成少数指标:期望(位置)、方差(离散度)、协方差与相关系数(线性关联)。核心论证工具是 Cauchy-Schwarz 不等式;特征函数是唯一性定理与中心极限定理的杠杆。

定义 4.1 · 数学期望

离散型:\(E X=\sum_k x_k p_k\)(要求 \(\sum|x_k|p_k<\infty\));连续型:\(E X=\int_{-\infty}^{\infty}x f(x)\,\mathrm{d}x\)(要求 \(\int|x|f<\infty\),否则期望不存在,如 Cauchy 分布)。

LOTUS(函数期望,无需先求 \(g(X)\) 的分布):\(E g(X)=\sum g(x_k)p_k\) 或 \(\int g(x)f(x)\,\mathrm{d}x\);多维 \(E g(X,Y)=\iint g(x,y)f(x,y)\,\mathrm{d}x\,\mathrm{d}y\)。

定理 4.2 · 期望的性质

(1) 线性性:\(E(aX+bY+c)=aEX+bEY+c\)(不需独立性);(2) 非负性:\(X\ge0\implies EX\ge0\);(3) 单调性:\(X\le Y\implies EX\le EY\);(4) 常数 \(E c=c\);(5) 独立性:\(X,Y\) 独立 ⟹ \(E(XY)=EX\cdot EY\)(逆不真)。

证明(离散型线性性)

\(E(aX+bY+c)=\sum_{i,j}(ax_i+by_j+c)P(X=x_i,Y=y_j)\)(把 \(aX+bY+c\) 看作二维函数用 LOTUS 的离散版)

\(=a\sum_i x_i\sum_j p_{ij}+b\sum_j y_j\sum_i p_{ij}+c\sum_{i,j}p_{ij}=aEX+bEY+c\)。

独立性 ⟹ \(E(XY)\):\(E(XY)=\sum_{i,j}x_iy_jp_ip_j=(\sum_i x_ip_i)(\sum_j y_jp_j)=EX\cdot EY\)。逆命题不成立(见 7.3 反例:\(Y=X^2\) 时可积不独立)。

定义 4.3 · 方差、协方差与相关系数

方差 \(\mathrm{Var}(X)=E[(X-EX)^2]=E X^2-(EX)^2\);标准差 \(\sqrt{\mathrm{Var}(X)}\)。

协方差 \(\mathrm{Cov}(X,Y)=E[(X-EX)(Y-EY)]=E(XY)-EX\cdot EY\);相关系数

\[\rho_{XY}=\frac{\mathrm{Cov}(X,Y)}{\sqrt{\mathrm{Var}X\,\mathrm{Var}Y}}.\]

不相关:\(\rho=0\)(或 \(\mathrm{Cov}=0\))。不相关 ≠ 独立:独立 ⟹ 不相关,反之不成立。

定理 4.4 · 方差与协方差的性质

(1) \(\mathrm{Var}(aX+b)=a^2\mathrm{Var}(X)\);(2) \(\mathrm{Var}(X+Y)=\mathrm{Var}X+\mathrm{Var}Y+2\mathrm{Cov}(X,Y)\)——独立时 \(\mathrm{Var}(X+Y)=\mathrm{Var}X+\mathrm{Var}Y\)(方差可加只需不相关);(3) Cauchy-Schwarz:\(|E(XY)|\le\sqrt{E X^2 E Y^2}\),从而 \(|\rho_{XY}|\le1\),且 \(|\rho|=1\) ⟺ 几乎必然线性相关 \(Y=aX+b\);(4) \(\mathrm{Cov}\) 双线性。

证明(Cauchy-Schwarz)

对任意实数 \(t\):\(0\le E[(tX-Y)^2]=t^2E X^2-2tE(XY)+E Y^2\) 是关于 \(t\) 的二次式恒非负,判别式 \(\le0\):\((2E(XY))^2-4E X^2 E Y^2\le0\),即 \(|E(XY)|\le\sqrt{E X^2}\sqrt{E Y^2}\)。

取 \(X-EX,\ Y-EY\) 代入得 \(|\mathrm{Cov}|\le\sqrt{\mathrm{Var}X\,\mathrm{Var}Y}\),除以分母即 \(|\rho|\le1\)。等号条件:判别式 = 0 即 \(tX-Y=0\) 几乎必然,故线性相关。

定义 4.5 · 矩、矩母函数与特征函数

k 阶原点矩 \(\mu_k=E X^k\)、中心矩 \(E(X-EX)^k\)。矩母函数 \(M_X(t)=E e^{tX}\)(未必处处存在)。特征函数(对一切分布存在):

\[\varphi_X(t)=E e^{itX}=\int e^{itx}\,\mathrm{d}F(x).\]

矩展开:\(\varphi_X(t)=1+itEX-\frac{t^2}{2}EX^2+\cdots\)(\(E|X|^k<\infty\) 时)。

定理 4.6 · 特征函数的性质

(1) 唯一性:分布函数与特征函数一一对应(\(F\) 可由 \(\varphi\) 反演:\(F(x)-F(x-0)=\lim_{T\to\infty}\frac1{2\pi}\int_{-T}^{T}\frac{e^{-itx}-e^{-it(x-h)}}{it}\varphi(t)\,\mathrm{d}t\) 类公式);(2) 线性:\(\varphi_{aX+b}(t)=e^{itb}\varphi_X(at)\);(3) 独立和:\(X,Y\) 独立 ⟹ \(\varphi_{X+Y}(t)=\varphi_X(t)\varphi_Y(t)\)(特征函数是卷积的乘法化);(4) 导数矩:\(E X^k=i^{-k}\varphi^{(k)}(0)\)。

证明要点

(3) 独立性 ⟹ \(E e^{it(X+Y)}=E(e^{itX}e^{itY})=E e^{itX}\,E e^{itY}\)(期望乘积定理,定理 4.2(5))。(4) 在 \(E|X|^k<\infty\) 与 \(t\) 的小邻域内对 \(\int e^{itx}\,\mathrm{d}F\) 作 \(k\) 次求导与积分交换(控制收敛),得 \(\varphi^{(k)}(t)=E[(ix)^k e^{itx}]\),代 \(t=0\) 即 \(i^k E X^k\)。

(1) 唯一性由 Fourier 反演;这保证"特征函数相同 ⟹ 分布相同"——第 5 章 CLT 与第 6 章正态判定的关键工具。

关系:期望与方差(4.1-4.4)是所有统计量的度量基础(第 6 章样本均值/方差的期望方差直接引用);独立 ⟹ 不相关、反之不然(4.4)是贯穿全册的警戒线;特征函数(4.5-4.6)把卷积(3.4)变成乘法,是第 5 章中心极限定理的标准证明通道,也是第 7 章判断抽样分布正态性的依据。

05大数定律与中心极限定理

本章是概率论 → 统计推断的桥:大数定律说"样本均值趋于总体均值"(收敛性),中心极限定理说"误差的分布趋于正态"(分布形状)。两种收敛模式的区别必须分清。

定义 5.1 · 收敛模式

随机变量列 \(X_n\) 与 \(X\)(同一概率空间):

依概率收敛:\(\forall\varepsilon>0,\ P(|X_n-X|>\varepsilon)\to0\)(记 \(X_n\xrightarrow{P}X\));几乎必然收敛:\(P(\lim X_n=X)=1\)(记 \(X_n\xrightarrow{\mathrm{a.s.}}X\),最强常用收敛);r 阶矩收敛:\(E|X_n-X|^r\to0\);依分布收敛:分布函数逐点收敛 \(F_n(x)\to F(x)\)(\(F\) 的连续点处)。

关系:a.s. ⟹ P;r 阶矩 ⟹ P;P ⟹ 依分布(逆命题不成立,见 7.3 反例)。

定理 5.2 · Chebyshev 不等式

\(X\) 有方差 \(\sigma^2<\infty\),则对任意 \(\varepsilon>0\):

\[P(|X-EX|\ge\varepsilon)\le\frac{\mathrm{Var}(X)}{\varepsilon^2}.\]

含义:方差给出偏离均值概率的普适上界(无需分布假设)。特例:\(\varepsilon=k\sigma\) 时 \(P(|X-EX|\ge k\sigma)\le1/k^2\)(约 4.5% 当 \(k=\sqrt{2}\) 时约 1/2 需 \(k=\sqrt2\)——不查表的口径)。

证明(Markov 不等式)

先证 Markov 不等式:\(Y\ge0\) 且 \(EY<\infty\) ⟹ \(P(Y\ge\varepsilon)\le\frac{EY}{\varepsilon}\)。由指示函数 \(\mathbf 1_{\{Y\ge\varepsilon\}}\le Y/\varepsilon\)(逐点),两边取期望:\(P(Y\ge\varepsilon)\le EY/\varepsilon\)。

取 \(Y=(X-EX)^2\)(非负):\(P((X-EX)^2\ge\varepsilon^2)\le\frac{E(X-EX)^2}{\varepsilon^2}=\frac{\mathrm{Var}X}{\varepsilon^2}\),即 \(P(|X-EX|\ge\varepsilon)\le\frac{\mathrm{Var}X}{\varepsilon^2}\)。

定理 5.3 · 大数定律

Chebyshev 弱大数定律:\(X_i\) 两两不相关、方差一致有界(\(\mathrm{Var}X_i\le C\)),则 \(\bar X_n=\frac1n\sum_{i=1}^{n}X_i\xrightarrow{P}E\bar X_n\)(独立同分布时 \(\xrightarrow{P}\mu\))。

Khinchin 弱大数定律:\(X_i\) iid、\(E|X_1|<\infty\),则 \(\bar X_n\xrightarrow{P}\mu\)(只需一阶矩,不需方差)。

Bernoulli:独立重复试验中频率 \(\frac{n_A}{n}\xrightarrow{P}P(A)\)——概率的频率定义依据。

证明(Chebyshev 路线)

\(\mathrm{Var}(\bar X_n)=\frac1{n^2}\sum_i\mathrm{Var}X_i\le\frac{C}{n}\to0\)(两两不相关 ⟹ 方差可加)。由 Chebyshev 不等式(定理 5.2)对 \(\bar X_n\) 应用:

\(P(|\bar X_n-E\bar X_n|\ge\varepsilon)\le\frac{\mathrm{Var}(\bar X_n)}{\varepsilon^2}\le\frac{C}{n\varepsilon^2}\to0\),即依概率收敛。Khinchin 版用截尾法 + 特征函数(或 Markov 不等式)替换方差估计,条件放宽到一阶矩。

定理 5.4 · 中心极限定理(CLT)

Lindeberg-Levy 中心极限定理:\(X_i\) iid,\(EX=\mu,\ \mathrm{Var}X=\sigma^2<\infty\),则

\[\frac{\sum_{i=1}^{n}X_i-n\mu}{\sigma\sqrt n}=\frac{\bar X_n-\mu}{\sigma/\sqrt n}\xrightarrow{d}N(0,1),\]

即 \(P\Big(\frac{\bar X_n-\mu}{\sigma/\sqrt n}\le x\Big)\to\Phi(x)\)。de Moivre-Laplace(特例):二项 \(B(n,p)\) 标准化后近似 \(N(0,1)\),带连续性修正 \(P(a\le X\le b)\approx\Phi(\frac{b+0.5-np}{\sqrt{npq}})-\Phi(\frac{a-0.5-np}{\sqrt{npq}})\)。

证明(特征函数法)

设 \(Y_i=(X_i-\mu)/\sigma\),\(E Y_i=0\),\(\mathrm{Var}Y_i=1\)。特征函数展开(定理 4.6(4)):\(\varphi_Y(t)=1-\frac{t^2}{2}+o(t^2)\)(二阶矩有限 ⟹ 余项小)。标准化和 \(S_n=\frac1{\sqrt n}\sum Y_i\) 的特征函数(独立 ⟹ 乘积):

\(\varphi_{S_n}(t)=[\varphi_Y(t/\sqrt n)]^n=\Big[1-\frac{t^2}{2n}+o(\frac{t^2}{n})\Big]^n\to e^{-t^2/2}\)。

由连续性定理(特征函数收敛 ⟹ 分布收敛)与 \(e^{-t^2/2}\) 是 \(N(0,1)\) 的特征函数,得 \(S_n\xrightarrow{d}N(0,1)\)。

关系:本章是概率论与数理统计的接口:大数定律(5.3)保证估计量的一致性(第 7 章),CLT(5.4)给出大样本下估计量与检验统计量的正态近似(第 7 章 Z 检验、区间估计的理论依据)。Chebyshev 不等式(5.2)是连接期望方差与概率事件的万能扳手。收敛模式(5.1)在 7.3 以反例呈现(依分布收敛不蕴含依概率收敛)。

06数理统计基础

本章从"总体分布已知"翻转到"从样本反推总体":样本必须是简单随机样本(iid);统计量是样本的函数(不含未知参数);三大抽样分布(\(\chi^2,t,F\))是正态总体推断的公共词汇表。

定义 6.1 · 总体、样本与简单随机样本

总体:研究对象的某个数量指标 \(X\)(随机变量,分布 \(F\) 未知);个体:总体的一个元素。样本:从中抽取的 \(n\) 个个体 \(X_1,\dots,X_n\)。

简单随机样本:\(X_i\) 相互独立且与总体同分布(iid)——这是绝大多数经典统计方法的前提假设。样本的联合密度 \(=\prod_{i=1}^{n}f(x_i)\)。

定义 6.2 · 统计量

统计量:样本的不含未知参数的函数 \(T=T(X_1,\dots,X_n)\)。常用:

样本均值 \(\bar X=\frac1n\sum_{i=1}^{n}X_i\);样本方差 \(S^2=\frac1{n-1}\sum_{i=1}^{n}(X_i-\bar X)^2\)(除以 \(n-1\)!);样本 \(k\) 阶矩 \(A_k=\frac1n\sum X_i^k\)。抽样分布 = 统计量的分布。

定理 6.3 · 样本均值与样本方差的性质

总体 \(EX=\mu,\ \mathrm{Var}X=\sigma^2\)(有限),样本 iid:

(1) \(E\bar X=\mu\),\(\mathrm{Var}(\bar X)=\sigma^2/n\)(大数定律 ⟹ \(\bar X\xrightarrow{P}\mu\),相合);(2) \(E S^2=\sigma^2\)(无偏,除以 \(n-1\) 的原因);(3) \(\frac1n\sum(X_i-\bar X)^2\) 有偏(偏小),无偏修正因子 \(n/(n-1)\)。

证明(S² 的无偏性)

先算 \(\sum_i(X_i-\bar X)^2=\sum_i X_i^2-n\bar X^2\)(展开交叉项消去)。取期望:

\(E\sum_i(X_i-\bar X)^2=\sum_i E X_i^2-nE\bar X^2\)。其中 \(EX_i^2=\sigma^2+\mu^2\),\(E\bar X^2=\mathrm{Var}(\bar X)+(E\bar X)^2=\sigma^2/n+\mu^2\)。

代入:\(=n(\sigma^2+\mu^2)-n(\sigma^2/n+\mu^2)=(n-1)\sigma^2\)。故 \(E S^2=\frac{1}{n-1}(n-1)\sigma^2=\sigma^2\),无偏。

定义 6.4 · 三大抽样分布

(1) \(\chi^2\) 分布:\(Z_i\) iid \(N(0,1)\),\(\chi^2(n)=\sum_{i=1}^{n}Z_i^2\)(自由度 \(n\))。性质:\(E\chi^2=n\),\(\mathrm{Var}=2n\),可加性 \(\chi^2(n)+\chi^2(m)=\chi^2(n+m)\)(独立)。

(2) \(t\) 分布:\(Z\sim N(0,1)\),\(\chi^2\sim\chi^2(n)\) 独立,\(t(n)=\frac{Z}{\sqrt{\chi^2/n}}\)。对称、重尾(\(n>1\) 时有均值 0;\(n=1\) 即 Cauchy)。

(3) \(F\) 分布:\(\chi_1^2\sim\chi^2(n_1)\),\(\chi_2^2\sim\chi^2(n_2)\) 独立,\(F(n_1,n_2)=\frac{\chi_1^2/n_1}{\chi_2^2/n_2}\)。性质:\(1/F(n_1,n_2)\sim F(n_2,n_1)\);\(t^2(n)\sim F(1,n)\)。

定理 6.5 · 正态总体的抽样分布定理

\(X_i\) iid \(N(\mu,\sigma^2)\),\(\bar X,\ S^2\) 如定义 6.2,则

(1) \(\bar X\sim N(\mu,\sigma^2/n)\);(2) \(\frac{(n-1)S^2}{\sigma^2}\sim\chi^2(n-1)\);(3) \(\bar X\) 与 \(S^2\) 独立;(4) \(t=\frac{\bar X-\mu}{S/\sqrt n}\sim t(n-1)\)(方差未知时检验均值,第 7 章);(5) 两正态总体方差比 \(\frac{S_1^2/\sigma_1^2}{S_2^2/\sigma_2^2}\sim F(n_1-1,n_2-1)\)。

证明要点

(1) 正态的线性组合仍正态(再生性,定理 3.4),\(E\bar X=\mu,\ \mathrm{Var}=\sigma^2/n\)。

(2)(3) 作正交变换(Helmert 变换)\(Y=QX\):取正交阵 \(Q\) 使首行 \(\propto(1,\dots,1)\),则 \(Y_1=\sqrt n\bar X\),其余 \(Y_2,\dots,Y_n\) 独立同 \(N(0,\sigma^2)\) 且与 \(Y_1\) 独立(正交变换保持独立正态)。而 \(\sum(X_i-\bar X)^2=\sum_{i=2}^{n}Y_i^2\),故除以 \(\sigma^2\) 后 \(\sim\chi^2(n-1)\),且与 \(\bar X\)(即 \(Y_1\))独立。

(4) 由 (1)(2)(3) 与 \(t\) 分布定义(\(Z=\frac{\bar X-\mu}{\sigma/\sqrt n}\sim N(0,1)\) 与 \(\chi^2\) 独立)。

关系:本章是推断的弹药库:统计量(6.2)与抽样分布(6.4-6.5)决定第 7 章每个置信区间与检验统计量长什么样(\(Z\) 用正态、\(t\) 用 \(t(n-1)\)、方差比用 \(F\));无偏性(6.3)是第 7 章估计量评价的第一标准。CLT(5.4)允许在"大样本 + 非正态总体"时用正态近似兜底。

07参数估计、假设检验与速查

收束全册:点估计(矩估计 / MLE)给出参数的最优猜测,区间估计(枢轴量法)给出不确定性的定量刻画,假设检验(两类错误 + Neyman-Pearson 引理)给出决策规则。随后是核心证明清单、高频是非辨析、常见反例与自检清单。"先陈述条件,再给结论"——iid、正态性、方差已知与否决定用哪个统计量。

定义 7.1 · 点估计:矩估计与极大似然估计

用样本估计总体参数 \(\theta\)。矩估计:令样本矩 = 总体矩(\(A_k=E X^k\) 的理论矩含 \(\theta\)),解方程得 \(\hat\theta\)。

极大似然估计(MLE):对样本 \((x_1,\dots,x_n)\),似然函数 \(L(\theta)=\prod_{i=1}^{n}f(x_i;\theta)\)(离散为分布律乘积);MLE 是使 \(L\)(或对数似然 \(\ell=\ln L\))最大的 \(\hat\theta\)。连续可微时解似然方程 \(\ell'(\theta)=0\)(须验证极大)。

定理 7.2 · 估计量的优良性标准

(1) 无偏性:\(E\hat\theta=\theta\)(对一切 \(\theta\));有偏时可修正(如 \(S^2\) 对 \(n-1\) 修正);

(2) 有效性:无偏估计中方差越小越好(最小方差无偏 MVU);

(3) 相合性:\(\hat\theta_n\xrightarrow{P}\theta\)(大样本逼近,由大数定律与矩的连续性保证);

(4) MLE 的性质(正则条件下):相合、渐近正态 \(\sqrt n(\hat\theta-\theta)\xrightarrow{d}N(0,I^{-1}(\theta))\)(\(I\) 为 Fisher 信息),且渐近有效——"大样本最优"。

证明要点(MLE 渐近正态)

得分函数 \(S_n(\theta)=\frac{\partial\ln L}{\partial\theta}=\sum_i\frac{\partial\ln f(X_i;\theta)}{\partial\theta}\)。由矩性质,\(E S_n(\theta)=0\),\(\mathrm{Var}S_n(\theta)=n I(\theta)\)(Fisher 信息,\(I(\theta)=E(\frac{\partial\ln f}{\partial\theta})^2=-E\frac{\partial^2\ln f}{\partial\theta^2}\))。

由 CLT,\(S_n(\theta)/\sqrt{nI(\theta)}\xrightarrow{d}N(0,1)\)。对 \(\ell'(\hat\theta)=0\) 在真值 \(\theta\) 处 Taylor 展开(中值定理):\(0=\ell'(\theta)+\ell''(\theta^*)(\hat\theta-\theta)\),即 \(\sqrt n(\hat\theta-\theta)=-\frac{\ell'(\theta)/\sqrt n}{\ell''(\theta^*)/n}\)。分子依分布收敛 \(N(0,I(\theta))\)、分母依概率收敛于 \(-I(\theta)\),Slutsky 定理 ⟹ \(\sqrt n(\hat\theta-\theta)\xrightarrow{d}N(0,I^{-1}(\theta))\)。

定义 7.2 · 区间估计与枢轴量法

置信区间:对 \(\alpha\in(0,1)\),统计量对 \((\hat\theta_L,\hat\theta_U)\) 满足 \(P(\hat\theta_L\le\theta\le\hat\theta_U)\ge1-\alpha\),称置信水平 \(1-\alpha\)。频率解释:反复抽样中,约 \(1-\alpha\) 比例的区间覆盖真值(不是"参数落在该区间的概率")。

枢轴量法:找枢轴量 \(Q=Q(X_1,\dots,X_n;\theta)\)——分布已知且不含未知参数、但含 \(\theta\)——由 \(P(q_{\alpha/2}\le Q\le q_{1-\alpha/2})=1-\alpha\) 反解出 \(\theta\) 的区间。例:正态均值 \(\frac{\bar X-\mu}{S/\sqrt n}\sim t(n-1)\) 是枢轴量。

定理 7.3 · 正态总体常用置信区间
待估参数(条件)枢轴量置信区间(\(1-\alpha\))
\(\mu\),\(\sigma^2\) 已知\(Z=\frac{\bar X-\mu}{\sigma/\sqrt n}\sim N(0,1)\)\(\bar X\pm z_{\alpha/2}\frac{\sigma}{\sqrt n}\)
\(\mu\),\(\sigma^2\) 未知\(t=\frac{\bar X-\mu}{S/\sqrt n}\sim t(n-1)\)\(\bar X\pm t_{\alpha/2}(n-1)\frac{S}{\sqrt n}\)
\(\sigma^2\),\(\mu\) 未知\(\frac{(n-1)S^2}{\sigma^2}\sim\chi^2(n-1)\)\(\Big(\frac{(n-1)S^2}{\chi^2_{\alpha/2}(n-1)},\ \frac{(n-1)S^2}{\chi^2_{1-\alpha/2}(n-1)}\Big)\)
\(p\)(比例),大样本\(Z=\frac{\hat p-p}{\sqrt{p(1-p)/n}}\xrightarrow{d}N(0,1)\)\(\hat p\pm z_{\alpha/2}\sqrt{\frac{\hat p(1-\hat p)}{n}}\)

单侧区间:分位数取 \(z_\alpha\)(单尾)。样本量确定:区间半宽 \(d=z_{\alpha/2}\sigma/\sqrt n\) ⟹ \(n=(z_{\alpha/2}\sigma/d)^2\)。

定理 7.4 · 假设检验与 Neyman-Pearson 引理

原假设 \(H_0\) vs 备择假设 \(H_1\)。两类错误:第一类(弃真)\(\alpha=P(\text{拒绝 }H_0\mid H_0\text{ 真})\),第二类(纳伪)\(\beta=P(\text{接受 }H_0\mid H_1\text{ 真})\)。检验水平:控制 \(\alpha\le\alpha_0\)(常用 0.05/0.01)。功效 \(1-\beta\)。

Neyman-Pearson 引理:检验 \(H_0:\theta=\theta_0\) vs \(H_1:\theta=\theta_1\)(简单假设)时,在水平 \(\alpha\) 的检验中,似然比检验

\[\text{拒绝 }H_0 \iff \frac{L(\theta_1)}{L(\theta_0)}>k\qquad(\text{阈值 }k\text{ 由 }\alpha\text{ 决定})\]

最优势检验(功效最大)。复合假设情形推广为一致最优势(UMP,需单边备择 + 单调似然比)。

证明(NP 引理要点)

设任意水平 \(\alpha\) 的检验函数 \(\phi(x)\in[0,1]\)(拒绝概率),似然比检验 \(\phi^*(x)=\mathbf1\{L(\theta_1)/L(\theta_0)>k\}+\gamma\mathbf1\{\cdot=k\}\)(随机化处理等号)。

关键不等式:对任意 \(\phi\),\((L_1-L_0)(\phi^*-\phi)\ge0\) 逐点成立(\(\phi^*=1\) 处 \(L_1>kL_0\),\(\phi^*=0\) 处 \(L_1

\(\int\phi^*L_1-\int\phi L_1\ge k\big(\int\phi^*L_0-\int\phi L_0\big)\ge k(\alpha-\alpha)=0\)(\(\phi^*\) 水平 \(\alpha\) 而 \(\phi\) 水平 \(\le\alpha\))。故 \(\int\phi^*L_1\ge\int\phi L_1\),即 \(\phi^*\) 功效不小于任何水平 \(\alpha\) 检验——最优势。

定义 7.5 · 常用检验与 p 值

均值检验:\(\sigma\) 已知用 Z 统计量,未知用 t 统计量(\(t(n-1)\));方差检验用 \(\chi^2\);两总体比较用 t / F。p 值:在原假设下,观测到"当前或更极端"数据的概率。决策:\(p<\alpha\) 拒绝 \(H_0\);p 值越小证据越强。注意:p 值不是 \(H_0\) 为真的概率。

7.1 核心证明清单(按优先级)

证明核心步骤速记
① 概率基本性质可列可加性 + 集合分解(\(A\cup B=A\cup(B\setminus AB)\))
② 全概率 / 贝叶斯划分拆 \(A=\bigcup AB_i\) + 可加性;条件概率定义代换
③ 相互独立 ⟹ 两两独立取 \(I\) 为二元子集;反例验证 \(1/4\ne1/8\)
④ 分布函数三性质单调(事件包含)、右连续(单调事件列极限)、极限(\(\Omega\) 升列)
⑤ 单调变换密度公式\(F_Y=F_X\circ h\),链式求导 + 绝对值
⑥ 卷积公式分布函数法 + Leibniz 求导;独立性 ⟹ 密度乘积
⑦ 期望线性性二维 LOTUS + 边际化 \(\sum_j p_{ij}=p_{i\cdot}\)
⑧ Cauchy-Schwarz / |ρ|≤1二次式 \(E(tX-Y)^2\ge0\) 判别式 ≤0;等号 ⟹ 线性相关
⑨ 特征函数独立和\(E e^{it(X+Y)}=E e^{itX}E e^{itY}\)(期望乘积定理)
⑩ Chebyshev 不等式Markov 不等式(\(\mathbf1_{\{Y\ge\varepsilon\}}\le Y/\varepsilon\))+ \(Y=(X-EX)^2\)
⑪ 弱大数定律\(\mathrm{Var}\bar X\le C/n\) + Chebyshev 上界
⑫ Lindeberg-Levy CLT特征函数展开 \(1-t^2/2+o(t^2)\),\((1-\frac{t^2}{2n})^n\to e^{-t^2/2}\),连续性定理
⑬ S² 无偏性\(\sum(X_i-\bar X)^2=\sum X_i^2-n\bar X^2\),两边取期望
⑭ 正态抽样分布定理Helmert 正交变换:\(\bar X\perp S^2\),\(\chi^2(n-1)\) 来源
⑮ MLE 渐近正态得分函数 Taylor 展开 + CLT + Slutsky
⑯ Neyman-Pearson 引理\((L_1-L_0)(\phi^*-\phi)\ge0\) 逐点 + 积分比较功效

7.2 高频是非辨析

命题判断理由 / 反例
概率为 0 的事件是不可能事件连续型 \(P(X=a)=0\) 但可能发生(定义 2.3)
相互独立 ⟹ 两两独立定义 1.5:全体公式含二元情形;反之否(Bernstein 反例)
独立 ⟺ 不相关独立 ⟹ 不相关恒真;反之仅二维正态等特殊情形成立(定理 3.3 推论)
\(E(XY)=EX\cdot EY\) ⟺ 独立该式只说明不相关(Cov=0),反例 \(Y=X^2\)
\(\mathrm{Var}(X+Y)=\mathrm{Var}X+\mathrm{Var}Y\) ⟺ 独立只需不相关(定理 4.4(2)),无需独立
\(|\rho_{XY}|=1\) ⟺ 线性相关Cauchy-Schwarz 等号条件(定理 4.4)
分布函数相同 ⟹ 分布相同分布函数与分布一一对应(定义 2.1);特征函数唯一性同理
依概率收敛 ⟹ 依分布收敛定义 5.1 的关系链;反之不成立
弱大数定律要求方差存在Khinchin 版只需一阶矩(定理 5.3);Chebyshev 版才需方差
样本方差除以 n 还是 n−1n−1\(E S^2=\sigma^2\) 无偏(定理 6.3);除以 n 有偏
MLE 一定无偏一般相合、渐近无偏;如正态方差 MLE \(\frac1n\sum(X_i-\bar X)^2\) 有偏
95% 置信区间意味着参数以 95% 概率落入其中频率解释:重复抽样中 95% 的区间覆盖(定义 7.2)
p 值 < α ⟹ 拒绝 H₀p 值是 H₀ 下"当前或更极端"的概率(定义 7.5);p 值大不证明 H₀ 真

7.3 常见反例清单

  • 概率 0 但可能发生:连续型取单点 \(P(X=a)=0\)——"概率为 0"与"不可能"是两回事。
  • 两两独立不相互独立:Bernstein 三分事件(定理 1.6),\(P(A_1A_2A_3)=1/4\ne1/8\)。
  • 不相关但非独立:\(X\sim U(-1,1)\),\(Y=X^2\)——\(\mathrm{Cov}=E X^3=0\)(对称),但 \(Y\) 由 \(X\) 完全决定。
  • 期望存在方差无穷:Pareto/学生 t 分布(自由度 2):一阶矩有限、二阶矩发散,Chebyshev 不等式不可用。
  • Cauchy 分布无期望:\(\int|x|f=\infty\),大数定律不适用(样本均值不收敛)。
  • 依分布收敛但不依概率收敛:\(X_n=X\)(同分布)但 \(X_n\) 与 \(X\) 独立——分布相同却不趋近于同一取值。
  • CLT 的失效:方差无穷(重尾)时标准化和不趋于正态,而趋于稳定分布——正态近似需二阶矩。
  • MLE 有偏:正态方差 \(\hat\sigma^2=\frac1n\sum(X_i-\bar X)^2\),\(E\hat\sigma^2=\frac{n-1}{n}\sigma^2\ne\sigma^2\)。
  • 置信区间的误读:一次实现后"该区间包含 \(\theta\) 的概率"不是 95%——\(\theta\) 与区间都已固定,概率语言失效(频率解释)。

7.4 考前自检清单

  • 能否从概率公理推出加法公式与全概率公式(划分 + 可加性)?
  • 能否构造两两独立但不相互独立的三事件反例?
  • 能否默写分布函数三性质并说明为什么它们刻画分布?
  • 能否用分布函数法 / Jacobi 公式求 \(Y=g(X)\) 的密度?
  • 能否证明 \(|ρ|≤1\)(Cauchy-Schwarz)并说明等号意义?
  • 能否证明 Chebyshev 不等式,并从它推出弱大数定律?
  • 能否叙述 Lindeberg-Levy CLT 的条件、结论与特征函数证明主线?
  • 能否证明 \(E S^2=\sigma^2\)(n−1 的来历)?
  • 能否写出正态总体均值(方差已知 / 未知)的置信区间与对应枢轴量?
  • 能否叙述 Neyman-Pearson 引理并说明它为什么给出最优势检验?
关系:最后一章把全册收拢成"从概率到统计"的完整回路:点估计(7.1-7.2)基于矩与大数定律(第 5 章),区间估计(7.2-7.3)基于枢轴量与抽样分布(第 6 章),假设检验(7.4-7.5)是最优化决策(似然比)。三类问题共享同一批武器:iid 假设(6.1)、CLT(5.4)与正态抽样定理(6.5)。复习时以"独立性(前提)、正态性(工具)、频率解释(口径)"三条警戒线串起全部易错点。

目 录