随机向量及其分布
📖 本章导读
本章对应原书第三章。建议先读本讲义某一节获得整体图景,再精读原书对应小节,最后完成习题。本章的计算量在全书居首,多数课程的期中、期末难题也集中于此;但支撑这些计算的思想只有少数几条,本讲义的任务是把它们明确地陈述出来。
3.0 导言:从一个随机变量到一组随机变量
第二章建立了单个随机变量的理论:分布函数、概率分布(离散型)与概率密度(连续型)、随机变量函数的分布。然而实际问题极少只涉及一个随机量。气温与用电负荷、弹落点的横坐标与纵坐标、一支股票的今日收益与明日收益——我们真正关心的往往是若干随机变量之间的联合行为:它们如何相互制约、一个的取值如何改变另一个的分布、它们的函数(和、差、最大值)又服从什么分布。
把 $n$ 个随机变量并列成 $\mathbf{X} = (X_1, X_2, \cdots, X_n)$,就得到随机向量。本章围绕它展开五个层层递进的问题:
- 如何描述联合行为?——联合分布函数、联合概率分布(离散)与联合密度(连续)(§3.1–§3.3)。这里出现全章第一个核心观念:联合分布的信息严格多于全体边缘分布的信息。知道每个分量各自的分布,并不能确定它们作为整体的行为。
- 何时可以把联合拆成边缘的乘积?——独立性的各种等价判别(§3.2B、§3.3D)。独立是"联合 = 边缘乘积"这一特殊情形,它使多维问题退化为一维问题的组合。
- 随机向量的函数服从什么分布?——分布函数法与变换法(§3.4)。卷积公式、正态分布的可加性、瑞利分布与柯西分布都在此产生。
- 已知一部分分量的取值,其余分量的分布如何更新?——条件分布与条件密度(§3.5)。第一章的条件概率在这里升级为处理连续型随机变量的精细工具,并孕育出"回归"这一统计学的中心概念。
- 把观测值从小到大排序后会发生什么?——次序统计量(§3.6)。极值问题(最大降雨量、最短寿命)与数理统计的诸多方法都以它为基础。
贯穿全章的技术主线只有一条:概率 = 密度在区域上的积分。边缘密度是"把联合密度沿某些方向积掉",条件密度是"把联合密度沿某条切片重新归一化",函数的分布是"把密度在原像区域上积分"。因此本章对二重积分的要求很高——确定积分限的能力,即"先画支撑集、再定上下限"的功夫,是本章一切计算的地基。
- 随机向量 = 定义在同一概率空间上的一组随机变量;研究对象从"各自的分布"升级为"联合行为"。
- 全章五问:联合描述 → 独立判别 → 函数的分布 → 条件分布 → 次序统计量。
- 技术主线:概率 = 密度的区域积分;确定积分限是本章的基本功。
3.1 随机向量及其联合分布:一个函数管住全部信息
对应原书 §3.1。
联合分布函数
定义 1.1–1.2 若 $X_1, X_2, \cdots, X_n$ 都是概率空间 $(\Omega, \mathcal{F}, P)$ 上的随机变量,则称 $\mathbf{X} = (X_1, \cdots, X_n)$ 为 $n$ 维随机向量;称 $\mathbf{R}^n$ 上的函数
$$ F(x_1, x_2, \cdots, x_n) = P(X_1 \leq x_1, X_2 \leq x_2, \cdots, X_n \leq x_n) \tag{1.1} $$
为 $\mathbf{X}$ 的联合分布函数(简称联合分布)。
注意定义中的一个细节:所有分量必须定义在同一个概率空间上。这不是形式上的要求——只有生活在同一个样本空间里,"$X_1 \leq x_1$ 与 $X_2 \leq x_2$ 同时发生"才是一个合法的事件。逗号在概率记号中表示事件的交:$P(X \leq x, Y \leq y) = P(\{X \leq x\} \cap \{Y \leq y\})$。
联合分布函数继承了一维分布函数的基本性质(关于每个自变量单调不减、右连续、在各变元趋于 $-\infty$ 时趋于 0、全部趋于 $+\infty$ 时趋于 1),但二维情形多出一条一维所没有的约束。以 $n = 2$ 为例,对矩形 $D = \{(x,y) \mid a < x \leq b,\ c < y \leq d\}$,用容斥的方式(原书例 1.1)可得
$$ P(a < X \leq b,\ c < Y \leq d) = F(b,d) - F(b,c) - F(a,d) + F(a,c) \geq 0. \tag{1.3–1.4} $$
推导本身值得复现一遍:先固定 $c < Y \leq d$ 把 $X$ 的范围拆开,再把 $Y$ 的范围拆开,四项正负相间,恰是"大矩形减去两条、补回一角"的容斥结构。矩形不等式 (1.4) 说明:并非任何"看起来像分布函数"的二元函数都能充当联合分布——它必须对一切矩形给出非负概率。这一约束在一维时自动被单调性蕴含,在高维则是独立的条件。
边缘分布:向低维投影
从联合分布函数取部分变元趋于 $+\infty$,就得到子向量的分布:
$$ F_k(x_1, \cdots, x_k) = F(x_1, \cdots, x_k, \infty, \cdots, \infty), $$
称为边缘分布。直观解释:$X_{k+1} \leq \infty$ 是必然事件,对它不加任何限制,等于把这些分量"遗忘"。二维时 $F_X(x) = F(x, \infty)$,$F_Y(y) = F(\infty, y)$。$n$ 维随机向量共有 $C_n^1 + C_n^2 + \cdots + C_n^{n-1} = 2^n - 2$ 个边缘分布(每个非空真子集对应一个)。
现在陈述本章第一个核心论断:联合分布唯一决定全部边缘分布,但边缘分布一般不能决定联合分布。前半句已由上式构造性地证明;后半句将在 §3.3 用二元正态给出具体反例($\rho$ 取不同值时联合分布不同,边缘分布却完全一样)。这个不对称性值得反复体会:边缘分布只记录每个分量"独自"的统计规律,而联合分布还记录它们"如何联动"——相关结构。从联合到边缘是投影,投影必然丢失信息。
唯一的例外是独立情形。由第二章独立性的定义直接改写即得:$X_1, \cdots, X_n$ 相互独立的充分必要条件是对一切 $(x_1, \cdots, x_n)$,
$$ F(x_1, x_2, \cdots, x_n) = F_1(x_1) F_2(x_2) \cdots F_n(x_n). \tag{1.6} $$
即:独立 = 联合分布恰好等于边缘分布的乘积 = 边缘信息已是全部信息。此后两节将把这一判别分别翻译成离散语言(概率分布相乘)与连续语言(密度相乘)。
- 联合分布 $F(x_1, \cdots, x_n) = P(X_1 \leq x_1, \cdots, X_n \leq x_n)$,逗号表示事件之交;各分量须在同一概率空间。
- 矩形不等式 $F(b,d) - F(b,c) - F(a,d) + F(a,c) \geq 0$ 是高维特有的约束。
- 令部分变元取 $\infty$ 得边缘分布;共 $2^n - 2$ 个。联合决定边缘,边缘不决定联合(投影丢失相关结构)。
- 独立 $\iff$ 联合分布 = 边缘分布之积。
3.2 离散型随机向量:概率分布表及其行列求和
对应原书 §3.2。
联合概率分布与边缘分布
各分量均为离散型时,随机向量的分布由联合概率分布
$$ p_{j_1 j_2 \cdots j_n} = P\big(X_1 = x_1(j_1), \cdots, X_n = x_n(j_n)\big) $$
完全刻画。它满足非负性与总和为 1(后者的证明用到第一章的语言:全体事件 $\{X_1 = x_1(j_1), \cdots\}$ 构成完备事件组,由可列可加性得总概率为 1)。求子向量的分布,则是把不关心的下标全部求和:
$$ P(X_1 = x_1(j_1), \cdots, X_k = x_k(j_k)) = \sum_{j_{k+1}, \cdots, j_n} p_{j_1 \cdots j_n}. \tag{2.3} $$
证明的机制与第一章全概率公式完全相同:按被遗忘分量的取值作分类讨论,逐类求和。
二维情形最宜用表格理解(原书例 2.1–2.2):行标 $x_i$、列标 $y_j$、格内 $p_{ij}$。则 $X$ 的边缘分布 $p_i = \sum_j p_{ij}$ 是行和,$Y$ 的边缘分布 $q_j = \sum_i p_{ij}$ 是列和。"边缘"(marginal)一词正来源于此:行和、列和习惯上写在表格的边缘处。这张表是本章多数离散计算的载体,习题 3.43 即是对它的综合训练。
多项分布:二项分布的多维推广
**例 2.3(多项分布)**是最重要的离散型随机向量。设 $A_1, \cdots, A_r$ 是试验 $S$ 的完备事件组,$P(A_i) = p_i$。独立重复 $n$ 次,以 $X_i$ 记 $A_i$ 发生的次数,则
$$ P(X_1 = k_1, \cdots, X_r = k_r) = \frac{n!}{k_1! \, k_2! \cdots k_r!} \, p_1^{k_1} p_2^{k_2} \cdots p_r^{k_r}, \qquad \sum_{i=1}^r k_i = n. \tag{2.6} $$
公式的结构可以直接读出,不必死记:指定哪些试验落入哪一类,是第一章计数武器(4)的多组分组问题,方案数为多项系数 $\frac{n!}{k_1! \cdots k_r!}$;每一种具体方案由独立性给出概率 $p_1^{k_1} \cdots p_r^{k_r}$;二者相乘。$r = 2$ 时它退化为二项分布 $B(n, p_1)$。原书采用归纳法证明(按第 $n$ 次试验落入哪一类作全概率分解),其中关键的合并步骤 $\sum_i \frac{k_i}{n} = 1$ 值得亲手验证一次。
多项分布的边缘分布可以从背景直接读出而无需计算:单看 $X_j$,每次试验只有"$A_j$ 发生 / 不发生"两种结果,故
$$ X_j \sim B(n, p_j). $$
这体现了一条重要的方法论:求边缘分布时,优先回到概率模型的背景解释,往往比对联合分布硬性求和更快。注意 $X_1, \cdots, X_r$ 必然不独立——它们受约束 $X_1 + \cdots + X_r = n$ 联结(练习 3.2(1));这是"边缘各自正常、联合存在制约"的又一实例。
离散型的独立性判别
定理 2.1 / 推论 2.2 $X, Y$ 相互独立的充分必要条件是对所有取值格点 $(x_i, y_j)$,
$$ P(X = x_i, Y = y_j) = P(X = x_i) P(Y = y_j). \tag{2.9} $$
即表格中每一格都等于其行和与列和的乘积。证明的两个方向都有教益:由 (2.9) 推独立,是把 $\{X \leq x\}$ 拆成可列个 $\{X = x_i\}$ 之并,用可列可加性把和式分解为两个单变量和式的乘积——这是"从点概率合成区间概率"的标准手法;反方向则依赖第二章的定理(独立随机变量落入任意 Borel 集的事件仍独立),取单点集即可。
易错提示
判别不独立只需一个反例格点,判别独立却必须核验全部格点。一个实用的快速否定法:若表中存在某格 $p_{ij} = 0$ 而对应行和、列和均为正,则必不独立(乘积为正而联合为零)。由此立即可知:联合分布的支撑集若不是"行集 × 列集"的乘积形状,独立性无从谈起。这一观察在连续情形将升级为"支撑集必须是矩形"的判据。
- 离散联合分布 = 概率表;边缘分布 = 行和 / 列和;"边缘"一词源于表格边缘。
- 多项分布 $\frac{n!}{k_1! \cdots k_r!} p_1^{k_1} \cdots p_r^{k_r}$:多组分组计数 × 独立试验概率;边缘为二项 $B(n, p_j)$;分量间因总数约束而不独立。
- 独立 $\iff$ 每格 = 行和 × 列和(须全部格点成立);一格为零而行列和为正即可否定独立。
3.3 连续型随机向量及其联合密度:概率即体积
对应原书 §3.3。本节概念密度最大,分四个层次推进。
A. 联合密度:从"长度上的密度"到"面积上的密度"
定义 3.1 若存在 $\mathbf{R}^n$ 上的非负可积函数 $f(x_1, \cdots, x_n)$,使得对任何子立方体 $D$,
$$ P(\mathbf{X} \in D) = \int_D f(x_1, \cdots, x_n) \, \mathrm{d}x_1 \cdots \mathrm{d}x_n, \tag{3.2} $$
则称 $\mathbf{X}$ 为连续型随机向量,$f$ 为其联合概率密度。该等式可扩展到任意 Borel 集 $B$(式 3.3),且 $f$ 在全空间的积分为 1。
一维密度的直觉在此完整地平移过来:$f(x, y)$ 本身不是概率,$f(x, y) \, \mathrm{d}x \, \mathrm{d}y$ 才近似地是 $(X, Y)$ 落入点 $(x,y)$ 附近小矩形的概率;概率是密度曲面下方、底为区域 $B$ 的体积。与分布函数的联系是(原书例 1.2 与式 3.10):
$$ F(x, y) = \int_{-\infty}^{x} \int_{-\infty}^{y} f(s, t) \, \mathrm{d}s \, \mathrm{d}t, \qquad f(x, y) = \frac{\partial^2 F(x, y)}{\partial x \, \partial y} \ \text{(当 } f \text{ 连续时)}. $$
一维时密度是分布函数的一阶导数,二维时则是混合二阶偏导——对每个方向各"剥"一次积分。
本节还预先陈述了 Fubini 定理(定理 3.1):非负或绝对可积函数的重积分可以化为任意次序的累次积分。本章几乎每一个计算都在默默使用它;数学分析课程中它有严格的条件,概率论的应用场景(密度非负)恰好使其无条件可用。
B. 边缘密度:把联合密度"压扁"
设 $(X, Y)$ 有联合密度 $f(x, y)$,则分量的密度为
$$ f_X(x) = \int_{-\infty}^{\infty} f(x, y) \, \mathrm{d}y, \qquad f_Y(y) = \int_{-\infty}^{\infty} f(x, y) \, \mathrm{d}x, $$
称为边缘密度。推导(原书式 3.7–3.8)只是 Fubini 定理的一次应用:$P(X \in D_k)$ 等于对全空间中"$x \in D_k$、$y$ 任意"的柱形区域积分,先把 $y$ 积掉,剩下的被积函数按定义就是 $X$ 的密度。几何图像:把密度曲面沿 $y$ 方向压扁(投影并累积)到 $x$ 轴上。离散情形的"行和"在此变成"沿行积分",二者是同一操作的两种语言。
积分限的确定是本章第一大失分点,必须建立规范流程。以原书例 3.3 为范本:$(X, Y)$ 在单位圆 $D = \{x^2 + y^2 \leq 1\}$ 内均匀分布,联合密度 $f = \frac{1}{\pi} \mathrm{I}_D$。求 $f_X$。
思路:边缘密度的公式对 $y$ 从 $-\infty$ 积到 $\infty$,但被积函数只在支撑集 $D$ 内非零,因此实际有效的积分限由"固定 $x$ 时,$(x,y)$ 仍留在 $D$ 内的 $y$ 的范围"决定。规范做法分三步:第一步画出支撑集(单位圆盘);第二步固定横坐标 $x$,作铅垂线,读出它与支撑集相交的线段:$|y| \leq \sqrt{1 - x^2}$;第三步在该线段上积分:
$$ f_X(x) = \frac{1}{\pi} \int_{-\sqrt{1-x^2}}^{\sqrt{1-x^2}} \mathrm{d}y = \frac{2}{\pi} \sqrt{1 - x^2}, \qquad |x| \leq 1. $$

同理 $f_Y(y) = \frac{2}{\pi}\sqrt{1 - y^2}$。两个边缘都是"半圆律"密度,而非均匀分布——均匀分布的边缘未必均匀,因为不同的 $x$ 处铅垂弦长不同。原书使用示性函数 $\mathrm{I}_D$ 完成同一计算:将 $\mathrm{I}_{\{x^2 + y^2 \leq 1\}}$ 改写为 $\mathrm{I}_{\{|y| \leq \sqrt{1-x^2}\}}$ 再积分。示性函数法与画图法本质相同,前者便于书写严格推导,后者便于正确起手;建议画图定限、示性函数落笔,双轨并用。
写边缘密度时必须同时写明自变量的范围(如 $|x| \leq 1$),范围之外密度为零。漏写范围等于把密度延拓到全轴,归一性立即被破坏,也是阅卷中最常见的扣分原因。
C. 联合分布与联合密度的关系:一个必要的反例
"$F$ 连续且混合偏导数几乎处处存在"是否保证联合密度存在?否。原书例 3.6 的反例极具启发性:设 $X \sim \mathcal{U}(0,1)$,$Y = X$,则 $(X, Y)$ 的联合分布函数 $F(x,y) = \min\{x, y\}$(截断到 $[0,1]$)处处连续,且除若干直线外混合偏导存在、连续。但若 $(X, Y)$ 有联合密度 $f$,记对角线 $D = \{y = x\}$,则
$$ 1 = P(X = Y) = \int_D f(x, y) \, \mathrm{d}x \, \mathrm{d}y = 0, $$
矛盾——直线是二维零体积集,其上的任何积分为零。故 $(X,Y)$ 无联合密度。
这个例子揭示的机理是:$(X, X)$ 的全部概率质量集中在一条一维曲线上,它在二维空间里"薄"到无法用密度描述——正如单点无法用一维密度描述一样。由此得到两条实用结论(练习 3.3(1)(2)):连续型随机向量满足 $P(X = Y + c) = 0$;以及两个分量各自连续,不保证向量整体连续(习题 3.8)。"连续型"是对向量整体的要求,比对每个分量的要求严格得多。定理 3.2 给出了实用的正面判据:由 $F$ 求混合偏导得到候选密度 $f$ 后,验证 $\int f = 1$;积分等于 1 则 $f$ 确为联合密度(质量没有泄漏到低维集合上),小于 1 则说明存在奇异部分。
D. 连续型的独立性判别与两大分布
定理 3.3 各 $X_i$ 有密度 $f_i$ 时,$X_1, \cdots, X_n$ 相互独立的充分必要条件是乘积 $f_1(x_1) f_2(x_2) \cdots f_n(x_n)$ 是 $\mathbf{X}$ 的联合密度。
证明双向都是 Fubini 定理:乘积形式的被积函数使累次积分逐变量分离。实际判别时常用其推论形式——若联合密度可以分解为 $f(x, y) = g(x) h(y)$(各因子只含一个变量),且支撑集是矩形(含无穷矩形),则 $X, Y$ 独立;此时 $g, h$ 各自归一化后就是边缘密度。两个条件缺一不可:
- 可分离:如二元标准正态 $\frac{1}{2\pi} e^{-(x^2+y^2)/2} = \frac{1}{\sqrt{2\pi}}e^{-x^2/2} \cdot \frac{1}{\sqrt{2\pi}}e^{-y^2/2}$,独立。
- 支撑集为矩形:例 3.3 的单位圆均匀分布,密度 $\frac{1}{\pi}\mathrm{I}_{\{x^2+y^2 \leq 1\}}$ 看似常数("可分离"),但支撑集是圆盘而非矩形,示性函数 $\mathrm{I}_{\{x^2 + y^2 \leq 1\}}$ 无法写成 $\mathrm{I}_A(x)\mathrm{I}_B(y)$,故 $X, Y$ 不独立。直观原因:知道 $X = 0.99$ 后 $Y$ 被压缩在很小的区间内——取值范围互相牵制,谈不上独立。矩形支撑条件正是离散情形"支撑集 = 行集 × 列集"的连续版本。
作为对照,原书例 3.7 证明:立方体上的均匀分布分量独立(各边缘为区间上的均匀分布,乘积恰为联合密度),且逆命题亦真。均匀分布分量是否独立,完全由支撑区域的形状决定。
**例 3.8–3.9(二元正态分布)**是本节压轴,也是全书最重要的连续型随机向量。$(X, Y) \sim N(\mu_1, \mu_2; \sigma_1^2, \sigma_2^2; \rho)$ 指联合密度为
$$ f(x, y) = \frac{1}{2\pi \sigma_1 \sigma_2 \sqrt{1 - \rho^2}} \exp\left\{ -\frac{1}{2(1 - \rho^2)} \left[ \frac{(x - \mu_1)^2}{\sigma_1^2} - \frac{2\rho (x - \mu_1)(y - \mu_2)}{\sigma_1 \sigma_2} + \frac{(y - \mu_2)^2}{\sigma_2^2} \right] \right\}. \tag{3.14} $$
五个参数的含义($\mu_i$ 为中心,$\sigma_i$ 为各方向的尺度,$\rho$ 刻画关联强弱与方向)将在第四章证明为期望、方差与相关系数。引入均值向量 $\boldsymbol{\mu}$ 与矩阵 $\Sigma = \begin{pmatrix} \sigma_1^2 & \rho \sigma_1 \sigma_2 \\ \rho \sigma_1 \sigma_2 & \sigma_2^2 \end{pmatrix}$,密度可写成与一维完全同构的形式
$$ f(\mathbf{x}) = \frac{1}{(\sqrt{2\pi})^n \sqrt{\det \Sigma}} \exp\left[ -\frac{1}{2} (\mathbf{x} - \boldsymbol{\mu}) \Sigma^{-1} (\mathbf{x} - \boldsymbol{\mu})^{\mathrm{T}} \right], \tag{3.18–3.19} $$
由此自然推广到 $n$ 元正态 $N(\boldsymbol{\mu}, \Sigma)$(§5.3 将系统研究)。一维的 $\frac{(x-\mu)^2}{\sigma^2}$ 升级为二次型 $(\mathbf{x}-\boldsymbol{\mu})\Sigma^{-1}(\mathbf{x}-\boldsymbol{\mu})^{\mathrm{T}}$,归一化常数中的 $\sigma$ 升级为 $\sqrt{\det \Sigma}$——这种"标量→矩阵"的对应是学习多元统计的基本感觉。
例 3.9 完成两个计算,方法都值得掌握。其一,边缘分布:对 $y$ 积分时,把指数中关于 $v = (y-\mu_2)/\sigma_2$ 的部分配方成 $(v - \rho u)^2 + (1 - \rho^2) u^2$ 的形式,前者积成高斯积分常数,剩下的恰是一维正态密度,得
$$ X \sim N(\mu_1, \sigma_1^2), \qquad Y \sim N(\mu_2, \sigma_2^2). $$
注意:边缘分布与 $\rho$ 无关。因此固定 $\mu_i, \sigma_i$ 而变动 $\rho$,可得无穷多个联合分布不同、边缘分布完全相同的例子——这就是"边缘不能决定联合"的标准反例。其二,独立性判据:
$$ X, Y \text{ 独立} \iff \rho = 0. $$
充分性由 $\rho = 0$ 时密度显式分离直接可见;必要性只需在独立等式 $f_X f_Y = f$ 中代入一点 $(\mu_1, \mu_2)$ 比较常数即得。$\rho$(第四章将证明它是相关系数)为零一般只意味着"不相关",远弱于独立;二元正态是"不相关 $\Rightarrow$ 独立"成立的著名特例,此结论在数理统计中被反复使用。另须警惕其边界:该等价性要求 $(X,Y)$ 联合正态;两个边缘各自正态而联合不正态时,$\rho = 0$ 不能推出独立。

- 联合密度:$P(\mathbf{X} \in B) = \int_B f$,概率即体积;$f = \partial^2 F / \partial x \partial y$。
- 边缘密度 = 沿被遗忘变量积分;定限三步:画支撑集 → 固定一个变量作直线 → 读出相交线段。写密度必须附带自变量范围。
- $(X, X)$ 型反例:质量集中在低维集合上则无联合密度;分量连续 $\nRightarrow$ 向量连续;验证 $\int f = 1$ 是正面判据。
- 独立判别 = 密度可分离 且 支撑集为矩形;圆盘上的均匀分布不独立。
- 二元正态:边缘 $N(\mu_i, \sigma_i^2)$ 与 $\rho$ 无关(边缘不定联合的反例);独立 $\iff \rho = 0$(不相关推独立的特例,以联合正态为前提)。
3.4 随机向量函数的分布:分布函数法与变换法
对应原书 §3.4。本节是全章计算方法的军械库。
A. 分布函数法与卷积公式
设 $\mathbf{X}$ 有联合密度 $f$,$Y_i = g_i(X_1, \cdots, X_n)$。求 $(Y_1, \cdots, Y_m)$ 分布的基本公式(式 4.1)概念上极简单:
$$ F_Y(y_1, \cdots, y_m) = P\big(g_1(\mathbf{X}) \leq y_1, \cdots, g_m(\mathbf{X}) \leq y_m\big) = \int_C f(x_1, \cdots, x_n) \, \mathrm{d}x_1 \cdots \mathrm{d}x_n, $$
其中 $C = \{\mathbf{x} \mid g_i(\mathbf{x}) \leq y_i, \forall i\}$ 是原像区域。也就是说:函数的分布函数 = 密度在原像区域上的积分;随后对 $y$ 求导(或求混合偏导并验证归一,参照定理 3.2)得密度。这一方法称为分布函数法,它不要求变换可逆,是普适的默认路径。
**例 4.1(和的分布与卷积公式)**是分布函数法最重要的产出。设 $(X, Y)$ 有联合密度 $f(x,y)$,则 $Z = X + Y$ 有密度
$$ f_Z(z) = \int_{-\infty}^{\infty} f(x, z - x) \, \mathrm{d}x; \tag{4.2} $$
当 $X, Y$ 独立时即卷积公式
$$ f_Z(z) = \int_{-\infty}^{\infty} f_X(x) f_Y(z - x) \, \mathrm{d}x. \tag{4.3} $$
原书的推导手法值得细读:对 $P(a < Z \leq b)$ 在斜带形区域 $\{a < x + y \leq b\}$ 上积分,先固定 $x$ 对 $y$ 积分,再作换元 $y = z - x$ **把斜带"扶正"**为 $z$ 的区间 $(a, b]$,最后交换积分次序,使表达式呈现"对 $z$ 在 $(a,b]$ 上积分某个函数"的形状——按定义,被积的那个函数就是 $f_Z$。这种"整理成 $\int_a^b (\cdot) \, \mathrm{d}z$ 再认出密度"的论证方式在本章反复出现。公式的直观读法:$Z$ 落在 $z$ 附近,要求 $X$ 取某值 $x$ 而 $Y$ 恰好补足 $z - x$,对所有分工方式 $x$ 累加。
例 4.2(三角分布):$X, Y$ 独立同 $\mathcal{U}(0,1)$,卷积给出
$$ f_Z(z) = \int_0^1 \mathrm{I}_{\{0 < z - x < 1\}} \, \mathrm{d}x = \begin{cases} z, & z \in [0, 1), \\ 2 - z, & z \in [1, 2], \\ 0, & \text{其他}. \end{cases} $$
计算的全部难点在示性函数的处理:$0 < z - x < 1$ 即 $z - 1 < x < z$,与积分区间 $(0,1)$ 取交后分 $z < 1$ 与 $z \geq 1$ 两段讨论。两个均匀分布之和不再均匀而呈三角形——中间的取值有更多的分工方式实现,两端只有唯一实现方式。这预示了中心极限定理的方向:不断卷积会使分布越来越"聚中、光滑"。
同法可得差的公式 $f_V(v) = \int f(x, x - v) \mathrm{d}x$(例 4.3,练习 3.4(2))。**例 4.4(瑞利分布)**演示原像区域为圆盘的情形:$X, Y$ 独立标准正态,$Z = \sqrt{X^2 + Y^2}$,用极坐标计算圆盘上的积分得
$$ F_Z(z) = \int_0^z r e^{-r^2/2} \, \mathrm{d}r, \qquad f_Z(z) = z e^{-z^2/2}, \quad z \geq 0. $$
此即瑞利分布(射击问题中"脱靶量"的分布)。旋转对称的密度配极坐标,是应当形成条件反射的搭配。
B. 变换法:雅可比行列式
当变换 $(X, Y) \mapsto (U, V)$ 可逆(或分片可逆)时,有比分布函数法更直接的变换法。
定理 4.1 设 $(X,Y)$ 有联合密度 $f$,$U = u(X,Y)$,$V = v(X,Y)$,区域 $D$ 满足 $P((U,V) \in D) = 1$。若存在反解 $x_i = x_i(u,v)$,$y_i = y_i(u,v)$($i = 1, \cdots, m$),使得每点 $(u,v) \in D$ 的原像恰为这 $m$ 支反函数的值、各支可逆且雅可比行列式非零、各支值域互不相交,则 $(U, V)$ 有联合密度
$$ g(u, v) = \sum_{i=1}^{m} f\big(x_i(u,v),\ y_i(u,v)\big) \left| \frac{\partial(x_i, y_i)}{\partial(u, v)} \right|, \qquad (u,v) \in D. \tag{4.11} $$
这个定理不是新原理,而是重积分换元公式的概率复述:$P((U,V) \in A) = P((X,Y) \in \text{原像})$,对右端的积分作变量替换,替换产生的体积伸缩因子正是雅可比行列式的绝对值。三点技术须知:
- 雅可比是"旧变量对新变量"求导:$\frac{\partial(x, y)}{\partial(u, v)}$,即先把 $x, y$ 反解为 $u, v$ 的函数再求导。若正向求导更方便,可利用互逆关系 $\frac{\partial(x,y)}{\partial(u,v)} = \left[\frac{\partial(u,v)}{\partial(x,y)}\right]^{-1}$。
- 取绝对值:密度必须非负,行列式的符号只反映定向。
- 多支求和:变换非单射时(典型如平方、取模),每一支原像各自贡献一项。这正是第二章 $Y = X^2$ 公式中"两支相加"的高维推广。
例 4.5(极坐标分解):$X, Y$ 独立标准正态,令 $X = R\cos\Theta$,$Y = R\sin\Theta$。变换单支可逆,$\frac{\partial(x,y)}{\partial(r,\theta)} = r$,故
$$ g(r, \theta) = \frac{1}{2\pi} r e^{-r^2/2}, \qquad r > 0, \ \theta \in [0, 2\pi). $$
密度分离且支撑为矩形(乘积区域),故 $R$ 与 $\Theta$ 独立:$R$ 服从瑞利分布,$\Theta$ 服从 $[0, 2\pi)$ 上的均匀分布。二维标准正态在方向上完全均匀、模长服从瑞利分布——这一结构是正态分布旋转对称性的解析表达。
**定理 4.2 与例 4.6(Box–Muller 方法)**顺势解决一个实际问题:如何从均匀随机数生成正态随机数。定理 4.2 陈述一个"同分布传递"原理:同分布的输入经同一函数映射,输出同分布——分布只依赖于分布,不依赖于随机变量的具体构造。据此,取 $U_1, U_2$ 独立 $\mathcal{U}(0,1)$,令
$$ X_1 = \sqrt{-2\ln U_1} \cos(2\pi U_2), \qquad Y_1 = \sqrt{-2\ln U_1} \sin(2\pi U_2), $$
则 $\sqrt{-2\ln U_1}$ 恰为瑞利分布(第二章分位数变换的一次应用),$2\pi U_2$ 为均匀角,二者独立,与例 4.5 的 $(R, \Theta)$ 同分布;于是 $(X_1, Y_1)$ 与独立标准正态对 $(X, Y)$ 同分布。这就是数值计算库中生成正态随机数的经典 Box–Muller 算法,也是"概率论定理直接变成代码"的一个佳例。
例 4.7(柯西分布的出现):$X, Y$ 独立标准正态,求 $U = X/Y$,$V = X^2 + Y^2$ 的联合密度。此例集中演示双支变换:由 $(u, v)$ 反解得两支 $(x, y)$ 与 $(-x, -y)$(因分子分母同时变号不改变商,平方和亦不变),各支雅可比同为 $\frac{1}{2(1+u^2)}$,求和得
$$ g(u, v) = \frac{1}{2} e^{-v/2} \cdot \frac{1}{\pi (1 + u^2)}, \qquad v > 0, \ u \in \mathbf{R}. $$
密度分离、支撑为矩形,故 $U, V$ 独立:$V$ 服从参数 $\frac12$ 的指数分布,$U$ 的密度 $\frac{1}{\pi(1+u^2)}$ 称为柯西分布——两个独立标准正态之商。柯西分布尾部极厚(第四章将证明其期望不存在),是概率论中最重要的"病态"范例,此处是它在本书的首次登场。
方法选择指南:只求单个函数 $Z = g(X,Y)$ 的分布,用分布函数法(或先补一个辅助变量如 $W = X$ 凑成二维可逆变换,用雅可比法算出联合密度后再积掉 $w$ 得边缘——"增补变量法",习题 3.48、3.49 均可这样处理);求联合密度且变换(分片)可逆,直接用雅可比法。线性变换是最常用特例(练习 3.4(4)):$(U,V) = (X,Y)A^{\mathrm{T}}$ 满秩时 $g(u,v) = \frac{1}{|\det A|} f(x, y)$。
- 分布函数法(普适):$F_Y = \int_{\text{原像区域}} f$,再求导;"整理成 $\int_a^b(\cdot)\mathrm{d}z$ 认出密度"是标准论证。
- 卷积:$f_{X+Y}(z) = \int f_X(x) f_Y(z-x) \mathrm{d}x$(独立时);均匀 + 均匀 = 三角分布。
- 雅可比法:$g(u,v) = \sum_i f(x_i, y_i) \left|\frac{\partial(x_i,y_i)}{\partial(u,v)}\right|$;旧对新求导、取绝对值、非单射分支求和。
- 极坐标分解:标准正态对 $\Rightarrow$ 模(瑞利)与方向(均匀)独立;由此得 Box–Muller 正态随机数算法。
- 正态之商为柯西分布;只求一维分布时可用"增补变量再积掉"的技巧。
3.5 条件分布和条件密度:给定信息后的分布更新
对应原书 §3.5。
A. 离散型:按行(列)重新归一化
离散情形不需要任何新工具,条件概率公式直接给出:对固定的 $j$($q_j = P(Y = y_j) > 0$),
$$ P(X = x_i \mid Y = y_j) = \frac{p_{ij}}{q_j}, \qquad i = 1, 2, \cdots \tag{5.3} $$
称为条件 $Y = y_j$ 下 $X$ 的条件分布。在概率表上看:取出 $Y = y_j$ 所在的那一列,将其中各格除以列和——即把一列重新归一化为一个概率分布。定理 5.1 随之显然:$X, Y$ 独立当且仅当每列归一化后都与边缘分布 $\{p_i\}$ 相同(条件化不改变分布,即信息无用)。
**例 5.1–5.2(几何等待时间的结构)**值得精读。射击命中率为 $p$,$S_1, S_2$ 为第一、二次命中时的射击次数,联合分布 $P(X = i, Y = j) = p^2 q^{j-2}$($j > i \geq 1$,$q = 1 - p$):前 $j$ 次中恰有第 $i$ 次与第 $j$ 次命中、其余 $j - 2$ 次落空。求和得边缘:$X$ 服从几何分布 $pq^{i-1}$,$Y$ 服从 $P(Y = j) = (j-1)p^2 q^{j-2}$(负二项分布的特例)。两个条件分布各有深意:
$$ P(X = i \mid Y = j) = \frac{1}{j - 1} \ (1 \leq i < j); \qquad P(Y = j \mid X = i) = p q^{j - i - 1} \ (j > i). $$
前者表明:已知第二次命中发生在第 $j$ 次,则第一次命中的位置在 $\{1, \cdots, j-1\}$ 上均匀分布——具体位置不携带任何倾向性信息。后者表明:已知 $S_1 = i$,则还需等待的次数 $Y - i$ 仍服从同一几何分布,与 $i$ 无关——几何分布无记忆性的又一表现。例 5.2 进一步验证增量 $X_1 = S_1, X_2 = S_2 - S_1$ 独立同分布(联合概率恰好分解为两个几何分布之积)。"等待时间的增量独立同分布"这一结构是第六章泊松过程的离散原型。
B. 连续型:一次不平凡的定义
连续情形出现了实质困难:想定义 $P(X \leq x \mid Y = y)$,但 $P(Y = y) = 0$,条件概率公式的分母为零,第一章的定义在此完全失效。然而这一概念又有明确的实际意义(原书的例子:已知明日最高气温 $Y = y$,电网最大负荷 $X$ 的分布——气温取 35℃ 这一事件概率为零,但"35℃ 那天的负荷分布"显然是有内容的问题)。
出路是用极限逼近:条件 $Y = y$ 理解为条件 $y - \varepsilon < Y \leq y$ 当 $\varepsilon \to 0$ 的极限。原书的推导(值得逐行复现):设 $f_Y$ 在 $y$ 处连续且为正,
$$ \lim_{\varepsilon \to 0} P(X \leq x \mid y - \varepsilon < Y \leq y) = \lim_{\varepsilon \to 0} \frac{F(x, y) - F(x, y - \varepsilon)}{F_Y(y) - F_Y(y - \varepsilon)} = \frac{\dfrac{\partial}{\partial y} \displaystyle\int_{-\infty}^{y} \left( \int_{-\infty}^{x} f(s, t) \, \mathrm{d}s \right) \mathrm{d}t}{f_Y(y)} = \frac{\displaystyle\int_{-\infty}^{x} f(s, y) \, \mathrm{d}s}{f_Y(y)}. $$
中间一步是"分子分母同除以 $\varepsilon$ 再各自取极限":分母趋于 $f_Y(y)$(密度的定义),分子趋于 $F(x, \cdot)$ 对 $y$ 的偏导(变上限积分求导)。极限的结果被采纳为定义:
定义 5.2 当 $f_Y(y) > 0$ 时,称
$$ F_{X \mid Y}(x \mid y) = \frac{\int_{-\infty}^{x} f(s, y) \, \mathrm{d}s}{f_Y(y)}, \qquad f_{X \mid Y}(x \mid y) = \frac{f(x, y)}{f_Y(y)} \tag{5.7–5.8} $$
为条件 $Y = y$ 下 $X$ 的条件分布函数与条件密度。
条件密度公式 $f_{X|Y} = f / f_Y$ 的几何解释与离散的"列归一化"严格平行:在密度曲面上沿 $Y = y$ 切一刀,得到截面曲线 $x \mapsto f(x, y)$;它非负但积分不为 1(其积分恰为 $f_Y(y)$),除以 $f_Y(y)$ 归一化后便是一条合法的一维密度。切片再归一化——这五个字概括了条件密度的全部内容。与离散情形相同,定理 5.2 给出独立性的条件语言刻画:$X, Y$ 独立 $\iff$ 一切正密度处 $f_{X|Y}(x \mid y) = f_X(x)$(切片形状与切的位置无关)。
三个例题各代表一类应用:
例 5.3(几何截面):单位圆内均匀分布,已知 $Y = y$ 时 $X$ 在弦 $\left(-\sqrt{1-y^2}, \sqrt{1-y^2}\right)$ 上均匀分布——均匀密度的切片仍是均匀的,但支撑随 $y$ 变化。这再次直观解释了 $X, Y$ 为何不独立。
例 5.4(分层建模与连续全概率公式):环境指标 $Y \sim \Gamma(\alpha, \beta)$,给定 $Y = y$ 时软件寿命 $X \sim \mathcal{E}(y)$。这类问题给出的不是联合密度,而是"边缘 + 条件"的分层描述;建模的第一步是用乘法公式重构联合密度
$$ f(x, y) = f_{X \mid Y}(x \mid y) \, f_Y(y), $$
再积掉 $y$ 得 $X$ 的边缘密度 $f_X(x) = \frac{\alpha \beta^\alpha}{(x + \beta)^{\alpha+1}}$($x > 0$,计算中使用 $\Gamma$ 函数的换元与递推 $\Gamma(\alpha+1) = \alpha\Gamma(\alpha)$)。两点评注:其一,链条"条件 × 边缘 = 联合 → 积分 = 边缘"正是第一章全概率公式的连续版本,分层模型(hierarchical model)是现代贝叶斯统计的基本构件;其二,指数分布被 $\Gamma$ 分布"混合"后得到的是幂律尾(Pareto 型)密度——尾部远厚于指数,混合放大了不确定性。
例 5.5(二元正态的条件分布:回归的源头):$(X, Y) \sim N(\mu_1, \mu_2; \sigma_1^2, \sigma_2^2; \rho)$ 时,给定 $X = x$,
$$ Y \mid X = x \ \sim \ N\left( \mu_2 + \rho \frac{\sigma_2}{\sigma_1}(x - \mu_1), \ (1 - \rho^2) \sigma_2^2 \right). \tag{5.9} $$
计算是密度相除后再配方,结论则值得长期记忆。条件期望 $\mu_x = \mu_2 + \rho\frac{\sigma_2}{\sigma_1}(x - \mu_1)$ 是 $x$ 的线性函数——这条直线就是统计学中的回归直线:"回归"概念在数学上的最初形态即二元正态的条件均值。条件方差 $(1-\rho^2)\sigma_2^2$ 与 $x$ 无关,且比无条件方差 $\sigma_2^2$ 缩小了因子 $1 - \rho^2$:$|\rho|$ 越大,知道 $X$ 后对 $Y$ 的不确定性削减越多;$\rho = 0$ 时条件分布与无条件分布相同(独立)。定义 5.3 将条件密度逐字推广到向量对向量的情形($f_{\mathbf{X}|\mathbf{Y}} = f / f_{\mathbf{Y}}$),无新内容。
*C. 条件概率 $P(A \mid X)$:把条件概率升级为随机变量(选学)
本小节为 §4.5 条件期望作概念铺垫,初读可略,但其思想转换非常精彩。对每个取值 $x$,$g(x) = P(A \mid X = x)$ 是一个数;让 $x$ 跑遍 $X$ 的值域,$g$ 是一个普通函数;再把随机变量 $X$ 代入自身的条件概率函数,得到*随机变量
$$ P(A \mid X) = g(X). $$
即:在观测到 $X$ 之前,"$A$ 在给定 $X$ 下的概率"本身是随机的——它随 $X$ 的实现而定。例 5.6(随机个顾客的营业额)、例 5.8($P(X \leq x \mid Y) = 1 - e^{-xY}$)演示了书写方式:先算 $P(A \mid X = x)$ 得 $g(x)$,再整体替换 $x \mapsto X$。这种"条件概率作为随机变量"的观点是现代概率论(鞅论、随机过程)的标准语言,第四章的条件期望 $E(Y \mid X)$ 将沿同一路线构造。
- 离散条件分布 = 一列(行)除以列(行)和;独立 $\iff$ 每列归一化后同于边缘。
- 几何等待时间:给定 $S_2 = j$ 时 $S_1$ 均匀;增量独立同分布(无记忆性)。
- 连续情形 $P(Y = y) = 0$,条件分布经 $\varepsilon$-邻域极限定义;$f_{X|Y} = f / f_Y$ = 切片再归一化。
- 乘法公式 $f = f_{X|Y} f_Y$ 用于分层建模;积掉条件变量 = 连续全概率公式。
- 二元正态条件分布仍正态:条件均值为线性函数(回归直线),条件方差缩减因子 $1 - \rho^2$。
- (选学)$P(A \mid X) = g(X)$ 是随机变量:条件概率的现代观点。
3.6 次序统计量:把样本从小到大排好
对应原书 §3.6。
A. 概念:逐点排序
设 $X_1, \cdots, X_n$ 为随机变量。对每个样本点 $\omega$,把实数 $X_1(\omega), \cdots, X_n(\omega)$ 从小到大重排,所得
$$ X_{(1)} \leq X_{(2)} \leq \cdots \leq X_{(n)} $$
称为次序统计量(定义 6.1)。要点在于排序是逐 $\omega$ 进行的:$X_{(1)}$ 在不同的 $\omega$ 处可能来自不同的原变量(原书例 6.1 用三次考试成绩具体演示了这一点——最低分未必总是同一位学生)。因此每个 $X_{(k)}$ 是原变量的函数,是货真价实的随机变量。两个端点最常用:$X_{(n)} = \max\{X_1, \cdots, X_n\}$,$X_{(1)} = \min\{X_1, \cdots, X_n\}$;原书例 6.2(五十年一遇的降雨量)说明极值分布在工程与保险中的地位。
以下设 $X_1, \cdots, X_n$ 独立同分布,公共分布函数 $F$、密度 $f$。
B. 三个层次的密度公式
第一层:全体次序统计量的联合密度(例 6.5)
$$ g(x_1, x_2, \cdots, x_n) = \begin{cases} n! \, f(x_1) f(x_2) \cdots f(x_n), & x_1 < x_2 < \cdots < x_n, \\ 0, & \text{其他}. \end{cases} \tag{6.4} $$
因子 $n!$ 的来源应当彻底理解。证明的骨架:连续型变量以概率 1 互不相等;事件"排序后的向量落入 $D$ 且严格递增"按是哪个排列实现了这个次序分解为 $n!$ 个互不相容事件之并;由独立同分布的对称性,每个排列事件的概率相同,故总概率为单个的 $n!$ 倍。直观语言:无序样本的每一种递增构型,可由原变量的 $n!$ 种指派方式实现,概率质量因此折叠到锥形区域 $\{x_1 < \cdots < x_n\}$ 上并放大 $n!$ 倍。配套的例 6.4 是一个纯积分引理:
$$ \int_{a < x_1 < \cdots < x_k < b} f(x_1) \cdots f(x_k) \, \mathrm{d}x_1 \cdots \mathrm{d}x_k = \frac{1}{k!} \big(F(b) - F(a)\big)^k, $$
含义是:$k$ 个独立样本全落入 $(a,b)$ 且按指定次序排列的概率,等于全落入的概率 $\left(F(b)-F(a)\right)^k$ 除以次序数 $k!$——对称性使 $k!$ 种次序等可能。该引理(归纳法证明,逐层"剥"最外一个变量)是下面一切边缘密度计算的引擎。
第二层:单个 $X_{(k)}$ 的密度(例 6.6)
$$ g_k(x) = \frac{n!}{(k-1)! \, (n-k)!} \, F(x)^{k-1} \big[1 - F(x)\big]^{n-k} f(x). \tag{6.5} $$
原书由联合密度积分(配合例 6.4)严格导出。但这个公式更应当用微元法直接"看"出来,这也是记忆它的正确方式。$X_{(k)}$ 落在微小区间 $(x, x + \mathrm{d}x)$ 中,意味着 $n$ 个独立样本被分成三组:恰有 $k - 1$ 个落在 $x$ 左侧(每个概率 $F(x)$)、恰有 1 个落入微元(概率 $f(x)\,\mathrm{d}x$)、其余 $n - k$ 个落在右侧(每个概率 $1 - F(x)$)。三组人选的指派方式数为多项系数 $\frac{n!}{(k-1)! \, 1! \, (n-k)!}$,故
$$ P\big(X_{(k)} \in (x, x + \mathrm{d}x)\big) \approx \frac{n!}{(k-1)!(n-k)!} F^{k-1} (1 - F)^{n-k} f \, \mathrm{d}x, $$
两边除以 $\mathrm{d}x$ 即得 (6.5)。(两个及以上样本同落微元的概率是 $(\mathrm{d}x)^2$ 阶的高阶无穷小,极限中消失——这是微元法在此严格可行的原因。)

两个端点情形建议独立掌握、优先使用,因为它们经由分布函数的推导更快且不易错:
$$ P(X_{(n)} \leq x) = P(\text{全体} \leq x) = F(x)^n \ \Rightarrow \ g_n(x) = n F^{n-1}(x) f(x); $$
$$ P(X_{(1)} > x) = P(\text{全体} > x) = [1 - F(x)]^n \ \Rightarrow \ g_1(x) = n [1 - F(x)]^{n-1} f(x). $$
最大值走分布函数、最小值走生存函数(尾概率)——这对"事件翻译"($\max \leq x \iff$ 全都 $\leq x$;$\min > x \iff$ 全都 $> x$)是次序统计量问题的第一反应。
第三层:两个次序统计量的联合密度(例 6.7):对 $k_1 < k_2$,
$$ g_{k_1, k_2}(x, y) = \frac{n!}{(k_1 - 1)! (k_2 - k_1 - 1)! (n - k_2)!} F(x)^{k_1 - 1} [F(y) - F(x)]^{k_2 - k_1 - 1} [1 - F(y)]^{n - k_2} f(x) f(y), \quad x < y. $$
不必背诵:微元法的图像自动生成它——数轴被 $x, y$ 两个微元分成三段,各段人数 $k_1 - 1$、$k_2 - k_1 - 1$、$n - k_2$,概率分别为 $F(x)$、$F(y) - F(x)$、$1 - F(y)$,再乘多项系数与两个密度微元。此公式是计算极差 $R = X_{(n)} - X_{(1)}$ 分布的出发点(习题 3.29)。
应用:竞争风险与"灯泡悖论"
例 6.9 以生活现象收束本节:住宅由 4 只灯泡改为 24 只后,主人感觉灯泡"更容易坏"。设各灯泡寿命独立同 $\mathcal{E}(\lambda)$,等待第一只烧坏的时间为最小值。由
$$ P(\min\{X_1, \cdots, X_n\} > t) = \big(e^{-\lambda t}\big)^n = e^{-n\lambda t} $$
得 $\min \sim \mathcal{E}(n\lambda)$:独立指数变量的最小值仍是指数的,且失效率相加。于是换灯泡的等待时间从 $\mathcal{E}(4\lambda)$ 变为 $\mathcal{E}(24\lambda)$,平均缩短为原来的 $1/6$;取 $\lambda = 1/1500$(小时$^{-1}$)计算,装修前 200 小时内不换灯泡的概率为 $58.7\%$,装修后仅 $4.1\%$。单只灯泡的质量并未改变,改变的是"第一次失效"这一极值事件的发生率——这一结构在可靠性理论中称为竞争风险:多个失效模式并联竞争,系统失效率为各失效率之和。它也是第六章泊松过程叠加性质的雏形。
- 次序统计量逐 $\omega$ 排序;$X_{(k)}$ 是随机变量,$X_{(1)}, X_{(n)}$ 为最值。
- 联合密度 $n! \prod f(x_i)$(递增锥上):$n!$ 来自排列对称性的折叠。
- $X_{(k)}$ 密度用微元法记忆:左 $k-1$(各 $F$)、微元 1($f\,\mathrm{d}x$)、右 $n-k$(各 $1-F$)、乘多项系数。
- 最大值配分布函数 $F^n$,最小值配尾概率 $(1-F)^n$,先算分布函数再求导最稳妥。
- 指数最小值:失效率相加,$\min \sim \mathcal{E}(n\lambda)$(竞争风险)。
本章收束:联合行为的完整语法
回顾本章的路径。§3.1–§3.3 建立了描述联合行为的三套等价语言——分布函数、概率分布表、联合密度——并确立了中心观念:联合 > 边缘,边缘是联合的投影,独立是"投影无损"的特殊情形,其判别归结为"可分离 + 矩形支撑"。§3.4 提供了从旧变量的分布计算新变量分布的两大算法:普适的分布函数法与高效的雅可比变换法,卷积、瑞利、柯西、Box–Muller 皆是其产出。§3.5 把第一章的条件概率精细化到连续场合:条件密度 = 切片再归一化,乘法公式支撑分层建模,二元正态的条件分布则孕育了回归。§3.6 将样本排序,用对称性($n!$ 折叠)与微元法(三段计数)掌握极值与一般次序统计量的分布。
至此,描述随机向量的分布层面工具已经齐备。但分布(一张表、一个二元函数)作为信息载体过于庞大:工程与统计实践需要少数几个数字概括一个分布的位置、离散程度与关联强弱。把分布压缩为数字——期望、方差、协方差与相关系数——并研究这些数字的运算规律,是下一章的主题。本章遗留的两个悬念也将在后续解决:二元正态的五个参数的确切含义(第四章),以及多元正态的完整理论(第五章 §5.3)。
公式速查卡
联合与边缘
- 联合分布 $F(x, y) = P(X \leq x, Y \leq y)$;矩形概率 $F(b,d) - F(b,c) - F(a,d) + F(a,c) \geq 0$
- 边缘:$F_X(x) = F(x, \infty)$;离散 $p_i = \sum_j p_{ij}$(行和);连续 $f_X(x) = \int f(x, y) \mathrm{d}y$(沿 $y$ 积掉,定限先画支撑集)
- 联合决定边缘;边缘 + 相关结构才决定联合
- $f = \partial^2 F / \partial x \partial y$($f$ 连续时);候选密度须验证 $\int f = 1$
独立性判别
- 通用:$F = \prod F_i$;离散:每格 = 行和 × 列和;连续:$f(x,y) = f_X(x) f_Y(y)$
- 实用判据:密度可分离 且 支撑集为矩形
- 二元正态:独立 $\iff \rho = 0$(需联合正态前提)
重要多维分布
- 多项分布:$\frac{n!}{k_1! \cdots k_r!} p_1^{k_1} \cdots p_r^{k_r}$;边缘 $X_j \sim B(n, p_j)$
- 区域 $D$ 上均匀分布:$f = \frac{1}{m(D)} \mathrm{I}_D$;矩形上分量独立,圆盘上不独立
- 二元正态 $N(\mu_1, \mu_2; \sigma_1^2, \sigma_2^2; \rho)$:边缘 $N(\mu_i, \sigma_i^2)$;矩阵形式 $f \propto \exp[-\frac12 (\mathbf{x} - \boldsymbol{\mu})\Sigma^{-1}(\mathbf{x} - \boldsymbol{\mu})^{\mathrm{T}}]$
函数的分布
- 分布函数法:$F_Z(z) = \int_{\{g \leq z\}} f$,再求导
- 卷积:$f_{X+Y}(z) = \int f(x, z - x) \mathrm{d}x \overset{\text{独立}}{=} \int f_X(x) f_Y(z - x) \mathrm{d}x$;差:$f_{X-Y}(v) = \int f(x, x - v) \mathrm{d}x$
- 雅可比法:$g(u,v) = \sum_i f(x_i(u,v), y_i(u,v)) \left| \frac{\partial(x_i, y_i)}{\partial(u,v)} \right|$(旧对新、取绝对值、多支求和)
- 线性变换:$g(u,v) = \frac{1}{|\det A|} f(A^{-1}(u,v)^{\mathrm{T}})$
- $\mathcal{U}(0,1) + \mathcal{U}(0,1) \to$ 三角分布;$\sqrt{N(0,1)^2 + N(0,1)^2} \to$ 瑞利 $z e^{-z^2/2}$;$N(0,1)/N(0,1) \to$ 柯西 $\frac{1}{\pi(1+u^2)}$
- Box–Muller:$\sqrt{-2\ln U_1}(\cos, \sin)(2\pi U_2) \sim$ 独立 $N(0,1)$ 对
条件分布
- 离散:$P(X = x_i \mid Y = y_j) = p_{ij} / q_j$(列归一化)
- 连续:$f_{X|Y}(x \mid y) = f(x, y) / f_Y(y)$(切片归一化,要求 $f_Y(y) > 0$)
- 乘法公式:$f(x, y) = f_{X|Y}(x \mid y) f_Y(y)$;边缘 $f_X = \int f_{X|Y} f_Y \, \mathrm{d}y$(连续全概率)
- 二元正态:$Y \mid X = x \sim N\big(\mu_2 + \rho\frac{\sigma_2}{\sigma_1}(x - \mu_1), \ (1 - \rho^2)\sigma_2^2\big)$
次序统计量(独立同分布,分布 $F$、密度 $f$)
- 联合:$n! f(x_1) \cdots f(x_n)$,$x_1 < \cdots < x_n$
- $X_{(k)}$:$\frac{n!}{(k-1)!(n-k)!} F^{k-1} (1-F)^{n-k} f$(微元法:左 $k-1$、中 1、右 $n-k$)
- $\max$:$F^n \Rightarrow n F^{n-1} f$;$\min$:尾 $(1-F)^n \Rightarrow n(1-F)^{n-1} f$
- 指数最小值:$\min\{\mathcal{E}(\lambda) \times n\} \sim \mathcal{E}(n\lambda)$
习题指引
习题三共 52 题,覆盖面广、层次分明。以下按"打底 → 核心方法 → 挑战"给出路线与思路提示(只指方向,不给解答;卡住超过 20 分钟建议来讨论)。
第一层:打底(联合密度与边缘密度的基本功)
- 3.1、3.2、3.19:求边缘密度。3.2 与 3.19 的支撑集分别是抛物线内区域与角形区域,严格按"画支撑集 → 固定变量作直线 → 读线段"三步定限;3.2 同时练"支撑非矩形 $\Rightarrow$ 不独立"的论证。
- 3.14:常数归一化 + 各类区域概率,综合检验积分基本功。
- 3.9、3.10、3.43:离散表格题。3.43 的 (2)(3) 用事件翻译 $\{\max \leq k\}$、$\{\min > k\}$ 处理。
- 3.17、3.18:两个独立指数变量的比较与最值。3.17 直接对区域 $\{x > y\}$ 积分;3.18 用 min/max 的分布函数法,注意 $\min \sim \mathcal{E}(\lambda + \mu)$。
第二层:核心方法(本章主干题型)
- 3.27、3.28:正态可加性 $aX + bY + c \sim N(a\mu_1 + b\mu_2 + c, a^2\sigma_1^2 + b^2\sigma_2^2)$。用卷积配方法证明,结论必须熟记(第五章特征函数将给出更简洁的证明)。
- 3.32:卷积公式的直接练习(注意支撑限制 $x, y > 0$ 对积分限的影响)。
- 3.20、3.21:利用定理 4.2(同分布传递)证二项、泊松的可加性——体会"不算积分也能定分布"的思想。
- 3.22:重要反例——$X^2$ 与 $Y^2$ 独立而 $X, Y$ 不独立。说明"函数独立"弱于"原变量独立"。
- 3.24、3.36:条件密度双向练习。3.36 是"边缘 + 条件 $\to$ 联合 $\to$ 另一边缘"的分层建模标准流程(对应例 5.4)。
- 3.29:极差 $R = X_{(n)} - X_{(1)}$ 的密度:先写 $(X_{(1)}, X_{(n)})$ 的联合密度(例 6.7 取 $k_1 = 1, k_2 = n$),再作差变换。
- 3.37、3.38:min/max 的实际应用;3.38 把个数 $N$ 也随机化,需对 $N$ 用全概率公式——次序统计量与分层模型的复合。
第三层:挑战(结构更深的题)
- 3.48、3.49:雅可比法双支变换(对应例 4.7 的手法)。3.49 注意由 $(u, v)$ 反解出四支 $(\pm x, \pm y)$。
- 3.35:指数次序统计量的间隔 $Y_k = X_{(k)} - X_{(k-1)}$ 相互独立——著名的结构定理,作变换 $(X_{(1)}, \cdots, X_{(n)}) \to (Y_1, \cdots, Y_n)$ 用雅可比法,结论在第六章泊松过程中重现。
- 3.44、3.45:次序统计量的条件密度;3.45(2) 的结论(给定最大值后其余点如同均匀样本)是"均匀化"思想的体现。
- 3.5、3.41:混合型(离散 × 连续)的乘积与和,检验对"密度存在性"的理解。
- 3.33、3.34、3.46、3.47:随机参数复合模型(家庭子女数、售票窗口、交易笔数),统一用"条件 + 全概率"框架处理。
- **3.51、3.52:理论题。3.51 补定理 3.2 的证明;3.52 综合次序统计量与分位数变换(提示:$F(X_i)$ 服从 $\mathcal{U}(0,1)$)。
通用自查清单:① 支撑集画了吗?积分限与支撑一致吗?② 写密度时附带自变量范围了吗?③ 判独立时同时核验了"可分离"与"矩形支撑"吗?④ 雅可比是"旧对新"求导并取了绝对值吗?非单射变换的分支都数齐了吗?⑤ 条件密度的分母 $f_Y(y) > 0$ 的范围写对了吗?