主题
字号
CHAPTER 03 ≈ 130 MIN READ

随机向量及其分布

📖 本章导读

本章对应原书第三章。建议先读本讲义某一节获得整体图景,再精读原书对应小节,最后完成习题。本章的计算量在全书居首,多数课程的期中、期末难题也集中于此;但支撑这些计算的思想只有少数几条,本讲义的任务是把它们明确地陈述出来。

3.0 导言:从一个随机变量到一组随机变量

第二章建立了单个随机变量的理论:分布函数、概率分布(离散型)与概率密度(连续型)、随机变量函数的分布。然而实际问题极少只涉及一个随机量。气温与用电负荷、弹落点的横坐标与纵坐标、一支股票的今日收益与明日收益——我们真正关心的往往是若干随机变量之间的联合行为:它们如何相互制约、一个的取值如何改变另一个的分布、它们的函数(和、差、最大值)又服从什么分布。

把 $n$ 个随机变量并列成 $\mathbf{X} = (X_1, X_2, \cdots, X_n)$,就得到随机向量。本章围绕它展开五个层层递进的问题:

  1. 如何描述联合行为?——联合分布函数、联合概率分布(离散)与联合密度(连续)(§3.1–§3.3)。这里出现全章第一个核心观念:联合分布的信息严格多于全体边缘分布的信息。知道每个分量各自的分布,并不能确定它们作为整体的行为。
  2. 何时可以把联合拆成边缘的乘积?——独立性的各种等价判别(§3.2B、§3.3D)。独立是"联合 = 边缘乘积"这一特殊情形,它使多维问题退化为一维问题的组合。
  3. 随机向量的函数服从什么分布?——分布函数法与变换法(§3.4)。卷积公式、正态分布的可加性、瑞利分布与柯西分布都在此产生。
  4. 已知一部分分量的取值,其余分量的分布如何更新?——条件分布与条件密度(§3.5)。第一章的条件概率在这里升级为处理连续型随机变量的精细工具,并孕育出"回归"这一统计学的中心概念。
  5. 把观测值从小到大排序后会发生什么?——次序统计量(§3.6)。极值问题(最大降雨量、最短寿命)与数理统计的诸多方法都以它为基础。

贯穿全章的技术主线只有一条:概率 = 密度在区域上的积分。边缘密度是"把联合密度沿某些方向积掉",条件密度是"把联合密度沿某条切片重新归一化",函数的分布是"把密度在原像区域上积分"。因此本章对二重积分的要求很高——确定积分限的能力,即"先画支撑集、再定上下限"的功夫,是本章一切计算的地基。

要点
  • 随机向量 = 定义在同一概率空间上的一组随机变量;研究对象从"各自的分布"升级为"联合行为"。
  • 全章五问:联合描述 → 独立判别 → 函数的分布 → 条件分布 → 次序统计量。
  • 技术主线:概率 = 密度的区域积分;确定积分限是本章的基本功。

3.1 随机向量及其联合分布:一个函数管住全部信息

对应原书 §3.1。

联合分布函数

定义 1.1–1.2 若 $X_1, X_2, \cdots, X_n$ 都是概率空间 $(\Omega, \mathcal{F}, P)$ 上的随机变量,则称 $\mathbf{X} = (X_1, \cdots, X_n)$ 为 $n$ 维随机向量;称 $\mathbf{R}^n$ 上的函数

$$ F(x_1, x_2, \cdots, x_n) = P(X_1 \leq x_1, X_2 \leq x_2, \cdots, X_n \leq x_n) \tag{1.1} $$

为 $\mathbf{X}$ 的联合分布函数(简称联合分布)。

注意定义中的一个细节:所有分量必须定义在同一个概率空间上。这不是形式上的要求——只有生活在同一个样本空间里,"$X_1 \leq x_1$ 与 $X_2 \leq x_2$ 同时发生"才是一个合法的事件。逗号在概率记号中表示事件的交:$P(X \leq x, Y \leq y) = P(\{X \leq x\} \cap \{Y \leq y\})$。

联合分布函数继承了一维分布函数的基本性质(关于每个自变量单调不减、右连续、在各变元趋于 $-\infty$ 时趋于 0、全部趋于 $+\infty$ 时趋于 1),但二维情形多出一条一维所没有的约束。以 $n = 2$ 为例,对矩形 $D = \{(x,y) \mid a < x \leq b,\ c < y \leq d\}$,用容斥的方式(原书例 1.1)可得

$$ P(a < X \leq b,\ c < Y \leq d) = F(b,d) - F(b,c) - F(a,d) + F(a,c) \geq 0. \tag{1.3–1.4} $$

推导本身值得复现一遍:先固定 $c < Y \leq d$ 把 $X$ 的范围拆开,再把 $Y$ 的范围拆开,四项正负相间,恰是"大矩形减去两条、补回一角"的容斥结构。矩形不等式 (1.4) 说明:并非任何"看起来像分布函数"的二元函数都能充当联合分布——它必须对一切矩形给出非负概率。这一约束在一维时自动被单调性蕴含,在高维则是独立的条件。

边缘分布:向低维投影

从联合分布函数取部分变元趋于 $+\infty$,就得到子向量的分布:

$$ F_k(x_1, \cdots, x_k) = F(x_1, \cdots, x_k, \infty, \cdots, \infty), $$

称为边缘分布。直观解释:$X_{k+1} \leq \infty$ 是必然事件,对它不加任何限制,等于把这些分量"遗忘"。二维时 $F_X(x) = F(x, \infty)$,$F_Y(y) = F(\infty, y)$。$n$ 维随机向量共有 $C_n^1 + C_n^2 + \cdots + C_n^{n-1} = 2^n - 2$ 个边缘分布(每个非空真子集对应一个)。

现在陈述本章第一个核心论断:联合分布唯一决定全部边缘分布,但边缘分布一般不能决定联合分布。前半句已由上式构造性地证明;后半句将在 §3.3 用二元正态给出具体反例($\rho$ 取不同值时联合分布不同,边缘分布却完全一样)。这个不对称性值得反复体会:边缘分布只记录每个分量"独自"的统计规律,而联合分布还记录它们"如何联动"——相关结构。从联合到边缘是投影,投影必然丢失信息。

唯一的例外是独立情形。由第二章独立性的定义直接改写即得:$X_1, \cdots, X_n$ 相互独立的充分必要条件是对一切 $(x_1, \cdots, x_n)$,

$$ F(x_1, x_2, \cdots, x_n) = F_1(x_1) F_2(x_2) \cdots F_n(x_n). \tag{1.6} $$

即:独立 = 联合分布恰好等于边缘分布的乘积 = 边缘信息已是全部信息。此后两节将把这一判别分别翻译成离散语言(概率分布相乘)与连续语言(密度相乘)。

要点
  • 联合分布 $F(x_1, \cdots, x_n) = P(X_1 \leq x_1, \cdots, X_n \leq x_n)$,逗号表示事件之交;各分量须在同一概率空间。
  • 矩形不等式 $F(b,d) - F(b,c) - F(a,d) + F(a,c) \geq 0$ 是高维特有的约束。
  • 令部分变元取 $\infty$ 得边缘分布;共 $2^n - 2$ 个。联合决定边缘,边缘不决定联合(投影丢失相关结构)。
  • 独立 $\iff$ 联合分布 = 边缘分布之积。

3.2 离散型随机向量:概率分布表及其行列求和

对应原书 §3.2。

联合概率分布与边缘分布

各分量均为离散型时,随机向量的分布由联合概率分布

$$ p_{j_1 j_2 \cdots j_n} = P\big(X_1 = x_1(j_1), \cdots, X_n = x_n(j_n)\big) $$

完全刻画。它满足非负性与总和为 1(后者的证明用到第一章的语言:全体事件 $\{X_1 = x_1(j_1), \cdots\}$ 构成完备事件组,由可列可加性得总概率为 1)。求子向量的分布,则是把不关心的下标全部求和

$$ P(X_1 = x_1(j_1), \cdots, X_k = x_k(j_k)) = \sum_{j_{k+1}, \cdots, j_n} p_{j_1 \cdots j_n}. \tag{2.3} $$

证明的机制与第一章全概率公式完全相同:按被遗忘分量的取值作分类讨论,逐类求和。

二维情形最宜用表格理解(原书例 2.1–2.2):行标 $x_i$、列标 $y_j$、格内 $p_{ij}$。则 $X$ 的边缘分布 $p_i = \sum_j p_{ij}$ 是行和,$Y$ 的边缘分布 $q_j = \sum_i p_{ij}$ 是列和。"边缘"(marginal)一词正来源于此:行和、列和习惯上写在表格的边缘处。这张表是本章多数离散计算的载体,习题 3.43 即是对它的综合训练。

多项分布:二项分布的多维推广

**例 2.3(多项分布)**是最重要的离散型随机向量。设 $A_1, \cdots, A_r$ 是试验 $S$ 的完备事件组,$P(A_i) = p_i$。独立重复 $n$ 次,以 $X_i$ 记 $A_i$ 发生的次数,则

$$ P(X_1 = k_1, \cdots, X_r = k_r) = \frac{n!}{k_1! \, k_2! \cdots k_r!} \, p_1^{k_1} p_2^{k_2} \cdots p_r^{k_r}, \qquad \sum_{i=1}^r k_i = n. \tag{2.6} $$

公式的结构可以直接读出,不必死记:指定哪些试验落入哪一类,是第一章计数武器(4)的多组分组问题,方案数为多项系数 $\frac{n!}{k_1! \cdots k_r!}$;每一种具体方案由独立性给出概率 $p_1^{k_1} \cdots p_r^{k_r}$;二者相乘。$r = 2$ 时它退化为二项分布 $B(n, p_1)$。原书采用归纳法证明(按第 $n$ 次试验落入哪一类作全概率分解),其中关键的合并步骤 $\sum_i \frac{k_i}{n} = 1$ 值得亲手验证一次。

多项分布的边缘分布可以从背景直接读出而无需计算:单看 $X_j$,每次试验只有"$A_j$ 发生 / 不发生"两种结果,故

$$ X_j \sim B(n, p_j). $$

这体现了一条重要的方法论:求边缘分布时,优先回到概率模型的背景解释,往往比对联合分布硬性求和更快。注意 $X_1, \cdots, X_r$ 必然不独立——它们受约束 $X_1 + \cdots + X_r = n$ 联结(练习 3.2(1));这是"边缘各自正常、联合存在制约"的又一实例。

离散型的独立性判别

定理 2.1 / 推论 2.2 $X, Y$ 相互独立的充分必要条件是对所有取值格点 $(x_i, y_j)$,

$$ P(X = x_i, Y = y_j) = P(X = x_i) P(Y = y_j). \tag{2.9} $$

即表格中每一格都等于其行和与列和的乘积。证明的两个方向都有教益:由 (2.9) 推独立,是把 $\{X \leq x\}$ 拆成可列个 $\{X = x_i\}$ 之并,用可列可加性把和式分解为两个单变量和式的乘积——这是"从点概率合成区间概率"的标准手法;反方向则依赖第二章的定理(独立随机变量落入任意 Borel 集的事件仍独立),取单点集即可。

易错提示

判别不独立只需一个反例格点,判别独立却必须核验全部格点。一个实用的快速否定法:若表中存在某格 $p_{ij} = 0$ 而对应行和、列和均为正,则必不独立(乘积为正而联合为零)。由此立即可知:联合分布的支撑集若不是"行集 × 列集"的乘积形状,独立性无从谈起。这一观察在连续情形将升级为"支撑集必须是矩形"的判据。

要点
  • 离散联合分布 = 概率表;边缘分布 = 行和 / 列和;"边缘"一词源于表格边缘。
  • 多项分布 $\frac{n!}{k_1! \cdots k_r!} p_1^{k_1} \cdots p_r^{k_r}$:多组分组计数 × 独立试验概率;边缘为二项 $B(n, p_j)$;分量间因总数约束而不独立。
  • 独立 $\iff$ 每格 = 行和 × 列和(须全部格点成立);一格为零而行列和为正即可否定独立。

3.3 连续型随机向量及其联合密度:概率即体积

对应原书 §3.3。本节概念密度最大,分四个层次推进。

A. 联合密度:从"长度上的密度"到"面积上的密度"

定义 3.1 若存在 $\mathbf{R}^n$ 上的非负可积函数 $f(x_1, \cdots, x_n)$,使得对任何子立方体 $D$,

$$ P(\mathbf{X} \in D) = \int_D f(x_1, \cdots, x_n) \, \mathrm{d}x_1 \cdots \mathrm{d}x_n, \tag{3.2} $$

则称 $\mathbf{X}$ 为连续型随机向量,$f$ 为其联合概率密度。该等式可扩展到任意 Borel 集 $B$(式 3.3),且 $f$ 在全空间的积分为 1。

一维密度的直觉在此完整地平移过来:$f(x, y)$ 本身不是概率,$f(x, y) \, \mathrm{d}x \, \mathrm{d}y$ 才近似地是 $(X, Y)$ 落入点 $(x,y)$ 附近小矩形的概率;概率是密度曲面下方、底为区域 $B$ 的体积。与分布函数的联系是(原书例 1.2 与式 3.10):

$$ F(x, y) = \int_{-\infty}^{x} \int_{-\infty}^{y} f(s, t) \, \mathrm{d}s \, \mathrm{d}t, \qquad f(x, y) = \frac{\partial^2 F(x, y)}{\partial x \, \partial y} \ \text{(当 } f \text{ 连续时)}. $$

一维时密度是分布函数的一阶导数,二维时则是混合二阶偏导——对每个方向各"剥"一次积分。

本节还预先陈述了 Fubini 定理(定理 3.1):非负或绝对可积函数的重积分可以化为任意次序的累次积分。本章几乎每一个计算都在默默使用它;数学分析课程中它有严格的条件,概率论的应用场景(密度非负)恰好使其无条件可用。

B. 边缘密度:把联合密度"压扁"

设 $(X, Y)$ 有联合密度 $f(x, y)$,则分量的密度为

$$ f_X(x) = \int_{-\infty}^{\infty} f(x, y) \, \mathrm{d}y, \qquad f_Y(y) = \int_{-\infty}^{\infty} f(x, y) \, \mathrm{d}x, $$

称为边缘密度。推导(原书式 3.7–3.8)只是 Fubini 定理的一次应用:$P(X \in D_k)$ 等于对全空间中"$x \in D_k$、$y$ 任意"的柱形区域积分,先把 $y$ 积掉,剩下的被积函数按定义就是 $X$ 的密度。几何图像:把密度曲面沿 $y$ 方向压扁(投影并累积)到 $x$ 轴上。离散情形的"行和"在此变成"沿行积分",二者是同一操作的两种语言。

积分限的确定是本章第一大失分点,必须建立规范流程。以原书例 3.3 为范本:$(X, Y)$ 在单位圆 $D = \{x^2 + y^2 \leq 1\}$ 内均匀分布,联合密度 $f = \frac{1}{\pi} \mathrm{I}_D$。求 $f_X$。

思路:边缘密度的公式对 $y$ 从 $-\infty$ 积到 $\infty$,但被积函数只在支撑集 $D$ 内非零,因此实际有效的积分限由"固定 $x$ 时,$(x,y)$ 仍留在 $D$ 内的 $y$ 的范围"决定。规范做法分三步:第一步画出支撑集(单位圆盘);第二步固定横坐标 $x$,作铅垂线,读出它与支撑集相交的线段:$|y| \leq \sqrt{1 - x^2}$;第三步在该线段上积分

$$ f_X(x) = \frac{1}{\pi} \int_{-\sqrt{1-x^2}}^{\sqrt{1-x^2}} \mathrm{d}y = \frac{2}{\pi} \sqrt{1 - x^2}, \qquad |x| \leq 1. $$

图 3-1|边缘密度的积分限:先画支撑集,再定上下限
图 3-1|边缘密度的积分限:先画支撑集,再定上下限

同理 $f_Y(y) = \frac{2}{\pi}\sqrt{1 - y^2}$。两个边缘都是"半圆律"密度,而非均匀分布——均匀分布的边缘未必均匀,因为不同的 $x$ 处铅垂弦长不同。原书使用示性函数 $\mathrm{I}_D$ 完成同一计算:将 $\mathrm{I}_{\{x^2 + y^2 \leq 1\}}$ 改写为 $\mathrm{I}_{\{|y| \leq \sqrt{1-x^2}\}}$ 再积分。示性函数法与画图法本质相同,前者便于书写严格推导,后者便于正确起手;建议画图定限、示性函数落笔,双轨并用。

写边缘密度时必须同时写明自变量的范围(如 $|x| \leq 1$),范围之外密度为零。漏写范围等于把密度延拓到全轴,归一性立即被破坏,也是阅卷中最常见的扣分原因。

C. 联合分布与联合密度的关系:一个必要的反例

"$F$ 连续且混合偏导数几乎处处存在"是否保证联合密度存在?。原书例 3.6 的反例极具启发性:设 $X \sim \mathcal{U}(0,1)$,$Y = X$,则 $(X, Y)$ 的联合分布函数 $F(x,y) = \min\{x, y\}$(截断到 $[0,1]$)处处连续,且除若干直线外混合偏导存在、连续。但若 $(X, Y)$ 有联合密度 $f$,记对角线 $D = \{y = x\}$,则

$$ 1 = P(X = Y) = \int_D f(x, y) \, \mathrm{d}x \, \mathrm{d}y = 0, $$

矛盾——直线是二维零体积集,其上的任何积分为零。故 $(X,Y)$ 无联合密度。

这个例子揭示的机理是:$(X, X)$ 的全部概率质量集中在一条一维曲线上,它在二维空间里"薄"到无法用密度描述——正如单点无法用一维密度描述一样。由此得到两条实用结论(练习 3.3(1)(2)):连续型随机向量满足 $P(X = Y + c) = 0$;以及两个分量各自连续,不保证向量整体连续(习题 3.8)。"连续型"是对向量整体的要求,比对每个分量的要求严格得多。定理 3.2 给出了实用的正面判据:由 $F$ 求混合偏导得到候选密度 $f$ 后,验证 $\int f = 1$;积分等于 1 则 $f$ 确为联合密度(质量没有泄漏到低维集合上),小于 1 则说明存在奇异部分。

D. 连续型的独立性判别与两大分布

定理 3.3 各 $X_i$ 有密度 $f_i$ 时,$X_1, \cdots, X_n$ 相互独立的充分必要条件是乘积 $f_1(x_1) f_2(x_2) \cdots f_n(x_n)$ 是 $\mathbf{X}$ 的联合密度。

证明双向都是 Fubini 定理:乘积形式的被积函数使累次积分逐变量分离。实际判别时常用其推论形式——若联合密度可以分解为 $f(x, y) = g(x) h(y)$(各因子只含一个变量),且支撑集是矩形(含无穷矩形),则 $X, Y$ 独立;此时 $g, h$ 各自归一化后就是边缘密度。两个条件缺一不可:

作为对照,原书例 3.7 证明:立方体上的均匀分布分量独立(各边缘为区间上的均匀分布,乘积恰为联合密度),且逆命题亦真。均匀分布分量是否独立,完全由支撑区域的形状决定。

**例 3.8–3.9(二元正态分布)**是本节压轴,也是全书最重要的连续型随机向量。$(X, Y) \sim N(\mu_1, \mu_2; \sigma_1^2, \sigma_2^2; \rho)$ 指联合密度为

$$ f(x, y) = \frac{1}{2\pi \sigma_1 \sigma_2 \sqrt{1 - \rho^2}} \exp\left\{ -\frac{1}{2(1 - \rho^2)} \left[ \frac{(x - \mu_1)^2}{\sigma_1^2} - \frac{2\rho (x - \mu_1)(y - \mu_2)}{\sigma_1 \sigma_2} + \frac{(y - \mu_2)^2}{\sigma_2^2} \right] \right\}. \tag{3.14} $$

五个参数的含义($\mu_i$ 为中心,$\sigma_i$ 为各方向的尺度,$\rho$ 刻画关联强弱与方向)将在第四章证明为期望、方差与相关系数。引入均值向量 $\boldsymbol{\mu}$ 与矩阵 $\Sigma = \begin{pmatrix} \sigma_1^2 & \rho \sigma_1 \sigma_2 \\ \rho \sigma_1 \sigma_2 & \sigma_2^2 \end{pmatrix}$,密度可写成与一维完全同构的形式

$$ f(\mathbf{x}) = \frac{1}{(\sqrt{2\pi})^n \sqrt{\det \Sigma}} \exp\left[ -\frac{1}{2} (\mathbf{x} - \boldsymbol{\mu}) \Sigma^{-1} (\mathbf{x} - \boldsymbol{\mu})^{\mathrm{T}} \right], \tag{3.18–3.19} $$

由此自然推广到 $n$ 元正态 $N(\boldsymbol{\mu}, \Sigma)$(§5.3 将系统研究)。一维的 $\frac{(x-\mu)^2}{\sigma^2}$ 升级为二次型 $(\mathbf{x}-\boldsymbol{\mu})\Sigma^{-1}(\mathbf{x}-\boldsymbol{\mu})^{\mathrm{T}}$,归一化常数中的 $\sigma$ 升级为 $\sqrt{\det \Sigma}$——这种"标量→矩阵"的对应是学习多元统计的基本感觉。

例 3.9 完成两个计算,方法都值得掌握。其一,边缘分布:对 $y$ 积分时,把指数中关于 $v = (y-\mu_2)/\sigma_2$ 的部分配方成 $(v - \rho u)^2 + (1 - \rho^2) u^2$ 的形式,前者积成高斯积分常数,剩下的恰是一维正态密度,得

$$ X \sim N(\mu_1, \sigma_1^2), \qquad Y \sim N(\mu_2, \sigma_2^2). $$

注意:边缘分布与 $\rho$ 无关。因此固定 $\mu_i, \sigma_i$ 而变动 $\rho$,可得无穷多个联合分布不同、边缘分布完全相同的例子——这就是"边缘不能决定联合"的标准反例。其二,独立性判据

$$ X, Y \text{ 独立} \iff \rho = 0. $$

充分性由 $\rho = 0$ 时密度显式分离直接可见;必要性只需在独立等式 $f_X f_Y = f$ 中代入一点 $(\mu_1, \mu_2)$ 比较常数即得。$\rho$(第四章将证明它是相关系数)为零一般只意味着"不相关",远弱于独立;二元正态是"不相关 $\Rightarrow$ 独立"成立的著名特例,此结论在数理统计中被反复使用。另须警惕其边界:该等价性要求 $(X,Y)$ 联合正态;两个边缘各自正态而联合不正态时,$\rho = 0$ 不能推出独立。

图 3-2|二元正态的等高线:$\rho$ 决定椭圆的倾斜
图 3-2|二元正态的等高线:$\rho$ 决定椭圆的倾斜

要点
  • 联合密度:$P(\mathbf{X} \in B) = \int_B f$,概率即体积;$f = \partial^2 F / \partial x \partial y$。
  • 边缘密度 = 沿被遗忘变量积分;定限三步:画支撑集 → 固定一个变量作直线 → 读出相交线段。写密度必须附带自变量范围。
  • $(X, X)$ 型反例:质量集中在低维集合上则无联合密度;分量连续 $\nRightarrow$ 向量连续;验证 $\int f = 1$ 是正面判据。
  • 独立判别 = 密度可分离 支撑集为矩形;圆盘上的均匀分布不独立。
  • 二元正态:边缘 $N(\mu_i, \sigma_i^2)$ 与 $\rho$ 无关(边缘不定联合的反例);独立 $\iff \rho = 0$(不相关推独立的特例,以联合正态为前提)。

3.4 随机向量函数的分布:分布函数法与变换法

对应原书 §3.4。本节是全章计算方法的军械库。

A. 分布函数法与卷积公式

设 $\mathbf{X}$ 有联合密度 $f$,$Y_i = g_i(X_1, \cdots, X_n)$。求 $(Y_1, \cdots, Y_m)$ 分布的基本公式(式 4.1)概念上极简单:

$$ F_Y(y_1, \cdots, y_m) = P\big(g_1(\mathbf{X}) \leq y_1, \cdots, g_m(\mathbf{X}) \leq y_m\big) = \int_C f(x_1, \cdots, x_n) \, \mathrm{d}x_1 \cdots \mathrm{d}x_n, $$

其中 $C = \{\mathbf{x} \mid g_i(\mathbf{x}) \leq y_i, \forall i\}$ 是原像区域。也就是说:函数的分布函数 = 密度在原像区域上的积分;随后对 $y$ 求导(或求混合偏导并验证归一,参照定理 3.2)得密度。这一方法称为分布函数法,它不要求变换可逆,是普适的默认路径。

**例 4.1(和的分布与卷积公式)**是分布函数法最重要的产出。设 $(X, Y)$ 有联合密度 $f(x,y)$,则 $Z = X + Y$ 有密度

$$ f_Z(z) = \int_{-\infty}^{\infty} f(x, z - x) \, \mathrm{d}x; \tag{4.2} $$

当 $X, Y$ 独立时即卷积公式

$$ f_Z(z) = \int_{-\infty}^{\infty} f_X(x) f_Y(z - x) \, \mathrm{d}x. \tag{4.3} $$

原书的推导手法值得细读:对 $P(a < Z \leq b)$ 在斜带形区域 $\{a < x + y \leq b\}$ 上积分,先固定 $x$ 对 $y$ 积分,再作换元 $y = z - x$ **把斜带"扶正"**为 $z$ 的区间 $(a, b]$,最后交换积分次序,使表达式呈现"对 $z$ 在 $(a,b]$ 上积分某个函数"的形状——按定义,被积的那个函数就是 $f_Z$。这种"整理成 $\int_a^b (\cdot) \, \mathrm{d}z$ 再认出密度"的论证方式在本章反复出现。公式的直观读法:$Z$ 落在 $z$ 附近,要求 $X$ 取某值 $x$ 而 $Y$ 恰好补足 $z - x$,对所有分工方式 $x$ 累加。

例 4.2(三角分布):$X, Y$ 独立同 $\mathcal{U}(0,1)$,卷积给出

$$ f_Z(z) = \int_0^1 \mathrm{I}_{\{0 < z - x < 1\}} \, \mathrm{d}x = \begin{cases} z, & z \in [0, 1), \\ 2 - z, & z \in [1, 2], \\ 0, & \text{其他}. \end{cases} $$

计算的全部难点在示性函数的处理:$0 < z - x < 1$ 即 $z - 1 < x < z$,与积分区间 $(0,1)$ 取交后分 $z < 1$ 与 $z \geq 1$ 两段讨论。两个均匀分布之和不再均匀而呈三角形——中间的取值有更多的分工方式实现,两端只有唯一实现方式。这预示了中心极限定理的方向:不断卷积会使分布越来越"聚中、光滑"。

同法可得差的公式 $f_V(v) = \int f(x, x - v) \mathrm{d}x$(例 4.3,练习 3.4(2))。**例 4.4(瑞利分布)**演示原像区域为圆盘的情形:$X, Y$ 独立标准正态,$Z = \sqrt{X^2 + Y^2}$,用极坐标计算圆盘上的积分得

$$ F_Z(z) = \int_0^z r e^{-r^2/2} \, \mathrm{d}r, \qquad f_Z(z) = z e^{-z^2/2}, \quad z \geq 0. $$

此即瑞利分布(射击问题中"脱靶量"的分布)。旋转对称的密度配极坐标,是应当形成条件反射的搭配。

B. 变换法:雅可比行列式

当变换 $(X, Y) \mapsto (U, V)$ 可逆(或分片可逆)时,有比分布函数法更直接的变换法

定理 4.1 设 $(X,Y)$ 有联合密度 $f$,$U = u(X,Y)$,$V = v(X,Y)$,区域 $D$ 满足 $P((U,V) \in D) = 1$。若存在反解 $x_i = x_i(u,v)$,$y_i = y_i(u,v)$($i = 1, \cdots, m$),使得每点 $(u,v) \in D$ 的原像恰为这 $m$ 支反函数的值、各支可逆且雅可比行列式非零、各支值域互不相交,则 $(U, V)$ 有联合密度

$$ g(u, v) = \sum_{i=1}^{m} f\big(x_i(u,v),\ y_i(u,v)\big) \left| \frac{\partial(x_i, y_i)}{\partial(u, v)} \right|, \qquad (u,v) \in D. \tag{4.11} $$

这个定理不是新原理,而是重积分换元公式的概率复述:$P((U,V) \in A) = P((X,Y) \in \text{原像})$,对右端的积分作变量替换,替换产生的体积伸缩因子正是雅可比行列式的绝对值。三点技术须知:

  1. 雅可比是"旧变量对新变量"求导:$\frac{\partial(x, y)}{\partial(u, v)}$,即先把 $x, y$ 反解为 $u, v$ 的函数再求导。若正向求导更方便,可利用互逆关系 $\frac{\partial(x,y)}{\partial(u,v)} = \left[\frac{\partial(u,v)}{\partial(x,y)}\right]^{-1}$。
  2. 取绝对值:密度必须非负,行列式的符号只反映定向。
  3. 多支求和:变换非单射时(典型如平方、取模),每一支原像各自贡献一项。这正是第二章 $Y = X^2$ 公式中"两支相加"的高维推广。

例 4.5(极坐标分解):$X, Y$ 独立标准正态,令 $X = R\cos\Theta$,$Y = R\sin\Theta$。变换单支可逆,$\frac{\partial(x,y)}{\partial(r,\theta)} = r$,故

$$ g(r, \theta) = \frac{1}{2\pi} r e^{-r^2/2}, \qquad r > 0, \ \theta \in [0, 2\pi). $$

密度分离且支撑为矩形(乘积区域),故 $R$ 与 $\Theta$ 独立:$R$ 服从瑞利分布,$\Theta$ 服从 $[0, 2\pi)$ 上的均匀分布。二维标准正态在方向上完全均匀、模长服从瑞利分布——这一结构是正态分布旋转对称性的解析表达。

**定理 4.2 与例 4.6(Box–Muller 方法)**顺势解决一个实际问题:如何从均匀随机数生成正态随机数。定理 4.2 陈述一个"同分布传递"原理:同分布的输入经同一函数映射,输出同分布——分布只依赖于分布,不依赖于随机变量的具体构造。据此,取 $U_1, U_2$ 独立 $\mathcal{U}(0,1)$,令

$$ X_1 = \sqrt{-2\ln U_1} \cos(2\pi U_2), \qquad Y_1 = \sqrt{-2\ln U_1} \sin(2\pi U_2), $$

则 $\sqrt{-2\ln U_1}$ 恰为瑞利分布(第二章分位数变换的一次应用),$2\pi U_2$ 为均匀角,二者独立,与例 4.5 的 $(R, \Theta)$ 同分布;于是 $(X_1, Y_1)$ 与独立标准正态对 $(X, Y)$ 同分布。这就是数值计算库中生成正态随机数的经典 Box–Muller 算法,也是"概率论定理直接变成代码"的一个佳例。

例 4.7(柯西分布的出现):$X, Y$ 独立标准正态,求 $U = X/Y$,$V = X^2 + Y^2$ 的联合密度。此例集中演示双支变换:由 $(u, v)$ 反解得两支 $(x, y)$ 与 $(-x, -y)$(因分子分母同时变号不改变商,平方和亦不变),各支雅可比同为 $\frac{1}{2(1+u^2)}$,求和得

$$ g(u, v) = \frac{1}{2} e^{-v/2} \cdot \frac{1}{\pi (1 + u^2)}, \qquad v > 0, \ u \in \mathbf{R}. $$

密度分离、支撑为矩形,故 $U, V$ 独立:$V$ 服从参数 $\frac12$ 的指数分布,$U$ 的密度 $\frac{1}{\pi(1+u^2)}$ 称为柯西分布——两个独立标准正态之商。柯西分布尾部极厚(第四章将证明其期望不存在),是概率论中最重要的"病态"范例,此处是它在本书的首次登场。

方法选择指南:只求单个函数 $Z = g(X,Y)$ 的分布,用分布函数法(或先补一个辅助变量如 $W = X$ 凑成二维可逆变换,用雅可比法算出联合密度后再积掉 $w$ 得边缘——"增补变量法",习题 3.48、3.49 均可这样处理);求联合密度且变换(分片)可逆,直接用雅可比法。线性变换是最常用特例(练习 3.4(4)):$(U,V) = (X,Y)A^{\mathrm{T}}$ 满秩时 $g(u,v) = \frac{1}{|\det A|} f(x, y)$。

要点
  • 分布函数法(普适):$F_Y = \int_{\text{原像区域}} f$,再求导;"整理成 $\int_a^b(\cdot)\mathrm{d}z$ 认出密度"是标准论证。
  • 卷积:$f_{X+Y}(z) = \int f_X(x) f_Y(z-x) \mathrm{d}x$(独立时);均匀 + 均匀 = 三角分布。
  • 雅可比法:$g(u,v) = \sum_i f(x_i, y_i) \left|\frac{\partial(x_i,y_i)}{\partial(u,v)}\right|$;旧对新求导、取绝对值、非单射分支求和。
  • 极坐标分解:标准正态对 $\Rightarrow$ 模(瑞利)与方向(均匀)独立;由此得 Box–Muller 正态随机数算法。
  • 正态之商为柯西分布;只求一维分布时可用"增补变量再积掉"的技巧。

3.5 条件分布和条件密度:给定信息后的分布更新

对应原书 §3.5。

A. 离散型:按行(列)重新归一化

离散情形不需要任何新工具,条件概率公式直接给出:对固定的 $j$($q_j = P(Y = y_j) > 0$),

$$ P(X = x_i \mid Y = y_j) = \frac{p_{ij}}{q_j}, \qquad i = 1, 2, \cdots \tag{5.3} $$

称为条件 $Y = y_j$ 下 $X$ 的条件分布。在概率表上看:取出 $Y = y_j$ 所在的那一,将其中各格除以列和——即把一列重新归一化为一个概率分布。定理 5.1 随之显然:$X, Y$ 独立当且仅当每列归一化后都与边缘分布 $\{p_i\}$ 相同(条件化不改变分布,即信息无用)。

**例 5.1–5.2(几何等待时间的结构)**值得精读。射击命中率为 $p$,$S_1, S_2$ 为第一、二次命中时的射击次数,联合分布 $P(X = i, Y = j) = p^2 q^{j-2}$($j > i \geq 1$,$q = 1 - p$):前 $j$ 次中恰有第 $i$ 次与第 $j$ 次命中、其余 $j - 2$ 次落空。求和得边缘:$X$ 服从几何分布 $pq^{i-1}$,$Y$ 服从 $P(Y = j) = (j-1)p^2 q^{j-2}$(负二项分布的特例)。两个条件分布各有深意:

$$ P(X = i \mid Y = j) = \frac{1}{j - 1} \ (1 \leq i < j); \qquad P(Y = j \mid X = i) = p q^{j - i - 1} \ (j > i). $$

前者表明:已知第二次命中发生在第 $j$ 次,则第一次命中的位置在 $\{1, \cdots, j-1\}$ 上均匀分布——具体位置不携带任何倾向性信息。后者表明:已知 $S_1 = i$,则还需等待的次数 $Y - i$ 仍服从同一几何分布,与 $i$ 无关——几何分布无记忆性的又一表现。例 5.2 进一步验证增量 $X_1 = S_1, X_2 = S_2 - S_1$ 独立同分布(联合概率恰好分解为两个几何分布之积)。"等待时间的增量独立同分布"这一结构是第六章泊松过程的离散原型。

B. 连续型:一次不平凡的定义

连续情形出现了实质困难:想定义 $P(X \leq x \mid Y = y)$,但 $P(Y = y) = 0$,条件概率公式的分母为零,第一章的定义在此完全失效。然而这一概念又有明确的实际意义(原书的例子:已知明日最高气温 $Y = y$,电网最大负荷 $X$ 的分布——气温取 35℃ 这一事件概率为零,但"35℃ 那天的负荷分布"显然是有内容的问题)。

出路是用极限逼近:条件 $Y = y$ 理解为条件 $y - \varepsilon < Y \leq y$ 当 $\varepsilon \to 0$ 的极限。原书的推导(值得逐行复现):设 $f_Y$ 在 $y$ 处连续且为正,

$$ \lim_{\varepsilon \to 0} P(X \leq x \mid y - \varepsilon < Y \leq y) = \lim_{\varepsilon \to 0} \frac{F(x, y) - F(x, y - \varepsilon)}{F_Y(y) - F_Y(y - \varepsilon)} = \frac{\dfrac{\partial}{\partial y} \displaystyle\int_{-\infty}^{y} \left( \int_{-\infty}^{x} f(s, t) \, \mathrm{d}s \right) \mathrm{d}t}{f_Y(y)} = \frac{\displaystyle\int_{-\infty}^{x} f(s, y) \, \mathrm{d}s}{f_Y(y)}. $$

中间一步是"分子分母同除以 $\varepsilon$ 再各自取极限":分母趋于 $f_Y(y)$(密度的定义),分子趋于 $F(x, \cdot)$ 对 $y$ 的偏导(变上限积分求导)。极限的结果被采纳为定义

定义 5.2 当 $f_Y(y) > 0$ 时,称

$$ F_{X \mid Y}(x \mid y) = \frac{\int_{-\infty}^{x} f(s, y) \, \mathrm{d}s}{f_Y(y)}, \qquad f_{X \mid Y}(x \mid y) = \frac{f(x, y)}{f_Y(y)} \tag{5.7–5.8} $$

为条件 $Y = y$ 下 $X$ 的条件分布函数条件密度

条件密度公式 $f_{X|Y} = f / f_Y$ 的几何解释与离散的"列归一化"严格平行:在密度曲面上沿 $Y = y$ 切一刀,得到截面曲线 $x \mapsto f(x, y)$;它非负但积分不为 1(其积分恰为 $f_Y(y)$),除以 $f_Y(y)$ 归一化后便是一条合法的一维密度。切片再归一化——这五个字概括了条件密度的全部内容。与离散情形相同,定理 5.2 给出独立性的条件语言刻画:$X, Y$ 独立 $\iff$ 一切正密度处 $f_{X|Y}(x \mid y) = f_X(x)$(切片形状与切的位置无关)。

三个例题各代表一类应用:

例 5.3(几何截面):单位圆内均匀分布,已知 $Y = y$ 时 $X$ 在弦 $\left(-\sqrt{1-y^2}, \sqrt{1-y^2}\right)$ 上均匀分布——均匀密度的切片仍是均匀的,但支撑随 $y$ 变化。这再次直观解释了 $X, Y$ 为何不独立。

例 5.4(分层建模与连续全概率公式):环境指标 $Y \sim \Gamma(\alpha, \beta)$,给定 $Y = y$ 时软件寿命 $X \sim \mathcal{E}(y)$。这类问题给出的不是联合密度,而是"边缘 + 条件"的分层描述;建模的第一步是用乘法公式重构联合密度

$$ f(x, y) = f_{X \mid Y}(x \mid y) \, f_Y(y), $$

再积掉 $y$ 得 $X$ 的边缘密度 $f_X(x) = \frac{\alpha \beta^\alpha}{(x + \beta)^{\alpha+1}}$($x > 0$,计算中使用 $\Gamma$ 函数的换元与递推 $\Gamma(\alpha+1) = \alpha\Gamma(\alpha)$)。两点评注:其一,链条"条件 × 边缘 = 联合 → 积分 = 边缘"正是第一章全概率公式的连续版本,分层模型(hierarchical model)是现代贝叶斯统计的基本构件;其二,指数分布被 $\Gamma$ 分布"混合"后得到的是幂律尾(Pareto 型)密度——尾部远厚于指数,混合放大了不确定性。

例 5.5(二元正态的条件分布:回归的源头):$(X, Y) \sim N(\mu_1, \mu_2; \sigma_1^2, \sigma_2^2; \rho)$ 时,给定 $X = x$,

$$ Y \mid X = x \ \sim \ N\left( \mu_2 + \rho \frac{\sigma_2}{\sigma_1}(x - \mu_1), \ (1 - \rho^2) \sigma_2^2 \right). \tag{5.9} $$

计算是密度相除后再配方,结论则值得长期记忆。条件期望 $\mu_x = \mu_2 + \rho\frac{\sigma_2}{\sigma_1}(x - \mu_1)$ 是 $x$ 的线性函数——这条直线就是统计学中的回归直线:"回归"概念在数学上的最初形态即二元正态的条件均值。条件方差 $(1-\rho^2)\sigma_2^2$ 与 $x$ 无关,且比无条件方差 $\sigma_2^2$ 缩小了因子 $1 - \rho^2$:$|\rho|$ 越大,知道 $X$ 后对 $Y$ 的不确定性削减越多;$\rho = 0$ 时条件分布与无条件分布相同(独立)。定义 5.3 将条件密度逐字推广到向量对向量的情形($f_{\mathbf{X}|\mathbf{Y}} = f / f_{\mathbf{Y}}$),无新内容。

*C. 条件概率 $P(A \mid X)$:把条件概率升级为随机变量(选学)

本小节为 §4.5 条件期望作概念铺垫,初读可略,但其思想转换非常精彩。对每个取值 $x$,$g(x) = P(A \mid X = x)$ 是一个数;让 $x$ 跑遍 $X$ 的值域,$g$ 是一个普通函数;再把随机变量 $X$ 代入自身的条件概率函数,得到*随机变量

$$ P(A \mid X) = g(X). $$

即:在观测到 $X$ 之前,"$A$ 在给定 $X$ 下的概率"本身是随机的——它随 $X$ 的实现而定。例 5.6(随机个顾客的营业额)、例 5.8($P(X \leq x \mid Y) = 1 - e^{-xY}$)演示了书写方式:先算 $P(A \mid X = x)$ 得 $g(x)$,再整体替换 $x \mapsto X$。这种"条件概率作为随机变量"的观点是现代概率论(鞅论、随机过程)的标准语言,第四章的条件期望 $E(Y \mid X)$ 将沿同一路线构造。

要点
  • 离散条件分布 = 一列(行)除以列(行)和;独立 $\iff$ 每列归一化后同于边缘。
  • 几何等待时间:给定 $S_2 = j$ 时 $S_1$ 均匀;增量独立同分布(无记忆性)。
  • 连续情形 $P(Y = y) = 0$,条件分布经 $\varepsilon$-邻域极限定义;$f_{X|Y} = f / f_Y$ = 切片再归一化。
  • 乘法公式 $f = f_{X|Y} f_Y$ 用于分层建模;积掉条件变量 = 连续全概率公式。
  • 二元正态条件分布仍正态:条件均值为线性函数(回归直线),条件方差缩减因子 $1 - \rho^2$。
  • (选学)$P(A \mid X) = g(X)$ 是随机变量:条件概率的现代观点。

3.6 次序统计量:把样本从小到大排好

对应原书 §3.6。

A. 概念:逐点排序

设 $X_1, \cdots, X_n$ 为随机变量。对每个样本点 $\omega$,把实数 $X_1(\omega), \cdots, X_n(\omega)$ 从小到大重排,所得

$$ X_{(1)} \leq X_{(2)} \leq \cdots \leq X_{(n)} $$

称为次序统计量(定义 6.1)。要点在于排序是逐 $\omega$ 进行的:$X_{(1)}$ 在不同的 $\omega$ 处可能来自不同的原变量(原书例 6.1 用三次考试成绩具体演示了这一点——最低分未必总是同一位学生)。因此每个 $X_{(k)}$ 是原变量的函数,是货真价实的随机变量。两个端点最常用:$X_{(n)} = \max\{X_1, \cdots, X_n\}$,$X_{(1)} = \min\{X_1, \cdots, X_n\}$;原书例 6.2(五十年一遇的降雨量)说明极值分布在工程与保险中的地位。

以下设 $X_1, \cdots, X_n$ 独立同分布,公共分布函数 $F$、密度 $f$。

B. 三个层次的密度公式

第一层:全体次序统计量的联合密度(例 6.5)

$$ g(x_1, x_2, \cdots, x_n) = \begin{cases} n! \, f(x_1) f(x_2) \cdots f(x_n), & x_1 < x_2 < \cdots < x_n, \\ 0, & \text{其他}. \end{cases} \tag{6.4} $$

因子 $n!$ 的来源应当彻底理解。证明的骨架:连续型变量以概率 1 互不相等;事件"排序后的向量落入 $D$ 且严格递增"按是哪个排列实现了这个次序分解为 $n!$ 个互不相容事件之并;由独立同分布的对称性,每个排列事件的概率相同,故总概率为单个的 $n!$ 倍。直观语言:无序样本的每一种递增构型,可由原变量的 $n!$ 种指派方式实现,概率质量因此折叠到锥形区域 $\{x_1 < \cdots < x_n\}$ 上并放大 $n!$ 倍。配套的例 6.4 是一个纯积分引理:

$$ \int_{a < x_1 < \cdots < x_k < b} f(x_1) \cdots f(x_k) \, \mathrm{d}x_1 \cdots \mathrm{d}x_k = \frac{1}{k!} \big(F(b) - F(a)\big)^k, $$

含义是:$k$ 个独立样本全落入 $(a,b)$ 且按指定次序排列的概率,等于全落入的概率 $\left(F(b)-F(a)\right)^k$ 除以次序数 $k!$——对称性使 $k!$ 种次序等可能。该引理(归纳法证明,逐层"剥"最外一个变量)是下面一切边缘密度计算的引擎。

第二层:单个 $X_{(k)}$ 的密度(例 6.6)

$$ g_k(x) = \frac{n!}{(k-1)! \, (n-k)!} \, F(x)^{k-1} \big[1 - F(x)\big]^{n-k} f(x). \tag{6.5} $$

原书由联合密度积分(配合例 6.4)严格导出。但这个公式更应当用微元法直接"看"出来,这也是记忆它的正确方式。$X_{(k)}$ 落在微小区间 $(x, x + \mathrm{d}x)$ 中,意味着 $n$ 个独立样本被分成三组:恰有 $k - 1$ 个落在 $x$ 左侧(每个概率 $F(x)$)、恰有 1 个落入微元(概率 $f(x)\,\mathrm{d}x$)、其余 $n - k$ 个落在右侧(每个概率 $1 - F(x)$)。三组人选的指派方式数为多项系数 $\frac{n!}{(k-1)! \, 1! \, (n-k)!}$,故

$$ P\big(X_{(k)} \in (x, x + \mathrm{d}x)\big) \approx \frac{n!}{(k-1)!(n-k)!} F^{k-1} (1 - F)^{n-k} f \, \mathrm{d}x, $$

两边除以 $\mathrm{d}x$ 即得 (6.5)。(两个及以上样本同落微元的概率是 $(\mathrm{d}x)^2$ 阶的高阶无穷小,极限中消失——这是微元法在此严格可行的原因。)

图 3-3|$\mathcal{U}(0,1)$ 五个样本的次序统计量密度
图 3-3|$\mathcal{U}(0,1)$ 五个样本的次序统计量密度

两个端点情形建议独立掌握、优先使用,因为它们经由分布函数的推导更快且不易错:

$$ P(X_{(n)} \leq x) = P(\text{全体} \leq x) = F(x)^n \ \Rightarrow \ g_n(x) = n F^{n-1}(x) f(x); $$

$$ P(X_{(1)} > x) = P(\text{全体} > x) = [1 - F(x)]^n \ \Rightarrow \ g_1(x) = n [1 - F(x)]^{n-1} f(x). $$

最大值走分布函数、最小值走生存函数(尾概率)——这对"事件翻译"($\max \leq x \iff$ 全都 $\leq x$;$\min > x \iff$ 全都 $> x$)是次序统计量问题的第一反应。

第三层:两个次序统计量的联合密度(例 6.7):对 $k_1 < k_2$,

$$ g_{k_1, k_2}(x, y) = \frac{n!}{(k_1 - 1)! (k_2 - k_1 - 1)! (n - k_2)!} F(x)^{k_1 - 1} [F(y) - F(x)]^{k_2 - k_1 - 1} [1 - F(y)]^{n - k_2} f(x) f(y), \quad x < y. $$

不必背诵:微元法的图像自动生成它——数轴被 $x, y$ 两个微元分成三段,各段人数 $k_1 - 1$、$k_2 - k_1 - 1$、$n - k_2$,概率分别为 $F(x)$、$F(y) - F(x)$、$1 - F(y)$,再乘多项系数与两个密度微元。此公式是计算极差 $R = X_{(n)} - X_{(1)}$ 分布的出发点(习题 3.29)。

应用:竞争风险与"灯泡悖论"

例 6.9 以生活现象收束本节:住宅由 4 只灯泡改为 24 只后,主人感觉灯泡"更容易坏"。设各灯泡寿命独立同 $\mathcal{E}(\lambda)$,等待第一只烧坏的时间为最小值。由

$$ P(\min\{X_1, \cdots, X_n\} > t) = \big(e^{-\lambda t}\big)^n = e^{-n\lambda t} $$

得 $\min \sim \mathcal{E}(n\lambda)$:独立指数变量的最小值仍是指数的,且失效率相加。于是换灯泡的等待时间从 $\mathcal{E}(4\lambda)$ 变为 $\mathcal{E}(24\lambda)$,平均缩短为原来的 $1/6$;取 $\lambda = 1/1500$(小时$^{-1}$)计算,装修前 200 小时内不换灯泡的概率为 $58.7\%$,装修后仅 $4.1\%$。单只灯泡的质量并未改变,改变的是"第一次失效"这一极值事件的发生率——这一结构在可靠性理论中称为竞争风险:多个失效模式并联竞争,系统失效率为各失效率之和。它也是第六章泊松过程叠加性质的雏形。

要点
  • 次序统计量逐 $\omega$ 排序;$X_{(k)}$ 是随机变量,$X_{(1)}, X_{(n)}$ 为最值。
  • 联合密度 $n! \prod f(x_i)$(递增锥上):$n!$ 来自排列对称性的折叠。
  • $X_{(k)}$ 密度用微元法记忆:左 $k-1$(各 $F$)、微元 1($f\,\mathrm{d}x$)、右 $n-k$(各 $1-F$)、乘多项系数。
  • 最大值配分布函数 $F^n$,最小值配尾概率 $(1-F)^n$,先算分布函数再求导最稳妥。
  • 指数最小值:失效率相加,$\min \sim \mathcal{E}(n\lambda)$(竞争风险)。

本章收束:联合行为的完整语法

回顾本章的路径。§3.1–§3.3 建立了描述联合行为的三套等价语言——分布函数、概率分布表、联合密度——并确立了中心观念:联合 > 边缘,边缘是联合的投影,独立是"投影无损"的特殊情形,其判别归结为"可分离 + 矩形支撑"。§3.4 提供了从旧变量的分布计算新变量分布的两大算法:普适的分布函数法与高效的雅可比变换法,卷积、瑞利、柯西、Box–Muller 皆是其产出。§3.5 把第一章的条件概率精细化到连续场合:条件密度 = 切片再归一化,乘法公式支撑分层建模,二元正态的条件分布则孕育了回归。§3.6 将样本排序,用对称性($n!$ 折叠)与微元法(三段计数)掌握极值与一般次序统计量的分布。

至此,描述随机向量的分布层面工具已经齐备。但分布(一张表、一个二元函数)作为信息载体过于庞大:工程与统计实践需要少数几个数字概括一个分布的位置、离散程度与关联强弱。把分布压缩为数字——期望、方差、协方差与相关系数——并研究这些数字的运算规律,是下一章的主题。本章遗留的两个悬念也将在后续解决:二元正态的五个参数的确切含义(第四章),以及多元正态的完整理论(第五章 §5.3)。


公式速查卡

联合与边缘

独立性判别

重要多维分布

函数的分布

条件分布

次序统计量(独立同分布,分布 $F$、密度 $f$)


习题指引

习题三共 52 题,覆盖面广、层次分明。以下按"打底 → 核心方法 → 挑战"给出路线与思路提示(只指方向,不给解答;卡住超过 20 分钟建议来讨论)。

第一层:打底(联合密度与边缘密度的基本功)

第二层:核心方法(本章主干题型)

第三层:挑战(结构更深的题)

通用自查清单:① 支撑集画了吗?积分限与支撑一致吗?② 写密度时附带自变量范围了吗?③ 判独立时同时核验了"可分离"与"矩形支撑"吗?④ 雅可比是"旧对新"求导并取了绝对值吗?非单射变换的分支都数齐了吗?⑤ 条件密度的分母 $f_Y(y) > 0$ 的范围写对了吗?