本节对应原书 PDF 第 289–295 页。定义、定理、公式、例题及其原解答逐字取自原书;解释性文字为 AI 通俗化改写;标有「解读」的引用块为 AI 补充的额外直觉。

12.3.1 离散型随机变量及其分布律

为了便于描述随机试验,将随机试验的结果数字化,这就是随机变量. 例如,对掷硬币试验,令

X=\begin{cases}1 & \text{若正面向上}\\ 0 & \text{若背面向上}\end{cases}

X 只可能取到 2 个值:1 或 0,分别对应正面向上或背面向上. \{X=1\} 表示正面向上,其概率等于 \frac{1}{2},记作 P\{X=1\}=\frac{1}{2}. 类似地,P\{X=0\}=\frac{1}{2}. P\{X=1\}=\frac{1}{2} 和 P\{X=0\}=\frac{1}{2} 完全地刻画了 X 的取值情况.

定义 12.5 设随机试验的样本空间为 \Omega,称定义在 \Omega 上的实值函数 X:\Omega\to R 为随机变量. 通常把 X(\omega)(\omega\in\Omega)简记作 X.

当 \Omega 为离散样本空间时,X 只可能取到有穷个或可数无穷个值,称这样的随机变量 X 为离散型随机变量.

设 X 是一个离散型随机变量,它可能取到的值为 a_1,a_2,\cdots(有穷个或可数无穷个),称

P\{X=a_k\}=p_k\qquad k=1,2,\cdots

为 X 的概率分布律,简称为分布律.

根据概率的性质,分布律满足下述条件:

(1) 对所有的 k,0\leqslant p_k\leqslant 1;

(2) \sum\limits_k p_k=1.

例如,本节开始时对掷硬币试验定义的 X 是一个离散型随机变量,它的分布律为 P\{X=1\}=\frac{1}{2},P\{X=0\}=\frac{1}{2}.

解读:随机变量是从样本空间到实数的函数,不是「变量」;把结果数字化以后才能做加法、求期望。分布律就是这张「取值—概率」对照表,两条条件正是概率公理的特化:非负、全空间概率为 1。表中概率之和若不是 1,它就不是某个随机变量的分布律。

例 12.9 套圈游戏. 某人反复套同一个目标,直到套中为止,把套中目标所用的次数记作 X. 设他每次套中目标的概率为 p(0<p<1) 且是否套中是相互独立的,试给出 X 的分布律.

解 显然,X 可能取到任意的正整数. 当 X=k 时,表示前 k-1 次都没有套中,第 k 次套中. 由题设,

P\{X=k\}=q^{k-1}p\qquad k=1,2,\cdots,\qquad 其中 q=1-p

事件的独立性可以推广到随机变量.

定义 12.6 设 X 和 Y 是两个离散型随机变量,它们的分布律分别为

P\{X=a_i\}=p_i\qquad i=1,2,\cdots

和

P\{Y=b_j\}=q_j\qquad j=1,2,\cdots

如果对每一对 i 和 j,事件 \{X=a_i\} 和 \{Y=b_j\} 相互独立,即

P\{X=a_i,Y=b_j\}=p_iq_j\qquad i,j=1,2,\cdots

则称 X 和 Y 相互独立.

设 X_1,X_2,\cdots,X_n 是 n 个离散型随机变量,X_i 的分布律为

P\{X_i=a_{ij}\}=p_{ij},\qquad j=1,2,\cdots,\qquad i=1,2,\cdots,n

如果对所有的 j_1,j_2,\cdots,j_n,事件 \{X_1=a_{1j_1}\},\{X_2=a_{2j_2}\},\cdots,\{X_n=a_{nj_n}\} 相互独立,则称 X_1,X_2,\cdots,X_n 相互独立.

解读:随机变量独立是把事件独立逐个取值地落实:任何一组取值组合都要满足乘积等式。注意这是比「每个 X_i 各自的分布」强得多的条件——联合分布要能拆成边缘分布的乘积。

12.3.2 常用分布

1. 0-1 分布

如果 X 的分布律为

P\{X=1\}=p,\qquad P\{X=0\}=q,\qquad 其中 q=1-p,\qquad 0<p<1

则称 X 服从 0-1 分布.

2. 二项分布

如果 X 的分布律为

P\{X=k\}=\binom{n}{k}p^kq^{n-k},\qquad k=0,1,\cdots,n,\qquad 其中 q=1-p,\qquad 0<p<1

则称 X 服从二项分布,记作 X\sim B(n,p).

在 n 次伯努利试验中,事件 A 发生的次数 X 服从二项分布 B(n,p),其中 p=P(A).

3. 泊松分布

如果 X 的分布律为

P\{X=k\}=\frac{\lambda^k}{k!}\mathrm{e}^{-\lambda},\qquad k=0,1,2,\cdots,\qquad \lambda>0

则称 X 服从泊松(Poisson)分布.

泊松分布是广泛使用的一种分布,在固定的时间间隔内稀有事件发生的次数都可以认为服从泊松分布. 例如,在 5 分钟内,网站主页被点击的次数,电话交换台接到请求通话的次数,车站候车的旅客人数,一块放射性物体放射出的粒子数,数字通信中的误码数等.

4. 超几何分布

设有 N 个小球,其中有 M 个红球. 从中任取 n(n\leqslant N-M) 个,记这 n 个中的红球数为 X,则 X 的分布律为

P\{X=k\}=\frac{\dbinom{M}{k}\dbinom{N-M}{n-k}}{\dbinom{N}{n}}\qquad k=0,1,\cdots,l

其中 l=\min(n,M),称 X 服从超几何分布.

5. 几何分布

设在伯努利试验中,每次试验事件 A 发生的概率为 p(0<p<1). 把事件 A 首次发生时的试验次数记作 X,则 X 的分布律为

P\{X=k\}=q^{k-1}p,\qquad k=1,2,\cdots,\qquad 其中 q=1-p

称 X 服从几何分布.

6. 巴斯卡分布与负二项分布

设在伯努利试验中,每次试验事件 A 发生的概率为 p(0<p<1). 把事件 A 第 r 次发生时的试验次数记作 X,则 X 的分布律为

P\{X=k\}=\binom{k-1}{r-1}q^{k-r}p^r,\qquad k=r,r+1,r+2,\cdots,\qquad 其中 q=1-p,\qquad r 为正整数

称 X 服从巴斯卡(Pascal)分布.

令 Y=X-r,Y 是在伯努利试验中事件 A 第 r 次发生前 A 不发生的次数,Y 的分布律为

P\{Y=k\}=P\{X=k+r\}=\binom{k+r-1}{r-1}q^kp^r,\qquad k=0,1,2,\cdots,\qquad q=1-p

称 Y 服从负二项分布.

负二项分布的名字来源于 \binom{k+r-1}{r-1}=\binom{k+r-1}{k}=(-1)^k\binom{-r}{k},其中 \binom{-r}{k} 恰好是 (1+q)^{-r} 的展开式中 q^k 的系数:(1+q)^{-r}=\sum\limits_{k=0}^{\infty}\binom{-r}{k}q^k. 这里把组合数 \binom{n}{k} 中的 n 推广到负整数. 当 n=-r 时,

\binom{-r}{k}=\frac{-r(-r-1)\cdots(-r-k+1)}{k!}=(-1)^k\binom{k+r-1}{k}

解读:这六种分布其实是一条链:0-1 分布是一次试验,二项分布是 n 次 0-1 之和,几何分布是等到首次成功,巴斯卡分布是等到第 r 次成功,负二项分布是巴斯卡分布换个计数起点(数失败次数而非总试验次数),超几何分布则是不放回抽样版的二项分布。抓住「数什么」就能把它们的分布律区分开,不必硬背公式。

12.3.3 数学期望

定义 12.7 设离散型随机变量 X 的分布律为

P\{X=a_k\}=p_k\qquad k=1,2,\cdots

如果 \sum\limits_k a_kp_k 绝对收敛,则称它是 X 的数学期望,简称期望,记作 E(X),或 EX. 即

E(X)=\sum_k a_kp_k

数学期望是随机变量所有可能取值的平均值. 定义中 \sum\limits_k 是对 X 的所有可能的取值求和,可能只有有限项,也可能有无穷多项. 当只有有限项时,不存在收敛问题,这里约定认为它是绝对收敛的. 当有无穷多项时,绝对收敛保证该级数收敛且级数的和与项的顺序无关. 今后遇到类似情况都采用这种记法,不再一一说明.

解读:期望是以概率为权重的加权平均,不是把取值简单平均。要求「绝对收敛」是为了让求和次序可以随意调换——否则同一个随机变量按不同次序求和可能得到不同的数,期望就不唯一了。

例 12.10 0-1 分布的数学期望.

解 设 X 服从 0-1 分布,分布律为

P\{X=1\}=p,\qquad P\{X=0\}=q,\qquad 其中 q=1-p,\qquad 0<p<1

由定义

E(X)=0\times q+1\times p=p

例 12.11 某甲练习打靶,对一个靶标进行射击直到击中为止,然后转向下一个靶标. 设甲的命中率为 p(0<p<1),求甲击中一个靶标所需的平均射击次数.

解 设甲对一个靶标射击的次数为 X,X 服从参数 p 的几何分布,分布律为

P\{X=k\}=q^{k-1}p,\qquad k=1,2,\cdots,\qquad 其中 q=1-p

对一个靶标射击的平均次数为

\begin{aligned} E(X)&=\sum_{k=1}^{\infty}kq^{k-1}p\\ &=p\sum_{k=1}^{\infty}kq^{k-1}\\ &=p\left(\sum_{k=0}^{\infty}q^k\right)'\\ &=p\left(\frac{1}{1-q}\right)'\\ &=\frac{p}{(1-q)^2}\\ &=\frac{1}{p} \end{aligned}

解读:这里的关键一步是把 \sum kq^{k-1} 看成等比级数 \sum q^k=\frac{1}{1-q} 的逐项求导结果。因为 |q|<1 时幂级数在收敛区间内部可以逐项求导,所以这个操作合法。结论 E(X)=\frac{1}{p} 很直观:命中率越高,平均等待的射击次数越少。

关于随机变量函数的期望有下述计算公式.

定理 12.3 设 \varphi(x) 是一实函数,X 是一随机变量,其分布律为

P\{X=a_k\}=p_k\qquad k=1,2,\cdots

又 Y=\varphi(X). 如果 \sum\limits_k\varphi(a_k)p_k 绝对收敛,则

E(Y)=\sum_k\varphi(a_k)p_k

证明 Y=\varphi(X) 也是一个离散型随机变量. 设它的可能取值为 b_1,b_2,\cdots,记 p_i'=P\{Y=b_i\},i=1,2,\cdots,则 p_i'=\sum\limits_{\varphi(a_k)=b_i}p_k. 于是,

\sum_i b_ip_i'=\sum_i\left(b_i\sum_{\varphi(a_k)=b_i}p_k\right)=\sum_i\sum_{\varphi(a_k)=b_i}\varphi(a_k)p_k

这里仅对下述特殊情况加以证明. 假设对每一个 i,只有有限个 a_k 使 \varphi(a_k)=b_i,由于绝对收敛的级数可以任意交换项的次序,并且收敛级数可以任意合并项,故上式右端的级数也绝对收敛且等于 \sum\limits_k\varphi(a_k)p_k,得证结论成立.

解读:定理 12.3 的价值在于不用先求 Y 的分布律。比如要算 E(X^2),不必把 X^2 的取值合并整理,直接对 X 的每一项算 a_k^2p_k 再求和即可。注意前提是那个级数绝对收敛。

数学期望具有下述性质.

性质 12.3.1 E(C)=C.

性质 12.3.2 E(CX)=CE(X).

性质 12.3.3 E(X\pm Y)=E(X)\pm E(Y).

更一般地,E(X_1\pm X_2\pm\cdots\pm X_n)=E(X_1)\pm E(X_2)\pm\cdots\pm E(X_n).

性质 12.3.4 如果 X 与 Y 相互独立,则 E(XY)=E(X)E(Y).

更一般地,如果 X_1,X_2,\cdots,X_n 相互独立,则

E(X_1X_2\cdots X_n)=E(X_1)E(X_2)\cdots E(X_n)

性质 12.3.5 施瓦兹(Schwarz)不等式

[E(XY)]^2\leqslant E(X^2)E(Y^2)

在上面的式子中 C 是常数,并假设所提及的数学期望存在.

解读:性质 12.3.3(期望可加)不要求独立,这是期望比方差好用的地方;而性质 12.3.4(期望可乘)必须要求独立,两者不要混。性质 12.3.1–12.3.3 合起来说明期望是线性运算。

例 12.12 二项分布的数学期望.

解 设 X\sim B(n,p),可以根据定义直接计算 E(X),在化简结果时需要一点技巧. 下面把 X 分解成 n 个随机变量的和,从而可以利用性质 12.3.3 进行计算.

把 X 看作 n 次伯努利试验中事件 A 发生的次数,每次试验 A 发生的概率为 p. 令

X_k=\begin{cases}1 & \text{若第 } k \text{ 次试验 } A \text{ 发生}\\ 0 & \text{若第 } k \text{ 次试验 } A \text{ 不发生}\end{cases}\qquad k=1,2,\cdots,n

X_1,X_2,\cdots,X_n 相互独立且都服从参数 p 的 0-1 分布. 由例 12.10,E(X_k)=p. 又 X=X_1+X_2+\cdots+X_n. 于是,得到

E(X)=E(X_1)+E(X_2)+\cdots+E(X_n)=np

12.3.4 方差

定义 12.8 如果 E[(X-EX)^2] 存在,则称它为随机变量 X 的方差,记作 D(X) 或 DX,即

D(X)=E[(X-EX)^2]

设 X 的分布律为

P\{X=a_k\}=p_k\qquad k=1,2,\cdots

则

D(X)=\sum_k(a_k-EX)^2p_k

DX 等于 X 偏离平均值 EX 大小的平方的平均值,从而刻画了 X 取值的分散程度. DX 越大,X 的取值越分散;DX 越小,X 的取值越集中.

方差有下述计算公式

D(X)=E(X^2)-(EX)^2 \tag{12.1}

证明

\begin{aligned} D(X)&=E[(X-EX)^2]\\ &=E[X^2-2XEX+(EX)^2]\\ &=E(X^2)-E(2XEX)+E[(EX)^2] \end{aligned}

注意到 EX 是常数,E(2XEX)=2(EX)^2,E[(EX)^2]=(EX)^2. 代入上式即可得到式(12.1).

解读:式(12.1) 是算方差的主用公式——先算 E(X^2) 和 EX 就够了,避免了逐项算 (a_k-EX)^2。注意 D(X)\geqslant 0 由 E(X^2)\geqslant (EX)^2 保证(施瓦兹不等式取 Y=1)。

例 12.13 0-1 分布的方差.

解 设 X 服从 0-1 分布,分布律为

P\{X=1\}=p,\qquad P\{X=0\}=q,\qquad 其中 q=1-p,\qquad 0<p<1

已知 EX=p,又 E(X^2)=0^2\times q+1^2\times p=p,由式(12.1),得

DX=p-p^2=pq

方差具有下述性质.

性质 12.3.6 D(C)=0.

性质 12.3.7 D(CX)=C^2D(X).

性质 12.3.8 如果 X 与 Y 相互独立,则 D(X\pm Y)=D(X)+D(Y).

更一般地,如果 X_1,X_2,\cdots,X_n 相互独立,则

D(X_1\pm X_2\pm\cdots\pm X_n)=D(X_1)+D(X_2)+\cdots+D(X_n)

解读:方差的性质与期望有三处关键差别:常数项被消掉(D(C)=0),常数倍数要平方(D(CX)=C^2D(X)),独立时加减号都变成加号(D(X-Y)=D(X)+D(Y) 而不是相减)。最后一条最容易记错。

例 12.14 二项分布的方差.

解 由例 12.13,设 X\sim B(n,p),则 X=X_1+X_2+\cdots+X_n,其中 X_1,X_2,\cdots,X_n 相互独立且都服从参数为 p 的 0-1 分布. 于是,由性质 12.3.8 知

D(X)=D(X_1)+D(X_2)+\cdots+D(X_n)=npq,\qquad 其中 q=1-p

定理 12.4(切比雪夫不等式) 设随机变量 X 的期望 EX 和方差 DX 存在,则对任意的 \varepsilon>0,

P\{|X-EX|\geqslant\varepsilon\}\leqslant\frac{DX}{\varepsilon^2}

证明 设 X 的分布律为

P\{X=a_k\}=p_k\qquad k=1,2,\cdots

于是

\begin{aligned} P\{|X-EX|\geqslant\varepsilon\}&=\sum_{|a_k-EX|\geqslant\varepsilon}p_k\\ &\leqslant\sum_{|a_k-EX|\geqslant\varepsilon}\frac{(a_k-EX)^2}{\varepsilon^2}p_k\\ &\leqslant\sum_k\frac{(a_k-EX)^2}{\varepsilon^2}p_k\\ &=\frac{DX}{\varepsilon^2} \end{aligned}

DX 刻画了 X 取值的分散程度,切比雪夫不等式对此在数量上给出了明确的描述. 取 \varepsilon=k\sqrt{DX},

P\{|X-EX|\geqslant k\sqrt{DX}\}\leqslant\frac{1}{k^2}

上式表明 X 落入 (EX-k\sqrt{DX},EX+k\sqrt{DX}) 内的概率不小于 1-\frac{1}{k^2}. 例如,取 k=3.16,X 落入 (EX-3.16\sqrt{DX},EX+3.16\sqrt{DX}) 内的概率不小于 0.90. 对于固定的 k,DX 越大,这个区间越长,表明 X 的取值越分散;DX 越小,这个区间越短,表明 X 的取值越集中.

解读:切比雪夫不等式的证明只做了一件事:在被求和的那些项上,把 \frac{(a_k-EX)^2}{\varepsilon^2} 换成一个不大于 1 的因子,于是放大成对整个 k 求和,正好凑出 DX。它不依赖 X 服从什么分布,代价是估计通常比较松。

最后给出矩的概念.

定义 12.9 设 k 是正整数,如果 E(X^k) 存在,则称它是 X 的 k 阶原点矩.

设 X 的分布律为

P\{X=a_i\}=p_i\qquad i=1,2,\cdots

则

E(X^k)=\sum_i a_i^kp_i\qquad k=1,2,\cdots

1 阶原点矩就是数学期望.

解读:原点矩是期望的推广:1 阶原点矩是 EX,2 阶原点矩 E(X^2) 配合式(12.1) 就能算方差。后面 12.4 节的母函数本质上就是把所有阶原点矩打包成一个生成函数的工具。