本节对应原书 PDF 第 289–295 页。定义、定理、公式、例题及其原解答逐字取自原书;解释性文字为 AI 通俗化改写;标有「解读」的引用块为 AI 补充的额外直觉。
12.3.1 离散型随机变量及其分布律
为了便于描述随机试验,将随机试验的结果数字化,这就是随机变量. 例如,对掷硬币试验,令
X 只可能取到 2 个值:1 或 0,分别对应正面向上或背面向上. \{X=1\} 表示正面向上,其概率等于 \frac{1}{2},记作 P\{X=1\}=\frac{1}{2}. 类似地,P\{X=0\}=\frac{1}{2}. P\{X=1\}=\frac{1}{2} 和 P\{X=0\}=\frac{1}{2} 完全地刻画了 X 的取值情况.
定义 12.5 设随机试验的样本空间为 \Omega,称定义在 \Omega 上的实值函数 X:\Omega\to R 为随机变量. 通常把 X(\omega)(\omega\in\Omega)简记作 X.
当 \Omega 为离散样本空间时,X 只可能取到有穷个或可数无穷个值,称这样的随机变量 X 为离散型随机变量.
设 X 是一个离散型随机变量,它可能取到的值为 a_1,a_2,\cdots(有穷个或可数无穷个),称
为 X 的概率分布律,简称为分布律.
根据概率的性质,分布律满足下述条件:
(1) 对所有的 k,0\leqslant p_k\leqslant 1;
(2) \sum\limits_k p_k=1.
例如,本节开始时对掷硬币试验定义的 X 是一个离散型随机变量,它的分布律为 P\{X=1\}=\frac{1}{2},P\{X=0\}=\frac{1}{2}.
解读:随机变量是从样本空间到实数的函数,不是「变量」;把结果数字化以后才能做加法、求期望。分布律就是这张「取值—概率」对照表,两条条件正是概率公理的特化:非负、全空间概率为 1。表中概率之和若不是 1,它就不是某个随机变量的分布律。
例 12.9 套圈游戏. 某人反复套同一个目标,直到套中为止,把套中目标所用的次数记作 X. 设他每次套中目标的概率为 p(0<p<1) 且是否套中是相互独立的,试给出 X 的分布律.
解 显然,X 可能取到任意的正整数. 当 X=k 时,表示前 k-1 次都没有套中,第 k 次套中. 由题设,
事件的独立性可以推广到随机变量.
定义 12.6 设 X 和 Y 是两个离散型随机变量,它们的分布律分别为
和
如果对每一对 i 和 j,事件 \{X=a_i\} 和 \{Y=b_j\} 相互独立,即
则称 X 和 Y 相互独立.
设 X_1,X_2,\cdots,X_n 是 n 个离散型随机变量,X_i 的分布律为
如果对所有的 j_1,j_2,\cdots,j_n,事件 \{X_1=a_{1j_1}\},\{X_2=a_{2j_2}\},\cdots,\{X_n=a_{nj_n}\} 相互独立,则称 X_1,X_2,\cdots,X_n 相互独立.
解读:随机变量独立是把事件独立逐个取值地落实:任何一组取值组合都要满足乘积等式。注意这是比「每个 X_i 各自的分布」强得多的条件——联合分布要能拆成边缘分布的乘积。
12.3.2 常用分布
1. 0-1 分布
如果 X 的分布律为
则称 X 服从 0-1 分布.
2. 二项分布
如果 X 的分布律为
则称 X 服从二项分布,记作 X\sim B(n,p).
在 n 次伯努利试验中,事件 A 发生的次数 X 服从二项分布 B(n,p),其中 p=P(A).
3. 泊松分布
如果 X 的分布律为
则称 X 服从泊松(Poisson)分布.
泊松分布是广泛使用的一种分布,在固定的时间间隔内稀有事件发生的次数都可以认为服从泊松分布. 例如,在 5 分钟内,网站主页被点击的次数,电话交换台接到请求通话的次数,车站候车的旅客人数,一块放射性物体放射出的粒子数,数字通信中的误码数等.
4. 超几何分布
设有 N 个小球,其中有 M 个红球. 从中任取 n(n\leqslant N-M) 个,记这 n 个中的红球数为 X,则 X 的分布律为
其中 l=\min(n,M),称 X 服从超几何分布.
5. 几何分布
设在伯努利试验中,每次试验事件 A 发生的概率为 p(0<p<1). 把事件 A 首次发生时的试验次数记作 X,则 X 的分布律为
称 X 服从几何分布.
6. 巴斯卡分布与负二项分布
设在伯努利试验中,每次试验事件 A 发生的概率为 p(0<p<1). 把事件 A 第 r 次发生时的试验次数记作 X,则 X 的分布律为
称 X 服从巴斯卡(Pascal)分布.
令 Y=X-r,Y 是在伯努利试验中事件 A 第 r 次发生前 A 不发生的次数,Y 的分布律为
称 Y 服从负二项分布.
负二项分布的名字来源于 \binom{k+r-1}{r-1}=\binom{k+r-1}{k}=(-1)^k\binom{-r}{k},其中 \binom{-r}{k} 恰好是 (1+q)^{-r} 的展开式中 q^k 的系数:(1+q)^{-r}=\sum\limits_{k=0}^{\infty}\binom{-r}{k}q^k. 这里把组合数 \binom{n}{k} 中的 n 推广到负整数. 当 n=-r 时,
解读:这六种分布其实是一条链:0-1 分布是一次试验,二项分布是 n 次 0-1 之和,几何分布是等到首次成功,巴斯卡分布是等到第 r 次成功,负二项分布是巴斯卡分布换个计数起点(数失败次数而非总试验次数),超几何分布则是不放回抽样版的二项分布。抓住「数什么」就能把它们的分布律区分开,不必硬背公式。
12.3.3 数学期望
定义 12.7 设离散型随机变量 X 的分布律为
如果 \sum\limits_k a_kp_k 绝对收敛,则称它是 X 的数学期望,简称期望,记作 E(X),或 EX. 即
数学期望是随机变量所有可能取值的平均值. 定义中 \sum\limits_k 是对 X 的所有可能的取值求和,可能只有有限项,也可能有无穷多项. 当只有有限项时,不存在收敛问题,这里约定认为它是绝对收敛的. 当有无穷多项时,绝对收敛保证该级数收敛且级数的和与项的顺序无关. 今后遇到类似情况都采用这种记法,不再一一说明.
解读:期望是以概率为权重的加权平均,不是把取值简单平均。要求「绝对收敛」是为了让求和次序可以随意调换——否则同一个随机变量按不同次序求和可能得到不同的数,期望就不唯一了。
例 12.10 0-1 分布的数学期望.
解 设 X 服从 0-1 分布,分布律为
由定义
例 12.11 某甲练习打靶,对一个靶标进行射击直到击中为止,然后转向下一个靶标. 设甲的命中率为 p(0<p<1),求甲击中一个靶标所需的平均射击次数.
解 设甲对一个靶标射击的次数为 X,X 服从参数 p 的几何分布,分布律为
对一个靶标射击的平均次数为
解读:这里的关键一步是把 \sum kq^{k-1} 看成等比级数 \sum q^k=\frac{1}{1-q} 的逐项求导结果。因为 |q|<1 时幂级数在收敛区间内部可以逐项求导,所以这个操作合法。结论 E(X)=\frac{1}{p} 很直观:命中率越高,平均等待的射击次数越少。
关于随机变量函数的期望有下述计算公式.
定理 12.3 设 \varphi(x) 是一实函数,X 是一随机变量,其分布律为
又 Y=\varphi(X). 如果 \sum\limits_k\varphi(a_k)p_k 绝对收敛,则
证明 Y=\varphi(X) 也是一个离散型随机变量. 设它的可能取值为 b_1,b_2,\cdots,记 p_i'=P\{Y=b_i\},i=1,2,\cdots,则 p_i'=\sum\limits_{\varphi(a_k)=b_i}p_k. 于是,
这里仅对下述特殊情况加以证明. 假设对每一个 i,只有有限个 a_k 使 \varphi(a_k)=b_i,由于绝对收敛的级数可以任意交换项的次序,并且收敛级数可以任意合并项,故上式右端的级数也绝对收敛且等于 \sum\limits_k\varphi(a_k)p_k,得证结论成立.
解读:定理 12.3 的价值在于不用先求 Y 的分布律。比如要算 E(X^2),不必把 X^2 的取值合并整理,直接对 X 的每一项算 a_k^2p_k 再求和即可。注意前提是那个级数绝对收敛。
数学期望具有下述性质.
性质 12.3.1 E(C)=C.
性质 12.3.2 E(CX)=CE(X).
性质 12.3.3 E(X\pm Y)=E(X)\pm E(Y).
更一般地,E(X_1\pm X_2\pm\cdots\pm X_n)=E(X_1)\pm E(X_2)\pm\cdots\pm E(X_n).
性质 12.3.4 如果 X 与 Y 相互独立,则 E(XY)=E(X)E(Y).
更一般地,如果 X_1,X_2,\cdots,X_n 相互独立,则
性质 12.3.5 施瓦兹(Schwarz)不等式
在上面的式子中 C 是常数,并假设所提及的数学期望存在.
解读:性质 12.3.3(期望可加)不要求独立,这是期望比方差好用的地方;而性质 12.3.4(期望可乘)必须要求独立,两者不要混。性质 12.3.1–12.3.3 合起来说明期望是线性运算。
例 12.12 二项分布的数学期望.
解 设 X\sim B(n,p),可以根据定义直接计算 E(X),在化简结果时需要一点技巧. 下面把 X 分解成 n 个随机变量的和,从而可以利用性质 12.3.3 进行计算.
把 X 看作 n 次伯努利试验中事件 A 发生的次数,每次试验 A 发生的概率为 p. 令
X_1,X_2,\cdots,X_n 相互独立且都服从参数 p 的 0-1 分布. 由例 12.10,E(X_k)=p. 又 X=X_1+X_2+\cdots+X_n. 于是,得到
12.3.4 方差
定义 12.8 如果 E[(X-EX)^2] 存在,则称它为随机变量 X 的方差,记作 D(X) 或 DX,即
设 X 的分布律为
则
DX 等于 X 偏离平均值 EX 大小的平方的平均值,从而刻画了 X 取值的分散程度. DX 越大,X 的取值越分散;DX 越小,X 的取值越集中.
方差有下述计算公式
证明
注意到 EX 是常数,E(2XEX)=2(EX)^2,E[(EX)^2]=(EX)^2. 代入上式即可得到式(12.1).
解读:式(12.1) 是算方差的主用公式——先算 E(X^2) 和 EX 就够了,避免了逐项算 (a_k-EX)^2。注意 D(X)\geqslant 0 由 E(X^2)\geqslant (EX)^2 保证(施瓦兹不等式取 Y=1)。
例 12.13 0-1 分布的方差.
解 设 X 服从 0-1 分布,分布律为
已知 EX=p,又 E(X^2)=0^2\times q+1^2\times p=p,由式(12.1),得
方差具有下述性质.
性质 12.3.6 D(C)=0.
性质 12.3.7 D(CX)=C^2D(X).
性质 12.3.8 如果 X 与 Y 相互独立,则 D(X\pm Y)=D(X)+D(Y).
更一般地,如果 X_1,X_2,\cdots,X_n 相互独立,则
解读:方差的性质与期望有三处关键差别:常数项被消掉(D(C)=0),常数倍数要平方(D(CX)=C^2D(X)),独立时加减号都变成加号(D(X-Y)=D(X)+D(Y) 而不是相减)。最后一条最容易记错。
例 12.14 二项分布的方差.
解 由例 12.13,设 X\sim B(n,p),则 X=X_1+X_2+\cdots+X_n,其中 X_1,X_2,\cdots,X_n 相互独立且都服从参数为 p 的 0-1 分布. 于是,由性质 12.3.8 知
定理 12.4(切比雪夫不等式) 设随机变量 X 的期望 EX 和方差 DX 存在,则对任意的 \varepsilon>0,
证明 设 X 的分布律为
于是
DX 刻画了 X 取值的分散程度,切比雪夫不等式对此在数量上给出了明确的描述. 取 \varepsilon=k\sqrt{DX},
上式表明 X 落入 (EX-k\sqrt{DX},EX+k\sqrt{DX}) 内的概率不小于 1-\frac{1}{k^2}. 例如,取 k=3.16,X 落入 (EX-3.16\sqrt{DX},EX+3.16\sqrt{DX}) 内的概率不小于 0.90. 对于固定的 k,DX 越大,这个区间越长,表明 X 的取值越分散;DX 越小,这个区间越短,表明 X 的取值越集中.
解读:切比雪夫不等式的证明只做了一件事:在被求和的那些项上,把 \frac{(a_k-EX)^2}{\varepsilon^2} 换成一个不大于 1 的因子,于是放大成对整个 k 求和,正好凑出 DX。它不依赖 X 服从什么分布,代价是估计通常比较松。
最后给出矩的概念.
定义 12.9 设 k 是正整数,如果 E(X^k) 存在,则称它是 X 的 k 阶原点矩.
设 X 的分布律为
则
1 阶原点矩就是数学期望.
解读:原点矩是期望的推广:1 阶原点矩是 EX,2 阶原点矩 E(X^2) 配合式(12.1) 就能算方差。后面 12.4 节的母函数本质上就是把所有阶原点矩打包成一个生成函数的工具。