本节对应原书 PDF 第 286–289 页。定义、定理、公式、例题及其原解答逐字取自原书;解释性文字为 AI 通俗化改写;标有「解读」的引用块为 AI 补充的额外直觉。
12.2.1 条件概率
考虑下述问题:
某班有 30 名学生,其中 20 名男生,10 名女生,身高 1.70 米以上的有 15 名,其中 12 名男生,3 名女生. 问:
(1) 任选一名学生,该学生的身高在 1.70 米以上的概率是多少?
(2) 任选一名学生,选出后发现是男生,该学生的身高在 1.70 米以上的概率是多少?
答案很容易给出. (1) 的答案是 \frac{15}{30}=0.5. (2) 的答案是 \frac{12}{20}=0.6.
要注意的是,这两个问题的提法是有区别的. 第二个问题是一种新的提法. “是男生”本身也是一个随机事件,记作 A. 把“身高 1.70 米以上”记作 B. 于是,第二个问题可以叙述成:在事件 A 发生(即已知是男生)的条件下,事件 B(身高 1.70 米以上)发生的概率是多少?把这个概率叫做在事件 A 发生的条件下,事件 B 的条件概率,记作 P(B\mid A),它既不同于 P(B),也不同于 P(AB). 注意到 P(A)=\frac{20}{30},P(AB)=\frac{12}{30},从而有
这个式子的直观含义是明显的,在事件 A 发生的条件下事件 B 发生,当然 A 和 B 都发生,即 AB 发生. 但是,现在 A 发生了成前提条件,因此应该以 A 作为整个样本空间,而排除 A 以外的样本点,因此 P(B\mid A) 是 P(AB) 与 P(A) 之比.
定义 12.2 设 A,B 是两个随机事件且 P(A)>0,称
为在事件 A 发生的条件下事件 B 的条件概率.
解读:条件概率不是新造的一种概率,而是把样本空间缩到 A 上重新归一化的结果:原来算在 \Omega 上的 P(AB) 除以 A 所占的份额 P(A),得到的正是「已知 A 已发生」时 B 的相对大小。注意定义要求 P(A)>0——分母为 0 时条件概率没有意义。
由条件概率的定义,立即有
4° 乘法公式
设事件 A,B 且 P(A)>0,则
乘法公式可以推广到 n 个事件,设事件 A_1,A_2,\cdots,A_n,n\geqslant 2,且 P(A_1A_2\cdots A_{n-1})>0,则
得
解读:乘法公式就是把「同时发生」拆成一串逐步收紧的条件:先发生 A_1,再在 A_1 已发生的世界里发生 A_2……每一步都在上一步缩小后的样本空间里算。条件 P(A_1A_2\cdots A_{n-1})>0 保证每一步的分母都不为 0。
设样本空间 \Omega,如果事件 B_1,B_2,\cdots,B_n 两两互不相容且 \bigcup\limits_{i=1}^n B_i=\Omega,则称 B_1,B_2,\cdots,B_n 是样本空间 \Omega 的一个划分.
解读:「划分」就是给样本空间做一次不重不漏的切分:两两互不相容保证不重,并起来是整个 \Omega 保证不漏。任何一个事件 A 都会被这把刀切成若干块 AB_i,这正是全概率公式的来源。
定理 12.1(全概率公式) 设 B_1,B_2,\cdots,B_n 是样本空间的一个划分且 P(B_i)>0,i=1,2,\cdots,n,A 是任一随机事件,则
证明 因为 \bigcup\limits_{i=1}^n B_i=\Omega 且 B_iB_j=\varnothing(i\neq j),所以 A=A\bigcup\limits_{i=1}^n B_i=\bigcup\limits_{i=1}^n AB_i,且 (AB_i)\cap(AB_j)=\varnothing(i\neq j). 故
解读:全概率公式把「直接算 A 的概率很难」变成「按原因分类讨论」。B_i 是各种可能的原因或情形,P(A\mid B_i) 是每种情形下 A 发生的概率,乘上该情形本身的权重 P(B_i) 再求和。用的时候关键是先找对划分。
例 12.5 一联机的计算机系统有 5 条通信线路. 统计资料表明该系统接收到的报文来自这 5 条线路的百分比分别为 20%,30%,10%,15% 和 25%,来自这 5 条线路的报文超过 100 个字母的概率分别为 0.4,0.6,0.2,0.8 和 0.9. 问:随机地选择一个报文,其长度超过 100 个字母的概率是多少?
解 记 A:报文超过 100 个字母;B_i:报文来自第 i 条线路,i=1,2,\cdots,5.
显然,B_1,B_2,\cdots,B_5 构成样本空间的一个划分. 由题意,已知
由全概率公式
例 12.6 袋中有 6 个红球和 4 个绿球,从袋中任意地取两次,每次取一个球. 有以下两种取法.
取法一:第一次取出的球放回袋中,称作放回抽样.
取法二:第一次取出的球不放回袋中,称作不放回抽样.
分别对这两种取法求:
(1) 第一次取到红球的概率.
(2) 第二次取到红球的概率.
(3) 在第一次取到红球的条件下第二次取到红球的条件概率.
解 设 A:第一次取到红球;B:第二次取到红球.
取法一:对于放回抽样,由于每次抽取时袋中都有 10 个小球,其中 6 个是红的,故
取法二:对于不放回抽样情况就不同了. 显然仍有 P(A)=\frac{6}{10},而 P(B\mid A)=\frac{5}{9},P(B\mid\bar A)=\frac{6}{9}. 由全概率公式
解读:例 12.6 是后面「独立」概念的引子。放回抽样里 P(B\mid A)=P(B),不放回抽样里 P(B\mid A)\neq P(B),但两种取法下 P(B) 都等于 \frac{6}{10}——「第二次取到红球」这个无条件概率与是否放回无关,变的只是它与第一次结果的关联方式。
12.2.2 独立性
分析例 12.6,在放回抽样中 P(B)=P(B\mid A),而在不放回抽样中 P(B)\neq P(B\mid A). 其实这是很自然的,因为在放回抽样中,不管第一次抽到红球还是抽到绿球,第二次抽取时袋中都是 10 个球,其中 6 个是红的. 因此第一次是否抽到红球不会影响第二次抽到红球的概率. 也就是说,事件 B 发生的概率与 A 是否发生无关. 而在不放回抽样中,情况就不同了. 显然,如果第一次抽到红球,那么第二次抽到红球的概率要小些;如果第一次抽到绿球,则第二次抽到红球的概率要大些. 也就是说,事件 B 发生的概率与 A 是否发生有关. 在前一种情况下,称事件 A 和 B 相互独立. 而后一种情况事件 A 和 B 不相互独立.
由乘法公式,当 P(A)>0 时,P(B)=P(B\mid A) 当且仅当 P(AB)=P(A)P(B). 而后者也可以适用于 P(A)(及 P(B))为 0 的情况. 于是,有下述定义.
定义 12.3 如果 P(AB)=P(A)P(B),则称事件 A 和 B 相互独立.
对于具体的问题往往是根据经验或直觉来判断两个事件是否是相互独立的. 更准确地说,是根据经验或直觉来合理地假设两个事件是相互独立的.
解读:定义用 P(AB)=P(A)P(B) 而不是 P(B)=P(B\mid A),是因为后者要求 P(A)>0 且形式不对称。乘法形式对 P(A)=0 或 P(B)=0 也照样成立,并且一眼看出 A 与 B 的地位对等。互不相容与相互独立是完全不同的两回事:互不相容说的是不能同时发生,独立说的是一个发生不改变另一个的概率。
例 12.7 两战士打靶,已知甲的命中率为 0.9,乙的命中率为 0.7. 两人同时射击同一个目标,各打一枪. 求目标被击中的概率.
解 设 A:甲击中目标;B:乙击中目标. 可以假设两人是否击中目标都不影响对方是否击中目标,即 A 与 B 相互独立. 于是,由加法公式,目标被击中的概率为
相互独立的概念可以推广到 3 个和 3 个以上事件.
定义 12.4 设 n 个事件 A_1,A_2,\cdots,A_n,n\geqslant 3. 如果对任意的正整数 k\leqslant n 和 1\leqslant i_1<i_2<\cdots<i_k\leqslant n,
则称这 n 个事件相互独立.
解读:注意这里要求的是任意 k 个(k=2,3,\cdots,n)都满足乘积等式,而不只是两两。两两独立推不出相互独立:三个事件可以两两独立,却仍然让 P(A_1A_2A_3)\neq P(A_1)P(A_2)P(A_3)。所以定义里那个「任意 k」不能省。
可以证明:若 A 与 B 相互独立,则 A 与 \bar B,\bar A 与 B,\bar A 与 \bar B 都相互独立(见习题 12.16).
对于 n 个事件有类似的结论. 设 A_1,A_2,\cdots,A_n 相互独立,则将其中的任意若干个事件换成它们的逆事件后也相互独立.
12.2.3 伯努利概型与二项概率公式
在相同的条件下重复进行 n 次试验,每次试验的结果只有两个:事件 A 发生或不发生,且各次试验是相互独立的,则称这 n 次试验为伯努利概型.
定理 12.2(二项概率公式) 设在伯努利概型中每次试验事件 A 发生的概率为 p(0<p<1),则在 n 次试验中 A 恰好发生 k(0\leqslant k\leqslant n) 次的概率为
由于 \binom{n}{k}p^kq^{n-k} 正好是 (p+q)^n 的展开式中的第 k+1 项,故称此式为二项概率公式.
证明 由试验的独立性,事件 A 在指定的 k 次试验中发生且在其余的 n-k 次试验中不发生的概率为 p^kq^{n-k},而 n 次试验中任意地指定 k 次试验有 \binom{n}{k} 种可能,故
解读:二项公式的推导只用了两件事:独立性让「指定 k 次发生、其余不发生」这个特定序列的概率直接乘成 p^kq^{n-k};等可能性让所有含 k 次发生的序列概率相同,于是乘上序列个数 \binom{n}{k}。少了独立性这一步,乘积就写不出来。
例 12.8 一台工作站有 10 个终端. 假设每个终端的使用率为 \frac{1}{3} 且是否使用是相互独立的,求:
(1) 恰好有 5 个终端在使用的概率.
(2) 至少有一个终端在使用的概率.
解 (1) 由二项概率公式,恰好有 5 个终端在使用的概率为
(2) 至少有一个终端在使用的概率为
解读:第 (2) 问用「至少有一个」的对立事件「一个都没有」来算,把 10 项求和压成 1 项。凡遇到「至少」「至多」的字样,先想对立事件,这是二项概率计算里最省事的技巧。