Article

概率论-CH6-集中不等式与大数定理

概率论-CH6-集中不等式与大数定理,待补充摘要。

May 27, 2026 修考 37 min read

https://www.eecs70.org/assets/pdf/notes/n19.pdf

集中不等式与大数定理 (Concentration Inequalities & LLN)

本篇笔记基于 UC Berkeley CS 70 概率论部分,结合手写笔记的逻辑进行整理与深度润色。旨在用最直观的语言解释核心定理的推导,解决学习中的疑难点。

目录

  1. 核心背景与问题引入
  2. 马尔可夫不等式 (Markov’s Inequality)
  3. 切比雪夫不等式 (Chebyshev’s Inequality)
  4. 应用:估计值偏离的界限 (Estimating Bias)
  5. 弱大数定理 (Weak Law of Large Numbers)

1. 核心背景与问题引入

1.1 什么是大数定理?

大数定理(Law of Large Numbers)是我们日常经验的数学化描述:随着实验次数 nn 的增加,样本的平均值会越来越接近其理论期望值 μ\mu

  • 直观例子:假设我们有一枚硬币,其真实的正面概率为 pp(此参数未知)。我们将其抛掷 nn 次,观察到正面朝上的总次数为 SnS_n

  • 根据二项分布,正面朝上次数的期望值为 E[Sn]=np\mathbb{E}[S_n] = np

  • 我们用样本均值(Sample Average) p^=Snn\hat{p} = \frac{S_n}{n} 作为对真实概率 pp 的估计值。

  • 根据期望的线性性质,这个估计是无偏的:

    E[p^]=E[Snn]=1nE[Sn]=1n(np)=p\mathbb{E}[\hat{p}] = \mathbb{E}\left[\frac{S_n}{n}\right] = \frac{1}{n}\mathbb{E}[S_n] = \frac{1}{n}(np) = p

  • 为什么要抛很多次硬币,而不是只抛一次? 因为抛的次数 nn 越多,估计值 p^\hat{p} 偏离真实值 pp 的可能性就越小。

1.2 误差区间与置信度:nn 应该取多大?

如果我们希望估计误差在 ϵ\epsilon 以内(即 p^pϵ|\hat{p} - p| \le \epsilon),我们需要多大的样本量 nn

  • 痛点纠正:我们不可能“完全百分之百”保证估计值落在误差区间内。因为即使硬币是均匀的(p=0.5p=0.5),在极小概率下,我们也有可能连续抛出 nn 次正面(概率为 0.5n0.5^n),此时 p^=1\hat{p}=1,误差极大。

  • 妥协方案:我们不要求“绝对保证”,而是要求“高概率保证”。引入置信度(Confidence) 1δ1-\delta,即:

    P[p^pϵ]1δ\mathbb{P}[|\hat{p} - p| \le \epsilon] \ge 1 - \delta

    或者等价地,限制估计失败(偏离均值超过 ϵ\epsilon)的概率在 δ\delta 以内:

    P[p^pϵ]δ\mathbb{P}[|\hat{p} - p| \ge \epsilon] \le \delta

💡 核心公式:如何记住样本量 nn 的下界?

在后续的推导中,我们会得到一个非常著名的样本量界限公式:

n14ϵ2δn \ge \frac{1}{4\epsilon^2\delta}

学习助手提示:你提到“我记不住这个公式”。别担心!这个公式并不是凭空产生的,

它是由切比雪夫不等式推导出来的。在 第 4 节 中,我们会一步步推导它。

理解了它的来龙去脉,你就再也不需要死记硬背了!

2. 马尔可夫不等式 (Markov’s Inequality)

马尔可夫不等式是集中不等式中最基础的一个,它仅适用于非负随机变量

2.1 定理内容

XX 是一个非负随机变量(即对所有样本点, X(ω)0X(\omega) \ge 0),且其期望 E[X]\mathbb{E}[X] 存在。则对于任意常数 c>0c > 0

P[Xc]E[X]c\mathbb{P}[X \ge c] \le \frac{\mathbb{E}[X]}{c}

  • 直观物理理解:如果大家的平均财富是 1 万元(E[X]=1\mathbb{E}[X]=1),那么拥有至少 5 万元(c=5c=5)的人数比例不可能超过 15=20%\frac{1}{5} = 20\%。如果超过了 20%20\%,哪怕其他所有人的财富都是 0,总体的平均财富也会超过 1 万元,这与事实矛盾。

2.2 两种证明方法详解(带你彻底看懂)

学习助手提示:你提到“两种证明方法我没怎么看明白”。我们用最直观、展开的方式重新推导它们。

证明方法一:代数求和/积分法(最经典、直观)

假设 XX 是离散随机变量,其值域为 A\mathcal{A}(因为 XX 非负,所以 A\mathcal{A} 中的元素都 0\ge 0)。 我们要计算 XX 的期望 E[X]\mathbb{E}[X]。根据期望的定义,我们将求和拆分为“小于 cc”和“大于等于 cc”两部分:

E[X]=aAaP[X=a] =a<caP[X=a]+acaP[X=a]\begin{aligned} \mathbb{E}[X] &= \sum_{a \in \mathcal{A}} a \cdot \mathbb{P}[X = a] \ &= \sum_{a < c} a \cdot \mathbb{P}[X = a] + \sum_{a \ge c} a \cdot \mathbb{P}[X = a] \end{aligned}

现在我们进行两步“缩放”:

  1. 因为所有 a0a \ge 0,第一项 a<caP[X=a]0\sum_{a < c} a \cdot \mathbb{P}[X = a] \ge 0。如果直接扔掉第一项,求和的值只会变小(或不变):

    E[X]acaP[X=a]\mathbb{E}[X] \ge \sum_{a \ge c} a \cdot \mathbb{P}[X = a]

  2. 对于在第二项中求和的所有 aa,它们都满足 aca \ge c。如果我们把所有的 aa 替换成更小的常数 cc,整个和式会进一步变小(或不变):

    E[X]accP[X=a]=cacP[X=a]\mathbb{E}[X] \ge \sum_{a \ge c} c \cdot \mathbb{P}[X = a] = c \sum_{a \ge c} \mathbb{P}[X = a]

由于 acP[X=a]\sum_{a \ge c} \mathbb{P}[X = a] 恰好就是随机变量 XcX \ge c 的概率 P[Xc]\mathbb{P}[X \ge c],我们得到:

E[X]cP[Xc]\mathbb{E}[X] \ge c \cdot \mathbb{P}[X \ge c]

两边同除以 cc(因为 c>0c > 0),即得证:

P[Xc]E[X]c\mathbb{P}[X \ge c] \le \frac{\mathbb{E}[X]}{c}

证明方法二:指示随机变量法(最现代、简洁)

首先引入指示随机变量(Indicator Random Variable)。对于事件 E\mathcal{E},定义: IE={1,若 E 发生 0,若 E 未发生I{\mathcal{E}} = \begin{cases} 1, & \text{若 } \mathcal{E} \text{ 发生} \ 0, & \text{若 } \mathcal{E} \text{ 未发生} \end{cases} 它的一个关键性质是:其期望值等于该事件发生的概率,即 E[I{E}]=P[E]\mathbb{E}[I\{\mathcal{E}\}] = \mathbb{P}[\mathcal{E}]

对于任意样本点 ω\omega,因为 X(ω)0X(\omega) \ge 0c>0c > 0,我们有以下必然成立的不等式:

X(ω)cI{X(ω)c}X(\omega) \ge c \cdot I\{X(\omega) \ge c\}

  • 为什么成立?分两种情况验证
    1. X(ω)<cX(\omega) < c,则指示变量为 00,右边为 c0=0c \cdot 0 = 0。显然 X(ω)0X(\omega) \ge 0 成立。
    2. X(ω)cX(\omega) \ge c,则指示变量为 11,右边为 c1=cc \cdot 1 = c。显然 X(ω)cX(\omega) \ge c 成立。

既然在每一个样本点上,左边的函数值都大于等于右边,那么它们的期望也必然满足同样的大小关系(期望单调性):

E[X]E[cI{Xc}]\mathbb{E}[X] \ge \mathbb{E}[c \cdot I\{X \ge c\}]

利用期望的线性性质,把常数 cc 提出来,并将指示变量的期望换写为概率:

E[X]cE[I{Xc}]=cP[Xc]\mathbb{E}[X] \ge c \cdot \mathbb{E}[I\{X \ge c\}] = c \cdot \mathbb{P}[X \ge c]

同除以 cc 即得证:

P[Xc]E[X]c\mathbb{P}[X \ge c] \le \frac{\mathbb{E}[X]}{c}

2.3 经典例题:抛硬币的马尔可夫上界

【题目】 抛掷一枚均匀的硬币 nn 次,用 XX 表示正面朝上的次数。求观察到正面朝上次数超过 34n\frac{3}{4}n 的概率上界。

【解析过程】

  1. 确定分布与期望: 硬币正面朝上次数 XX 服从二项分布 XBinomial(n,0.5)X \sim \text{Binomial}(n, 0.5)。(此处手写笔记中写成了超几何分布,需要修正为二项分布,因为每次抛硬币是相互独立的重复实验)。 所以期望值为:

    E[X]=np=12n\mathbb{E}[X] = n \cdot p = \frac{1}{2}n

  2. 应用马尔可夫不等式: 因为 X0X \ge 0 恒成立,且常数 c=34n>0c = \frac{3}{4}n > 0,可直接代入公式:

    P[X34n]E[X]34n=12n34n=23\mathbb{P}\left[X \ge \frac{3}{4}n\right] \le \frac{\mathbb{E}[X]}{\frac{3}{4}n} = \frac{\frac{1}{2}n}{\frac{3}{4}n} = \frac{2}{3}

  3. 结果分析与“不等式与实际的区别”

    • 通过马尔可夫不等式得到的概率上界是 230.667\frac{2}{3} \approx 0.667,这个界限完全不依赖于抛掷次数 nn

    • 但实际概率是多少呢?根据二项分布的精确求和公式:

      P[X34n]=k=34nn(nk)(12)n\mathbb{P}\left[X \ge \frac{3}{4}n\right] = \sum_{k=\lceil \frac{3}{4}n \rceil}^{n} \binom{n}{k} \left(\frac{1}{2}\right)^n

      • n=10n = 10 时,实际概率约为 5.5×102=0.0555.5 \times 10^{-2} = 0.055
      • n=100n = 100 时,实际概率约为 2.8×1072.8 \times 10^{-7}
    • 结论:随着 nn 增大,实际概率会呈指数级衰减。然而马尔可夫不等式给出的界依然死板地停留在 23\frac{2}{3}。这说明马尔可夫不等式给出的上界非常宽松(Loose),它没有考虑方差,因此无法捕捉随着样本量增大而产生的“集中效应”

3. 切比雪夫不等式 (Chebyshev’s Inequality)

为了解决马尔可夫不等式过于宽松的问题,我们引入了考虑方差(衡量数据散布程度的工具)的切比雪夫不等式。

3.1 定理内容

XX 是一个具有有限期望值 E[X]=μ\mathbb{E}[X] = \mu 和有限方差 Var(X)Var(X) 的任意随机变量。则对任意常数 c>0c > 0

P[Xμc]Var(X)c2\mathbb{P}[|X - \mu| \ge c] \le \frac{Var(X)}{c^2}

  • 直观物理理解:随机变量偏离其均值 μ\mu 的距离超过 cc 的概率,绝对不会超过它的方差除以 c2c^2。偏离的阈值 cc 越大,不确定性(概率)就以二次方的速度迅速衰减。

3.2 证明推导

切比雪夫不等式的妙处在于,它实际上就是对一个精心构造的非负随机变量应用马尔可夫不等式

  1. 定义一个新的随机变量 Y=(Xμ)2Y = (X - \mu)^2

    • 因为任何实数的平方都是非负的,所以 YY 必然是一个非负随机变量Y0Y \ge 0)。
    • 根据方差的定义,其期望值为:E[Y]=E[(Xμ)2]=Var(X)\mathbb{E}[Y] = \mathbb{E}[(X - \mu)^2] = Var(X)
  2. 注意到以下两个事件是完全等价的:

    {Xμc}    {(Xμ)2c2}    {Yc2}\{|X - \mu| \ge c\} \iff \left\{(X - \mu)^2 \ge c^2\right\} \iff \{Y \ge c^2\}

    所以它们的概率也完全相同:

    P[Xμc]=P[Yc2]\mathbb{P}[|X - \mu| \ge c] = \mathbb{P}[Y \ge c^2]

  3. 因为 YY 非负,且常数 c2>0c^2 > 0,我们对 YY 应用马尔可夫不等式

    P[Yc2]E[Y]c2\mathbb{P}[Y \ge c^2] \le \frac{\mathbb{E}[Y]}{c^2}

  4. E[Y]=Var(X)\mathbb{E}[Y] = Var(X) 代回,即得证:

    P[Xμc]Var(X)c2\mathbb{P}[|X - \mu| \ge c] \le \frac{Var(X)}{c^2}

3.3 经典例题:重新讨论硬币问题

【题目】 抛掷一枚均匀硬币 nn 次,用 XX 表示正面朝上的次数。利用切比雪夫不等式求 P[X34n]\mathbb{P}[X \ge \frac{3}{4}n] 的上界。

【解析过程】

  1. 计算均值与方差: 由于 XBinomial(n,0.5)X \sim \text{Binomial}(n, 0.5),我们有:

    • 期望 μ=E[X]=n2\mu = \mathbb{E}[X] = \frac{n}{2}
    • 方差 Var(X)=np(1p)=n1212=n4Var(X) = n \cdot p \cdot (1-p) = n \cdot \frac{1}{2} \cdot \frac{1}{2} = \frac{n}{4}
  2. 将单边概率转化为双边绝对值概率: 我们想估算 X34nX \ge \frac{3}{4}n 的概率。注意到当 X34nX \ge \frac{3}{4}n 时,它偏离期望的距离为 Xn2n4X - \frac{n}{2} \ge \frac{n}{4}。 因此,单边事件是双边偏差事件的子集:

    P[X34n]=P[Xn2n4]P[Xn2n4]\mathbb{P}\left[X \ge \frac{3}{4}n\right] = \mathbb{P}\left[X - \frac{n}{2} \ge \frac{n}{4}\right] \le \mathbb{P}\left[\left|X - \frac{n}{2}\right| \ge \frac{n}{4}\right]

  3. 应用切比雪夫不等式: 这里偏差阈值 c=n4c = \frac{n}{4}。代入公式得:

    P[Xn2n4]Var(X)c2=n4(n4)2=1n4=4n\mathbb{P}\left[\left|X - \frac{n}{2}\right| \ge \frac{n}{4}\right] \le \frac{Var(X)}{c^2} = \frac{\frac{n}{4}}{\left(\frac{n}{4}\right)^2} = \frac{1}{\frac{n}{4}} = \frac{4}{n}

  4. 结论对比

    • 切比雪夫上界为 4n\frac{4}{n}
    • 对比马尔可夫:马尔可夫给出的上界是常数 23\frac{2}{3},而切比雪夫给出的上界随 nn 的增大而逐渐减小(当 n=100n=100 时,上界仅为 0.040.04)。这明显是一个好得多的界!

4. 应用:估计值偏离的界限 (Estimating Bias)

学习助手提示:你提到“这个例题的求解没太看明白,但很重要”。这就是课本核心应用部分——如何用抛硬币估计概率 pp,并推导出那个“记不住”的样本量公式。我们在此进行最细致的拆解:

4.1 问题建模与方差推导

我们有独立同分布(i.i.d.)的硬币抛掷结果 X1,X2,,XnX_1, X_2, \dots, X_n,其中每次抛掷 Xi{0,1}X_i \in \{0, 1\},且 P[Xi=1]=p\mathbb{P}[X_i = 1] = p

  • 单次抛掷的均值与方差

    E[Xi]=p\mathbb{E}[X_i] = p

    Var(Xi)=p(1p)Var(X_i) = p(1-p)

  • 样本均值的期望

    p^=Snn=1ni=1nXi    E[p^]=p\hat{p} = \frac{S_n}{n} = \frac{1}{n}\sum_{i=1}^n X_i \implies \mathbb{E}[\hat{p}] = p

  • 样本均值的方差(注意常数提到方差外面要平方,且独立变量相加方差也相加):

    Var(p^)=Var(1ni=1nXi)=1n2i=1nVar(Xi)=1n2np(1p)=p(1p)nVar(\hat{p}) = Var\left(\frac{1}{n}\sum_{i=1}^n X_i\right) = \frac{1}{n^2} \sum_{i=1}^n Var(X_i) = \frac{1}{n^2} \cdot n \cdot p(1-p) = \frac{p(1-p)}{n}

4.2 核心不等式推导

我们希望估计偏离误差超过 ϵ\epsilon 的概率被控制在 δ\delta 以内。直接对 p^\hat{p} 应用切比雪夫不等式

P[p^pϵ]Var(p^)ϵ2=p(1p)nϵ2\mathbb{P}[|\hat{p} - p| \ge \epsilon] \le \frac{Var(\hat{p})}{\epsilon^2} = \frac{p(1-p)}{n\epsilon^2}

为了实现置信度要求,我们只要让这个概率的上界小于等于 δ\delta 即可:

p(1p)nϵ2δ    np(1p)ϵ2δ\frac{p(1-p)}{n\epsilon^2} \le \delta \implies n \ge \frac{p(1-p)}{\epsilon^2\delta}

4.3 为什么最大化 p(1p)p(1-p) 得到常数 14\frac{1}{4}

在实际情况中,真实的 pp 正是我们想要去估计的未知数,我们根本不知道 p(1p)p(1-p) 是多少! 为了保证在任何可能的真实 pp 下,我们的样本量 nn 都足够大,我们需要采用最坏情况(Worst-case),即寻找 p(1p)p(1-p) 的最大可能值。

  • 极值推导: 设函数 f(p)=p(1p)=pp2f(p) = p(1-p) = p - p^2,其中 0p10 \le p \le 1。 求导数并令其为 0:

    f(p)=12p=0    p=12f'(p) = 1 - 2p = 0 \implies p = \frac{1}{2}

    因为二阶导数 f(p)=2<0f''(p) = -2 < 0,所以在 p=12p=\frac{1}{2} 处取得极大值(也是最大值):

    maxpp(1p)=12(112)=14\max_{p} p(1-p) = \frac{1}{2}\left(1 - \frac{1}{2}\right) = \frac{1}{4}

  • 最保守的样本量界限: 既然对任意 pp,都有 p(1p)14p(1-p) \le \frac{1}{4},我们直接把 p(1p)p(1-p) 替换成其最大上限 14\frac{1}{4}

    np(1p)ϵ2δ    n1/4ϵ2δ=14ϵ2δn \ge \frac{p(1-p)}{\epsilon^2\delta} \impliedby n \ge \frac{1/4}{\epsilon^2\delta} = \frac{1}{4\epsilon^2\delta}

这就是公式 n14ϵ2δn \ge \frac{1}{4\epsilon^2\delta} 的完整诞生过程!

4.4 补充应用例题(巩固理解)

学习助手提示:为你补充一个简单的数值例题,帮助你切实掌握公式应用。

【题目】 民意调查机构想要估算大选中某候选人的支持率 pp。要求估计值 p^\hat{p} 与真实支持率 pp 的误差不超过 0.050.05(即 ϵ=0.05\epsilon = 0.05)的概率至少为 95%95\%(即置信度 1δ=0.951-\delta = 0.95,得出置信失败允许的最大概率 δ=0.05\delta = 0.05)。请问最少需要随机电话采访多少位选民?

【解析过程】

  1. 明确已知参数

    • 允许误差极限 ϵ=0.05\epsilon = 0.05
    • 允许失败概率 δ=10.95=0.05\delta = 1 - 0.95 = 0.05
  2. 套用推导出的样本量下界公式

    n14ϵ2δn \ge \frac{1}{4\epsilon^2\delta}

  3. 代入具体数值计算

    n14(0.05)20.05=140.00250.05=10.010.05=10.0005=2000n \ge \frac{1}{4 \cdot (0.05)^2 \cdot 0.05} = \frac{1}{4 \cdot 0.0025 \cdot 0.05} = \frac{1}{0.01 \cdot 0.05} = \frac{1}{0.0005} = 2000

  4. 答案: 最少需要调查 20002000 位选民。 (值得注意的是,这个选民样本量的大小完全不依赖于整个国家总人口的多寡。)

5. 弱大数定理 (Weak Law of Large Numbers)

通过切比雪夫不等式,我们终于可以严谨地证明弱大数定理。

5.1 定理内容

X1,X2,X_1, X_2, \dots 是一组独立同分布(i.i.d.)的随机变量序列,它们具有共同的有限期望 E[Xi]=μ\mathbb{E}[X_i] = \mu 和有限方差 Var(Xi)=σ2Var(X_i) = \sigma^2。 用 Sn=X1++XnS_n = X_1 + \dots + X_n 表示前 nn 项和,则对任意给定的任意小的误差 ϵ>0\epsilon > 0

P[1nSnμϵ]0(当 n 时)\mathbb{P}\left[\left|\frac{1}{n}S_n - \mu\right| \ge \epsilon\right] \to 0 \quad (\text{当 } n \to \infty \text{ 时})

5.2 证明推导

  1. 计算样本均值 Xˉn=1nSn\bar{X}_n = \frac{1}{n}S_n 的均值和方差:

    • E[Xˉn]=μ\mathbb{E}[\bar{X}_n] = \mu
    • Var(Xˉn)=σ2nVar(\bar{X}_n) = \frac{\sigma^2}{n}
  2. Xˉn\bar{X}_n 直接应用切比雪夫不等式

    P[1nSnμϵ]Var(Xˉn)ϵ2=σ2nϵ2\mathbb{P}\left[\left|\frac{1}{n}S_n - \mu\right| \ge \epsilon\right] \le \frac{Var(\bar{X}_n)}{\epsilon^2} = \frac{\sigma^2}{n\epsilon^2}

  3. nn \to \infty。由于 σ2\sigma^2ϵ2\epsilon^2 是固定的常数,当分母中的 nn 趋于无穷大时,右侧的上界趋于 0:

    limnσ2nϵ2=0\lim_{n\to\infty} \frac{\sigma^2}{n\epsilon^2} = 0

  4. 因为概率值不可能为负数,夹逼定理可证:

    limnP[1nSnμϵ]=0\lim_{n\to\infty} \mathbb{P}\left[\left|\frac{1}{n}S_n - \mu\right| \ge \epsilon\right] = 0

定理直观结语:只要我们取样足够多,样本均值与理论均值产生任何细微偏差(ϵ\epsilon)的概率,在极限下都将归于零。


集中不等式与大数定律:教材经典习题精析

本学习文件精心挑选了日本概率论教材中与《集中不等式与大数定理》高度匹配的 3 道核心习题。每道题均配有日汉双语对照直观的解题思路严谨的数学推导以及方法论总结,旨在帮助你彻底攻克学习难关。

习题一:馬爾可夫与切比雪夫不等式的通用推导 (問題 49)

1.1 日语原题 (Original Textbook Text)

問題 49 (確率不等式と大数の弱法則)

(1) 確率変数 XX の確率密度関数を f(x)f(x) とする。任意の非負値関数 h(x)0h(x) \ge 0 と、任意の定数 a>0a > 0 に対して、次を示せ。

P[h(X)a]E[h(X)]a\mathbb{P}[h(X) \ge a] \le \frac{\mathbb{E}[h(X)]}{a}

(2) (1) を用いて、平均 μ\mu、分散 σ2\sigma^2 をもつ任意の確率変数 XX に対するチェビシェフの不等式:

P[Xμk]σ2k2(k>0)\mathbb{P}[|X - \mu| \ge k] \le \frac{\sigma^2}{k^2} \quad (k > 0)

を証明せよ。

(3) 互いに独立に平均 μ\mu、分散 σ2\sigma^2 の同一の分布に従う確率変数序列 X1,X2,,XnX_1, X_2, \dots, X_n に対し、大数の弱法則:

limnP[X1+X2++Xnnμϵ]=0(ϵ>0)\lim_{n \to \infty} \mathbb{P}\left[\left|\frac{X_1 + X_2 + \dots + X_n}{n} - \mu\right| \ge \epsilon\right] = 0 \quad (\epsilon > 0)

を示せ。

1.2 中文翻译

问题 49 (概率不等式与大数弱定律)

(1) 设 XX 的概率密度函数为 f(x)f(x)。对于任意非负函数 h(x)0h(x) \ge 0 和任意常数 a>0a > 0,证明:

P[h(X)a]E[h(X)]a\mathbb{P}[h(X) \ge a] \le \frac{\mathbb{E}[h(X)]}{a}

(2) 利用 (1) 的结论,证明具有均值 μ\mu、方差 σ2\sigma^2 的任意随机变量 XX 均满足切比雪夫不等式:

P[Xμk]σ2k2(k>0)\mathbb{P}[|X - \mu| \ge k] \le \frac{\sigma^2}{k^2} \quad (k > 0)

(3) 设 X1,X2,,XnX_1, X_2, \dots, X_n 是独立同分布(i.i.d.)的随机变量序列,其共同均值为 μ\mu,共同方差为 σ2\sigma^2。证明大数弱定律:

limnP[X1+X2++Xnnμϵ]=0(ϵ>0)\lim_{n \to \infty} \mathbb{P}\left[\left|\frac{X_1 + X_2 + \dots + X_n}{n} - \mu\right| \ge \epsilon\right] = 0 \quad (\epsilon > 0)

1.3 详细解答过程 (Step-by-Step Solution)

第一问证明:广义马尔可夫不等式

由于 XX 是连续型随机变量(教材本章主题),我们利用其概率密度函数 f(x)f(x) 进行积分推导。 期望 E[h(X)]\mathbb{E}[h(X)] 的定义式为:

E[h(X)]=h(x)f(x)dx\mathbb{E}[h(X)] = \int_{-\infty}^{\infty} h(x) f(x) dx

我们定义实数集上的一个子集 M={xRh(x)a}M = \{x \in \mathbb{R} \mid h(x) \ge a\}。由于 h(x)0h(x) \ge 0f(x)0f(x) \ge 0,我们可以将积分区间拆分为 MMMM 的补集 McM^cE[h(X)]=Mh(x)f(x)dx+Mch(x)f(x)dx Mh(x)f(x)dx(因为在补集 Mc 上 h(x)f(x)0)\begin{aligned} \mathbb{E}[h(X)] &= \int_{M} h(x) f(x) dx + \int_{M^c} h(x) f(x) dx \ &\ge \int_{M} h(x) f(x) dx \quad (\text{因为在补集 } M^c \text{ 上 } h(x)f(x) \ge 0) \end{aligned}

对于属于集合 MM 的所有 xx,根据定义均有 h(x)ah(x) \ge a。我们将积分中的 h(x)h(x) 替换为更小的常数 aa

E[h(X)]Maf(x)dx=aMf(x)dx\mathbb{E}[h(X)] \ge \int_{M} a \cdot f(x) dx = a \int_{M} f(x) dx

根据概率密度的物理意义,在区间 MM 上的积分恰好等于事件 {h(X)a}\{h(X) \ge a\} 发生的概率:

Mf(x)dx=P[h(X)a]\int_{M} f(x) dx = \mathbb{P}[h(X) \ge a]

因此,我们得到:

E[h(X)]aP[h(X)a]\mathbb{E}[h(X)] \ge a \cdot \mathbb{P}[h(X) \ge a]

两边同除以 aa(因为 a>0a > 0),不等式得证:

P[h(X)a]E[h(X)]a\mathbb{P}[h(X) \ge a] \le \frac{\mathbb{E}[h(X)]}{a} \quad \blacksquare

第二问证明:切比雪夫不等式

我们要证明 P[Xμk]σ2k2\mathbb{P}[|X - \mu| \ge k] \le \frac{\sigma^2}{k^2}

  1. 构造辅助函数:令 h(X)=(Xμ)2h(X) = (X - \mu)^2,显然对任意实数,平方值 h(X)0h(X) \ge 0 恒成立。

  2. 设定阈值:令常数 a=k2a = k^2(由于 k>0k > 0,故 a>0a > 0)。

  3. 利用第一问结论

    P[(Xμ)2k2]E[(Xμ)2]k2\mathbb{P}[(X - \mu)^2 \ge k^2] \le \frac{\mathbb{E}[(X - \mu)^2]}{k^2}

  4. 化简不等式

    • 左侧事件:(Xμ)2k2    Xμk(X - \mu)^2 \ge k^2 \iff |X - \mu| \ge k
    • 右侧期望:根据方差的定义,E[(Xμ)2]=Var(X)=σ2\mathbb{E}[(X - \mu)^2] = Var(X) = \sigma^2

    直接代入即得:

    P[Xμk]σ2k2\mathbb{P}[|X - \mu| \ge k] \le \frac{\sigma^2}{k^2} \quad \blacksquare

第三问证明:大数弱定律 (WLLN)

  1. 构建样本均值变量: 设样本均值为 Xˉn=X1+X2++Xnn\bar{X}_n = \frac{X_1 + X_2 + \dots + X_n}{n}

  2. 计算其期望与方差

    • 期望的线性性质:

      E[Xˉn]=E[1ni=1nXi]=1ni=1nE[Xi]=1n(nμ)=μ\mathbb{E}[\bar{X}_n] = \mathbb{E}\left[\frac{1}{n}\sum_{i=1}^n X_i\right] = \frac{1}{n}\sum_{i=1}^n \mathbb{E}[X_i] = \frac{1}{n} (n\mu) = \mu

    • 独立变量方差的性质:

      Var(Xˉn)=Var(1ni=1nXi)=1n2i=1nVar(Xi)=1n2(nσ2)=σ2nVar(\bar{X}_n) = Var\left(\frac{1}{n}\sum_{i=1}^n X_i\right) = \frac{1}{n^2} \sum_{i=1}^n Var(X_i) = \frac{1}{n^2} (n\sigma^2) = \frac{\sigma^2}{n}

  3. Xˉn\bar{X}_n 应用切比雪夫不等式: 对于任意给定的 ϵ>0\epsilon > 0,将 Xˉn\bar{X}_n 的期望 μ\mu 和方差 σ2n\frac{\sigma^2}{n} 代入:

    P[Xˉnμϵ]Var(Xˉn)ϵ2=σ2nϵ2\mathbb{P}[|\bar{X}_n - \mu| \ge \epsilon] \le \frac{Var(\bar{X}_n)}{\epsilon^2} = \frac{\sigma^2}{n\epsilon^2}

  4. 求极限: 由于 σ2\sigma^2ϵ2\epsilon^2 是常数,当 nn \to \infty 时:

    limnσ2nϵ2=0\lim_{n\to\infty} \frac{\sigma^2}{n\epsilon^2} = 0

    因此:

    limnP[X1+X2++Xnnμϵ]=0\lim_{n \to \infty} \mathbb{P}\left[\left|\frac{X_1 + X_2 + \dots + X_n}{n} - \mu\right| \ge \epsilon\right] = 0 \quad \blacksquare

习题二:大数定律的极限定理计算应用 (問題 47)

2.1 日语原题 (Original Textbook Text)

問題 47 (大数の法則の応用)

X1,X2,X_1, X_2, \dots は互いに独立に、同一の分布に従う確率変数で、その平均は E[X1]=μ\mathbb{E}[X_1] = \mu、二乗の期待値は E[X12]=α\mathbb{E}[X_1^2] = \alpha(ただし α>0\alpha > 0)とする。 このとき、次の極限値を求めよ。

limnX1+X2++XnX12+X22++Xn2\lim_{n \to \infty} \frac{X_1 + X_2 + \dots + X_n}{X_1^2 + X_2^2 + \dots + X_n^2}

2.2 中文翻译

问题 47 (大数定律的应用)

X1,X2,X_1, X_2, \dots 是独立同分布的随机变量序列,其共同均值为 E[X1]=μ\mathbb{E}[X_1] = \mu,共同二阶矩(平方的期望)为 E[X12]=α\mathbb{E}[X_1^2] = \alpha(其中 α>0\alpha > 0)。 求以下随机变量序列的极限值:

limnX1+X2++XnX12+X22++Xn2\lim_{n \to \infty} \frac{X_1 + X_2 + \dots + X_n}{X_1^2 + X_2^2 + \dots + X_n^2}

2.3 详细解答过程 (Step-by-Step Solution)

第一步:代数变换(同除以 nn

由于极限式中的分子和分母都随着 nn \to \infty 而发散,我们无法直接求极限。数学上的经典技巧是:将分子和分母同时除以 nn,构造出“样本均值”的形式:

Yn=X1+X2++XnX12+X22++Xn2=1ni=1nXi1ni=1nXi2Y_n = \frac{X_1 + X_2 + \dots + X_n}{X_1^2 + X_2^2 + \dots + X_n^2} = \frac{\frac{1}{n}\sum_{i=1}^n X_i}{\frac{1}{n}\sum_{i=1}^n X_i^2}

第二步:分子应用大数定律

分子部分 Un=1ni=1nXiU_n = \frac{1}{n}\sum_{i=1}^n X_i 是独立同分布变量 XiX_i 的样本均值。 根据大数定律(LLN),当 nn \to \infty 时,它在概率上收敛于其期望值:

UnPE[X1]=μU_n \xrightarrow{\mathbb{P}} \mathbb{E}[X_1] = \mu

第三步:分母应用大数定律

分母部分 Vn=1ni=1nXi2V_n = \frac{1}{n}\sum_{i=1}^n X_i^2 可以看作是一组新随机变量 Wi=Xi2W_i = X_i^2 的样本均值。 因为 X1,X2,X_1, X_2, \dots 独立同分布,所以其平方序列 X12,X22,X_1^2, X_2^2, \dots 也必定是独立同分布的。 该新序列的期望值为:

E[W1]=E[X12]=α\mathbb{E}[W_1] = \mathbb{E}[X_1^2] = \alpha

根据大数定律(LLN),分母在概率上收敛于:

VnPE[X12]=αV_n \xrightarrow{\mathbb{P}} \mathbb{E}[X_1^2] = \alpha

第四步:利用连续映射定理(Continuous Mapping Theorem)合并极限

UnPμU_n \xrightarrow{\mathbb{P}} \muVnPαV_n \xrightarrow{\mathbb{P}} \alpha(其中 α>0\alpha > 0),则根据极限的代数性质,它们的商也收敛于极限值的商:

limnYn=limnUnlimnVn=μα\lim_{n \to \infty} Y_n = \frac{\lim_{n \to \infty} U_n}{\lim_{n \to \infty} V_n} = \frac{\mu}{\alpha}

【本题答案】

μα(或 μσ2+μ2)\frac{\mu}{\alpha} \quad \left(\text{或 } \frac{\mu}{\sigma^2 + \mu^2}\right)

习题三:硬币投掷中集中不等式界限的精确对比 (問題 33)

3.1 日语原题 (Original Textbook Text)

問題 33 (不等式の評価の比較)

公正なコインを n=100n = 100 回投げるとき、表が出る回数を XX とする。

(1) マルコフの不等式を用いて、P[X75]\mathbb{P}[X \ge 75] の上界を求めよ。

(2) チェビシェフの不等式を用いて、P[X5025]\mathbb{P}[|X - 50| \ge 25] の上界を求めよ。これを用いて P[X75]\mathbb{P}[X \ge 75] の上界について何が言えるか。

(3) 二項分布の正規近似(ド・モアブル=ラプラスの定理)を用いて、P[X75]\mathbb{P}[X \ge 75] の実際の近似確率を求めよ。(必要ならば標準正規分布表より Φ(5.0)0.0000003\Phi(5.0) \approx 0.0000003 を用いよ)

3.2 中文翻译

问题 33 (不等式估计的比较)

抛掷一枚均匀的硬币 n=100n = 100 次,用 XX 表示正面朝上的次数。

(1) 使用马尔可夫不等式,求概率 P[X75]\mathbb{P}[X \ge 75] 的上界。

(2) 使用切比雪夫不等式,求概率 P[X5025]\mathbb{P}[|X - 50| \ge 25] 的上界。由此,能对 P[X75]\mathbb{P}[X \ge 75] 的上界做出怎样的推论?

(3) 利用二项分布的德莫佛-拉普拉斯定理(即中心极限定理的二项分布特例,用正态分布逼近),求 P[X75]\mathbb{P}[X \ge 75] 的实际近似概率。对比三者结果。

3.3 详细解答过程 (Step-by-Step Solution)

(1) 马尔可夫不等式求解

XX 表示 100 次投掷中正面朝上的次数,服从二项分布 XBinomial(100,0.5)X \sim \text{Binomial}(100, 0.5)。 由于硬币是均匀的,期望值为:

E[X]=np=100×0.5=50\mathbb{E}[X] = n \cdot p = 100 \times 0.5 = 50

因为 X0X \ge 0 恒成立,我们直接对 c=75c = 75 使用马尔可夫不等式:

P[X75]E[X]75=5075=230.6667\mathbb{P}[X \ge 75] \le \frac{\mathbb{E}[X]}{75} = \frac{50}{75} = \frac{2}{3} \approx 0.6667

(2) 切比雪夫不等式求解

首先计算 XX 的方差:

Var(X)=np(1p)=100×0.5×0.5=25Var(X) = n \cdot p \cdot (1-p) = 100 \times 0.5 \times 0.5 = 25

均值为 μ=50\mu = 50。 使用切比雪夫不等式估计偏离均值至少 2525 的概率(即 c=25c = 25):

P[X5025]Var(X)252=25625=125=0.04\mathbb{P}[|X - 50| \ge 25] \le \frac{Var(X)}{25^2} = \frac{25}{625} = \frac{1}{25} = 0.04

【推论部分】: 由于事件 {X75}\{X \ge 75\} 意味着 X5025X - 50 \ge 25。 这显然是双边偏差事件 {X5025}\{|X - 50| \ge 25\} 的子集。因此其概率一定小于或等于双边概率:

P[X75]P[X5025]0.04\mathbb{P}[X \ge 75] \le \mathbb{P}[|X - 50| \ge 25] \le 0.04

结论:切比雪夫不等式给出的上界为 0.040.04,比马尔可夫的 0.66670.6667 紧密了整整 16.6 倍

(3) 正态近似(实际概率)求解

nn 较大时,二项分布 XBinomial(100,0.5)X \sim \text{Binomial}(100, 0.5) 可由正态分布 N(μ,σ2)\mathcal{N}(\mu, \sigma^2) 近似:

  • μ=50\mu = 50
  • σ=Var(X)=25=5\sigma = \sqrt{Var(X)} = \sqrt{25} = 5

为了让离散变量的近似更精确,我们加入连续性修正(Continuity Correction)(即把 X75X \ge 75 修正为 X74.5X \ge 74.5):

P[X75]P[Xcontinuous74.5]\mathbb{P}[X \ge 75] \approx \mathbb{P}[X_{continuous} \ge 74.5]

将其标准化(Standardization):

Z=Xcontinuousμσ=74.5505=24.55=4.9Z = \frac{X_{continuous} - \mu}{\sigma} = \frac{74.5 - 50}{5} = \frac{24.5}{5} = 4.9

因此:

P[X75]P[Z4.9]=1Φ(4.9)\mathbb{P}[X \ge 75] \approx \mathbb{P}[Z \ge 4.9] = 1 - \Phi(4.9)

由于 Φ(5.0)13×107\Phi(5.0) \approx 1 - 3 \times 10^{-7},我们可以得知该概率数量级大约在:

P[X75]4.8×107=0.00000048\mathbb{P}[X \ge 75] \approx 4.8 \times 10^{-7} = 0.00000048

3.4 极重要:三者对比分析表 (Methodology Comparison)

估计方法概率上界 / 实际值核心使用参数特点分析
马尔可夫不等式0.6667\le 0.6667仅需期望值 E[X]\mathbb{E}[X]极易计算,但非常粗糙,无法随 nn 增大而收紧。
切比雪夫不等式0.0400\le 0.0400期望值 E[X]\mathbb{E}[X] + 方差 Var(X)Var(X)引入了二阶矩,能体现出大样本下的数据集中效应。
正态分布近似0.00000048\approx 0.00000048完整分布形态信息最贴近真实概率。说明在真实世界中,极端偏差发生的概率是以指数级衰减的(切比雪夫的二次方衰减依然是保守估计)。

通过这道题,你可以直观地明白,虽然切比雪夫不等式比马尔可夫不等式优秀得多,但在实际应用中,它依然是一个非常保守的上界约束