https://www.eecs70.org/assets/pdf/notes/n19.pdf
集中不等式与大数定理 (Concentration Inequalities & LLN)
本篇笔记基于 UC Berkeley CS 70 概率论部分,结合手写笔记的逻辑进行整理与深度润色。旨在用最直观的语言解释核心定理的推导,解决学习中的疑难点。
目录
- 核心背景与问题引入
- 马尔可夫不等式 (Markov’s Inequality)
- 切比雪夫不等式 (Chebyshev’s Inequality)
- 应用:估计值偏离的界限 (Estimating Bias)
- 弱大数定理 (Weak Law of Large Numbers)
1. 核心背景与问题引入
1.1 什么是大数定理?
大数定理(Law of Large Numbers)是我们日常经验的数学化描述:随着实验次数 n 的增加,样本的平均值会越来越接近其理论期望值 μ。
-
直观例子:假设我们有一枚硬币,其真实的正面概率为 p(此参数未知)。我们将其抛掷 n 次,观察到正面朝上的总次数为 Sn。
-
根据二项分布,正面朝上次数的期望值为 E[Sn]=np。
-
我们用样本均值(Sample Average) p^=nSn 作为对真实概率 p 的估计值。
-
根据期望的线性性质,这个估计是无偏的:
E[p^]=E[nSn]=n1E[Sn]=n1(np)=p
-
为什么要抛很多次硬币,而不是只抛一次? 因为抛的次数 n 越多,估计值 p^ 偏离真实值 p 的可能性就越小。
1.2 误差区间与置信度:n 应该取多大?
如果我们希望估计误差在 ϵ 以内(即 ∣p^−p∣≤ϵ),我们需要多大的样本量 n?
-
痛点纠正:我们不可能“完全百分之百”保证估计值落在误差区间内。因为即使硬币是均匀的(p=0.5),在极小概率下,我们也有可能连续抛出 n 次正面(概率为 0.5n),此时 p^=1,误差极大。
-
妥协方案:我们不要求“绝对保证”,而是要求“高概率保证”。引入置信度(Confidence) 1−δ,即:
P[∣p^−p∣≤ϵ]≥1−δ
或者等价地,限制估计失败(偏离均值超过 ϵ)的概率在 δ 以内:
P[∣p^−p∣≥ϵ]≤δ
💡 核心公式:如何记住样本量 n 的下界?
在后续的推导中,我们会得到一个非常著名的样本量界限公式:
n≥4ϵ2δ1
学习助手提示:你提到“我记不住这个公式”。别担心!这个公式并不是凭空产生的,
它是由切比雪夫不等式推导出来的。在 第 4 节 中,我们会一步步推导它。
理解了它的来龙去脉,你就再也不需要死记硬背了!
2. 马尔可夫不等式 (Markov’s Inequality)
马尔可夫不等式是集中不等式中最基础的一个,它仅适用于非负随机变量。
2.1 定理内容
设 X 是一个非负随机变量(即对所有样本点, X(ω)≥0),且其期望 E[X] 存在。则对于任意常数 c>0:
P[X≥c]≤cE[X]
- 直观物理理解:如果大家的平均财富是 1 万元(E[X]=1),那么拥有至少 5 万元(c=5)的人数比例不可能超过 51=20%。如果超过了 20%,哪怕其他所有人的财富都是 0,总体的平均财富也会超过 1 万元,这与事实矛盾。
2.2 两种证明方法详解(带你彻底看懂)
学习助手提示:你提到“两种证明方法我没怎么看明白”。我们用最直观、展开的方式重新推导它们。
证明方法一:代数求和/积分法(最经典、直观)
假设 X 是离散随机变量,其值域为 A(因为 X 非负,所以 A 中的元素都 ≥0)。 我们要计算 X 的期望 E[X]。根据期望的定义,我们将求和拆分为“小于 c”和“大于等于 c”两部分:
E[X]=a∈A∑a⋅P[X=a] =a<c∑a⋅P[X=a]+a≥c∑a⋅P[X=a]
现在我们进行两步“缩放”:
-
因为所有 a≥0,第一项 ∑a<ca⋅P[X=a]≥0。如果直接扔掉第一项,求和的值只会变小(或不变):
E[X]≥∑a≥ca⋅P[X=a]
-
对于在第二项中求和的所有 a,它们都满足 a≥c。如果我们把所有的 a 替换成更小的常数 c,整个和式会进一步变小(或不变):
E[X]≥∑a≥cc⋅P[X=a]=c∑a≥cP[X=a]
由于 ∑a≥cP[X=a] 恰好就是随机变量 X≥c 的概率 P[X≥c],我们得到:
E[X]≥c⋅P[X≥c]
两边同除以 c(因为 c>0),即得证:
P[X≥c]≤cE[X]
证明方法二:指示随机变量法(最现代、简洁)
首先引入指示随机变量(Indicator Random Variable)。对于事件 E,定义: IE={1,若 E 发生 0,若 E 未发生 它的一个关键性质是:其期望值等于该事件发生的概率,即 E[I{E}]=P[E]。
对于任意样本点 ω,因为 X(ω)≥0 且 c>0,我们有以下必然成立的不等式:
X(ω)≥c⋅I{X(ω)≥c}
- 为什么成立?分两种情况验证:
- 若 X(ω)<c,则指示变量为 0,右边为 c⋅0=0。显然 X(ω)≥0 成立。
- 若 X(ω)≥c,则指示变量为 1,右边为 c⋅1=c。显然 X(ω)≥c 成立。
既然在每一个样本点上,左边的函数值都大于等于右边,那么它们的期望也必然满足同样的大小关系(期望单调性):
E[X]≥E[c⋅I{X≥c}]
利用期望的线性性质,把常数 c 提出来,并将指示变量的期望换写为概率:
E[X]≥c⋅E[I{X≥c}]=c⋅P[X≥c]
同除以 c 即得证:
P[X≥c]≤cE[X]
2.3 经典例题:抛硬币的马尔可夫上界
【题目】 抛掷一枚均匀的硬币 n 次,用 X 表示正面朝上的次数。求观察到正面朝上次数超过 43n 的概率上界。
【解析过程】
-
确定分布与期望: 硬币正面朝上次数 X 服从二项分布 X∼Binomial(n,0.5)。(此处手写笔记中写成了超几何分布,需要修正为二项分布,因为每次抛硬币是相互独立的重复实验)。 所以期望值为:
E[X]=n⋅p=21n
-
应用马尔可夫不等式: 因为 X≥0 恒成立,且常数 c=43n>0,可直接代入公式:
P[X≥43n]≤43nE[X]=43n21n=32
-
结果分析与“不等式与实际的区别”:
-
通过马尔可夫不等式得到的概率上界是 32≈0.667,这个界限完全不依赖于抛掷次数 n。
-
但实际概率是多少呢?根据二项分布的精确求和公式:
P[X≥43n]=∑k=⌈43n⌉n(kn)(21)n
- 当 n=10 时,实际概率约为 5.5×10−2=0.055
- 当 n=100 时,实际概率约为 2.8×10−7
-
结论:随着 n 增大,实际概率会呈指数级衰减。然而马尔可夫不等式给出的界依然死板地停留在 32。这说明马尔可夫不等式给出的上界非常宽松(Loose),它没有考虑方差,因此无法捕捉随着样本量增大而产生的“集中效应”。
3. 切比雪夫不等式 (Chebyshev’s Inequality)
为了解决马尔可夫不等式过于宽松的问题,我们引入了考虑方差(衡量数据散布程度的工具)的切比雪夫不等式。
3.1 定理内容
设 X 是一个具有有限期望值 E[X]=μ 和有限方差 Var(X) 的任意随机变量。则对任意常数 c>0:
P[∣X−μ∣≥c]≤c2Var(X)
- 直观物理理解:随机变量偏离其均值 μ 的距离超过 c 的概率,绝对不会超过它的方差除以 c2。偏离的阈值 c 越大,不确定性(概率)就以二次方的速度迅速衰减。
3.2 证明推导
切比雪夫不等式的妙处在于,它实际上就是对一个精心构造的非负随机变量应用马尔可夫不等式。
-
定义一个新的随机变量 Y=(X−μ)2。
- 因为任何实数的平方都是非负的,所以 Y 必然是一个非负随机变量(Y≥0)。
- 根据方差的定义,其期望值为:E[Y]=E[(X−μ)2]=Var(X)。
-
注意到以下两个事件是完全等价的:
{∣X−μ∣≥c}⟺{(X−μ)2≥c2}⟺{Y≥c2}
所以它们的概率也完全相同:
P[∣X−μ∣≥c]=P[Y≥c2]
-
因为 Y 非负,且常数 c2>0,我们对 Y 应用马尔可夫不等式:
P[Y≥c2]≤c2E[Y]
-
将 E[Y]=Var(X) 代回,即得证:
P[∣X−μ∣≥c]≤c2Var(X)
3.3 经典例题:重新讨论硬币问题
【题目】 抛掷一枚均匀硬币 n 次,用 X 表示正面朝上的次数。利用切比雪夫不等式求 P[X≥43n] 的上界。
【解析过程】
-
计算均值与方差: 由于 X∼Binomial(n,0.5),我们有:
- 期望 μ=E[X]=2n
- 方差 Var(X)=n⋅p⋅(1−p)=n⋅21⋅21=4n
-
将单边概率转化为双边绝对值概率: 我们想估算 X≥43n 的概率。注意到当 X≥43n 时,它偏离期望的距离为 X−2n≥4n。 因此,单边事件是双边偏差事件的子集:
P[X≥43n]=P[X−2n≥4n]≤P[X−2n≥4n]
-
应用切比雪夫不等式: 这里偏差阈值 c=4n。代入公式得:
P[X−2n≥4n]≤c2Var(X)=(4n)24n=4n1=n4
-
结论对比:
- 切比雪夫上界为 n4。
- 对比马尔可夫:马尔可夫给出的上界是常数 32,而切比雪夫给出的上界随 n 的增大而逐渐减小(当 n=100 时,上界仅为 0.04)。这明显是一个好得多的界!
4. 应用:估计值偏离的界限 (Estimating Bias)
学习助手提示:你提到“这个例题的求解没太看明白,但很重要”。这就是课本核心应用部分——如何用抛硬币估计概率 p,并推导出那个“记不住”的样本量公式。我们在此进行最细致的拆解:
4.1 问题建模与方差推导
我们有独立同分布(i.i.d.)的硬币抛掷结果 X1,X2,…,Xn,其中每次抛掷 Xi∈{0,1},且 P[Xi=1]=p。
-
单次抛掷的均值与方差:
E[Xi]=p
Var(Xi)=p(1−p)
-
样本均值的期望:
p^=nSn=n1∑i=1nXi⟹E[p^]=p
-
样本均值的方差(注意常数提到方差外面要平方,且独立变量相加方差也相加):
Var(p^)=Var(n1∑i=1nXi)=n21∑i=1nVar(Xi)=n21⋅n⋅p(1−p)=np(1−p)
4.2 核心不等式推导
我们希望估计偏离误差超过 ϵ 的概率被控制在 δ 以内。直接对 p^ 应用切比雪夫不等式:
P[∣p^−p∣≥ϵ]≤ϵ2Var(p^)=nϵ2p(1−p)
为了实现置信度要求,我们只要让这个概率的上界小于等于 δ 即可:
nϵ2p(1−p)≤δ⟹n≥ϵ2δp(1−p)
4.3 为什么最大化 p(1−p) 得到常数 41?
在实际情况中,真实的 p 正是我们想要去估计的未知数,我们根本不知道 p(1−p) 是多少! 为了保证在任何可能的真实 p 下,我们的样本量 n 都足够大,我们需要采用最坏情况(Worst-case),即寻找 p(1−p) 的最大可能值。
-
极值推导: 设函数 f(p)=p(1−p)=p−p2,其中 0≤p≤1。 求导数并令其为 0:
f′(p)=1−2p=0⟹p=21
因为二阶导数 f′′(p)=−2<0,所以在 p=21 处取得极大值(也是最大值):
maxpp(1−p)=21(1−21)=41
-
最保守的样本量界限: 既然对任意 p,都有 p(1−p)≤41,我们直接把 p(1−p) 替换成其最大上限 41:
n≥ϵ2δp(1−p)⟸n≥ϵ2δ1/4=4ϵ2δ1
这就是公式 n≥4ϵ2δ1 的完整诞生过程!
4.4 补充应用例题(巩固理解)
学习助手提示:为你补充一个简单的数值例题,帮助你切实掌握公式应用。
【题目】 民意调查机构想要估算大选中某候选人的支持率 p。要求估计值 p^ 与真实支持率 p 的误差不超过 0.05(即 ϵ=0.05)的概率至少为 95%(即置信度 1−δ=0.95,得出置信失败允许的最大概率 δ=0.05)。请问最少需要随机电话采访多少位选民?
【解析过程】
-
明确已知参数:
- 允许误差极限 ϵ=0.05
- 允许失败概率 δ=1−0.95=0.05
-
套用推导出的样本量下界公式:
n≥4ϵ2δ1
-
代入具体数值计算:
n≥4⋅(0.05)2⋅0.051=4⋅0.0025⋅0.051=0.01⋅0.051=0.00051=2000
-
答案: 最少需要调查 2000 位选民。 (值得注意的是,这个选民样本量的大小完全不依赖于整个国家总人口的多寡。)
5. 弱大数定理 (Weak Law of Large Numbers)
通过切比雪夫不等式,我们终于可以严谨地证明弱大数定理。
5.1 定理内容
设 X1,X2,… 是一组独立同分布(i.i.d.)的随机变量序列,它们具有共同的有限期望 E[Xi]=μ 和有限方差 Var(Xi)=σ2。 用 Sn=X1+⋯+Xn 表示前 n 项和,则对任意给定的任意小的误差 ϵ>0:
P[n1Sn−μ≥ϵ]→0(当 n→∞ 时)
5.2 证明推导
-
计算样本均值 Xˉn=n1Sn 的均值和方差:
- E[Xˉn]=μ
- Var(Xˉn)=nσ2
-
对 Xˉn 直接应用切比雪夫不等式:
P[n1Sn−μ≥ϵ]≤ϵ2Var(Xˉn)=nϵ2σ2
-
令 n→∞。由于 σ2 和 ϵ2 是固定的常数,当分母中的 n 趋于无穷大时,右侧的上界趋于 0:
limn→∞nϵ2σ2=0
-
因为概率值不可能为负数,夹逼定理可证:
limn→∞P[n1Sn−μ≥ϵ]=0
定理直观结语:只要我们取样足够多,样本均值与理论均值产生任何细微偏差(ϵ)的概率,在极限下都将归于零。
集中不等式与大数定律:教材经典习题精析
本学习文件精心挑选了日本概率论教材中与《集中不等式与大数定理》高度匹配的 3 道核心习题。每道题均配有日汉双语对照、直观的解题思路、严谨的数学推导以及方法论总结,旨在帮助你彻底攻克学习难关。
习题一:馬爾可夫与切比雪夫不等式的通用推导 (問題 49)
1.1 日语原题 (Original Textbook Text)
問題 49 (確率不等式と大数の弱法則)
(1) 確率変数 X の確率密度関数を f(x) とする。任意の非負値関数 h(x)≥0 と、任意の定数 a>0 に対して、次を示せ。
P[h(X)≥a]≤aE[h(X)]
(2) (1) を用いて、平均 μ、分散 σ2 をもつ任意の確率変数 X に対するチェビシェフの不等式:
P[∣X−μ∣≥k]≤k2σ2(k>0)
を証明せよ。
(3) 互いに独立に平均 μ、分散 σ2 の同一の分布に従う確率変数序列 X1,X2,…,Xn に対し、大数の弱法則:
limn→∞P[nX1+X2+⋯+Xn−μ≥ϵ]=0(ϵ>0)
を示せ。
1.2 中文翻译
问题 49 (概率不等式与大数弱定律)
(1) 设 X 的概率密度函数为 f(x)。对于任意非负函数 h(x)≥0 和任意常数 a>0,证明:
P[h(X)≥a]≤aE[h(X)]
(2) 利用 (1) 的结论,证明具有均值 μ、方差 σ2 的任意随机变量 X 均满足切比雪夫不等式:
P[∣X−μ∣≥k]≤k2σ2(k>0)
(3) 设 X1,X2,…,Xn 是独立同分布(i.i.d.)的随机变量序列,其共同均值为 μ,共同方差为 σ2。证明大数弱定律:
limn→∞P[nX1+X2+⋯+Xn−μ≥ϵ]=0(ϵ>0)
1.3 详细解答过程 (Step-by-Step Solution)
第一问证明:广义马尔可夫不等式
由于 X 是连续型随机变量(教材本章主题),我们利用其概率密度函数 f(x) 进行积分推导。 期望 E[h(X)] 的定义式为:
E[h(X)]=∫−∞∞h(x)f(x)dx
我们定义实数集上的一个子集 M={x∈R∣h(x)≥a}。由于 h(x)≥0 且 f(x)≥0,我们可以将积分区间拆分为 M 和 M 的补集 Mc: E[h(X)]=∫Mh(x)f(x)dx+∫Mch(x)f(x)dx ≥∫Mh(x)f(x)dx(因为在补集 Mc 上 h(x)f(x)≥0)
对于属于集合 M 的所有 x,根据定义均有 h(x)≥a。我们将积分中的 h(x) 替换为更小的常数 a:
E[h(X)]≥∫Ma⋅f(x)dx=a∫Mf(x)dx
根据概率密度的物理意义,在区间 M 上的积分恰好等于事件 {h(X)≥a} 发生的概率:
∫Mf(x)dx=P[h(X)≥a]
因此,我们得到:
E[h(X)]≥a⋅P[h(X)≥a]
两边同除以 a(因为 a>0),不等式得证:
P[h(X)≥a]≤aE[h(X)]■
第二问证明:切比雪夫不等式
我们要证明 P[∣X−μ∣≥k]≤k2σ2。
-
构造辅助函数:令 h(X)=(X−μ)2,显然对任意实数,平方值 h(X)≥0 恒成立。
-
设定阈值:令常数 a=k2(由于 k>0,故 a>0)。
-
利用第一问结论:
P[(X−μ)2≥k2]≤k2E[(X−μ)2]
-
化简不等式:
- 左侧事件:(X−μ)2≥k2⟺∣X−μ∣≥k。
- 右侧期望:根据方差的定义,E[(X−μ)2]=Var(X)=σ2。
直接代入即得:
P[∣X−μ∣≥k]≤k2σ2■
第三问证明:大数弱定律 (WLLN)
-
构建样本均值变量: 设样本均值为 Xˉn=nX1+X2+⋯+Xn。
-
计算其期望与方差:
-
期望的线性性质:
E[Xˉn]=E[n1∑i=1nXi]=n1∑i=1nE[Xi]=n1(nμ)=μ
-
独立变量方差的性质:
Var(Xˉn)=Var(n1∑i=1nXi)=n21∑i=1nVar(Xi)=n21(nσ2)=nσ2
-
对 Xˉn 应用切比雪夫不等式: 对于任意给定的 ϵ>0,将 Xˉn 的期望 μ 和方差 nσ2 代入:
P[∣Xˉn−μ∣≥ϵ]≤ϵ2Var(Xˉn)=nϵ2σ2
-
求极限: 由于 σ2 和 ϵ2 是常数,当 n→∞ 时:
limn→∞nϵ2σ2=0
因此:
limn→∞P[nX1+X2+⋯+Xn−μ≥ϵ]=0■
习题二:大数定律的极限定理计算应用 (問題 47)
2.1 日语原题 (Original Textbook Text)
問題 47 (大数の法則の応用)
X1,X2,… は互いに独立に、同一の分布に従う確率変数で、その平均は E[X1]=μ、二乗の期待値は E[X12]=α(ただし α>0)とする。 このとき、次の極限値を求めよ。
limn→∞X12+X22+⋯+Xn2X1+X2+⋯+Xn
2.2 中文翻译
问题 47 (大数定律的应用)
设 X1,X2,… 是独立同分布的随机变量序列,其共同均值为 E[X1]=μ,共同二阶矩(平方的期望)为 E[X12]=α(其中 α>0)。 求以下随机变量序列的极限值:
limn→∞X12+X22+⋯+Xn2X1+X2+⋯+Xn
2.3 详细解答过程 (Step-by-Step Solution)
第一步:代数变换(同除以 n)
由于极限式中的分子和分母都随着 n→∞ 而发散,我们无法直接求极限。数学上的经典技巧是:将分子和分母同时除以 n,构造出“样本均值”的形式:
Yn=X12+X22+⋯+Xn2X1+X2+⋯+Xn=n1∑i=1nXi2n1∑i=1nXi
第二步:分子应用大数定律
分子部分 Un=n1∑i=1nXi 是独立同分布变量 Xi 的样本均值。 根据大数定律(LLN),当 n→∞ 时,它在概率上收敛于其期望值:
UnPE[X1]=μ
第三步:分母应用大数定律
分母部分 Vn=n1∑i=1nXi2 可以看作是一组新随机变量 Wi=Xi2 的样本均值。 因为 X1,X2,… 独立同分布,所以其平方序列 X12,X22,… 也必定是独立同分布的。 该新序列的期望值为:
E[W1]=E[X12]=α
根据大数定律(LLN),分母在概率上收敛于:
VnPE[X12]=α
第四步:利用连续映射定理(Continuous Mapping Theorem)合并极限
若 UnPμ 且 VnPα(其中 α>0),则根据极限的代数性质,它们的商也收敛于极限值的商:
limn→∞Yn=limn→∞Vnlimn→∞Un=αμ
【本题答案】
αμ(或 σ2+μ2μ)
习题三:硬币投掷中集中不等式界限的精确对比 (問題 33)
3.1 日语原题 (Original Textbook Text)
問題 33 (不等式の評価の比較)
公正なコインを n=100 回投げるとき、表が出る回数を X とする。
(1) マルコフの不等式を用いて、P[X≥75] の上界を求めよ。
(2) チェビシェフの不等式を用いて、P[∣X−50∣≥25] の上界を求めよ。これを用いて P[X≥75] の上界について何が言えるか。
(3) 二項分布の正規近似(ド・モアブル=ラプラスの定理)を用いて、P[X≥75] の実際の近似確率を求めよ。(必要ならば標準正規分布表より Φ(5.0)≈0.0000003 を用いよ)
3.2 中文翻译
问题 33 (不等式估计的比较)
抛掷一枚均匀的硬币 n=100 次,用 X 表示正面朝上的次数。
(1) 使用马尔可夫不等式,求概率 P[X≥75] 的上界。
(2) 使用切比雪夫不等式,求概率 P[∣X−50∣≥25] 的上界。由此,能对 P[X≥75] 的上界做出怎样的推论?
(3) 利用二项分布的德莫佛-拉普拉斯定理(即中心极限定理的二项分布特例,用正态分布逼近),求 P[X≥75] 的实际近似概率。对比三者结果。
3.3 详细解答过程 (Step-by-Step Solution)
(1) 马尔可夫不等式求解
X 表示 100 次投掷中正面朝上的次数,服从二项分布 X∼Binomial(100,0.5)。 由于硬币是均匀的,期望值为:
E[X]=n⋅p=100×0.5=50
因为 X≥0 恒成立,我们直接对 c=75 使用马尔可夫不等式:
P[X≥75]≤75E[X]=7550=32≈0.6667
(2) 切比雪夫不等式求解
首先计算 X 的方差:
Var(X)=n⋅p⋅(1−p)=100×0.5×0.5=25
均值为 μ=50。 使用切比雪夫不等式估计偏离均值至少 25 的概率(即 c=25):
P[∣X−50∣≥25]≤252Var(X)=62525=251=0.04
【推论部分】: 由于事件 {X≥75} 意味着 X−50≥25。 这显然是双边偏差事件 {∣X−50∣≥25} 的子集。因此其概率一定小于或等于双边概率:
P[X≥75]≤P[∣X−50∣≥25]≤0.04
结论:切比雪夫不等式给出的上界为 0.04,比马尔可夫的 0.6667 紧密了整整 16.6 倍。
(3) 正态近似(实际概率)求解
当 n 较大时,二项分布 X∼Binomial(100,0.5) 可由正态分布 N(μ,σ2) 近似:
- μ=50
- σ=Var(X)=25=5
为了让离散变量的近似更精确,我们加入连续性修正(Continuity Correction)(即把 X≥75 修正为 X≥74.5):
P[X≥75]≈P[Xcontinuous≥74.5]
将其标准化(Standardization):
Z=σXcontinuous−μ=574.5−50=524.5=4.9
因此:
P[X≥75]≈P[Z≥4.9]=1−Φ(4.9)
由于 Φ(5.0)≈1−3×10−7,我们可以得知该概率数量级大约在:
P[X≥75]≈4.8×10−7=0.00000048
3.4 极重要:三者对比分析表 (Methodology Comparison)
| 估计方法 | 概率上界 / 实际值 | 核心使用参数 | 特点分析 |
|---|
| 马尔可夫不等式 | ≤0.6667 | 仅需期望值 E[X] | 极易计算,但非常粗糙,无法随 n 增大而收紧。 |
| 切比雪夫不等式 | ≤0.0400 | 期望值 E[X] + 方差 Var(X) | 引入了二阶矩,能体现出大样本下的数据集中效应。 |
| 正态分布近似 | ≈0.00000048 | 完整分布形态信息 | 最贴近真实概率。说明在真实世界中,极端偏差发生的概率是以指数级衰减的(切比雪夫的二次方衰减依然是保守估计)。 |
通过这道题,你可以直观地明白,虽然切比雪夫不等式比马尔可夫不等式优秀得多,但在实际应用中,它依然是一个非常保守的上界约束。