https://www.eecs70.org/assets/pdf/notes/n17.pdf
CS 70 概率论深度学习笔记:随机变量的函数、方差与协方差
https://gemini.google.com/app/900a7c92eb0e3c22
本笔记基于 CS 70 Spring 2026 Note 17 课程教材,并深度结合个人手写笔记的脉络与直观理解进行整理、润色与修正。
1. 随机变量的函数与 LOTUS 定律
1.1 基本定义
若 X 是定义在样本空间 Ω 上的随机变量,其概率分布为 PX。对于定义在 X 值域上的任意实值函数 f(⋅),我们有一个新的随机变量 Y=f(X),其在样本空间中的取值为:
Y(ω)=f(X(ω)),∀ω∈Ω
-
事件的等价性:在样本空间中,事件 {Y=y} 等价于事件 {X∈f−1(y)},其中 f−1(y) 是自变量的逆像(Preimage)集合 {x∣f(x)=y}。
-
Y 的概率分布:
PY[Y=y]=∑x:f(x)=yPX[X=x]
1.2 无意识统计学家定律 (LOTUS)
在计算 f(X) 的期望时,我们不需要先求出 Y=f(X) 的概率分布,而是可以直接通过下式计算:
E[f(X)]=∑xf(x)PX[X=x]
手写笔记直观理解:求 E[f(X)] 时,我们使用的公式形式依然是标准的 E[X]=∑xi⋅P(xi),但其精髓在于直接将值 xi 替换为 f(xi)。
⚠️ 经典警告 (Warning)
在通常情况下,期望算子与非线性函数不能交换:
E[f(X)]=f(E[X])
例如,对于平方运算:
E[X2]=(E[X])2
只有当 f(X)=aX+b(即 f 为线性函数)时,等式 E[aX+b]=aE[X]+b 才成立。
2. 条件期望与全期望公式
2.1 条件期望 (Conditional Expectation)
给定定义在同一概率空间上的随机变量 X 和 Y。若对于某一取值 b∈B 有 P[Y=b]>0,则在已知 Y=b 的条件下,X 的条件期望定义为:
E[X∣Y=b]=∑a∈Aa⋅P[X=a∣Y=b]
手写笔记直观理解:条件期望本质上就是普通的期望,只是把概率换成条件概率而已。因此,它完全保留了期望的所有优良性质(如线性性质)。
2.2 作为随机变量的条件期望与全期望公式 (LTE)
我们可以定义一个关于随机变量 Y 的函数:
f(Y)=E[X∣Y]
这意味着,当 Y=b 时,该随机变量取值为实数 E[X∣Y=b]。
既然 f(Y) 是一个随机变量,我们就可以对它求期望:
E[f(Y)]=∑b∈Bf(b)P[Y=b]=∑b∈BE[X∣Y=b]P[Y=b]
这就引出了概率论中极其重要的定理:
定理 2.1:全期望公式 (Law of Total Expectation / Tower Rule)
若 E[∣X∣]<∞,则:
E[X]=E[E[X∣Y]]
展开式写为:
E[X]=∑b∈BE[X∣Y=b]P[Y=b]
【定理证明】
E[E[X∣Y]]=b∈B∑E[X∣Y=b]P[Y=b] =b∈B∑(a∈A∑aP[X=a∣Y=b])P[Y=b] =a∈A∑ab∈B∑P[X=a∣Y=b]P[Y=b](交换求和顺序) =a∈A∑aP[X=a](利用全概率公式) =E[X]■
3. 方差与标准差
手写笔记直观理解:期望告诉我们分布的平均值(中心位置),而方差则度量了数据的波动性与偏差(离散程度)。
3.1 引入思考:一维对称随机游走 (Random Walk)
假设一个粒子从 0 点出发,每一步独立地等概率向左(记为 −1)或向右(记为 +1)移动 1 步。设 Sn 为 n 步后粒子的位置:
Sn=X1+X2+⋯+Xn
其中 P[Xi=1]=P[Xi=−1]=1/2。
- 位置期望:由于 E[Xi]=0,由线性期望易得 E[Sn]=∑i=1nE[Xi]=0。但这无法告诉我们粒子实际游走了多远。
- 距离期望 E[∣Sn∣]:由于绝对值算子难以直接求和,我们退而求其次,研究距离的平方的期望 E[Sn2]。
命题 3.1:对于对称随机游走,E[Sn2]=n。
【证明】 将 Sn2 展开:
E[Sn2]=E[(∑i=1nXi)2]=∑i=1nE[Xi2]+2∑i<jE[XiXj]
因为 Xi∈{+1,−1},所以 Xi2=1 恒成立,即 E[Xi2]=1。 又因为 Xi 与 Xj 相互独立(i=j),所以:
E[XiXj]=E[Xi]E[Xj]=0×0=0
代入上式,得:
E[Sn2]=n⋅1+2∑i<j0=n■
💡 思考拓展:
- E[Sn2]=n 表明粒子偏离原点的“典型”平方距离为 n,也就是说,其典型游走距离大约在 n 数量级。
- 注意:绝对不能简单地认为 E[∣Sn∣]=E[Sn2]=n,因为期望与根号不能任意交换(由詹森不等式 Jensen’s Inequality 易知 E[∣Sn∣]≤E[Sn2]=n)。
3.2 方差与标准差的正式定义
对于一个随机变量 X,设其均值为 μ=E[X]。
-
方差 (Variance):
Var(X)=E[(X−μ)2]
-
标准差 (Standard Deviation):
σ(X)=Var(X)
标准差的物理量纲与 X 本身一致,更便于直观解释。对于上述随机游走问题,其方差为 Var(Sn)=n,标准差为 σ(Sn)=n。
3.3 方差计算替代公式
定理 3.2:对于任意随机变量 X,有:
Var(X)=E[X2]−μ2=E[X2]−(E[X])2
【定理证明】
利用期望的线性性质: Var(X)=E[(X−μ)2] =E[X2−2μX+μ2] =E[X2]−2μE[X]+E[μ2] =E[X2]−2μ2+μ2(∵E[X]=μ 且 μ2 是常数) =E[X2]−μ2■
3.4 方差的重要运算性质
-
常数乘积性质:对于任意常数 c,
Var(cX)=c2Var(X)
直观理解:若变量放大 c 倍,其平方偏差便会放大 c2 倍。
-
独立变量和的方差:
定理 3.3:若 X 和 Y 是相互独立的随机变量,则:
Var(X+Y)=Var(X)+Var(Y)
【引理:独立变量乘积的期望】
若 X,Y 独立,则:
E[XY]=E[X]E[Y]
(证明:E[XY]=∑a∑babP[X=a,Y=b]=∑aaP[X=a]∑bbP[Y=b]=E[X]E[Y])
【定理 3.3 证明】
Var(X+Y)=E[(X+Y)2]−(E[X+Y])2 =E[X2]+E[Y2]+2E[XY]−(E[X]+E[Y])2 =(E[X2]−(E[X])2)+(E[Y2]−(E[Y])2)+2(E[XY]−E[X]E[Y]) =Var(X)+Var(Y)+2(E[XY]−E[X]E[Y]) 由于 X,Y 独立,由引理可知最后项为 0,故:
Var(X+Y)=Var(X)+Var(Y)■
4. 经典分布的方差计算
4.1 公平骰子的点数 X
设 X 为一个公平骰子的点数:
-
均值:E[X]=21+2+3+4+5+6=27
-
平方期望:E[X2]=612+22+32+42+52+62=691
-
方差:
Var(X)=E[X2]−(E[X])2=691−449=1235
设 X∼Uniform{1,…,n},即 X 等概率取值 {1,…,n}。
-
均值:
E[X]=2n+1
-
方差(利用平方和公式 ∑i=1ni2=6n(n+1)(2n+1)):
Var(X)=12n2−1
4.3 随机置换的固定点个数 (Fixed Points of Permutations)
设 Xn 为 n 个元素随机置换后保持原位的点数(例如:n 封信随机装入 n 个信封,刚好装对的信封数)。 写成指示随机变量(Indicator)之和:
Xn=I1+I2+⋯+In
其中 Ii=1(若第 i 个点为固定点),否则 Ii=0。
我们已知对于任意 n,均值恒为 E[Xn]=1。为了求其方差:
E[Xn2]=∑i=1nE[Ii2]+2∑i<jE[IiIj]
- 因为 Ii 为指示变量,所以 E[Ii2]=P[Ii=1]=n1。
- 对于 i<j,E[IiIj]=P[Ii=1∧Ij=1]=n(n−1)1(即 i 和 j 同时为固定点的概率)。
代入求和: E[Xn2]=n(n1)+2(2n)n(n−1)1 =1+2[2n(n−1)]n(n−1)1 =1+1=2 因此,方差为:
Var(Xn)=E[Xn2]−(E[Xn])2=2−12=1
结论:不论元素个数 n 多大,固定点个数的均值和方差都恒等于 1。
4.4 二项分布 (Binomial Distribution)
设 Xn∼Binomial(n,p) 代表 n 次独立重复伯努利试验中成功的次数。 写成独立指示变量的和:
Xn=I1+I2+⋯+In
其中 Ii∼Bernoulli(p),各 Ii 相互独立。
-
单次试验方差:
Var(Ii)=E[Ii2]−(E[Ii])2=p−p2=p(1−p)
-
总方差(由于相互独立,方差可以直接相加):
Var(Xn)=∑i=1nVar(Ii)=np(1−p)
💡 对比直观: 对于公平硬币(p=1/2),标准差 σ(Xn)=2n。这表明,当试验次数 n 极大时,分布的“绝对宽度”(≈n)相对于其最大取值范围 n 是极窄的。这与均匀分布(标准差与 n 属同阶,≈12n)形成鲜明对比,体现了独立变量叠加后的高集中性。
5. 协方差与相关系数
5.1 协方差 (Covariance)
当变量之间不独立时,我们需要度量它们之间的联合波动。
定义 5.1:随机变量 X 和 Y 的协方差定义为:
cov(X,Y)=E[(X−μX)(Y−μY)]=E[XY]−E[X]E[Y]
手写笔记直观理解:协方差是变量之间的偏移关系(度量它们是否倾向于同时偏离各自的均值)。
- 若 cov(X,Y)>0,说明 X 变大时 Y 也倾向于变大(正相关)。
- 若 cov(X,Y)<0,说明 X 变大时 Y 倾向于变小(负相关)。
协方差的核心性质:
-
独立性与协方差:若 X 和 Y 独立,则 cov(X,Y)=0。注意:逆命题不一定成立!(协方差只能度量线性关联)。
-
自身协方差:cov(X,X)=Var(X)。
-
双线性性质 (Bilinearity):
cov(∑i=1naiXi,∑j=1mbjYj)=∑i=1n∑j=1maibjcov(Xi,Yj)
-
一般和的方差公式:对于任意两个随机变量(不要求独立):
Var(X+Y)=Var(X)+Var(Y)+2cov(X,Y)
5.2 相关系数 (Correlation)
手写笔记直观理解:协方差的大小受变量自身量纲(尺度)的影响太大。为了消除尺度影响,将其标准化,便得到了相关系数。
定义 5.2:若 σ(X)>0 且 σ(Y)>0,相关系数(通常记为 ρ)定义为:
Corr(X,Y)=σ(X)σ(Y)cov(X,Y)
定理 5.1:相关系数的有界性
对于任意随机变量 X 和 Y,有:
−1≤Corr(X,Y)≤+1
【证明】
定义标准化随机变量:
X~=σ(X)X−μX,Y~=σ(Y)Y−μY
显然有 E[X~2]=E[Y~2]=1,且 E[X~Y~]=Corr(X,Y)。 考虑如下两个平方项的期望,其必定非负:
0≤E[(X~−Y~)2]=E[X~2]+E[Y~2]−2E[X~Y~]=2−2E[X~Y~]
0≤E[(X~+Y~)2]=E[X~2]+E[Y~2]+2E[X~Y~]=2+2E[X~Y~]
由此立得:
−1≤E[X~Y~]≤+1⟹−1≤Corr(X,Y)≤+1■
关于线性相关边界的探讨:
-
Corr(X,Y)=+1 当且仅当 E[(X~−Y~)2]=0,即 X~=Y~(以概率 1 成立)。
-
Corr(X,Y)=−1 当且仅当 E[(X~+Y~)2]=0,即 X~=−Y~(以概率 1 成立)。
-
用原始变量表示:若相关系数达到边界值 ±1,则意味着存在常数 a,b 使得:
Y=aX+b(以概率 1 成立)
当相关系数为 +1 时 a>0;当相关系数为 −1 时 a<0。
6. 核心公式与概念直观速查表
| 概念/公式 | 符号表达 | 计算公式 / 展开式 | 物理含义 / 补充说明 |
|---|
| 无意识统计学家定律 | E[f(X)] | ∑xf(x)PX[X=x] | 求期望时直接用 f(x) 替代标准的 x 即可 |
| 条件期望 (对事件) | E[X∣Y=b] | ∑aaP[X=a∣Y=b] | 只是把普通期望里的概率替换为条件概率 |
| 全期望公式 (LTE) | E[X] | E[E[X∣Y]] | 塔式法则(Tower Rule),可通过分情况条件化来计算期望 |
| 方差定义 | Var(X) | E[(X−E[X])2] | 度量随机变量与其均值的“典型偏差平方” |
| 方差计算替代公式 | Var(X) | E[X2]−(E[X])2 | 方差 = 平方的期望 - 期望的平方(计算时常用) |
| 常数缩放方差 | Var(cX) | c2Var(X) | 常数因子提取出方差时必须进行平方 |
| 和的方差 (独立) | Var(X+Y) | Var(X)+Var(Y) | 仅在 X,Y 相互独立 时成立 |
| 和的方差 (不独立) | Var(X+Y) | Var(X)+Var(Y)+2cov(X,Y) | 必须额外加上两倍的协方差项 |
| 协方差 (Covariance) | cov(X,Y) | E[XY]−E[X]E[Y] | 衡量两个随机变量同步波动的偏移关系 |
| 相关系数 (Correlation) | Corr(X,Y) | σ(X)σ(Y)cov(X,Y) | 协方差的无量纲版本,取值范围限制在 [−1,+1] 之间 |