数学基础 · 附录 C 概率与统计要点 · C6

大数定律与中心极限定理

The Law of Large Numbers and the Central Limit Theorem
已完成速查更新于 2026.10.08统计物理讲义 v1.0

这两条定理是"统计力学为什么可行"的数学基础:大数定律说宏观量几乎是确定的;中心极限定理说它的涨落几乎总是高斯型的。正文用到它们的地方:二项分布的高斯极限(§2.4);随机行走与扩散(§P5.2);高分子末端距的高斯分布(§30.1 的 (30.2));蒙特卡罗方法的统计误差(§32.2)。

下面设 X1,X2,…,XNX_1,X_2,\dots,X_N 相互独立、分布相同(简称"独立同分布"),均值 μ\mu,方差 σ2\sigma^2(有限)。记 SN=∑iXiS_N = \sum_iX_i,样本平均 XˉN=SN/N\bar X_N = S_N/N。

§C6.1大数定律

由线性性与 (C3.5):

⟨XˉN⟩=μ,Var(XˉN)=σ2N(C6.1)\langle\bar X_N\rangle = \mu,\qquad \mathrm{Var}(\bar X_N) = \frac{\sigma^2}{N} \tag{C6.1}

再用切比雪夫不等式 (C2.3):对任意 ϵ>0\epsilon>0,

P(∣XˉN−μ∣≥ϵ)≤σ2Nϵ2 →N→∞ 0(C6.2)P\big(\lvert\bar X_N - \mu\rvert\ge\epsilon\big)\le\frac{\sigma^2}{N\epsilon^2}\ \xrightarrow{N\to\infty}\ 0 \tag{C6.2}

样本平均依概率收敛于期望值:偏离超过任意 ϵ\epsilon 的概率趋于零(这是"弱"大数定律;"强"大数定律断言以概率 1 收敛,并且只要求均值有限)。物理含义:

  • 宏观量(大量微观贡献的平均)几乎是确定的,相对涨落 ∝N−1/2\propto N^{-1/2}(§2.2)。
  • 频率趋于概率:NN 次试验中事件 AA 发生的比例(指示变量的平均)趋于 P(A)P(A)。
  • 蒙特卡罗方法:用随机样本的平均值估计期望值,误差按 N−1/2N^{-1/2} 减小(§32.2)。

只要关联随距离(或时间)足够快地衰减,(C6.1) 中的 σ2\sigma^2 换成 σ2(1+2∑kρk)\sigma^2(1 + 2\sum_k\rho_k)(§C3.5)后结论仍成立;这是宏观系统中有相互作用的粒子仍然服从大数定律的原因。

§C6.2中心极限定理

定理:标准化的和

ZN=SN−NμσNZ_N = \frac{S_N - N\mu}{\sigma\sqrt N}

的分布在 N→∞N\to\infty 时趋于标准正态分布 N(0,1)N(0,1),与 XiX_i 本身的分布形状无关(只要方差有限)。等价地说,SNS_N 近似服从 N(Nμ, Nσ2)N(N\mu,\ N\sigma^2)。

证明(特征函数法)。令 Yi=(Xi−μ)/σY_i = (X_i - \mu)/\sigma,均值 0、方差 1。它的特征函数在 k=0k = 0 附近展开(附录 C2;ϕ(k)=⟨eikY⟩=1+ik⟨Y⟩−k22⟨Y2⟩+⋯\phi(k) = \langle e^{ikY}\rangle = 1 + ik\langle Y\rangle - \frac{k^2}{2}\langle Y^2\rangle + \cdots):

ϕY(k)=1−k22+o(k2)\phi_Y(k) = 1 - \frac{k^2}{2} + o(k^2)

ZN=∑iYi/NZ_N = \sum_iY_i/\sqrt N 是独立变量之和,特征函数相乘(§C3.6):

ϕZN(k)=[ϕY ⁣(kN)]N=[1−k22N+o ⁣(1N)]N →N→∞ e−k2/2\phi_{Z_N}(k) = \left[\phi_Y\!\left(\frac{k}{\sqrt N}\right)\right]^N = \left[1 - \frac{k^2}{2N} + o\!\left(\frac1N\right)\right]^N\ \xrightarrow{N\to\infty}\ e^{-k^2/2}

(最后一步是 (A10.5)。)e−k2/2e^{-k^2/2} 正是 N(0,1)N(0,1) 的特征函数,而特征函数唯一地确定分布。□\square

累积量的观点。独立变量之和的累积量相加:κn(SN)=Nκn(X)\kappa_n(S_N) = N\kappa_n(X)。标准化后(n≥2n\ge2 时;平移 −Nμ-N\mu 只改变 κ1\kappa_1,所以 κ1(ZN)=0\kappa_1(Z_N) = 0)

κn(ZN)=Nκn(X)(σN)n∝N1−n/2\kappa_n(Z_N) = \frac{N\kappa_n(X)}{(\sigma\sqrt N)^n}\propto N^{1 - n/2}

n=2n = 2 时为 1,n≥3n\ge3 时都趋于零——只剩下高斯分布的前两个累积量。还可以看出收敛的速度:偏度(n=3n = 3)按 N−1/2N^{-1/2} 消失。这与 (C2.6) 后面关于能量分布的讨论是同一回事。

每个变量的分布
ZNZ_N 的直方图(2 万个样本)标准正态分布
概率密度\text{概率密度}
ZN=(SN−Nμ)/σNZ_N = (S_N - N\mu)/\sigma\sqrt N
偏度(样本)\text{偏度(样本)}
—
偏度(κ3/σ3N)\text{偏度(}\kappa_3/\sigma^3\sqrt N\text{)}
—
超出峰度(样本)\text{超出峰度(样本)}
—
图 C6.1NN 个独立同分布变量之和,标准化以后的分布。不论每个变量服从什么分布,NN 增大时都趋于标准正态分布;偏度按 N−1/2N^{-1/2} 消失,所以不对称的分布(指数、稀有事件)收敛得慢。取离散值的变量在 NN 较小时直方图呈梳状。

§C6.3正文中的例子

  1. 二项分布(§2.4):n=∑xin = \sum x_i,xi∈{0,1}x_i\in\lbrace0,1\rbrace,μ=1/2\mu = 1/2,σ2=1/4\sigma^2 = 1/4;所以 nn 近似服从 N(N/2, N/4)N(N/2,\ N/4),即 (2.15)。§2.4 用斯特林公式直接证明了这一点;中心极限定理说明它不是巧合。
  2. 随机行走与扩散(§P5.2):每步位移 ±a\pm a,Ns=t/τN_{\mathrm s} = t/\tau 步后位置近似服从 N(0, Nsa2)N(0,\ N_{\mathrm s}a^2),与扩散方程的解 (P5.5) 对比得 D=a2/(2τ)D = a^2/(2\tau)。
  3. 高分子链(§30.1):末端距 R=∑ibi\mathbf R = \sum_i\mathbf b_i,每个键的分量方差为 b2/3b^2/3;由多元中心极限定理,R\mathbf R 服从协方差为 Nb23I\frac{Nb^2}{3}I 的三维高斯分布 (30.2)。注意单个键的分布(固定长度、方向均匀)与高斯分布相差甚远,而 NN 个键之和却是高斯的。
  4. 蒙特卡罗误差(§32.2):MM 个独立样本的平均值的误差为 Var(A)/M\sqrt{\mathrm{Var}(A)/M},并且这个误差本身近似服从高斯分布,所以可以给出"68% 置信区间"之类的陈述。
  5. 正则系综中的能量:宏观系统可以看成许多弱耦合的子系统,总能量是许多近似独立的贡献之和,所以能量分布是窄的高斯峰,宽度 ∝N\propto\sqrt N(§4.4)。

§C6.4适用条件与失效

(a) 方差必须有限。 洛伦兹分布(柯西分布)p(x)=1π11+x2p(x) = \frac{1}{\pi}\frac{1}{1 + x^2} 的方差(甚至均值)不存在。它的特征函数是 e−∣k∣e^{-\lvert k\rvert}(由 (A14.10) 的第二式与反演公式)。NN 个独立柯西变量的平均值的特征函数为 [e−∣k∣/N]N=e−∣k∣\left[e^{-\lvert k\rvert/N}\right]^N = e^{-\lvert k\rvert}——与单个变量完全相同:平均了一百万次,分布一点也没有变窄。重尾分布在物理中确实出现(洛伦兹线形的随机频率、"莱维飞行"型的随机行走),这时既没有大数定律的 N−1/2N^{-1/2},也没有高斯极限。

(b) 关联必须足够短程。 在临界点,关联长度 ξ\xi 发散,大量自旋强烈关联。此时总磁化强度的涨落不再 ∝N\propto\sqrt N(χ\chi 发散,(18.3)),其分布也不是高斯的。这正是临界现象需要重整化群而不能用简单统计处理的原因(第20章)。

(c) 只适用于"典型"涨落。 中心极限定理描述的是偏离平均值约 σN\sigma\sqrt N 的涨落。偏离与 NN 成正比的"大偏差"概率按 e−NI(x)e^{-NI(x)} 衰减,其中速率函数 I(x)I(x) 一般不是二次函数(§22.6 的硬币例子)。

§C6.5大偏差的一个简单估计

马尔可夫不等式:对非负随机变量 YY 与 a>0a>0,P(Y≥a)≤⟨Y⟩/aP(Y\ge a)\le\langle Y\rangle/a(证明与切比雪夫不等式相同:⟨Y⟩≥∫y≥ay p dy≥aP(Y≥a)\langle Y\rangle\ge\int_{y\ge a}y\,p\,dy\ge aP(Y\ge a))。把它用于 Y=esSNY = e^{sS_N}(s>0s>0):

P(XˉN≥x)=P(esSN≥esNx)≤⟨esSN⟩esNx=e−N[sx−K(s)]P(\bar X_N\ge x) = P\left(e^{sS_N}\ge e^{sNx}\right)\le\frac{\langle e^{sS_N}\rangle}{e^{sNx}} = e^{-N[sx - K(s)]}

(用了 ⟨esSN⟩=⟨esX⟩N=eNK(s)\langle e^{sS_N}\rangle = \langle e^{sX}\rangle^N = e^{NK(s)},KK 为累积量生成函数。)对 ss 取最紧的界:

P(XˉN≥x)≤e−NI(x),I(x)=max⁡s[sx−K(s)](C6.3)P(\bar X_N\ge x)\le e^{-NI(x)},\qquad I(x) = \max_s\big[sx - K(s)\big] \tag{C6.3}

(这里 x>μx>\mu;此时对 s>0s>0 取极大与对全体 ss 取极大结果相同。这称为切尔诺夫界;克拉默定理进一步说明在对数意义下它就是严格的渐近式。)速率函数是累积量生成函数的勒让德变换(附录 A5)。在 xx 接近 μ\mu 时,K(s)≈μs+12σ2s2K(s)\approx\mu s + \frac12\sigma^2s^2,求极大得 I(x)≈(x−μ)22σ2I(x)\approx\frac{(x - \mu)^2}{2\sigma^2},于是 P≈e−N(x−μ)2/2σ2P\approx e^{-N(x-\mu)^2/2\sigma^2}——回到中心极限定理。对硬币(K(s)=ln⁡1+es2K(s) = \ln\frac{1 + e^s}{2}),(C6.3) 给出 (22.18)(附录 A5 的自测题 5 做过反方向的变换)。

自测题

  1. 设 U1,…,U12U_1,\dots,U_{12} 是 [0,1][0,1] 上独立的均匀变量。说明 ∑Ui−6\sum U_i - 6 近似服从 N(0,1)N(0,1)。[提示:均值 12×12−6=012\times\frac12 - 6 = 0,方差 12×112=112\times\frac1{12} = 1。这是早期计算机产生高斯随机数的方法。]
  2. 掷 10410^4 次硬币,正面超过 5100 次的概率约为多少?[答:σ=50\sigma = 50,超出 2σ2\sigma,约 2.3%。]
  3. 用特征函数证明:NN 个独立柯西变量的平均值仍服从同一个柯西分布。
  4. 在 [0,1]2[0,1]^2 中随机撒 10610^6 个点,用落在四分之一圆内的比例乘以 4 来估计 π\pi。估计的统计误差是多少?[答:比例 p=π/4p = \pi/4,误差 p(1−p)/106≈4.1×10−4\sqrt{p(1-p)/10^6}\approx4.1\times10^{-4},乘以 4 得约 1.6×10−31.6\times10^{-3}。]
  5. 对 K(s)=ln⁡1+es2K(s) = \ln\frac{1 + e^s}{2} 计算 (C6.3) 的 I(x)I(x),验证它等于 (22.18),并验证 I′′(1/2)=4=1/σ2I''(1/2) = 4 = 1/\sigma^2。