数学基础 · 附录 C 概率与统计要点 · C5

高斯(正态)分布

The Gaussian (Normal) Distribution
已完成速查更新于 2026.10.08统计物理讲义 v1.0

高斯分布是统计物理中出现最多的分布:速度分量(§5.4)、宏观量的涨落(§2.4、§4.4、§22.1)、扩散粒子的位置(§P5.2)、高分子的末端距(§30.1)、朗之万方程中的随机力(第23章)。本节汇总它的性质,并说明它为什么无处不在。

§C5.1定义与基本性质

p(x)=12πσ2exp⁡[−(x−μ)22σ2](C5.1)p(x) = \frac{1}{\sqrt{2\pi\sigma^2}}\exp\left[-\frac{(x - \mu)^2}{2\sigma^2}\right] \tag{C5.1}

记作 X∼N(μ,σ2)X\sim N(\mu,\sigma^2)。正文 §2.3 已用高斯积分验证了归一化、均值 μ\mu 与方差 σ2\sigma^2。令 z=(x−μ)/σz = (x - \mu)/\sigma,任何高斯变量都化为标准正态 N(0,1)N(0,1)。

矩与累积量:奇数阶中心矩为零(对称性);偶数阶中心矩 ⟨(x−μ)2n⟩=(2n−1)!! σ2n\langle(x-\mu)^{2n}\rangle = (2n-1)!!\,\sigma^{2n}((A7.4))。累积量生成函数 K(s)=μs+12σ2s2K(s) = \mu s + \frac12\sigma^2s^2(由 (A7.5)),所以只有前两个累积量不为零——高斯分布完全由均值和方差确定。特征函数为 ϕ(k)=eikμ−σ2k2/2\phi(k) = e^{ik\mu - \sigma^2k^2/2}。

§C5.2概率的数值与尾巴

偏离平均值不超过 kσk\sigma 的概率为 erf(k/2)\mathrm{erf}(k/\sqrt2),其中 erf(x)=2π∫0xe−t2dt\mathrm{erf}(x) = \frac{2}{\sqrt\pi}\int_0^xe^{-t^2}dt 称为误差函数:

范围∣x−μ∣<σ\lvert x - \mu\rvert<\sigma<2σ<2\sigma<3σ<3\sigma
概率68.3%95.4%99.73%

单侧的尾巴 P(x−μ>kσ)=∫k∞e−z2/22πdzP(x - \mu>k\sigma) = \int_k^\infty\frac{e^{-z^2/2}}{\sqrt{2\pi}}dz 在 kk 较大时可以这样估计:写成 ∫k∞1z⋅ze−z2/2dz\int_k^\infty\frac{1}{z}\cdot ze^{-z^2/2}dz 并分部积分(ze−z2/2ze^{-z^2/2} 的原函数是 −e−z2/2-e^{-z^2/2}),

P(x−μ>kσ)=e−k2/2k2π[1−1k2+⋯ ](C5.2)P(x - \mu>k\sigma) = \frac{e^{-k^2/2}}{k\sqrt{2\pi}}\left[1 - \frac{1}{k^2} + \cdots\right] \tag{C5.2}

例如 k=5k = 5:(C5.2) 的首项给出 3.0×10−73.0\times10^{-7},严格值 2.9×10−72.9\times10^{-7}。尾巴的衰减由 e−k2/2e^{-k^2/2} 主导:多偏离一点,概率就小很多。§2.4 中 N=1020N = 10^{20} 的硬币偏离 10−5N10^{-5}N 时,k=2×105k = 2\times10^5,概率约 e−2×1010e^{-2\times10^{10}}——宏观上"不可能"的事件在概率论里只是极其罕见。(但要注意:这样远的尾巴已超出高斯近似的有效范围,真实的概率由大偏差的速率函数给出,§22.6。)

§C5.3线性组合仍是高斯分布

独立高斯变量之和是高斯变量:若 X∼N(μ1,σ12)X\sim N(\mu_1,\sigma_1^2)、Y∼N(μ2,σ22)Y\sim N(\mu_2,\sigma_2^2) 独立,特征函数相乘(§C3.6),eikμ1−σ12k2/2eikμ2−σ22k2/2e^{ik\mu_1 - \sigma_1^2k^2/2}e^{ik\mu_2 - \sigma_2^2k^2/2} 仍是高斯型,所以 X+Y∼N(μ1+μ2, σ12+σ22)X + Y\sim N(\mu_1 + \mu_2,\ \sigma_1^2 + \sigma_2^2)。更一般地,联合高斯变量(例如相互独立的高斯变量)的线性组合仍是高斯变量。这一性质使得线性系统在高斯噪声驱动下的响应仍然是高斯的:例如朗之万方程的解 (23.5) 是高斯随机力的线性泛函,所以速度服从高斯分布(附录 C9 的奥恩斯坦–乌伦贝克过程)。

§C5.4多元高斯分布

nn 个变量的联合高斯分布为

p(x)=det⁡A(2π)nexp⁡[−12(x−μ)TA(x−μ)](C5.3)p(\mathbf x) = \sqrt{\frac{\det A}{(2\pi)^n}}\exp\left[-\frac12(\mathbf x - \boldsymbol\mu)^{\mathsf T}A(\mathbf x - \boldsymbol\mu)\right] \tag{C5.3}

AA 为实对称正定矩阵(归一化由 (B2.7) 给出)。由 (B2.9),协方差矩阵 C=⟨δx δxT⟩C = \langle\delta\mathbf x\,\delta\mathbf x^{\mathsf T}\rangle 等于 A−1A^{-1}。§22.1 的爱因斯坦涨落公式正是这种形式(AA 换成 A/kBA/k_{\mathrm B})。

性质:

  1. 边缘分布仍是高斯分布:对部分变量积分(用配方法),剩下的变量仍服从高斯分布,其协方差矩阵就是 CC 中相应的子矩阵。
  2. 不相关 ⟺ 独立(这是高斯分布的特殊性质,一般分布只有"独立 ⇒ 不相关"):若 CC 是对角矩阵,则 A=C−1A = C^{-1} 也是对角的,(C5.3) 的指数是各变量的平方和,概率密度因子化为各变量的一维高斯分布之积,即独立。§30.1 中末端距三个分量的独立性正是由此而来(§C3.4)。
  3. 二元的例子:两个方差为 1、相关系数为 rr 的高斯变量,
p(x,y)=12π1−r2exp⁡[−x2−2rxy+y22(1−r2)]p(x,y) = \frac{1}{2\pi\sqrt{1 - r^2}}\exp\left[-\frac{x^2 - 2rxy + y^2}{2(1 - r^2)}\right]

(C=(1rr1)C = \begin{pmatrix}1&r\\r&1\end{pmatrix},det⁡C=1−r2\det C = 1 - r^2,A=C−1=11−r2(1−r−r1)A = C^{-1} = \frac{1}{1-r^2}\begin{pmatrix}1&-r\\-r&1\end{pmatrix}。)已知 X=xX = x 时,YY 的条件分布是均值 rxrx、方差 1−r21 - r^2 的高斯分布(自测题 4):知道了 XX,对 YY 的不确定性减小了。

§C5.5维克定理(伊瑟利斯定理)

对均值为零的联合高斯变量,高阶矩等于所有两两配对方式的二阶矩乘积之和。例如

⟨x1x2x3x4⟩=⟨x1x2⟩⟨x3x4⟩+⟨x1x3⟩⟨x2x4⟩+⟨x1x4⟩⟨x2x3⟩(C5.4)\langle x_1x_2x_3x_4\rangle = \langle x_1x_2\rangle\langle x_3x_4\rangle + \langle x_1x_3\rangle\langle x_2x_4\rangle + \langle x_1x_4\rangle\langle x_2x_3\rangle \tag{C5.4}

奇数个变量之积的平均为零;2n2n 个变量共有 (2n−1)!!(2n-1)!! 种配对方式。特例 x1=⋯=x4=xx_1 = \cdots = x_4 = x:⟨x4⟩=3⟨x2⟩2\langle x^4\rangle = 3\langle x^2\rangle^2,与 (A7.4) 一致。

证明:由 (B2.8)–(B2.9),⟨ebTx⟩=e12bTCb=e12∑ijCijbibj\langle e^{\mathbf b^{\mathsf T}\mathbf x}\rangle = e^{\frac12\mathbf b^{\mathsf T}C\mathbf b} = e^{\frac12\sum_{ij}C_{ij}b_ib_j}。⟨x1x2x3x4⟩\langle x_1x_2x_3x_4\rangle 是左边展开式中 b1b2b3b4b_1b_2b_3b_4 的系数。右边的指数展开中,含四个不同 bb 的项只来自二阶项 12!(12∑Cijbibj)2\frac{1}{2!}\left(\frac12\sum C_{ij}b_ib_j\right)^2;把 b1b2b3b4b_1b_2b_3b_4 分成两对的方式有三种,每种的系数恰好是相应的 CijCklC_{ij}C_{kl}(12⋅14\frac12\cdot\frac14 被 i,ji,j 的两种次序、k,lk,l 的两种次序以及两对的两种先后次序共 8 种排列抵消)。

维克定理把一切高斯涨落的计算化为二阶关联函数("传播子")的组合,是场论与多体理论中费曼图方法的基础。

§C5.6高斯分布为什么无处不在

  1. 中心极限定理(附录 C6):大量独立(或弱关联)小贡献之和趋于高斯分布,与各贡献的具体分布无关。宏观量正是大量微观贡献之和。
  2. 在极大值附近展开:任何尖锐的分布 p∝ef(x)p\propto e^{f(x)},把 ff 在极大值处展开到二阶,就得到高斯近似(拉普拉斯方法,§2.3;爱因斯坦涨落公式,§22.1)。NN 越大,峰越尖,近似越好。
  3. 最大熵(§A12.5):只知道均值与方差时,熵最大的分布是高斯分布。
  4. 线性动力学保持高斯性(§C5.3):线性系统受高斯噪声驱动,输出仍是高斯的。

什么时候不是高斯分布:(a) 方差无限的"重尾"分布(例如洛伦兹分布,附录 C6);(b) 临界点附近,关联长度发散,大量贡献不再"独立",序参量的涨落是非高斯的(临界指数 η≠0\eta\ne0 的来源之一,第19、20章);(c) 远离平均值的大偏差(§22.6):高斯近似只在平均值附近若干个 σ\sigma 内可靠。

自测题

  1. 设 X∼N(μ,σ2)X\sim N(\mu,\sigma^2),证明 ⟨eX⟩=eμ+σ2/2\langle e^X\rangle = e^{\mu + \sigma^2/2}。[提示:(A7.5),或特征函数中令 k=−ik = -i。]
  2. 用维克定理求 ⟨x6⟩\langle x^6\rangle(⟨x⟩=0\langle x\rangle = 0,⟨x2⟩=σ2\langle x^2\rangle = \sigma^2)。[答:15σ615\sigma^6。]
  3. 设 XX、YY 独立且都服从 N(0,1)N(0,1)。证明 U=X+YU = X + Y 与 W=X−YW = X - Y 相互独立。[提示:二者联合高斯,Cov(U,W)=VarX−VarY=0\mathrm{Cov}(U,W) = \mathrm{Var}X - \mathrm{Var}Y = 0。]
  4. 对 §C5.4 的二元高斯分布,求 X=xX = x 时 YY 的条件分布。[提示:把指数对 yy 配方:x2−2rxy+y2=(y−rx)2+(1−r2)x2x^2 - 2rxy + y^2 = (y - rx)^2 + (1 - r^2)x^2。答:N(rx, 1−r2)N(rx,\ 1 - r^2)。]
  5. 用 (C5.2) 估计 P(x−μ>3σ)P(x - \mu>3\sigma),并与严格值 0.001350.00135 比较。[答:首项给出 0.001480.00148;乘上 (1−1/9)(1 - 1/9) 后为 0.001310.00131。]