数学基础 · 附录 C 概率与统计要点 · C2

期望、方差与矩;詹森不等式

Expectation, Variance and Moments; Jensen's Inequality
已完成速查更新于 2026.10.08统计物理讲义 v1.0

正文用到本节的地方:玩具模型的平均值与涨落(§2.2);能量涨落与热容(§4.4);博戈留波夫不等式(§18.5);相对熵的非负性(§23.6);雅津斯基等式与第二定律(§33.4)。

§C2.1期望(平均值)

离散变量 ⟨X⟩=∑kxkpk\langle X\rangle = \sum_kx_kp_k,连续变量 ⟨X⟩=∫x p(x) dx\langle X\rangle = \int x\,p(x)\,dx。函数的平均值直接用原来的分布计算:

⟨g(X)⟩=∑kg(xk) pk或∫g(x) p(x) dx(C2.1)\langle g(X)\rangle = \sum_kg(x_k)\,p_k\quad\text{或}\quad\int g(x)\,p(x)\,dx \tag{C2.1}

(不必先求出 g(X)g(X) 的分布。)数学书中也记作 E[X]E[X];物理中常写 ⟨X⟩\langle X\rangle 或 Xˉ\bar X。

线性:⟨aX+bY⟩=a⟨X⟩+b⟨Y⟩\langle aX + bY\rangle = a\langle X\rangle + b\langle Y\rangle,无论 XX、YY 是否独立(用联合分布写出来,求和可以拆开,附录 C3)。这一条看似平凡,却极其有用。

指示变量技巧。事件 AA 的指示变量 1A\mathbb 1_A 在 AA 发生时为 1、否则为 0,⟨1A⟩=P(A)\langle\mathbb 1_A\rangle = P(A)。要求"满足某种条件的对象的平均个数",把总数写成指示变量之和再用线性性。例:§2.2 中 n=∑ixin = \sum_ix_i,⟨n⟩=∑i⟨xi⟩=N/2\langle n\rangle = \sum_i\langle x_i\rangle = N/2;体积 VV 中 NN 个独立均匀分布的粒子,落在子体积 vv 中的平均个数为 N⋅(v/V)N\cdot(v/V)。

注意 ⟨g(X)⟩≠g(⟨X⟩)\langle g(X)\rangle\ne g(\langle X\rangle)(除非 gg 是线性的)。例如 ⟨X2⟩≠⟨X⟩2\langle X^2\rangle\ne\langle X\rangle^2,⟨1/X⟩≠1/⟨X⟩\langle1/X\rangle\ne1/\langle X\rangle,⟨eX⟩≠e⟨X⟩\langle e^X\rangle\ne e^{\langle X\rangle}。两者之间的不等式关系由 §C2.5 的詹森不等式给出。

§C2.2方差与标准差

Var(X)=⟨(X−⟨X⟩)2⟩=⟨X2⟩−⟨X⟩2(C2.2)\mathrm{Var}(X) = \left\langle(X - \langle X\rangle)^2\right\rangle = \langle X^2\rangle - \langle X\rangle^2 \tag{C2.2}

(第二个等号:展开平方,⟨X2−2X⟨X⟩+⟨X⟩2⟩=⟨X2⟩−2⟨X⟩2+⟨X⟩2\langle X^2 - 2X\langle X\rangle + \langle X\rangle^2\rangle = \langle X^2\rangle - 2\langle X\rangle^2 + \langle X\rangle^2,用了线性性与"⟨X⟩\langle X\rangle 是常数"。)标准差 σ=Var\sigma = \sqrt{\mathrm{Var}} 衡量分布的宽度;σ/⟨X⟩\sigma/\langle X\rangle 是相对涨落。性质:Var(aX+b)=a2Var(X)\mathrm{Var}(aX + b) = a^2\mathrm{Var}(X)(平移不改变宽度);Var≥0\mathrm{Var}\ge0,等号当且仅当 XX 恒为常数。

物理中的例子:σE2=kBT2CV\sigma_E^2 = k_{\mathrm B}T^2C_V((4.13)),于是由 Var≥0\mathrm{Var}\ge0 得 CV≥0C_V\ge0——热力学稳定性条件成了概率论的平凡推论。

§C2.3切比雪夫不等式

P(∣X−μ∣≥kσ)≤1k2(C2.3)P\big(\lvert X - \mu\rvert\ge k\sigma\big)\le\frac{1}{k^2} \tag{C2.3}

(μ=⟨X⟩\mu = \langle X\rangle。)证明:σ2=∫(x−μ)2p dx≥∫∣x−μ∣≥kσ(x−μ)2p dx≥k2σ2∫∣x−μ∣≥kσp dx\sigma^2 = \int(x - \mu)^2p\,dx\ge\int_{\lvert x-\mu\rvert\ge k\sigma}(x - \mu)^2p\,dx\ge k^2\sigma^2\int_{\lvert x-\mu\rvert\ge k\sigma}p\,dx,两边除以 k2σ2k^2\sigma^2。

它对任何分布都成立,所以很粗糙(高斯分布偏离 3σ3\sigma 的概率是 0.27%,切比雪夫只保证不超过 11%),但它告诉我们:只要方差小,大偏离就不可能。这是证明大数定律的关键一步(附录 C6)。例:宏观量的相对涨落 σ/μ∼10−12\sigma/\mu\sim10^{-12},则偏离平均值达 10−810^{-8}(相对值)的概率不超过 (10−12/10−8)2=10−8(10^{-12}/10^{-8})^2 = 10^{-8}——这还只是最保守的估计。

§C2.4矩、累积量与生成函数

矩 mn=⟨Xn⟩m_n = \langle X^n\rangle,中心矩 ⟨(X−μ)n⟩\langle(X - \mu)^n\rangle。方差是二阶中心矩;三阶中心矩衡量分布的不对称(偏度),四阶衡量"尾巴"的轻重。

矩生成函数 M(s)=⟨esX⟩=∑nsnn!mnM(s) = \langle e^{sX}\rangle = \sum_n\frac{s^n}{n!}m_n:它在 s=0s = 0 处的各阶导数就是各阶矩。累积量生成函数

K(s)=ln⁡M(s)=∑n≥1snn!κn(C2.4)K(s) = \ln M(s) = \sum_{n\ge1}\frac{s^n}{n!}\kappa_n \tag{C2.4}

的展开系数 κn\kappa_n 称为累积量。由 K′=M′/MK' = M'/M、K′′=M′′/M−(M′/M)2K'' = M''/M - (M'/M)^2 在 s=0s = 0 处取值(M(0)=1M(0) = 1):

κ1=⟨X⟩,κ2=Var(X),κ3=⟨(X−μ)3⟩,κ4=⟨(X−μ)4⟩−3 Var(X)2(C2.5)\kappa_1 = \langle X\rangle,\qquad \kappa_2 = \mathrm{Var}(X),\qquad \kappa_3 = \langle(X - \mu)^3\rangle,\qquad \kappa_4 = \langle(X - \mu)^4\rangle - 3\,\mathrm{Var}(X)^2 \tag{C2.5}

为什么用累积量:若 XX、YY 独立,⟨es(X+Y)⟩=⟨esX⟩⟨esY⟩\langle e^{s(X+Y)}\rangle = \langle e^{sX}\rangle\langle e^{sY}\rangle(附录 C3),所以 KX+Y=KX+KYK_{X+Y} = K_X + K_Y:独立变量之和的各阶累积量都是相加的。对高斯分布,K(s)=μs+12σ2s2K(s) = \mu s + \frac12\sigma^2s^2(由 (A7.5)),三阶及以上的累积量全为零;所以高阶累积量衡量"偏离高斯的程度"。

ln⁡Z\ln Z 就是累积量生成函数。正则分布下 ⟨e−λE⟩=1Z(β)∑ie−(β+λ)Ei=Z(β+λ)Z(β)\langle e^{-\lambda E}\rangle = \frac{1}{Z(\beta)}\sum_ie^{-(\beta + \lambda)E_i} = \frac{Z(\beta + \lambda)}{Z(\beta)},所以能量的累积量生成函数为 ln⁡Z(β+λ)−ln⁡Z(β)\ln Z(\beta + \lambda) - \ln Z(\beta)(以 −λ-\lambda 为变量),

κn(E)=(−1)n∂nln⁡Z∂βn(C2.6)\kappa_n(E) = (-1)^n\frac{\partial^n\ln Z}{\partial\beta^n} \tag{C2.6}

n=1,2n = 1,2 就是 (A7.6)。由于 ln⁡Z∝N\ln Z\propto N,能量的所有累积量都正比于 NN;相对涨落 κ21/2/κ1∝N−1/2\kappa_2^{1/2}/\kappa_1\propto N^{-1/2},偏度 κ3/κ23/2∝N−1/2\kappa_3/\kappa_2^{3/2}\propto N^{-1/2}——NN 越大,分布越接近一个窄的高斯峰。

特征函数 ϕ(k)=⟨eikX⟩=∫p(x)eikxdx\phi(k) = \langle e^{ikX}\rangle = \int p(x)e^{ikx}dx 是概率密度的傅里叶变换(附录 A14 的时间约定)。它对任何分布都存在(∣eikx∣=1\lvert e^{ikx}\rvert = 1),ϕ(0)=1\phi(0) = 1,并且通过反变换唯一地确定 p(x)p(x)。矩由导数给出:⟨Xn⟩=(−i)nϕ(n)(0)\langle X^n\rangle = (-i)^n\phi^{(n)}(0)。高斯分布的特征函数是 eikμ−σ2k2/2e^{ik\mu - \sigma^2k^2/2}(由 (A14.9))。附录 C6 用它证明中心极限定理。

§C2.5詹森不等式

凸函数(g′′≥0g''\ge0,图像向上弯)位于它任一点切线的上方:g(x)≥g(x0)+g′(x0)(x−x0)g(x)\ge g(x_0) + g'(x_0)(x - x_0)。取 x0=⟨X⟩x_0 = \langle X\rangle,对 XX 的分布求平均,右边第二项的平均为零,于是

⟨g(X)⟩≥g(⟨X⟩)(g 凸)(C2.7)\langle g(X)\rangle\ge g(\langle X\rangle)\qquad(g\text{ 凸}) \tag{C2.7}

对凹函数不等号反向。若 gg 严格凸(g′′>0g''>0),等号当且仅当 XX 是常数。直观图像:凸函数上两点的连线(弦)在曲线上方,"先平均再取函数"落在曲线上,"先取函数再平均"落在弦上。

例:

  1. g=x2g = x^2:⟨X2⟩≥⟨X⟩2\langle X^2\rangle\ge\langle X\rangle^2,即 Var≥0\mathrm{Var}\ge0。
  2. g=exg = e^x:⟨eX⟩≥e⟨X⟩\langle e^X\rangle\ge e^{\langle X\rangle}。这就是博戈留波夫不等式 (18.21) 的来源:⟨e−β(H−H0)⟩0≥e−β⟨H−H0⟩0\langle e^{-\beta(\mathcal H - \mathcal H_0)}\rangle_0\ge e^{-\beta\langle\mathcal H - \mathcal H_0\rangle_0}。
  3. 雅津斯基等式与第二定律(§33.4):⟨e−βW⟩=e−βΔF\langle e^{-\beta W}\rangle = e^{-\beta\Delta F} (33.1)。由 (C2.7),e−β⟨W⟩≤⟨e−βW⟩=e−βΔFe^{-\beta\langle W\rangle}\le\langle e^{-\beta W}\rangle = e^{-\beta\Delta F},所以 ⟨W⟩≥ΔF\langle W\rangle\ge\Delta F:平均而言,外界做的功不少于自由能的增加——这就是第二定律。个别实现中 W<ΔFW<\Delta F 是允许的,只是必须足够罕见。
  4. 熵的上界:ln⁡\ln 是凹函数,所以 ⟨ln⁡Y⟩≤ln⁡⟨Y⟩\langle\ln Y\rangle\le\ln\langle Y\rangle。取 Y=1/PiY = 1/P_i(以概率 PiP_i 取值,只计 Pi>0P_i>0 的 Ω\Omega 个态):−∑iPiln⁡Pi=⟨ln⁡(1/P)⟩≤ln⁡∑iPi⋅1Pi=ln⁡Ω-\sum_iP_i\ln P_i = \langle\ln(1/P)\rangle\le\ln\sum_iP_i\cdot\frac{1}{P_i} = \ln\Omega。熵在等概率分布时最大,与附录 A8 的例 2 一致。
  5. 相对熵非负(吉布斯不等式):对两个分布 PP、QQ,
D(P∥Q)≡∑iPiln⁡PiQi≥0(C2.8)D(P\Vert Q)\equiv\sum_iP_i\ln\frac{P_i}{Q_i}\ge0 \tag{C2.8}

证明:−D=∑iPiln⁡QiPi≤ln⁡∑iPiQiPi=ln⁡∑iQi≤0-D = \sum_iP_i\ln\frac{Q_i}{P_i}\le\ln\sum_iP_i\frac{Q_i}{P_i} = \ln\sum_iQ_i\le0;等号当且仅当 P=QP = Q。§23.6 中 D(t)=∑iPiln⁡(Pi/πi)≥0\mathcal D(t) = \sum_iP_i\ln(P_i/\pi_i)\ge0 就是相对熵,它随时间单调减小到零((23.20),证明用到细致平衡),说明满足细致平衡的主方程总使系统趋于平衡分布。

自测题

  1. 求 [0,1][0,1] 上均匀分布的方差。[答:13−14=112\frac13 - \frac14 = \frac1{12}。]
  2. 指数分布 p=λe−λxp = \lambda e^{-\lambda x} 的累积量生成函数是 K(s)=−ln⁡(1−s/λ)K(s) = -\ln(1 - s/\lambda)。求 κ1\kappa_1、κ2\kappa_2 与一般的 κn\kappa_n。[答:1/λ1/\lambda,1/λ21/\lambda^2,κn=(n−1)!/λn\kappa_n = (n-1)!/\lambda^n。]
  3. 两能级系统(能量 00 与 ε\varepsilon),激发态概率 p=1/(eβε+1)p = 1/(e^{\beta\varepsilon} + 1)。求能量的方差,并由 (4.13) 写出热容。[答:ε2p(1−p)\varepsilon^2p(1-p);C=kB(βε)2eβε(eβε+1)2C = k_{\mathrm B}(\beta\varepsilon)^2\frac{e^{\beta\varepsilon}}{(e^{\beta\varepsilon} + 1)^2}(肖特基峰)。]
  4. 用詹森不等式证明:对正的随机变量,⟨1/X⟩≥1/⟨X⟩\langle1/X\rangle\ge1/\langle X\rangle。
  5. 对 Y=Y = 骰子点数,比较切比雪夫不等式对 P(∣Y−3.5∣≥2.5)P(\lvert Y - 3.5\rvert\ge2.5) 给出的上界与真实值。[答:σ2=35/12\sigma^2 = 35/12,k=2.5/σ≈1.46k = 2.5/\sigma\approx1.46,上界 ≈0.47\approx0.47;真实值 2/6≈0.332/6\approx0.33。]