十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Steve Brunton | Probability Bootcamp | 笔记 | 第四部分:高级统计 | Lecture 36 | 中心极限定理

Steve Brunton | Probability Bootcamp | 笔记 | 第四部分:高级统计 | Lecture 36 | 中心极限定理 目录前言1. 引言2. CLT 陈述样本均值形式3. CLT 证明概略4. CLT 陈述变量和形式5. 结语结语参考前言学习 Steven Brunton 讲授的概率与统计入门概述视频本篇文章记录第三十六讲中心极限定理记录下个人学习笔记和大家一起分享交流videohttps://www.youtube.com/playlist?listPLMrJAkhIeNNR3sNYvfgiKgcStwuPSts9V1. 引言OK今天我将为大家阐述概率论与统计学中最重要的定理之一 — 中心极限定理。上节课我们讨论了大数定律并利用切比雪夫不等式完成了证明这是一个非常直观的结论当我们从n nn个相互独立且同分布的随机变量X 1 X_1X1​到X n X_nXn​中获取数据时这些数据可以来自n nn次抛硬币、掷骰子或是n nn份调查问卷你可以收集n nn个人的各类数据比如n nn个人的身高这并不重要这是从总体中抽取的n nn个独立随机变量那么样本均值X ˉ \bar{X}Xˉ实际上就是这些数值的平均值。当样本数量趋近于无穷大时这n nn个样本的算术平均值将收敛于它们所属分布的期望值这个结论非常直观我们直觉上就能理解这个结论的合理性当我从独立同分布IID的随机变量中收集越来越多的数据并计算其平均值时该平均值将收敛于该分布的期望值。而中心极限定理的适用范围更广这个定理具有更强的普适性在实际应用中也更为实用其核心思想一以贯之且更进一步。大数定律指出样本均值X ˉ \bar{X}Xˉ会收敛于总体均值μ \muμ而中心极限定理则更进一步X ˉ \bar{X}Xˉ服从正态分布其方差和均值均可通过计算得出。2. CLT 陈述样本均值形式接下来我来说明中心极限定理的核心表述中心极限定理的基本前提假设与此前相同我们设有n nn个独立同分布的随机变量样本均值X ˉ \bar{X}Xˉ的计算公式为X ˉ 1 n ∑ i 1 n X i \bar{X} \frac{1}{n} \sum_{i1}^n X_iXˉn1​i1∑n​Xi​即对全部n nn次独立试验结果取算术平均。这其实就是我所有数据的平均值这将是一个服从正态分布的随机变量该分布服从均值为μ \muμ方差为σ 2 n \frac{\sigma^2}{n}nσ2​的正态分布即X ˉ ∼ N ( μ , σ 2 n ) \bar{X} \sim \mathcal{N}(\mu, \frac{\sigma^2}{n})Xˉ∼N(μ,nσ2​)这意味着其标准差SD为σ n \frac{\sigma}{\sqrt{n}}n​σ​这样理解起来应该会更顺畅些这意味着样本均值不仅会收敛于分布期望值μ \muμ而且随着样本量n nn的增大样本均值的分布会逐渐趋近于高斯随机变量即呈现正态分布的特征。当处理实际数据时这能为我们提供关于样本均值估计精度的非常可靠的衡量标准这一点至关重要。例如当你尝试测量某个物理量比如光速或是电子的质量这类难以精确测量的物理量时你可能会进行约 30 次随机试验在这 30 次不同的测量中测得的光速或电子质量数值都会存在细微差异。这意味着无论这些随机变量原本服从何种分布 — 可能是均匀分布、指数分布或泊松分布等只要将它们相加并计算平均值这个平均值就会逐渐趋近于高斯分布其均值等于原始分布的实际均值而标准差随着试验次数的增加不断减小。这一发现对实验误差建模具有深远意义如何通过小样本均值推理总体特征这正是中心极限定理的核心价值该定理作为概率论与统计学中最重要的理论之一揭示了样本均值与总体参数之间的内在联系这正是通过样本均值表述该定理的一种方式其理论基础正是我们先前讨论的大数定律。我们很快将通过数值实验来验证这个结论我们将通过实际计算来观察当n nn增大时该统计量的变化规律我们将通过大量重复实验来验证这一规律。我们将以n 100 n100n100为例计算这些统计量的数值序列接下来我们将这个实验重复进行约 50 次从而观察该分布的期望方差特性。我们将通过计算机模拟展示其收敛于正态分布的过程并运用矩生成函数对此结论进行严格证明。这个定理的证明过程颇具挑战性需要些时间来逐步构建证明所需的数学框架这个证明过程虽然很有意思但并非理解的关键。3. CLT 证明概略如果你愿意相信这个结论并且能够掌握如何运用它那么不一定要深究证明过程不过这个证明确实很有意思我稍后会为大家讲解其基本思路建立在矩生成函数的基础上。简单来说矩生成函数与概率密度函数的拉普拉斯变换密切相关相差一个符号对于随机变量之和的矩生成函数记作m ( t ) m(t)m(t)在给定概率分布或概率密度函数P ( x ) P(x)P(x)的情况下若存在一组随机变量之和 — 此处的样本均值X ˉ \bar{X}Xˉ本质上就是一系列随机变量的加权和 — 则该总和的矩生成函数等于各独立试验个体矩生成函数的乘积。因此我们将通过已知变量的矩生成函数来逼近目标变量的矩生成函数我们将证明这类聚合矩生成函数会收敛于正态分布的矩生成函数后续内容敬请期待以上就是我们运用矩生成函数的核心思路概览。这种方法能清晰地展示该概率密度函数如何收敛至目标概率密度函数严格来说是前者的累积分布函数会收敛至后者的累积分布函数我们将借助矩生成函数来证明这一结论。这个思路确实非常精妙这虽然是个进阶课题但我很期待尽快为大家讲解。下面是关于样本均值的表述方式X ˉ 1 n ∑ i 1 n X i \bar{X} \frac{1}{n} \sum_{i1}^n X_iXˉn1​i1∑n​Xi​我特意这样书写是为了与大数定律建立关联。4. CLT 陈述变量和形式另一种表述方法是将所有变量之和记作S n S_nSn​S n ∑ k 1 n X k S_n \sum_{k1}^n X_kSn​k1∑n​Xk​这里我没有除以n nn求平均值而是直接将这些随机变量全部相加。我们也可以说这个总和S n S_nSn​服从正态分布是一个正态随机变量其均值为n μ n\munμ方差为n σ 2 n\sigma^2nσ2即S n ∼ N ( n μ , n σ 2 ) S_n \sim \mathcal{N}(n \mu, n\sigma^2)Sn​∼N(nμ,nσ2)因此这两种表述本质上是完全等价的但有时你会看到中心极限定理直接表述为这些变量之和的分布形式。从样本均值的分布角度来理解会更有意义因为这有助于我们理解实验误差和实验设计我们需要多大的样本如果我们希望方差小于某个特定值是否需要这样做这其中蕴含着诸多有趣的规律我得做多大规模的采样调查才能准确预测选举结果诸如此类的问题这些概念在此至关重要这一切都与中心极限定理中的n nn和σ 2 n \frac{\sigma^2}{n}nσ2​相关。5. 结语现在我要再次强调这个极其深刻的原理因为它确实意义深远无论X i X_iXi​服从何种分布只要这些变量满足独立同分布且具有相同均值与方差无论其具体分布形态如何都无关紧要由此可以得出关于中心极限定理的一个非常强大的结论。OK我想重点说明的是这本质上是对大数定律的重要拓展大数定律表明随着样本量n → ∞ n \rightarrow \inftyn→∞样本均值会收敛于总体均值μ \muμ且方差会不断减小。而中心极限定理的表述则更为深刻它指出该变量会逐渐趋近于服从正态分布其分布呈现出特定形态我们都能通过其均值和方差精确计算出该分布的均值与方差无论这些独立随机变量原本服从何种分布。这真是个深刻而令人意外的结论堪称概率论与统计学的基石在进行假设检验和实验设计时这个定理将成为我们不可或缺的工具。无论是置信区间构建还是任何基于数据做出统计推理的场景这个定理都发挥着根本性作用。结语中心极限定理CLT是整个概率论短期课程的终极结论也是 L33–L36 不等式与极限定理链条的顶点。LLN 告诉我们样本均值X ˉ n \bar{X}_nXˉn​收敛到μ \muμCLT 则进一步揭示了如何收敛X ˉ n ∼ N ( μ , σ 2 n ) \bar{X}_n \sim \mathcal{N}(\mu, \frac{\sigma^2}{n})Xˉn​∼N(μ,nσ2​)即样本均值的分布在大n nn下趋近于以μ \muμ为中心、以σ / n \sigma/\sqrt{n}σ/n​为标准差的正态分布。这一结论的普适性令人震撼无论原始X i X_iXi​来自何种分布—均匀、指数、泊松、伯努利甚至任何怪异形状—只要独立同分布且具有有限方差它们的均值就必然服从正态。这不是某个特定分布的偶然性质而是加法本身的深层数学结构。等价地以总和形式陈述S n ∑ X i ∼ N ( n μ , n σ 2 ) S_n \sum X_i \sim \mathcal{N}(n\mu, n\sigma^2)Sn​∑Xi​∼N(nμ,nσ2)。两种陈述之间的转换只需乘以或除以n nn和n 2 n^2n2但样本均值形式在实践中更为常用σ / n \sigma/\sqrt{n}σ/n​直接给出了 “估计精度如何随样本量提升” 的答案—精度以n \sqrt{n}n​而非n nn的速率提高样本量翻倍标准误仅减小约 30%。这对实验设计有直接的工程含义若想将估计精度提高一位小数需要100 × 100\times100×的样本量。证明方面Brunton 勾勒了矩生成函数MGF的核心思路独立和⇒ \Rightarrow⇒MGF 相乘标准化后的 MGF→ n → ∞ e t 2 / 2 \xrightarrow{n\to\infty} e^{t^2/2}n→∞​et2/2标准正态的 MGFMGF 的逐点收敛等价于分布的收敛。这一证明思路将拉普拉斯变换、特征函数与极限理论串联在一起属于概率论 “优雅证明” 的殿堂级展示。CLT 的现实意义贯穿整个统计推断体系置信区间的构建假设样本均值近似正态假设检验的p pp值计算依赖正态尾概率选举民调的误差范围margin of error是± 1.96 ⋅ σ / n \pm 1.96 \cdot \sigma/\sqrt{n}±1.96⋅σ/n​蒙特卡洛方法的收敛速率由 CLT 保证。从测量光速的物理实验到预测选情的统计模型CLT 是所有这些实践背后的 “隐形操作系统”—它解释了为什么在充满复杂与混沌的世界里钟形曲线依然无处不在 。参考https://www.youtube.com/playlist?listPLMrJAkhIeNNR3sNYvfgiKgcStwuPSts9V
返回列表