不重复抽样公式推导全解析,掌握核心算法提升效率 深入解析:不重复抽样(不放回抽样)方差公式的严谨推导
在统计学中,抽样调查是推断总体特征的核心手段。当我们从有限总体中抽取样本时,最常被提及的两种抽样方式分别是有放回抽样(Simple Random Sampling with Replacement, SRSWR)和无放回抽样(Simple Random Sampling without Replacement, SRSWR,简称不重复抽样)。 虽然两者在样本均值估计上具有无偏性,但在方差估计上却存在显著差异。特别是当抽样比()不可忽略时,不重复抽样的方差需要引入“有限总体校正系数”(Finite Population Correction, FPC)。 本文将通过严谨的数学推导,揭示不重复抽样中方差公式的来源,并解释其背后的逻辑。
1. 问题设定与基本定义
假设有一个大小为 的有限总体,其中的个体值分别为 。 定义总体的均值为 ,总体方差为 : (注:此处定义总体方差时分母为 ,这是推导过程中的常见设定。若使用样本方差分母为 的定义,最终结果形式略有不同,但校正系数逻辑一致。) 现在,我们从该总体中随机抽取一个容量为 的样本,且不放回。 设样本中的第 个观测值为 ()。 样本均值为: 我们的目标是计算样本均值 的方差,即 。
2. 核心推导思路
样本均值的方差可以展开为: 为了计算 的方差,我们需要利用方差的可加性公式。对于任意随机变量之和,其方差等于各变量方差之和加上所有两两协方差之和: 这里的关键在于:在不重复抽样中,样本内的各个观测值 并非相互独立! 因此,协方差项 不为零,必须予以考虑。
3. 逐步推导过程
第一步:计算单个观测值的方差
由于是不重复简单随机抽样,总体中的每一个个体被抽中的概率是相等的。因此,对于任意位置 的样本 ,其分布与总体分布相同。 即 的期望为 ,方差为总体方差 : 共有 个这样的项,所以第一部分求和为:
第二步:计算两个不同观测值的协方差
考虑 的情况。我们需要计算 。 已知 ,所以: 接下来计算 。 在不重复抽样中, 相当于从总体中随机抽取的两个不同个体的有序对。 总体中所有可能的不同个体对 (其中 )共有 种组合,且每种组合出现的概率相等,均为 。 因此: 为了计算 ,我们可以利用恒等式: 所以: 我们知道 ,且 (因为 )。 代入得: 现在回到期望值: 最后,计算协方差: 关键洞察:在不重复抽样中,协方差是负值。这是因为如果第一个抽到的值偏高,剩余总体中剩下的值平均偏低,导致第二个抽到的值倾向于偏低,两者存在负相关。
第三步:合并所有项
回到方差展开式: 1. 方差项之和: 2. 协方差项之和: 共有 对不同的 组合(因为 有 种选法, 有 种选法,且 )。 将两部分相加: 提取公因式 : 化简括号内的项: 所以:
第四步:计算样本均值的方差
最后,代回第一步的公式 : 通常,我们将 称为有限总体校正系数(FPC)。
4. 结果分析与讨论
最终得到的不重复抽样样本均值方差公式为: 作为对比,有放回抽样的方差公式为:
1. 校正系数的意义
当 很大时:如果总体容量 远大于样本容量 (例如 ),则 。此时不重复抽样与有放回抽样的方差几乎相同,可以忽略校正系数。 当 接近 时:随着样本量增加,方差减小。当 (普查)时,校正系数变为 0,方差为 0。这符合逻辑,因为普查没有抽样误差。
2. 为什么方差更小?
从直觉上看,不重复抽样比有放回抽样提供了更多的信息。在有放回抽样中,我们可能重复抽到同一个极端值,导致样本变异较大;而不重复抽样强制样本覆盖总体的不同部分,使得样本均值更稳定地逼近总体均值。数学上的负协方差项 正是这一现象的体现。
3. 实际应用中的近似
在实际应用中,当 很大时,分母中的 通常近似为 ,公式简化为: 其中 即为常见的抽样比校正因子。
5. 结论
通过对不重复抽样方差公式的严谨推导,我们不仅得到了最终的数学表达式,更深刻理解了有限总体校正系数的来源。它源于样本单元间的负相关性。 这一推导提醒统计工作者: 1. 在总体规模有限且抽样比不可忽略时,直接使用有放回抽样公式会高估方差(即过于保守)。 2. 正确应用校正系数可以提高估计的精度,并在样本量规划中提供更准确的依据。 掌握这一推导过程,有助于从底层逻辑上把握抽样设计的精髓,而非仅仅机械地套用公式。