ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

点估计推导过程详解:从矩估计到最大似然估计

点估计推导过程详解:从矩估计到最大似然估计 1. 什么是点估计现实中我们经常不知道总体参数却能抽到样本。例如想知道某厂灯泡的平均寿命 μ总体均值不可能把所有灯泡都点亮测一遍想知道一枚硬币是否均匀即正面概率 p只能抛若干次记录结果。点估计Point Estimation就是从样本 X₁, X₂, …, Xₙ 出发构造一个统计量 θ̂ θ̂(X₁, …, Xₙ)用它的一个具体数值去“猜”未知参数 θ。点估计的逻辑链条是总体分布 → 抽样得到样本 → 构造统计量 → 输出一个数。关键问题是这个统计量怎么构造最常用的两套推导思路是矩估计法用“样本矩”代替“总体矩”最大似然估计找让现有样本“最有可能出现”的那个参数。2. 方法一矩估计法Method of Moments, MOM2.1 原理矩moment是分布的数字特征。k 阶总体原点矩定义为μₖ E(Xᵏ)k 1, 2, …其中一阶原点矩 μ₁ E(X) 就是均值。对应的样本原点矩是把期望换成“平均”Aₖ (1/n) · Σᵢ Xᵢᵏ矩估计的核心假设极其朴素样本矩依概率收敛到总体矩大数定律所以当样本量 n 较大时可以令Aₖ μₖ(θ)k 1, 2, …待估参数有几个就列几个方程解出来的就是矩估计 θ̂。推导步骤通用模板写出总体矩关于 θ 的函数 μₖ(θ)写出样本矩 Aₖ令 μₖ(θ) Aₖ解方程组把解中的样本符号换成观测值得到估计。2.2 例子 1正态分布 N(μ, σ²) 的矩估计设 X ~ N(μ, σ²)两个未知参数 θ (μ, σ²)列两个方程。第一步求总体矩。一阶原点矩和二阶原点矩分别为μ₁ E(X) μμ₂ E(X²) Var(X) [E(X)]² σ² μ²第二步写样本矩。A₁ (1/n) Σ Xᵢ X̄A₂ (1/n) Σ Xᵢ²第三步令总体矩 样本矩。由第一个方程直接得μ̂ A₁ X̄把 μ̂ X̄ 代入第二个方程σ² X̄² (1/n) Σ Xᵢ²移项并利用恒等式 Σ(Xᵢ − X̄)² Σ Xᵢ² − nX̄²σ̂² (1/n) Σ Xᵢ² − X̄² (1/n) Σ (Xᵢ − X̄)²数值例子某灯泡寿命单位小时抽了 5 只测得1010, 990, 1020, 980, 1000样本均值x̄ (1010 990 1020 980 1000) / 5 1000 小时样本二阶中心矩σ̂² [10² (−10)² 20² (−20)² 0²] / 5 1000 / 5 200所以矩估计结果为μ̂ 1000 小时σ̂² 200小时²σ̂ ≈ 14.14 小时。2.3 例子 2指数分布 Exp(λ) 的矩估计指数分布常用于“寿命/等待时间”建模密度为f(x; λ) λ · e^(−λx)x 0λ 0它的一阶原点矩均值是μ₁ E(X) ∫₀^∞ x · λ e^(−λx) dx 1/λ令 μ₁ A₁ X̄即 1/λ X̄解得 λ̂ 1/X̄。数值例子某设备故障间隔时间天记录为2, 4, 3, 7, 4。x̄ (2 4 3 7 4) / 5 4 天λ̂ 1/4 0.25 次/天含义平均每 4 天发生一次故障故障率约为 0.25 次/天。矩估计的优缺点原理直观、计算简单不需要完整写出密度但它只用到分布的前几阶矩信息没有利用分布的全部形状在小样本下不一定最优。3. 方法二最大似然估计Maximum Likelihood Estimation, MLE3.1 原理似然函数是什么设总体密度为 f(x; θ)样本 X₁, …, Xₙ 独立同分布。当样本已经抽出来了记观测值为 x₁, …, xₙ我们反过来问取哪个 θ最容易抽到眼前这组样本把联合密度看作 θ 的函数就是似然函数L(θ) ∏ᵢ f(xᵢ; θ)由于连乘容易下溢且对数单调通常改用对数似然ℓ(θ) ln L(θ) Σᵢ ln f(xᵢ; θ)MLE 就是求θ̂_MLE argmax L(θ) argmax ℓ(θ)在可微情形下令一阶导数为零∂ℓ(θ)/∂θ 0直观上似然函数随参数 θ 变化其峰值对应的就是 MLE。3.2 例子 1伯努利分布抛硬币设 Xᵢ ~ Bernoulli(p)即f(x; p) pˣ (1−p)^(1−x)x ∈ {0, 1}其中 x 1 表示正面x 0 表示反面。第一步写似然函数。L(p) ∏ p^(xᵢ) (1−p)^(1−xᵢ) p^(Σxᵢ) · (1−p)^(n−Σxᵢ)第二步取对数。ℓ(p) (Σxᵢ) ln p (n − Σxᵢ) ln(1−p)第三步对 p 求导并令其为零。dℓ/dp (Σxᵢ)/p − (n−Σxᵢ)/(1−p) 0第四步解方程。两边乘以 p(1−p)(Σxᵢ)(1−p) (n − Σxᵢ)pΣxᵢ − pΣxᵢ np − pΣxᵢ含 pΣxᵢ 的项抵消得Σxᵢ np ⟹ p̂ (1/n) Σxᵢ x̄数值例子抛一枚硬币 10 次结果为正、反、正、正、反、正、反、正、正、正即正面次数 Σxᵢ 7。p̂ 7/10 0.7于是我们估计这枚硬币正面概率约为 0.7有偏倾向于正面。3.3 例子 2正态分布 N(μ, σ²) 的 MLE密度为f(x; μ, σ²) 1/√(2πσ²) · exp[ −(x−μ)² / (2σ²) ]第一步对数似然。ℓ(μ, σ²) −(n/2) ln(2π) − (n/2) ln(σ²) − (1/(2σ²)) Σ(xᵢ−μ)²第二步对 μ 求偏导并令为零。∂ℓ/∂μ (1/σ²) Σ(xᵢ−μ) 0Σxᵢ − nμ 0 ⟹ μ̂ x̄第三步把 μ̂ x̄ 代入对 σ² 求偏导。为方便记 σ² v∂ℓ/∂v −n/(2v) (1/(2v²)) Σ(xᵢ − x̄)² 0两边乘 2v²−nv Σ(xᵢ − x̄)² 0 ⟹ v̂ σ̂² (1/n) Σ(xᵢ − x̄)²数值例子用 2.2 节那组灯泡寿命 1010, 990, 1020, 980, 1000μ̂ x̄ 1000 小时σ̂² (1/5) Σ(xᵢ−1000)² 200可见对于正态分布矩估计和 MLE 给出了完全相同的结果这不是巧合正态分布的总体矩恰好由均值和方差决定。4. 点估计的评价标准同一个参数往往有多个估计量怎么判断谁好常用三条标准。4.1 无偏性Unbiasedness若 E(θ̂) θ称 θ̂ 是 θ 的无偏估计。直观含义是在大量重复抽样下估计值的平均恰好落在真值上没有系统偏差。样本均值是无偏的E(X̄) E[(1/n) Σ Xᵢ] (1/n) Σ E(Xᵢ) (1/n)·nμ μ但 MLE 的方差估计是有偏的可以证明E[ (1/n) Σ(Xᵢ−X̄)² ] ((n−1)/n) · σ² ≠ σ²因此统计学里常把它修正为除以 n−1 的样本方差S² (1/(n−1)) Σ(Xᵢ−X̄)²E(S²) σ²无偏关键区分MLE 的 σ̂² (1/n)Σ(Xᵢ−X̄)² 有偏教材中常用的无偏样本方差是 S² (1/(n−1))Σ(Xᵢ−X̄)²。在 2.2 的灯泡例子中σ̂² 200若要无偏估计则 s² (5/4)×200 250。4.2 有效性Efficiency在所有无偏估计中方差越小越有效。方差大小由克拉默–拉奥下界Cramér–Rao Lower Bound决定Var(θ̂) ≥ 1 / [n·I(θ)]I(θ) E[ ∂ ln f(X;θ)/∂θ ]²对于大样本MLE 恰好达到这个下界因此它是渐近有效的——这也是 MLE 备受青睐的原因之一。4.3 一致性Consistency当 n → ∞ 时θ̂ 依概率收敛到真值 θθ̂ →ᴾ θn → ∞矩估计由大数定律保证一致MLE 在温和条件下也是一致的。通俗说样本越多估计越准。估计量针对参数无偏性一致性X̄μ无偏一致(1/n)Σ(Xᵢ−X̄)²σ²有偏偏 (n−1)/n一致S²(1/(n−1))Σ(...)σ²无偏一致1/X̄λ指数分布近似无偏一致5. 总结两种推导思路对比矩估计 MOM最大似然估计 MLE核心思想样本矩 ≈ 总体矩找让样本“最可能出现”的参数需要什么只需总体矩表达式需要完整密度/分布律推导关键解方程 Aₖ μₖ(θ)∂ln L/∂θ 0优点直观、计算简单利用全部分布信息大样本下有效、一致、渐近正态缺点只用矩信息可能低效需要可微/可求极值小样本可能有偏如 σ̂²一句话串起来点估计 构造一个统计量 θ̂ 去猜总体参数矩估计靠“样本矩等于总体矩”列方程MLE 靠“最大化对数似然”求导两者得到的估计还要用无偏性、有效性、一致性三条标准来检验。下一篇将继续推导最大似然估计在更多分布上的应用以及如何用梯度下降法数值求解 MLE。
返回列表