统计推断

核心观点:统计推断是从样本数据推断总体特征的方法,是数据分析和机器学习的核心。


📊 统计推断框架

graph TB
    subgraph 统计推断
        A1["参数估计<br/>点估计/区间估计"]
        A2["假设检验<br/>判断假设真伪"]
        A3["回归分析<br/>变量关系"]
    end    
    A1 & A2 & A3
    
    style A1 fill:#ffebee

🎯 点估计

点估计方法

方法原理优缺点
矩估计样本矩=总体矩简单但不一定最优
最大似然估计使似然函数最大最优但计算复杂
贝叶斯估计后验众数/均值融合先验信息

估计量性质

graph TB
    subgraph 估计量性质
        A1["无偏性<br/>E(θ̂) = θ"]
        A2["有效性<br/>方差最小"]
        A3["一致性<br/>θ̂ → θ"]
        A4["充分性<br/>包含全部信息"]
    end    
    A1 & A2 & A3 & A4
    
    style A1 fill:#ffebee

最大似然估计

步骤内容公式
1. 构造似然函数所有样本联合概率L(θ) = ∏P(xᵢ|θ)
2. 对数似然取对数简化计算l(θ) = ∑logP(xᵢ|θ)
3. 求导最大化令导数为0∂l/∂θ = 0

📐 区间估计

置信区间

概念公式意义
置信区间[θ̂₋, θ̂₊]参数可能范围
置信水平1-α包含真值的概率

常用置信区间

graph TB
    subgraph 置信区间
        A1["均值<br/>X̄ ± zₐ/₂σ/√n"]
        A2["方差<br/>χ²分布"]
        A3["比例<br/>p̂ ± zₐ/₂√(p̂(1-p̂)/n)"]
    end    
    A1 & A2 & A3
    
    style A1 fill:#ffebee

🧪 假设检验

检验步骤

步骤内容说明
1. 建立假设H₀ vs H₁原假设/备择假设
2. 选择统计量检验统计量t检验、χ²检验
3. 确定拒绝域临界值显著性水平α
4. 做出决策拒绝/不拒绝p值判断

常见检验

graph TB
    subgraph 假设检验
        A1["t检验<br/>均值检验"]
        A2["χ²检验<br/>方差/独立性"]
        A3["F检验<br/>方差齐性"]
        A4["非参数检验<br/>秩和检验"]
    end    
    A1 & A2 & A3 & A4
    
    style A1 fill:#ffebee

第一类与第二类错误

错误类型定义概率
第一类错误拒绝真H₀α(显著性水平)
第二类错误接受假H₀β
检验功效1-β正确拒绝H₀的概率

🤖 机器学习应用

模型选择

graph TB
    subgraph 统计检验应用
        A1["过拟合检测<br/>交叉验证"]
        A2["模型比较<br/>t检验、F检验"]
        A3["特征选择<br/>假设检验"]
        A4["显著性分析<br/>p值"]
    end    
    A1 & A2 & A3 & A4
    
    style A1 fill:#ffebee

A/B测试

步骤内容方法
设计随机分组实验设计
采集收集数据样本量
分析假设检验t检验、卡方检验
决策是否显著p值<α

🎯 核心结论

统计推断核心概念

  1. 点估计:给出参数的单一估计值
  2. 区间估计:给出参数的可能范围
  3. 假设检验:判断假设的真伪
  4. p值:观察到的结果至少如实际极端的概率
  5. 置信水平:重复实验中包含真值的比例

学习路径

统计推断学习四步骤:
1. 点估计:矩估计、MLE
2. 区间估计:置信区间
3. 假设检验:t检验、χ²检验
4. 应用:A/B测试、模型选择

📚 参考文献

  1. 《概率论与数理统计》- 浙江大学
  2. 《统计学习方法》- 李航
  3. 《统计学》- 贾俊平
  4. 《统计推断》- Casella
  5. 《All of Statistics》- Larry Wasserman
  6. 《Introduction to the Practice of Statistics》
  7. 《统计学方法》
  8. 《假设检验》