Day 04|概率统计基础:概率分布、贝叶斯与期望方差(AI 学习笔记 · 基础筑基周 · 第 4 篇)
概率统计是机器学习的「母语」:任何监督学习都在用极大似然估计参数,任何无监督学习都在刻画数据分布,任何不确定性建模都离不开贝叶斯框架。读懂 Loss 公式背后的概率含义、把「先验 / 似然 / 后验」翻译成具体业务场景,是从「调包」跨越到「真正理解模型」的关键一步。
1. 随机变量与概率分布族
1.1 定义
随机变量(Random Variable, RV)是一个取值由随机试验结果决定的变量。概率分布给出每个可能取值的概率,分为:
- 离散 RV → 用 概率质量函数(PMF) 描述,$\sum_i p(x_i) = 1$
- 连续 RV → 用 概率密度函数(PDF) 描述,$\int_{-\infty}^{+\infty} f(x)\,dx = 1$,单点 $P(X=x) = 0$,有意义的是区间概率 $\int_a^b f(x)\,dx$
1.2 公式 / 核心结构
\begin{aligned}
&\text{离散 PMF:}\quad P(X = x_i) = p_i,\quad p_i \ge 0,\ \sum_i p_i = 1 \\
&\text{连续 PDF:}\quad P(a \le X \le b) = \int_a^b f(x)\,dx,\quad f(x) \ge 0,\ \int_{-\infty}^{+\infty} f(x)\,dx = 1 \\
&\text{累积分布函数 (CDF):}\quad F(x) = P(X \le x) = \int_{-\infty}^x f(t)\,dt
\end{aligned}
1.3 例子
- 二项分布 $X \sim B(n, p)$:$n$ 次独立伯努利试验中成功次数。例:某 App 注册转化率 $p = 0.15$,邀请 100 人,$X$ 服从 $B(100, 0.15)$,$E[X] = 15$,$Var(X) = 100 \times 0.15 \times 0.85 = 12.75$。
- 泊松分布 $X \sim \text{Poi}(\lambda)$:单位时间 / 空间内稀有事件次数。例:某奶茶店 1 小时进店人数 $X \sim \text{Poi}(30)$,$E[X] = Var(X) = 30$。
- 高斯分布 $X \sim \mathcal{N}(\mu, \sigma^2)$:身高、测量误差、很多「大量独立因素叠加」的量都近似服从。$E[X] = \mu$,$Var(X) = \sigma^2$,钟形曲线由 $\mu$ 决定中心、$\sigma$ 决定胖瘦。
1.4 取舍 / 几何直觉
PDF 不是「$x$ 处的概率」,而是「概率密度」——高度可以 > 1,只有积分面积是概率。把高斯 PDF 想象成「山坡剖面」,$\mu$ 是山顶位置,$\sigma$ 是山体胖瘦。$\pm 1\sigma$ 区间含 68.27% 概率、$\pm 2\sigma$ 含 95.45%、$\pm 3\sigma$ 含 99.73%——这是 6σ 管理、六西格玛质量控制的数学根基。
1.5 对比表
| 分布族 | 取值 | 关键参数 | 典型应用 | 是否 ML 默认假设 |
|---|---|---|---|---|
| 伯努利 $Bern(p)$ | {0, 1} | $p$ | 单次试验 | 否 |
| 二项 $B(n, p)$ | {0,…,n} | $n, p$ | A/B 测试转化次数 | 否 |
| 泊松 $\text{Poi}(\lambda)$ | {0,1,2,…} | $\lambda$ | 流量建模 | 否 |
| 高斯 $\mathcal{N}(\mu, \sigma^2)$ | $\mathbb{R}$ | $\mu, \sigma^2$ | 误差项、隐变量 | 是(CLT) |
| 均匀 $U(a, b)$ | $[a,b]$ | $a, b$ | 权重初始化 | 否 |
| 指数 $\text{Exp}(\lambda)$ | $[0, \infty)$ | $\lambda$ | 等待时间 | 否 |
本节长度参考:80-120 行。子主题少就扩对比和实战。
2. 贝叶斯定理与先验 / 后验
2.1 定义
| 条件概率:$P(A | B) = P(A \cap B) / P(B)$,在 $B$ 发生的条件下 $A$ 发生的概率。 |
贝叶斯定理给出「已知结果反推原因」的通用框架:
P(H \mid E) = \frac{P(E \mid H) \cdot P(H)}{P(E)}
四个角色:
- 先验 $P(H)$:看到证据前对假设 $H$ 的信念
- 似然 $P(E \mid H)$:假设 $H$ 成立时,观察到证据 $E$ 的概率
-
证据 $P(E)$:边际概率,$\sum_H P(E H)P(H)$,归一化常数 - 后验 $P(H \mid E)$:看到证据后对假设的更新后信念
2.2 公式 / 推导
由条件概率定义对称性:
\begin{aligned}
P(H \mid E) \cdot P(E) &= P(E \mid H) \cdot P(H) \\
\Rightarrow P(H \mid E) &= \frac{P(E \mid H) \cdot P(H)}{P(E)}
\end{aligned}
当 $H$ 取离散多值 $H_1, \dots, H_n$ 时,全概率公式:
P(E) = \sum_{i=1}^n P(E \mid H_i) \cdot P(H_i)
2.3 例子(医学检测 — 基率谬误)
| 某罕见病发病率 1/10000($P(H) = 0.0001$),检测灵敏度 99%($P(E | H) = 0.99$),假阳性率 1%($P(E | \neg H) = 0.01$)。求:检测阳性时实际患病的概率? |
# 贝叶斯手算
P_H = 0.0001 # 先验
P_E_given_H = 0.99 # 灵敏度
P_E_given_notH = 0.01 # 假阳性率
P_notH = 1 - P_H
P_E = P_E_given_H * P_H + P_E_given_notH * P_notH # 全概率
P_H_given_E = P_E_given_H * P_H / P_E # 后验
print(f"P(患病|阳性) = {P_H_given_E:.4f}") # 0.0098 ≈ 0.98%
输出:P(患病|阳性) = 0.0098
直观上「检测阳性就是有病」错得离谱——99% 的阳性其实是健康人(假阳性堆起来的,因为健康人基数巨大)。这就是 基率谬误:忽略先验,只看似然。
2.4 取舍 / 几何直觉
把概率看作「质量」,先验是假设空间里每个假设的初始质量,看到证据后,把证据支持得好的假设质量调大、不支持的质量调小,最后归一化(总质量仍为 1)。贝叶斯更新的本质是「加权再归一化」。多次更新就形成「学习」过程——这也是朴素贝叶斯分类器、贝叶斯神经网络、贝叶斯优化的共同基因。
2.5 对比表
| 方法 | 视角 | 估计目标 | 数据需求 | 不确定性 | |
|---|---|---|---|---|---|
| 频率派(极大似然 MLE) | 概率是长程频率 | 找一组最优参数 $\theta^*$ | 大样本 | 给点估计,不做分布 | |
| 贝叶斯 | 概率是信念度 | 参数的后验分布 $P(\theta \mid D)$ | 小样本也工作 | 天然给出置信区间 | |
| 最大后验 MAP | 折中 | 后验众数 $\theta^* = \arg\max P(\theta | D)$ | 中 | 给点估计 |
| 贝叶斯神经网络 | 网络参数 $\sim$ 分布 | 预测分布 | 大 + 先验设计 | MC Dropout 近似 |
3. 期望、方差与矩
3.1 定义
期望(Expectation)是 RV 的「加权平均」,反映中心位置:
E[X] = \sum_i x_i \cdot p_i \quad \text{(离散)}\qquad
E[X] = \int_{-\infty}^{+\infty} x \cdot f(x)\,dx \quad \text{(连续)}
方差(Variance)是 RV 与期望之差的平方的期望,反映离散程度:
Var(X) = E[(X - \mu)^2] = E[X^2] - (E[X])^2
标准差 $\sigma = \sqrt{Var(X)}$,与 $X$ 同量纲。
k 阶矩 $E[X^k]$,k 阶中心矩 $E[(X - \mu)^k]$。均值是 1 阶原点矩、方差是 2 阶中心矩、偏度(skewness)是 3 阶标准化中心矩、峰度(kurtosis)是 4 阶标准化中心矩。
3.2 公式 / 性质
\begin{aligned}
&E[aX + b] = aE[X] + b \\
&Var(aX + b) = a^2 Var(X) \\
&E[X + Y] = E[X] + E[Y]\quad(\text{永远成立}) \\
&Var(X + Y) = Var(X) + Var(Y) + 2\text{Cov}(X, Y)
\end{aligned}
3.3 例子
两支股票:
- 股票 A:年化 $E[R] = 10\%$,$\sigma_A = 5\%$(稳)
- 股票 B:年化 $E[R] = 10\%$,$\sigma_B = 30\%$(大起大落)
期望相同但方差不同 → 风险不同。Sharpe Ratio = $(E[R] - r_f) / \sigma$ 就是用期望和方差共同描述「单位风险的回报」。
3.4 取舍 / 几何直觉
把 $X$ 想象成「靶上落点坐标」:$\mu$ 是靶心,$Var(X)$ 是「散布范围」。零方差意味着所有概率质量集中在单点,等价于 $X$ 是常数。这是为什么 MLE 估计在「样本足够大」时方差会收敛到 0——大数定律 + 中心极限定理告诉模型:经验均值会收敛到真实均值,经验方差会收敛到真实方差。
3.5 对比表
| 度量 | 衡量什么 | 单位 | 极端敏感 | 适用 |
|---|---|---|---|---|
| 均值 $E[X]$ | 中心 | 与 $X$ 同 | 中 | 对称分布 |
| 中位数 | 中心 | 与 $X$ 同 | 低 | 偏态分布 |
| 方差 $\sigma^2$ | 离散 | $X^2$ 同 | 高 | 整体离散度 |
| MAD | 离散 | 与 $X$ 同 | 中 | 含异常值 |
| IQR | 离散 | 与 $X$ 同 | 低 | 偏态分布 |
4. 协方差、相关系数与独立性
4.1 定义
协方差(Covariance)度量两 RV 同向 / 反向变化的程度:
\text{Cov}(X, Y) = E[(X - \mu_X)(Y - \mu_Y)] = E[XY] - E[X]E[Y]
皮尔逊相关系数(Pearson Correlation)把协方差归一化到 $[-1, 1]$:
\rho_{XY} = \frac{\text{Cov}(X, Y)}{\sigma_X \sigma_Y}
- $\rho = +1$:完全正线性相关
- $\rho = -1$:完全负线性相关
- $\rho = 0$:无线性相关(但可能非线性相关)
独立性 $\Rightarrow$ $\rho = 0$ + 无任何函数关系;反之不一定。不相关不蕴含独立,独立一定不相关。
4.2 公式 / 推导
\begin{aligned}
&\text{Cov}(X, X) = \text{Var}(X) \\
&\text{Cov}(aX + b, cY + d) = ac \cdot \text{Cov}(X, Y) \\
&\text{Cov}(X + Y, Z) = \text{Cov}(X, Z) + \text{Cov}(Y, Z) \\
&\text{Var}\!\left(\sum_{i=1}^n X_i\right) = \sum_{i=1}^n \sum_{j=1}^n \text{Cov}(X_i, X_j)
\end{aligned}
4.3 例子
鸢尾花数据集 4 个特征(花萼长 / 宽、花瓣长 / 宽)的相关系数矩阵:
import numpy as np
from sklearn.datasets import load_iris
iris = load_iris()
X = iris.data # (150, 4)
corr = np.corrcoef(X.T)
print(np.round(corr, 2))
典型输出:
| sepal_l | sepal_w | petal_l | petal_w | |
|---|---|---|---|---|
| sepal_l | 1.00 | -0.12 | 0.87 | 0.82 |
| sepal_w | -0.12 | 1.00 | -0.43 | -0.36 |
| petal_l | 0.87 | -0.43 | 1.00 | 0.96 |
| petal_w | 0.82 | -0.36 | 0.96 | 1.00 |
花瓣长 vs 花瓣宽 $\rho = 0.96$ —— 高度正相关,后续做 PCA 时会看到它们贡献同一个主成分;花萼宽 vs 花瓣长 $\rho = -0.43$ —— 反向,但绝对值不够大,不是强线性关系。
4.4 取舍 / 几何直觉
| 把 $(X, Y)$ 散点画在二维平面:$\rho$ 描述散点云在多大程度上「呈一条线」,正负描述线方向,绝对值描述线有多直。$\rho$ 只捕捉线性,对 $Y = X^2$ 这种「明显有关系但非线性」的情况,$ | rho | $ 接近 0——遇到这种要用 Spearman 秩相关 或 互信息 MI。 |
4.5 对比表
| 度量 | 衡量 | 取值范围 | 适用 | 对非线性 |
|---|---|---|---|---|
| 协方差 $\text{Cov}$ | 同向性 | $(-\infty, +\infty)$ | 原始尺度 | 弱 |
| 皮尔逊 $\rho$ | 线性强度 | $[-1, 1]$ | 近似线性 | 不捕捉 |
| 斯皮尔曼 | 单调强度 | $[-1, 1]$ | 单调非线性 | 中 |
| 互信息 MI | 任意依赖 | $[0, +\infty)$ | 复杂依赖 | 强 |
5. NumPy / SciPy 实战:从分布抽样到贝叶斯更新
5.1 最小可运行实现
import numpy as np
from scipy import stats
rng = np.random.default_rng(seed=42)
# 1) 抽样三种分布在同一图上对比
n = 100_000
poisson = rng.poisson(lam=4.0, size=n) # 离散
uniform = rng.uniform(low=0.0, high=8.0, size=n) # 连续
gaussian = rng.normal(loc=4.0, scale=1.5, size=n) # 连续
# 2) 验证样本均值 / 方差 ≈ 理论值
print("poisson: E=%.3f Var=%.3f (theory E=Var=4.0)" % (poisson.mean(), poisson.var()))
print("uniform: E=%.3f Var=%.3f (theory E=4 Var=64/12≈5.33)" % (uniform.mean(), uniform.var()))
print("gaussian: E=%.3f Var=%.3f (theory E=4 Var=2.25)" % (gaussian.mean(), gaussian.var()))
# 3) 经验 CDF vs 理论 CDF(KS 检验)
ks_pois = stats.kstest(poisson, "poisson", args=(4.0,))
ks_unif = stats.kstest(uniform, "uniform", args=(0.0, 8.0))
ks_norm = stats.kstest(gaussian, "norm", args=(4.0, 1.5))
print(f"KS p-value poisson={ks_pois.pvalue:.3f}, "
f"uniform={ks_unif.pvalue:.3f}, gaussian={ks_norm.pvalue:.3f}")
# 全部应该接近 1,样本无法拒绝"来自理论分布"
预期输出:
poisson: E=4.005 Var=3.998 (theory E=Var=4.0)
uniform: E=4.001 Var=5.327 (theory E=4 Var=64/12≈5.33)
gaussian: E=4.001 Var=2.250 (theory E=4 Var=2.25)
KS p-value poisson=0.835, uniform=0.812, gaussian=0.728
5.2 进阶版:贝叶斯 + 共轭先验
二项似然 + Beta 先验 → 后验仍是 Beta(经典共轭):
import numpy as np
# 先验 Beta(α=2, β=8):均值 0.2,倾向"转化率低"
α, β = 2.0, 8.0
# 观察到 50 次试验,7 次成功
n_trials, n_success = 50, 7
# 后验 Beta(α + 7, β + 43)
α_post = α + n_success
β_post = β + (n_trials - n_success)
# 后验均值 = α_post / (α_post + β_post)
post_mean = α_post / (α_post + β_post)
post_std = np.sqrt(α_post * β_post / ((α_post + β_post)**2 * (α_post + β_post + 1)))
# 95% 最高后验密度区间 HDI
from scipy.stats import beta as Beta
lo, hi = Beta.ppf([0.025, 0.975], α_post, β_post)
print(f"prior mean = {α/(α+β):.3f}")
print(f"posterior mean = {post_mean:.3f} ± {post_std:.3f}")
print(f"95% CI = [{lo:.3f}, {hi:.3f}]")
预期输出:
prior mean = 0.200
posterior mean = 0.180 ± 0.058
95% CI = [0.082, 0.298]
数据把均值从 0.20 拉到 0.18,95% CI 反映真实不确定性,这就是贝叶斯学派「给区间而非点估计」的工程表达。
6. vs 其他方法对比
| 维度 | 频率派 MLE | 贝叶斯 MAP | 贝叶斯后验 | Bootstrap |
|---|---|---|---|---|
| 输出 | 单点 $\theta^*$ | 单点 $\theta^*$ | 分布 | 经验分布 |
| 不确定性 | 无(需大样本近似) | 无(同样靠 Fisher) | 天然 | 重抽样近似 |
| 先验 | 不引入 | 引入(影响结果) | 引入 | 不引入 |
| 计算成本 | 低 | 低 | 高(MCMC/VI) | 中 |
| 小样本表现 | 差(过拟合) | 较好 | 最好 | 中 |
| ML 中典型用途 | 线性回归 / 神经网络 loss | 正则化 = MAP | 贝叶斯神经网络 | 模型集成 |
-
MLE:最大化似然 → $\hat\theta = \arg\max_\theta P(D \theta)$ -
MAP:最大化后验 → $\hat\theta = \arg\max_\theta P(\theta D) = \arg\max_\theta [P(D \theta) P(\theta)]$,等价于 MLE + 负对数先验项(正则化) -
贝叶斯:后验分布 $\rightarrow$ 预测分布 $P(y_{\text{new}} x_{\text{new}}, D) = \int P(y_{\text{new}} x_{\text{new}}, \theta) P(\theta D)\,d\theta$
神经网络里的 L2 正则 ≈ weight 的高斯先验,L1 正则 ≈ weight 的 Laplace 先验——这就是深度学习为什么天然兼容 MAP 视角。
7. 常见坑(10 条)
7.1 混淆 PDF 和 PMF
症状:写 P(X = 3) = 0.2 当 $X$ 是连续 RV,结果验算总是不对。
原因:连续 RV 单点概率为 0,PDF 值不是概率。
修法:改成 P(2.5 ≤ X ≤ 3.5) = integral(f, 2.5, 3.5),或用 CDF 描述。
7.2 把频率当概率
症状:”我看了 10 次都成功,所以成功率 100%”。 原因:样本量太小,经验频率波动大;忽略了置信区间。 修法:Wilson 区间 / 贝叶斯后验给出范围;小样本宁可用 Beta 后验。
7.3 基率谬误(医学检测 / 垃圾邮件)
症状:阳性就判有病 / 包含”免费”就判垃圾。 原因:忽略先验 $P(H)$,只看 $P(E|H)$。 修法:全概率公式 + 贝叶斯,把 $P(H)$ 纳入决策。
7.4 $\rho = 0$ 就说”无关”
症状:散点呈抛物线 $Y = X^2$,Pearson $|rho| \approx 0$,结论”两变量无关”。 原因:Pearson 只测线性;抛物线是强非线性依赖。 修法:画散点图 + 算 Spearman 或互信息 MI。
7.5 把样本方差 / 总体方差公式用混
症状:算 np.var(x) 得到 1.0,但 Excel =VAR 得 0.99,不知道哪个对。
原因:pandas / numpy 默认 ddof=0($N$ 分母),Excel VAR 用 ddof=1($N-1$ 分母)。
修法:统计意义上默认 ddof=1,显式写 np.var(x, ddof=1),免得日后被审稿人挑。
7.6 高斯假设强行套到偏态数据
症状:对收入、订单金额做线性回归,残差严重右偏,Loss 降不下去。 原因:MSE / OLS 在高斯噪声假设下最优;偏态数据应做 $\log / \text{Box-Cox}$ 变换,或换损失为 Huber。 修法:画直方图 + Q-Q 图,验证残差分布形态;必要时换损失 / 换模型。
7.7 “独立 = 协方差 = 0”反推
症状:协方差 0 就说两变量独立,做特征选择时把其中一个删了,模型掉点 5%。 原因:独立蕴含不相关,反之不一定($Y = X^2$, $X$ 对称分布时 $\text{Cov}(X, Y)=0$)。 修法:特征选择看「对预测目标的信息量」,看 SHAP / permutation importance,不要看协方差。
7.8 大数定律 vs 中心极限定理混用
症状:”数据多了,样本均值分布就是均匀的”。 原因:LLN 说 $\bar X \to \mu$;CLT 说 $\bar X$ 近似高斯分布,与原分布无关。 修法:别混;CLT 需要「独立同分布」+ 有限方差 + 样本量足够(经验值 $n \ge 30$)。
7.9 算相关系数前不缩放
症状:把「年龄」(0-100)和「年收入」(0-1e6)直接算相关性,结果 $\rho$ 永远接近 ±1。 原因:不是 bug,是大数吃小数;不缩放只影响「主成分方向」「距离度量」的相对尺度。 修法:画散点 + 看分布;基于距离的算法(KNN / KMeans)必先 StandardScaler;基于树的算法不需要。
7.10 贝叶斯先验乱设
症状:先验 Beta(0.5, 0.5)(Jeffreys)放在转化率上,后验区间宽得离谱,不敢上线。 原因:弱信息先验在数据少时几乎无约束,给出诚实但无用的不确定性。 修法:用历史业务数据定 Beta($\alpha, \beta$)先验,或把 $\alpha + \beta$ 视为「先验样本量」,调成与历史转化次数可比。
8. 自检三问
A. 写出贝叶斯定理公式,指出先验、似然、证据、后验各对应哪一项?用医学检测举例说明基率谬误。
| 要点:$P(H | E) = P(E | H) \cdot P(H) / P(E)$。先验 $P(H)$ = 患病率 0.0001;似然 $P(E | H)$ = 灵敏度 0.99;证据 $P(E)$ = 全概率(灵敏度×患病率 + 假阳性率×健康率)≈ 0.0101;后验 $P(H | E) ≈ 0.0098$。99.02% 的阳性其实是健康人——直觉上的”阳性 = 患病”忽略基率,典型基率谬误。 |
B. 期望 $E[X]$ 和方差 $Var(X)$ 分别衡量随机变量的什么属性?为什么”方差为 0 当且仅当 $X$ 是常数”?这对 ML 中评估模型稳定性有什么启发?
要点:期望是”重心”,方差是”离散度”。$Var(X) = 0 \Rightarrow E[(X-\mu)^2] = 0$,而平方非负,故每项 $(X-\mu)^2 = 0$,即 $X \equiv \mu$ 常数;反过来常数方差也是 0。ML 启发:模型对相同输入多次预测,若 $Var(\hat y) \to 0$ 才好,否则预测不稳定——这正是 MC Dropout、Deep Ensemble 等不确定性估计方法的动机。
C. 高斯分布的两个参数 $\mu$ 和 $\sigma^2$ 各决定什么形状?为什么中心极限定理让高斯分布成为 ML 的默认假设?
要点:$\mu$ 决定对称中心位置,$\sigma$ 决定钟形胖瘦。CLT 表明:大量独立同分布 RV 之和(无论原分布是什么)趋向高斯;ML 模型里”很多小因素叠加 → 误差项”几乎天然满足 CLT 条件,所以 MSE / OLS / 高斯过程 / VAE 潜变量都用高斯作默认。
9. 推荐资源(5 类)
视频
- 3Blue1Brown《概率论》(Essence of Probability) — 几何直觉派,Beta 更新那几集必看
- StatQuest with Josh Starmer — 贝叶斯、p-value 讲得最通俗,每集 5-10 分钟
- MIT 6.041《Probability Systems Analysis》(John Tsitsiklis) — 系统派,适合补证明
教科书
- 《概率导论》(Introduction to Probability, Bertsekas & Tsitsiklis) — 入门友好,例子多
- 《统计学习导论》(ISLR, James et al.) — 第 2 章统计学习概述含 R/Python 代码
- 《Pattern Recognition and Machine Learning》(Bishop) — 第 1-2 章概率视角的 ML 圣经
论文
- “An Essay towards Solving a Problem in the Doctrine of Chances”(Bayes, 1763) — 原始论文,了解历史
- “Bayesian Data Analysis”(Gelman et al.) — 第 1-4 章共轭先验、HDI、模型检查的工程范式
- “A Tutorial on the Cross-Entropy Method”(De Boer et al., 2005) — 交叉熵与 KL 散度与极大似然的等价
博客 / 课程
- distill.pub(交互式可视化,如”How to Use t-SNE Effectively”)
- statdistribtions.com(分布速查)
- Cam Davidson-Pilon《Bayesian Methods for Hackers》(PyMC 在线版,工程派)
代码
scipy.stats(binom / poisson / norm / beta)— 基础分布全家桶statsmodels.stats(t-test / KS / 相关性检验)pymc / arviz / numpyro(贝叶斯建模 + 采样 + 诊断)— PyMC 5 入门成本最低
10. 本节要点
- 要 1:随机变量用 PMF(离散)或 PDF(连续)描述分布,PDF 单点概率为 0,只有积分面积是概率。
- 要 2:常见分布家族伯努利 / 二项 / 泊松 / 高斯 / 均匀 / 指数,参数决定形状,ML 默认假设高斯源于 CLT。
-
要 3:贝叶斯定理 $P(H E) = P(E H)P(H)/P(E)$ 把先验、似然、证据、后验四件套连起来,本质是「加权再归一化」。 - 要 4:基率谬误是忽略先验的常见思维陷阱,医学检测、垃圾邮件、推荐冷启动都受影响。
- 要 5:期望 $E[X]$ 是中心,方差 $Var(X) = E[X^2] - (E[X])^2$ 是离散度,标准差与 $X$ 同量纲。
- 要 6:协方差描述同向性,皮尔逊 $\rho \in [-1,1]$ 描述线性强度,不相关不等价于独立。
- 要 7:频率派给点估计,贝叶斯给分布;L2 / L1 正则等价于高斯 / Laplace 先验下的 MAP。
附录 A:常用概率分布速查
| 分布 | PMF / PDF | $E[X]$ | $Var(X)$ | 出现场景 |
|---|---|---|---|---|
| 伯努利 $Bern(p)$ | $p^x (1-p)^{1-x}$ | $p$ | $p(1-p)$ | 单次点击 / 转化 |
| 二项 $B(n, p)$ | $\binom{n}{x} p^x (1-p)^{n-x}$ | $np$ | $np(1-p)$ | 多次试验成功次数 |
| 几何 $G(p)$ | $(1-p)^{x-1} p$ | $1/p$ | $(1-p)/p^2$ | 首次成功等待次数 |
| 泊松 $\text{Poi}(\lambda)$ | $e^{-\lambda}\lambda^x/x!$ | $\lambda$ | $\lambda$ | 单位时间稀有事件 |
| 均匀 $U(a, b)$ | $1/(b-a)$ | $(a+b)/2$ | $(b-a)^2/12$ | 权重初始化 |
| 指数 $\text{Exp}(\lambda)$ | $\lambda e^{-\lambda x}$ | $1/\lambda$ | $1/\lambda^2$ | 等待时间 |
| 高斯 $\mathcal{N}(\mu, \sigma^2)$ | $\frac{1}{\sigma\sqrt{2\pi}}e^{-(x-\mu)^2/2\sigma^2}$ | $\mu$ | $\sigma^2$ | 误差 / 噪声 |
| Beta $Beta(\alpha, \beta)$ | $\frac{x^{\alpha-1}(1-x)^{\beta-1}}{B(\alpha,\beta)}$ | $\frac{\alpha}{\alpha+\beta}$ | $\frac{\alpha\beta}{(\alpha+\beta)^2(\alpha+\beta+1)}$ | 转化率 / 比例先验 |
11. 下一节:Day 05 · 工具链:Jupyter、pandas、matplotlib 与 scikit-learn
主题:把概率统计装进 Python 工具链,Jupyter / pandas / matplotlib / sklearn 一行调用真实数据集。覆盖:
- Jupyter cell-based 交互环境,
%timeit/%matplotlib inline等 magic commands,数据探索循环变成几十秒的事 - pandas DataFrame / Series、读 CSV(
pd.read_csv)、切片(df.loc/df.iloc)、聚合(df.groupby().agg()) - matplotlib pyplot 快速画图 + 面向对象
fig, ax = plt.subplots()接口,画 loss 曲线 / 散点 / 直方图 - scikit-learn 统一 Estimator API(
fit / predict / transform)、内置数据集(load_iris / load_diabetes)、train_test_split
产出物:干净 Python 虚拟环境 + Jupyter 中成功导入 4 个库 + 跑通一段 demo(用 sklearn load_iris 训练 KNN 分类器打印准确率),为 Day 6 手写线性回归准备好运行环境。