专栏 AI 与算法

Day 04|概率统计基础:概率分布、贝叶斯与期望方差(AI 学习笔记 · 基础筑基周 · 第 4 篇)

概率统计是机器学习的「母语」:任何监督学习都在用极大似然估计参数,任何无监督学习都在刻画数据分布,任何不确定性建模都离不开贝叶斯框架。读懂 Loss 公式背后的概率含义、把「先验 / 似然 / 后验」翻译成具体业务场景,是从「调包」跨越到「真正理解模型」的关键一步。


1. 随机变量与概率分布族

1.1 定义

随机变量(Random Variable, RV)是一个取值由随机试验结果决定的变量。概率分布给出每个可能取值的概率,分为:

  • 离散 RV → 用 概率质量函数(PMF) 描述,$\sum_i p(x_i) = 1$
  • 连续 RV → 用 概率密度函数(PDF) 描述,$\int_{-\infty}^{+\infty} f(x)\,dx = 1$,单点 $P(X=x) = 0$,有意义的是区间概率 $\int_a^b f(x)\,dx$

1.2 公式 / 核心结构

\begin{aligned}
&\text{离散 PMF:}\quad P(X = x_i) = p_i,\quad p_i \ge 0,\ \sum_i p_i = 1 \\
&\text{连续 PDF:}\quad P(a \le X \le b) = \int_a^b f(x)\,dx,\quad f(x) \ge 0,\ \int_{-\infty}^{+\infty} f(x)\,dx = 1 \\
&\text{累积分布函数 (CDF):}\quad F(x) = P(X \le x) = \int_{-\infty}^x f(t)\,dt
\end{aligned}

1.3 例子

  • 二项分布 $X \sim B(n, p)$:$n$ 次独立伯努利试验中成功次数。例:某 App 注册转化率 $p = 0.15$,邀请 100 人,$X$ 服从 $B(100, 0.15)$,$E[X] = 15$,$Var(X) = 100 \times 0.15 \times 0.85 = 12.75$。
  • 泊松分布 $X \sim \text{Poi}(\lambda)$:单位时间 / 空间内稀有事件次数。例:某奶茶店 1 小时进店人数 $X \sim \text{Poi}(30)$,$E[X] = Var(X) = 30$。
  • 高斯分布 $X \sim \mathcal{N}(\mu, \sigma^2)$:身高、测量误差、很多「大量独立因素叠加」的量都近似服从。$E[X] = \mu$,$Var(X) = \sigma^2$,钟形曲线由 $\mu$ 决定中心、$\sigma$ 决定胖瘦。

1.4 取舍 / 几何直觉

PDF 不是「$x$ 处的概率」,而是「概率密度」——高度可以 > 1,只有积分面积是概率。把高斯 PDF 想象成「山坡剖面」,$\mu$ 是山顶位置,$\sigma$ 是山体胖瘦。$\pm 1\sigma$ 区间含 68.27% 概率、$\pm 2\sigma$ 含 95.45%、$\pm 3\sigma$ 含 99.73%——这是 6σ 管理、六西格玛质量控制的数学根基。

1.5 对比表

分布族 取值 关键参数 典型应用 是否 ML 默认假设
伯努利 $Bern(p)$ {0, 1} $p$ 单次试验 否
二项 $B(n, p)$ {0,…,n} $n, p$ A/B 测试转化次数 否
泊松 $\text{Poi}(\lambda)$ {0,1,2,…} $\lambda$ 流量建模 否
高斯 $\mathcal{N}(\mu, \sigma^2)$ $\mathbb{R}$ $\mu, \sigma^2$ 误差项、隐变量 是(CLT)
均匀 $U(a, b)$ $[a,b]$ $a, b$ 权重初始化 否
指数 $\text{Exp}(\lambda)$ $[0, \infty)$ $\lambda$ 等待时间 否

本节长度参考:80-120 行。子主题少就扩对比和实战。


2. 贝叶斯定理与先验 / 后验

2.1 定义

条件概率:$P(A B) = P(A \cap B) / P(B)$,在 $B$ 发生的条件下 $A$ 发生的概率。

贝叶斯定理给出「已知结果反推原因」的通用框架:

P(H \mid E) = \frac{P(E \mid H) \cdot P(H)}{P(E)}

四个角色:

  • 先验 $P(H)$:看到证据前对假设 $H$ 的信念
  • 似然 $P(E \mid H)$:假设 $H$ 成立时,观察到证据 $E$ 的概率
  • 证据 $P(E)$:边际概率,$\sum_H P(E H)P(H)$,归一化常数
  • 后验 $P(H \mid E)$:看到证据后对假设的更新后信念

2.2 公式 / 推导

由条件概率定义对称性:

\begin{aligned}
P(H \mid E) \cdot P(E) &= P(E \mid H) \cdot P(H) \\
\Rightarrow P(H \mid E) &= \frac{P(E \mid H) \cdot P(H)}{P(E)}
\end{aligned}

当 $H$ 取离散多值 $H_1, \dots, H_n$ 时,全概率公式:

P(E) = \sum_{i=1}^n P(E \mid H_i) \cdot P(H_i)

2.3 例子(医学检测 — 基率谬误)

某罕见病发病率 1/10000($P(H) = 0.0001$),检测灵敏度 99%($P(E H) = 0.99$),假阳性率 1%($P(E \neg H) = 0.01$)。求:检测阳性时实际患病的概率?
# 贝叶斯手算
P_H = 0.0001            # 先验
P_E_given_H = 0.99      # 灵敏度
P_E_given_notH = 0.01   # 假阳性率

P_notH = 1 - P_H
P_E = P_E_given_H * P_H + P_E_given_notH * P_notH   # 全概率
P_H_given_E = P_E_given_H * P_H / P_E               # 后验

print(f"P(患病|阳性) = {P_H_given_E:.4f}")   # 0.0098 ≈ 0.98%

输出:P(患病|阳性) = 0.0098

直观上「检测阳性就是有病」错得离谱——99% 的阳性其实是健康人(假阳性堆起来的,因为健康人基数巨大)。这就是 基率谬误:忽略先验,只看似然。

2.4 取舍 / 几何直觉

把概率看作「质量」,先验是假设空间里每个假设的初始质量,看到证据后,把证据支持得好的假设质量调大、不支持的质量调小,最后归一化(总质量仍为 1)。贝叶斯更新的本质是「加权再归一化」。多次更新就形成「学习」过程——这也是朴素贝叶斯分类器、贝叶斯神经网络、贝叶斯优化的共同基因。

2.5 对比表

方法 视角 估计目标 数据需求 不确定性  
频率派(极大似然 MLE) 概率是长程频率 找一组最优参数 $\theta^*$ 大样本 给点估计,不做分布  
贝叶斯 概率是信念度 参数的后验分布 $P(\theta \mid D)$ 小样本也工作 天然给出置信区间  
最大后验 MAP 折中 后验众数 $\theta^* = \arg\max P(\theta D)$ 中 给点估计
贝叶斯神经网络 网络参数 $\sim$ 分布 预测分布 大 + 先验设计 MC Dropout 近似  

3. 期望、方差与矩

3.1 定义

期望(Expectation)是 RV 的「加权平均」,反映中心位置:

E[X] = \sum_i x_i \cdot p_i \quad \text{(离散)}\qquad
E[X] = \int_{-\infty}^{+\infty} x \cdot f(x)\,dx \quad \text{(连续)}

方差(Variance)是 RV 与期望之差的平方的期望,反映离散程度:

Var(X) = E[(X - \mu)^2] = E[X^2] - (E[X])^2

标准差 $\sigma = \sqrt{Var(X)}$,与 $X$ 同量纲。

k 阶矩 $E[X^k]$,k 阶中心矩 $E[(X - \mu)^k]$。均值是 1 阶原点矩、方差是 2 阶中心矩、偏度(skewness)是 3 阶标准化中心矩、峰度(kurtosis)是 4 阶标准化中心矩。

3.2 公式 / 性质

\begin{aligned}
&E[aX + b] = aE[X] + b \\
&Var(aX + b) = a^2 Var(X) \\
&E[X + Y] = E[X] + E[Y]\quad(\text{永远成立}) \\
&Var(X + Y) = Var(X) + Var(Y) + 2\text{Cov}(X, Y)
\end{aligned}

3.3 例子

两支股票:

  • 股票 A:年化 $E[R] = 10\%$,$\sigma_A = 5\%$(稳)
  • 股票 B:年化 $E[R] = 10\%$,$\sigma_B = 30\%$(大起大落)

期望相同但方差不同 → 风险不同。Sharpe Ratio = $(E[R] - r_f) / \sigma$ 就是用期望和方差共同描述「单位风险的回报」。

3.4 取舍 / 几何直觉

把 $X$ 想象成「靶上落点坐标」:$\mu$ 是靶心,$Var(X)$ 是「散布范围」。零方差意味着所有概率质量集中在单点,等价于 $X$ 是常数。这是为什么 MLE 估计在「样本足够大」时方差会收敛到 0——大数定律 + 中心极限定理告诉模型:经验均值会收敛到真实均值,经验方差会收敛到真实方差。

3.5 对比表

度量 衡量什么 单位 极端敏感 适用
均值 $E[X]$ 中心 与 $X$ 同 中 对称分布
中位数 中心 与 $X$ 同 低 偏态分布
方差 $\sigma^2$ 离散 $X^2$ 同 高 整体离散度
MAD 离散 与 $X$ 同 中 含异常值
IQR 离散 与 $X$ 同 低 偏态分布

4. 协方差、相关系数与独立性

4.1 定义

协方差(Covariance)度量两 RV 同向 / 反向变化的程度:

\text{Cov}(X, Y) = E[(X - \mu_X)(Y - \mu_Y)] = E[XY] - E[X]E[Y]

皮尔逊相关系数(Pearson Correlation)把协方差归一化到 $[-1, 1]$:

\rho_{XY} = \frac{\text{Cov}(X, Y)}{\sigma_X \sigma_Y}
  • $\rho = +1$:完全正线性相关
  • $\rho = -1$:完全负线性相关
  • $\rho = 0$:无线性相关(但可能非线性相关)

独立性 $\Rightarrow$ $\rho = 0$ + 无任何函数关系;反之不一定。不相关不蕴含独立,独立一定不相关。

4.2 公式 / 推导

\begin{aligned}
&\text{Cov}(X, X) = \text{Var}(X) \\
&\text{Cov}(aX + b, cY + d) = ac \cdot \text{Cov}(X, Y) \\
&\text{Cov}(X + Y, Z) = \text{Cov}(X, Z) + \text{Cov}(Y, Z) \\
&\text{Var}\!\left(\sum_{i=1}^n X_i\right) = \sum_{i=1}^n \sum_{j=1}^n \text{Cov}(X_i, X_j)
\end{aligned}

4.3 例子

鸢尾花数据集 4 个特征(花萼长 / 宽、花瓣长 / 宽)的相关系数矩阵:

import numpy as np
from sklearn.datasets import load_iris

iris = load_iris()
X = iris.data   # (150, 4)
corr = np.corrcoef(X.T)
print(np.round(corr, 2))

典型输出:

  sepal_l sepal_w petal_l petal_w
sepal_l 1.00 -0.12 0.87 0.82
sepal_w -0.12 1.00 -0.43 -0.36
petal_l 0.87 -0.43 1.00 0.96
petal_w 0.82 -0.36 0.96 1.00

花瓣长 vs 花瓣宽 $\rho = 0.96$ —— 高度正相关,后续做 PCA 时会看到它们贡献同一个主成分;花萼宽 vs 花瓣长 $\rho = -0.43$ —— 反向,但绝对值不够大,不是强线性关系。

4.4 取舍 / 几何直觉

把 $(X, Y)$ 散点画在二维平面:$\rho$ 描述散点云在多大程度上「呈一条线」,正负描述线方向,绝对值描述线有多直。$\rho$ 只捕捉线性,对 $Y = X^2$ 这种「明显有关系但非线性」的情况,$ rho $ 接近 0——遇到这种要用 Spearman 秩相关 或 互信息 MI。

4.5 对比表

度量 衡量 取值范围 适用 对非线性
协方差 $\text{Cov}$ 同向性 $(-\infty, +\infty)$ 原始尺度 弱
皮尔逊 $\rho$ 线性强度 $[-1, 1]$ 近似线性 不捕捉
斯皮尔曼 单调强度 $[-1, 1]$ 单调非线性 中
互信息 MI 任意依赖 $[0, +\infty)$ 复杂依赖 强

5. NumPy / SciPy 实战:从分布抽样到贝叶斯更新

5.1 最小可运行实现

import numpy as np
from scipy import stats

rng = np.random.default_rng(seed=42)

# 1) 抽样三种分布在同一图上对比
n = 100_000
poisson = rng.poisson(lam=4.0, size=n)            # 离散
uniform = rng.uniform(low=0.0, high=8.0, size=n)   # 连续
gaussian = rng.normal(loc=4.0, scale=1.5, size=n)  # 连续

# 2) 验证样本均值 / 方差 ≈ 理论值
print("poisson:   E=%.3f Var=%.3f  (theory E=Var=4.0)" % (poisson.mean(), poisson.var()))
print("uniform:   E=%.3f Var=%.3f  (theory E=4 Var=64/12≈5.33)" % (uniform.mean(), uniform.var()))
print("gaussian:  E=%.3f Var=%.3f  (theory E=4 Var=2.25)" % (gaussian.mean(), gaussian.var()))

# 3) 经验 CDF vs 理论 CDF(KS 检验)
ks_pois = stats.kstest(poisson, "poisson", args=(4.0,))
ks_unif = stats.kstest(uniform, "uniform", args=(0.0, 8.0))
ks_norm = stats.kstest(gaussian, "norm", args=(4.0, 1.5))
print(f"KS p-value poisson={ks_pois.pvalue:.3f}, "
      f"uniform={ks_unif.pvalue:.3f}, gaussian={ks_norm.pvalue:.3f}")
# 全部应该接近 1,样本无法拒绝"来自理论分布"

预期输出:

poisson:   E=4.005 Var=3.998  (theory E=Var=4.0)
uniform:   E=4.001 Var=5.327  (theory E=4 Var=64/12≈5.33)
gaussian:  E=4.001 Var=2.250  (theory E=4 Var=2.25)
KS p-value poisson=0.835, uniform=0.812, gaussian=0.728

5.2 进阶版:贝叶斯 + 共轭先验

二项似然 + Beta 先验 → 后验仍是 Beta(经典共轭):

import numpy as np

# 先验 Beta(α=2, β=8):均值 0.2,倾向"转化率低"
α, β = 2.0, 8.0

# 观察到 50 次试验,7 次成功
n_trials, n_success = 50, 7

# 后验 Beta(α + 7, β + 43)
α_post = α + n_success
β_post = β + (n_trials - n_success)

# 后验均值 = α_post / (α_post + β_post)
post_mean = α_post / (α_post + β_post)
post_std = np.sqrt(α_post * β_post / ((α_post + β_post)**2 * (α_post + β_post + 1)))

# 95% 最高后验密度区间 HDI
from scipy.stats import beta as Beta
lo, hi = Beta.ppf([0.025, 0.975], α_post, β_post)

print(f"prior mean = {α/(α+β):.3f}")
print(f"posterior mean = {post_mean:.3f} ± {post_std:.3f}")
print(f"95% CI = [{lo:.3f}, {hi:.3f}]")

预期输出:

prior mean = 0.200
posterior mean = 0.180 ± 0.058
95% CI = [0.082, 0.298]

数据把均值从 0.20 拉到 0.18,95% CI 反映真实不确定性,这就是贝叶斯学派「给区间而非点估计」的工程表达。


6. vs 其他方法对比

维度 频率派 MLE 贝叶斯 MAP 贝叶斯后验 Bootstrap
输出 单点 $\theta^*$ 单点 $\theta^*$ 分布 经验分布
不确定性 无(需大样本近似) 无(同样靠 Fisher) 天然 重抽样近似
先验 不引入 引入(影响结果) 引入 不引入
计算成本 低 低 高(MCMC/VI) 中
小样本表现 差(过拟合) 较好 最好 中
ML 中典型用途 线性回归 / 神经网络 loss 正则化 = MAP 贝叶斯神经网络 模型集成
  • MLE:最大化似然 → $\hat\theta = \arg\max_\theta P(D \theta)$
  • MAP:最大化后验 → $\hat\theta = \arg\max_\theta P(\theta D) = \arg\max_\theta [P(D \theta) P(\theta)]$,等价于 MLE + 负对数先验项(正则化)
  • 贝叶斯:后验分布 $\rightarrow$ 预测分布 $P(y_{\text{new}} x_{\text{new}}, D) = \int P(y_{\text{new}} x_{\text{new}}, \theta) P(\theta D)\,d\theta$

神经网络里的 L2 正则 ≈ weight 的高斯先验,L1 正则 ≈ weight 的 Laplace 先验——这就是深度学习为什么天然兼容 MAP 视角。


7. 常见坑(10 条)

7.1 混淆 PDF 和 PMF

症状:写 P(X = 3) = 0.2 当 $X$ 是连续 RV,结果验算总是不对。 原因:连续 RV 单点概率为 0,PDF 值不是概率。 修法:改成 P(2.5 ≤ X ≤ 3.5) = integral(f, 2.5, 3.5),或用 CDF 描述。

7.2 把频率当概率

症状:”我看了 10 次都成功,所以成功率 100%”。 原因:样本量太小,经验频率波动大;忽略了置信区间。 修法:Wilson 区间 / 贝叶斯后验给出范围;小样本宁可用 Beta 后验。

7.3 基率谬误(医学检测 / 垃圾邮件)

症状:阳性就判有病 / 包含”免费”就判垃圾。 原因:忽略先验 $P(H)$,只看 $P(E|H)$。 修法:全概率公式 + 贝叶斯,把 $P(H)$ 纳入决策。

7.4 $\rho = 0$ 就说”无关”

症状:散点呈抛物线 $Y = X^2$,Pearson $|rho| \approx 0$,结论”两变量无关”。 原因:Pearson 只测线性;抛物线是强非线性依赖。 修法:画散点图 + 算 Spearman 或互信息 MI。

7.5 把样本方差 / 总体方差公式用混

症状:算 np.var(x) 得到 1.0,但 Excel =VAR 得 0.99,不知道哪个对。 原因:pandas / numpy 默认 ddof=0($N$ 分母),Excel VAR 用 ddof=1($N-1$ 分母)。 修法:统计意义上默认 ddof=1,显式写 np.var(x, ddof=1),免得日后被审稿人挑。

7.6 高斯假设强行套到偏态数据

症状:对收入、订单金额做线性回归,残差严重右偏,Loss 降不下去。 原因:MSE / OLS 在高斯噪声假设下最优;偏态数据应做 $\log / \text{Box-Cox}$ 变换,或换损失为 Huber。 修法:画直方图 + Q-Q 图,验证残差分布形态;必要时换损失 / 换模型。

7.7 “独立 = 协方差 = 0”反推

症状:协方差 0 就说两变量独立,做特征选择时把其中一个删了,模型掉点 5%。 原因:独立蕴含不相关,反之不一定($Y = X^2$, $X$ 对称分布时 $\text{Cov}(X, Y)=0$)。 修法:特征选择看「对预测目标的信息量」,看 SHAP / permutation importance,不要看协方差。

7.8 大数定律 vs 中心极限定理混用

症状:”数据多了,样本均值分布就是均匀的”。 原因:LLN 说 $\bar X \to \mu$;CLT 说 $\bar X$ 近似高斯分布,与原分布无关。 修法:别混;CLT 需要「独立同分布」+ 有限方差 + 样本量足够(经验值 $n \ge 30$)。

7.9 算相关系数前不缩放

症状:把「年龄」(0-100)和「年收入」(0-1e6)直接算相关性,结果 $\rho$ 永远接近 ±1。 原因:不是 bug,是大数吃小数;不缩放只影响「主成分方向」「距离度量」的相对尺度。 修法:画散点 + 看分布;基于距离的算法(KNN / KMeans)必先 StandardScaler;基于树的算法不需要。

7.10 贝叶斯先验乱设

症状:先验 Beta(0.5, 0.5)(Jeffreys)放在转化率上,后验区间宽得离谱,不敢上线。 原因:弱信息先验在数据少时几乎无约束,给出诚实但无用的不确定性。 修法:用历史业务数据定 Beta($\alpha, \beta$)先验,或把 $\alpha + \beta$ 视为「先验样本量」,调成与历史转化次数可比。


8. 自检三问

A. 写出贝叶斯定理公式,指出先验、似然、证据、后验各对应哪一项?用医学检测举例说明基率谬误。

要点:$P(H E) = P(E H) \cdot P(H) / P(E)$。先验 $P(H)$ = 患病率 0.0001;似然 $P(E H)$ = 灵敏度 0.99;证据 $P(E)$ = 全概率(灵敏度×患病率 + 假阳性率×健康率)≈ 0.0101;后验 $P(H E) ≈ 0.0098$。99.02% 的阳性其实是健康人——直觉上的”阳性 = 患病”忽略基率,典型基率谬误。

B. 期望 $E[X]$ 和方差 $Var(X)$ 分别衡量随机变量的什么属性?为什么”方差为 0 当且仅当 $X$ 是常数”?这对 ML 中评估模型稳定性有什么启发?

要点:期望是”重心”,方差是”离散度”。$Var(X) = 0 \Rightarrow E[(X-\mu)^2] = 0$,而平方非负,故每项 $(X-\mu)^2 = 0$,即 $X \equiv \mu$ 常数;反过来常数方差也是 0。ML 启发:模型对相同输入多次预测,若 $Var(\hat y) \to 0$ 才好,否则预测不稳定——这正是 MC Dropout、Deep Ensemble 等不确定性估计方法的动机。

C. 高斯分布的两个参数 $\mu$ 和 $\sigma^2$ 各决定什么形状?为什么中心极限定理让高斯分布成为 ML 的默认假设?

要点:$\mu$ 决定对称中心位置,$\sigma$ 决定钟形胖瘦。CLT 表明:大量独立同分布 RV 之和(无论原分布是什么)趋向高斯;ML 模型里”很多小因素叠加 → 误差项”几乎天然满足 CLT 条件,所以 MSE / OLS / 高斯过程 / VAE 潜变量都用高斯作默认。


9. 推荐资源(5 类)

视频

  • 3Blue1Brown《概率论》(Essence of Probability) — 几何直觉派,Beta 更新那几集必看
  • StatQuest with Josh Starmer — 贝叶斯、p-value 讲得最通俗,每集 5-10 分钟
  • MIT 6.041《Probability Systems Analysis》(John Tsitsiklis) — 系统派,适合补证明

教科书

  • 《概率导论》(Introduction to Probability, Bertsekas & Tsitsiklis) — 入门友好,例子多
  • 《统计学习导论》(ISLR, James et al.) — 第 2 章统计学习概述含 R/Python 代码
  • 《Pattern Recognition and Machine Learning》(Bishop) — 第 1-2 章概率视角的 ML 圣经

论文

  • “An Essay towards Solving a Problem in the Doctrine of Chances”(Bayes, 1763) — 原始论文,了解历史
  • “Bayesian Data Analysis”(Gelman et al.) — 第 1-4 章共轭先验、HDI、模型检查的工程范式
  • “A Tutorial on the Cross-Entropy Method”(De Boer et al., 2005) — 交叉熵与 KL 散度与极大似然的等价

博客 / 课程

  • distill.pub(交互式可视化,如”How to Use t-SNE Effectively”)
  • statdistribtions.com(分布速查)
  • Cam Davidson-Pilon《Bayesian Methods for Hackers》(PyMC 在线版,工程派)

代码

  • scipy.stats(binom / poisson / norm / beta)— 基础分布全家桶
  • statsmodels.stats(t-test / KS / 相关性检验)
  • pymc / arviz / numpyro(贝叶斯建模 + 采样 + 诊断)— PyMC 5 入门成本最低

10. 本节要点

  • 要 1:随机变量用 PMF(离散)或 PDF(连续)描述分布,PDF 单点概率为 0,只有积分面积是概率。
  • 要 2:常见分布家族伯努利 / 二项 / 泊松 / 高斯 / 均匀 / 指数,参数决定形状,ML 默认假设高斯源于 CLT。
  • 要 3:贝叶斯定理 $P(H E) = P(E H)P(H)/P(E)$ 把先验、似然、证据、后验四件套连起来,本质是「加权再归一化」。
  • 要 4:基率谬误是忽略先验的常见思维陷阱,医学检测、垃圾邮件、推荐冷启动都受影响。
  • 要 5:期望 $E[X]$ 是中心,方差 $Var(X) = E[X^2] - (E[X])^2$ 是离散度,标准差与 $X$ 同量纲。
  • 要 6:协方差描述同向性,皮尔逊 $\rho \in [-1,1]$ 描述线性强度,不相关不等价于独立。
  • 要 7:频率派给点估计,贝叶斯给分布;L2 / L1 正则等价于高斯 / Laplace 先验下的 MAP。

附录 A:常用概率分布速查

分布 PMF / PDF $E[X]$ $Var(X)$ 出现场景
伯努利 $Bern(p)$ $p^x (1-p)^{1-x}$ $p$ $p(1-p)$ 单次点击 / 转化
二项 $B(n, p)$ $\binom{n}{x} p^x (1-p)^{n-x}$ $np$ $np(1-p)$ 多次试验成功次数
几何 $G(p)$ $(1-p)^{x-1} p$ $1/p$ $(1-p)/p^2$ 首次成功等待次数
泊松 $\text{Poi}(\lambda)$ $e^{-\lambda}\lambda^x/x!$ $\lambda$ $\lambda$ 单位时间稀有事件
均匀 $U(a, b)$ $1/(b-a)$ $(a+b)/2$ $(b-a)^2/12$ 权重初始化
指数 $\text{Exp}(\lambda)$ $\lambda e^{-\lambda x}$ $1/\lambda$ $1/\lambda^2$ 等待时间
高斯 $\mathcal{N}(\mu, \sigma^2)$ $\frac{1}{\sigma\sqrt{2\pi}}e^{-(x-\mu)^2/2\sigma^2}$ $\mu$ $\sigma^2$ 误差 / 噪声
Beta $Beta(\alpha, \beta)$ $\frac{x^{\alpha-1}(1-x)^{\beta-1}}{B(\alpha,\beta)}$ $\frac{\alpha}{\alpha+\beta}$ $\frac{\alpha\beta}{(\alpha+\beta)^2(\alpha+\beta+1)}$ 转化率 / 比例先验

11. 下一节:Day 05 · 工具链:Jupyter、pandas、matplotlib 与 scikit-learn

主题:把概率统计装进 Python 工具链,Jupyter / pandas / matplotlib / sklearn 一行调用真实数据集。覆盖:

  • Jupyter cell-based 交互环境,%timeit / %matplotlib inline 等 magic commands,数据探索循环变成几十秒的事
  • pandas DataFrame / Series、读 CSV(pd.read_csv)、切片(df.loc / df.iloc)、聚合(df.groupby().agg())
  • matplotlib pyplot 快速画图 + 面向对象 fig, ax = plt.subplots() 接口,画 loss 曲线 / 散点 / 直方图
  • scikit-learn 统一 Estimator API(fit / predict / transform)、内置数据集(load_iris / load_diabetes)、train_test_split

产出物:干净 Python 虚拟环境 + Jupyter 中成功导入 4 个库 + 跑通一段 demo(用 sklearn load_iris 训练 KNN 分类器打印准确率),为 Day 6 手写线性回归准备好运行环境。

说明 · 本站内容均为学习笔记与经验总结,所有菜谱与技法请结合实际食材、季节与个人口味灵活调整。涉及生食、营养与健康的内容仅供参考,特殊体质或疾病请咨询专业营养师/医生。