《根本方与传承方》——一份抄本的偏差
寓言
很久以前有一座山,山里住着一族药工。石祠里刻着一张治瘟疫的方子——历代口耳相传累积下来的,叫根本方。每一年,最聪明的学徒下山行医,临行前师父把方子抄在纸上交给他,叫传承方。
传承方一代代传下去。抄写人会偷懒:把三味药合成两味,把"半盏"写成"小半盏",把"清晨"写成"早晨"。一开始差别极小,几代之后,传承方已面目全非,抄写人自己浑然不觉。
新学徒上山求艺,她学的是上一代传承方——传承方的传承方,已经跟根本方隔了七八代。师父问她:"你背的方子,和石祠里的方子,差多少?"
学徒说:"数药味。"
师父说:"光数药味没用。两张方子都可以是十味药,但写的是完全不同的十味。"
他让学徒在石祠前大声背一遍。每背一句,他就指:哪句同、哪句略偏、哪句找不到出处。
"偏一句,就多一份惊讶。你预期背的是传承方,结果听到了根本方——反过来也一样。"
学徒算了,发现两件怪事:
"从根本方走到传承方,惊讶是 X。从传承方回看根本方,惊讶是 Y。X 和 Y 居然不一样。"
师父点头:"两份方子,方向不同,惊讶也不同。"
"还有,偏得再多,惊讶也是 ≥ 0。两张方子再不同,也没有'反而比原来更对'的事。"
她不甘心,把两张方子的字摊开看——两份都用了十个字、都用了三次"半盏"、平均字数一样。可字与字之间的搭配完全不同:一份的"半盏"接"清晨",另一份接"中午"。
"平均一样,分布却不同。"她说,按某种加权的方式重新算了一遍——
得到的数字,比单纯数平均大了许多。
"原来'看上去差不多'的方子,在更深一层,相差能这么远。"
概念解释
KL 散度(Kullback-Leibler Divergence) 是 Solomon Kullback 与 Richard Leibler 在 1951 年提出的概念,用于衡量两个概率分布之间的"信息距离"。
本质:用分布 $Q$ 去近似真实分布 $P$ 时,平均会丢失多少信息量(以 bit 为单位)。
- KL 越大 → $Q$ 离 $P$ 越远 → 用 $Q$ 编码 $P$ 浪费的 bit 越多
- KL 越小 → $Q$ 越接近 $P$ → 编码越高效
- KL = 0 当且仅当 $P = Q$
寓言 ↔ 概念对照表
| 寓言元素 | 对应概念 |
|---|---|
| 根本方(本) | 真实分布 $P$ |
| 传承方(传) | 近似分布 $Q$ |
| 从根本方走到传承方的偏差 | $D_{\text{KL}}(P \| Q)$ |
| 从传承方回看根本方的偏差 | $D_{\text{KL}}(Q \| P)$ |
| 偏差永远 ≥ 0 | Gibbs 不等式:$D_{\text{KL}}(P \| Q) \geq 0$,等号当且仅当 $P = Q$ |
| 偏差具有方向性、两种量法不等 | KL 散度的非对称性 |
| 抄写时取整、简化、近似 | 用 $Q$ 编码 $P$ 的"信息损失" |
| 两份方子平均字量相同、字与字搭配不同 | 不同分布可以有相同均值/方差,但 KL 散度不同 |
核心公式
KL 散度的定义(离散概率分布):
$$ D_{\text{KL}}(P \| Q) = \sum_{x \in \mathcal{X}} p(x) \log \frac{p(x)}{q(x)} $$
连续版本(概率密度函数):
$$ D_{\text{KL}}(P \| Q) = \int p(x) \log \frac{p(x)}{q(x)} \, dx $$
非负性(Gibbs 不等式):
$$ D_{\text{KL}}(P \| Q) \geq 0, \quad \text{当且仅当 } P = Q \text{ 时等号成立} $$
非对称性(一般情况):
$$ D_{\text{KL}}(P \| Q) \neq D_{\text{KL}}(Q \| P) $$
关键要点
- 方向敏感:$D_{\text{KL}}(P \| Q)$ 衡量的是"以 $Q$ 为码表,编码 $P$ 时多用的 bit"——把哪个分布当"真"、哪个当"近似",结果完全不同
- 永不小于零:信息只能丢不能凭空生;这是物理层面的限制
- 不是真正的距离:不满足对称性和三角不等式;想用对称版本的话用 Jensen-Shannon 散度(JSD)
- 机器学习中的应用:变分自编码器(VAE)的 ELBO 项、生成对抗网络的策略梯度、贝叶斯推断中的模型比较、强化学习中的策略优化都依赖 KL 散度
- 直觉类比:等价于"以 $Q$ 为参照,$P$ 的相对熵"——不是"差多少",而是"用 $Q$ 描述 $P$ 时被强迫多花的描述成本"
参考文献
- Kullback, S., & Leibler, R. A. (1951). On information and sufficiency. Annals of Mathematical Statistics, 22(1), 79–86.
- Kullback, S. (1959). Information Theory and Statistics. Wiley.
- Cover, T. M., & Thomas, J. A. (2006). Elements of Information Theory (2nd ed.). Wiley-Interscience.
- MacKay, D. J. C. (2003). Information Theory, Inference, and Learning Algorithms. Cambridge University Press.
- Wikipedia: "Kullback–Leibler divergence" https://en.wikipedia.org/wiki/Kullback%E2%80%93Leibler_divergence