《根本方与传承方》——一份抄本的偏差

寓言

很久以前有一座山,山里住着一族药工。石祠里刻着一张治瘟疫的方子——历代口耳相传累积下来的,叫根本方。每一年,最聪明的学徒下山行医,临行前师父把方子抄在纸上交给他,叫传承方

传承方一代代传下去。抄写人会偷懒:把三味药合成两味,把"半盏"写成"小半盏",把"清晨"写成"早晨"。一开始差别极小,几代之后,传承方已面目全非,抄写人自己浑然不觉。

新学徒上山求艺,她学的是上一代传承方——传承方的传承方,已经跟根本方隔了七八代。师父问她:"你背的方子,和石祠里的方子,差多少?"

学徒说:"数药味。"

师父说:"光数药味没用。两张方子都可以是十味药,但写的是完全不同的十味。"

他让学徒在石祠前大声背一遍。每背一句,他就指:哪句同、哪句略偏、哪句找不到出处。

"偏一句,就多一份惊讶。你预期背的是传承方,结果听到了根本方——反过来也一样。"

学徒算了,发现两件怪事:

"从根本方走到传承方,惊讶是 X。从传承方回看根本方,惊讶是 Y。X 和 Y 居然不一样。"

师父点头:"两份方子,方向不同,惊讶也不同。"

"还有,偏得再多,惊讶也是 ≥ 0。两张方子再不同,也没有'反而比原来更对'的事。"

她不甘心,把两张方子的字摊开看——两份都用了十个字、都用了三次"半盏"、平均字数一样。可字与字之间的搭配完全不同:一份的"半盏"接"清晨",另一份接"中午"。

"平均一样,分布却不同。"她说,按某种加权的方式重新算了一遍——

得到的数字,比单纯数平均大了许多。

"原来'看上去差不多'的方子,在更深一层,相差能这么远。"


概念解释

KL 散度(Kullback-Leibler Divergence) 是 Solomon Kullback 与 Richard Leibler 在 1951 年提出的概念,用于衡量两个概率分布之间的"信息距离"。

本质:用分布 $Q$ 去近似真实分布 $P$ 时,平均会丢失多少信息量(以 bit 为单位)。

  • KL 越大 → $Q$ 离 $P$ 越远 → 用 $Q$ 编码 $P$ 浪费的 bit 越多
  • KL 越小 → $Q$ 越接近 $P$ → 编码越高效
  • KL = 0 当且仅当 $P = Q$

寓言 ↔ 概念对照表

寓言元素 对应概念
根本方(本) 真实分布 $P$
传承方(传) 近似分布 $Q$
从根本方走到传承方的偏差 $D_{\text{KL}}(P \| Q)$
从传承方回看根本方的偏差 $D_{\text{KL}}(Q \| P)$
偏差永远 ≥ 0 Gibbs 不等式:$D_{\text{KL}}(P \| Q) \geq 0$,等号当且仅当 $P = Q$
偏差具有方向性、两种量法不等 KL 散度的非对称性
抄写时取整、简化、近似 用 $Q$ 编码 $P$ 的"信息损失"
两份方子平均字量相同、字与字搭配不同 不同分布可以有相同均值/方差,但 KL 散度不同

核心公式

KL 散度的定义(离散概率分布):

$$ D_{\text{KL}}(P \| Q) = \sum_{x \in \mathcal{X}} p(x) \log \frac{p(x)}{q(x)} $$

连续版本(概率密度函数):

$$ D_{\text{KL}}(P \| Q) = \int p(x) \log \frac{p(x)}{q(x)} \, dx $$

非负性(Gibbs 不等式):

$$ D_{\text{KL}}(P \| Q) \geq 0, \quad \text{当且仅当 } P = Q \text{ 时等号成立} $$

非对称性(一般情况):

$$ D_{\text{KL}}(P \| Q) \neq D_{\text{KL}}(Q \| P) $$

关键要点

  1. 方向敏感:$D_{\text{KL}}(P \| Q)$ 衡量的是"以 $Q$ 为码表,编码 $P$ 时多用的 bit"——把哪个分布当"真"、哪个当"近似",结果完全不同
  2. 永不小于零:信息只能丢不能凭空生;这是物理层面的限制
  3. 不是真正的距离:不满足对称性和三角不等式;想用对称版本的话用 Jensen-Shannon 散度(JSD)
  4. 机器学习中的应用:变分自编码器(VAE)的 ELBO 项、生成对抗网络的策略梯度、贝叶斯推断中的模型比较、强化学习中的策略优化都依赖 KL 散度
  5. 直觉类比:等价于"以 $Q$ 为参照,$P$ 的相对熵"——不是"差多少",而是"用 $Q$ 描述 $P$ 时被强迫多花的描述成本"

参考文献

  • Kullback, S., & Leibler, R. A. (1951). On information and sufficiency. Annals of Mathematical Statistics, 22(1), 79–86.
  • Kullback, S. (1959). Information Theory and Statistics. Wiley.
  • Cover, T. M., & Thomas, J. A. (2006). Elements of Information Theory (2nd ed.). Wiley-Interscience.
  • MacKay, D. J. C. (2003). Information Theory, Inference, and Learning Algorithms. Cambridge University Press.
  • Wikipedia: "Kullback–Leibler divergence" https://en.wikipedia.org/wiki/Kullback%E2%80%93Leibler_divergence
最后修改:2026 年 07 月 30 日
如果觉得我的文章对你有用,请随意赞赏