墨与留白——一位测绘师的顿悟

寓言

崇山峻岭之间,有一位老测绘师,带着唯一的徒弟云游四方。

师傅有一只旧皮箱,里面整整齐齐码着墨锭、狼毫笔与泛黄的宣纸。他的规矩是:每到一地,只取恰好够用的一张纸——不多,不少。云游三十年,他的箱子从不见空,也从不见满。

徒弟跟在身后,心中暗忖:师傅是如何知道该带多少纸的?

某日,师徒二人来到一片荒漠。沙丘连绵,一望无际。师傅从箱中取出纸,裁下一条窄窄的纸带,卷好入箱。徒弟瞪大了眼睛:"师傅!这地方这么大,怎么就带这么点?"

师傅笑了笑:"你且看。"

第二日,他们进入了一片河网交错的三角洲。水道如蛛网,汊港似迷宫,连向导都迷失了方向。师傅在箱中翻找良久,最后取出一刀厚厚的纸,足足有平日十倍。徒弟更困惑了:"师傅,这地方再大,也比昨日的沙漠小得多啊!"

师傅头也不抬:"你且看。"

此后数月,徒弟留心观察,发现了师傅用纸的规律:

  • 沙漠广阔却单调——沙丘连绵,形态相似,一张窄纸条便够了
  • 河网弹丸之地却变化无穷——每条岔路、每处回流都不同,需要厚厚一叠
  • 雪原苍茫而均匀——只需薄薄一张
  • 古城街巷曲折、废墟残垣——纸用得极多

徒弟苦思不得其解。一夜露宿山巅,他望着满天繁星,忽然悟道:

"师傅,我懂了!"

"哦?"

"您用的纸量,不取决于地方有多大,而取决于那个地方的花样多不多!"

师傅停下脚步。

"花样多、不确定、猜不到——这就是'乱'。越乱的地方,越难用简单的语言描述,就需要越多的纸来记录。反过来说,如果一个地方板上钉钉、毫无意外,那一张纸都嫌多。"

师傅转过身,第一次露出赞许的神色:"那你说,该怎么量化这个'乱'呢?"

徒弟望着星空,沉吟片刻:

"若一种情况出现的概率是 p,它带来的'意外'大约正比于 log(1/p)……把所有可能情况的意外加权求和,便是那一地需要的纸量。不确定性的总量。"

师傅缓缓点头,从怀中取出一本泛黄的手抄本,封面上写着两个字——

《信息熵》

"这本书,我本打算等你再走三十年路再给你。"


概念解释

信息熵(Information Entropy) 是香农(Claude Shannon)在 1948 年提出的概念,用于量化一个概率分布中不确定性的总量。

信息熵的本质是:描述一个随机变量平均需要多少信息量

  • 熵越高 → 随机变量的不确定性越大 → 越难预测
  • 熵越低 → 随机变量越确定 → 越容易被压缩/描述

寓言 ↔ 概念对照表

寓言元素对应概念
测绘师记录一地用纸量用信息量描述随机变量
地形花样多、变化大高概率分布 → 高熵
地形单调、一望无际低概率分布 → 低熵
纸量 = 花样"意外"的加权求和$H(X) = -\sum_x p(x) \log p(x)$
概率 p 的意外 = log(1/p)信息量 $I(x) = -\log p(x)$

核心公式

信息量(Self-Information):单个事件携带的信息,与它发生的概率负相关。

$$I(x) = -\log_2 p(x)$$

信息熵(Information Entropy):随机变量 $X$ 的平均信息量。

$$H(X) = -\sum_{x \in \mathcal{X}} p(x) \log_2 p(x) = \mathbb{E}_{x \sim p}[-\log_2 p(x)]$$

熵的链式法则:联合熵与条件熵的关系。

$$H(X, Y) = H(X) + H(Y|X) = H(Y) + H(X|Y)$$

互信息(Mutual Information):两个变量共享的信息量。

$$I(X; Y) = H(X) - H(X|Y) = H(Y) - H(Y|X)$$

关键要点

  1. 熵的单位 是 bit(以 2 为底的对数),表示描述随机变量平均所需的最少二进制位数
  2. 最大熵原则:在没有额外信息时,应选择熵最大的分布——即让所有可能事件概率均等
  3. 熵与压缩:熵是数据压缩的理论下限,无法压缩到低于熵的平均码长
  4. 条件熵减少信息:知道一个变量的信息后,条件熵 $H(Y|X) \leq H(Y)$,即不确定性只会减少
  5. 机器学习中的应用:决策树的分裂准则(ID3、C4.5)、特征选择、朴素贝叶斯分类器、变分推断中的 ELBO 等都依赖熵的概念

参考文献

  • Shannon, C. E. (1948). A Mathematical Theory of Communication. Bell System Technical Journal, 27(3), 379–423.
  • Cover, T. M., & Thomas, J. A. (2006). Elements of Information Theory (2nd ed.). Wiley-Interscience.
  • MacKay, D. J. C. (2003). Information Theory, Inference, and Learning Algorithms. Cambridge University Press.
最后修改:2026 年 07 月 30 日
如果觉得我的文章对你有用,请随意赞赏